{"as_of":"2026-08-14T13:17:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:02e7a11f6e6a3ed45432c467ea3968323c7c2f79d3d31d74fd2c69e4d29d6274","coverage":[{"denominator":57,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":57,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-06T23:35:37.514349Z","state":"measured"},{"denominator":61,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":61,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-14T06:32:32.682623+00:00","state":"measured"},{"denominator":4,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":4,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-06T23:35:35.805367Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-07-04T10:19:47.988040Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2506.17611","last_updated":"2025-06-21T06:30:59Z","snapshot_observed_at":"2026-08-10T07:54:14.180718Z","submitted_at":"2025-06-21T06:30:59Z","title":"OpusLM: A Family of Open Unified Speech Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.17611","snapshot_observed_at":"2026-08-06T23:35:35.805367Z","title":"The to- kenization is described in §2.1","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.17611","last_updated":"2025-06-21T06:30:59Z","snapshot_observed_at":"2026-08-10T07:54:14.180718Z","submitted_at":"2025-06-21T06:30:59Z","title":"OpusLM: A Family of Open Unified Speech Language Models","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-06T23:35:35.805367Z"},"links":{"cited_paper":"/paper/2506.17611","citing_paper":"/paper/2506.17611"},"observation_digest":"sha256:e499509c199fd87fc23b38627ff5ef64ed42c0f41b1458c7d836954750fdab3b","observation_id":"9f94f05f-bee1-4862-8945-76bf43178963","resolution":{"observed_at":"2026-08-06T23:35:35.805367Z","resolver_source":null,"status":"malformed_identifier"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.17611","last_updated":"2025-06-21T06:30:59Z","snapshot_observed_at":"2026-08-10T07:54:14.180718Z","submitted_at":"2025-06-21T06:30:59Z","title":"OpusLM: A Family of Open Unified Speech Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.17611","snapshot_observed_at":"2026-08-04T11:29:35.787283Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2510.04593","last_updated":"2026-06-08T05:49:30Z","snapshot_observed_at":"2026-08-13T22:52:06.796347Z","submitted_at":"2025-10-06T08:47:38Z","title":"UniVoice: Unifying Autoregressive ASR and Flow-Matching based TTS with Large Language Models","version":3},"reference_index":53,"source":"arxiv_source","source_observed_at":"2026-08-04T11:29:35.787283Z"},"links":{"cited_paper":"/paper/2506.17611","citing_paper":"/paper/2510.04593"},"observation_digest":"sha256:84df17a41599b14183a42b522de9b9de3bcec8f98abac4d94a24ceec571e4219","observation_id":"f7ac93b2-b13d-4169-bc04-40c1e4174723","resolution":{"observed_at":"2026-08-04T11:29:35.787283Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.17611","last_updated":"2025-06-21T06:30:59Z","snapshot_observed_at":"2026-08-10T07:54:14.180718Z","submitted_at":"2025-06-21T06:30:59Z","title":"OpusLM: A Family of Open Unified Speech Language Models","version":1},"cited_work":{"arxiv_id":"2506.17611","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2506.17611","snapshot_observed_at":"2026-07-04T10:19:47.988040Z","title":"Opuslm: A family of open unified speech language models,","venue":null,"work_id":"988a16ce-2ae7-40b3-91ba-aa98b5cb72a7","year":2025},"citing_paper":{"arxiv_id":"2606.22811","last_updated":"2026-06-22T03:40:28Z","snapshot_observed_at":"2026-08-12T19:01:27.173684Z","submitted_at":"2026-06-22T03:40:28Z","title":"Bagpiper-TTS: Natural Language Guided Universal Speech Synthesis","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-06-26T08:54:18.325054Z"},"links":{"cited_paper":"/paper/2506.17611","citing_paper":"/paper/2606.22811"},"observation_digest":"sha256:c59e4f61982ba2d61ae3b943fccc9a05b7adfc281e164b8f06d1e46026342bcf","observation_id":"2ac87cda-fac0-4a2f-84c8-27f14ebcf149","resolution":{"observed_at":"2026-07-04T10:19:47.989537Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.17611","last_updated":"2025-06-21T06:30:59Z","snapshot_observed_at":"2026-08-10T07:54:14.180718Z","submitted_at":"2025-06-21T06:30:59Z","title":"OpusLM: A Family of Open Unified Speech Language Models","version":1},"cited_work":{"arxiv_id":"2506.17611","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2506.17611","snapshot_observed_at":"2026-07-04T10:19:47.988040Z","title":"Opuslm: A family of open unified speech language models,","venue":null,"work_id":"988a16ce-2ae7-40b3-91ba-aa98b5cb72a7","year":2025},"citing_paper":{"arxiv_id":"2607.02119","last_updated":"2026-07-02T12:55:11Z","snapshot_observed_at":"2026-08-04T18:11:17.418102Z","submitted_at":"2026-07-02T12:55:11Z","title":"An Efficient vLLM-Based Inference Pipeline for Unified Audio Understanding and Generation","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-07-03T05:04:23.295592Z"},"links":{"cited_paper":"/paper/2506.17611","citing_paper":"/paper/2607.02119"},"observation_digest":"sha256:464ece9e6fe1eecb5c721c9095e8f3bcbec756110c68693ec60b73e58877204f","observation_id":"4e7d6f72-051e-4415-8efb-3bb12206aa9f","resolution":{"observed_at":"2026-07-03T05:07:38.317151Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2506.17611/citation-record","integrity":"/paper/2506.17611/integrity","json":"/paper/2506.17611/citation-record.json","paper":"/paper/2506.17611"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:35:43.164748Z","title":"This prosperity quickly spread to the speech domain and invoked the popular- ity of speech language models (SpeechLMs) [4–6]","venue":null,"work_id":"7561e7f1-e379-4d31-97df-41643076ce81","year":null},"citing_paper":{"arxiv_id":"2506.17611","last_updated":"2025-06-21T06:30:59Z","snapshot_observed_at":"2026-08-10T07:54:14.180718Z","submitted_at":"2025-06-21T06:30:59Z","title":"OpusLM: A Family of Open Unified Speech Language Models","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-06T23:35:35.768809Z"},"links":{"citing_paper":"/paper/2506.17611"},"observation_digest":"sha256:30d72d41f4a4a86f5971d63f929c50d8ae524796f73c0060be0e36821eca2dab","observation_id":"3b8c5a0a-2ad1-4961-b14a-b848c46c297e","resolution":{"observed_at":"2026-08-06T23:35:43.204876Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.17611","last_updated":"2025-06-21T06:30:59Z","snapshot_observed_at":"2026-08-10T07:54:14.180718Z","submitted_at":"2025-06-21T06:30:59Z","title":"OpusLM: A Family of Open Unified Speech Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.17611","snapshot_observed_at":"2026-08-06T23:35:35.805367Z","title":"The to- kenization is described in §2.1","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.17611","last_updated":"2025-06-21T06:30:59Z","snapshot_observed_at":"2026-08-10T07:54:14.180718Z","submitted_at":"2025-06-21T06:30:59Z","title":"OpusLM: A Family of Open Unified Speech Language Models","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-06T23:35:35.805367Z"},"links":{"cited_paper":"/paper/2506.17611","citing_paper":"/paper/2506.17611"},"observation_digest":"sha256:e499509c199fd87fc23b38627ff5ef64ed42c0f41b1458c7d836954750fdab3b","observation_id":"9f94f05f-bee1-4862-8945-76bf43178963","resolution":{"observed_at":"2026-08-06T23:35:35.805367Z","resolver_source":null,"status":"malformed_identifier"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"3690.16245","doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:35:39.552528Z","title":"Experimental Setup Data:Our speech data is a mixture of YODAS [41], Emilia [42], and OWSM v3.2 suite [22]","venue":null,"work_id":"1f9c7bd9-c531-48a2-ada9-86f661cef932","year":null},"citing_paper":{"arxiv_id":"2506.17611","last_updated":"2025-06-21T06:30:59Z","snapshot_observed_at":"2026-08-10T07:54:14.180718Z","submitted_at":"2025-06-21T06:30:59Z","title":"OpusLM: A Family of Open Unified Speech Language Models","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-06T23:35:35.845196Z"},"links":{"citing_paper":"/paper/2506.17611"},"observation_digest":"sha256:dd44eed6ed1d89de069dcc2d2d351618f3a03b968dcaefa118f52268cfad152a","observation_id":"2111fd18-8b77-4f2a-bc85-96c22520c478","resolution":{"observed_at":"2026-08-06T23:35:39.596126Z","resolver_source":"raw_fallback","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:35:42.994831Z","title":"The code, data, checkpoints, and training logs are released to support open speech language model research in the community","venue":null,"work_id":"00c4f568-bed4-4aff-b125-57f6c5db15b6","year":null},"citing_paper":{"arxiv_id":"2506.17611","last_updated":"2025-06-21T06:30:59Z","snapshot_observed_at":"2026-08-10T07:54:14.180718Z","submitted_at":"2025-06-21T06:30:59Z","title":"OpusLM: A Family of Open Unified Speech Language Models","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-06T23:35:35.891220Z"},"links":{"citing_paper":"/paper/2506.17611"},"observation_digest":"sha256:fafd6b7f56fc1d189cb2e75d300e05fb3b92a4251735c090080a132c38d947c2","observation_id":"0c65bce9-1a68-4cfd-9bf3-0ba1d36a8361","resolution":{"observed_at":"2026-08-06T23:35:43.044755Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:35:42.832249Z","title":"18Note the out-domain corpus in [25] is of sufficiently high quality, so we believe this degradation is more from domain mismatch","venue":null,"work_id":"ac0073b5-7e18-4e43-b155-5bb4fafd3b30","year":null},"citing_paper":{"arxiv_id":"2506.17611","last_updated":"2025-06-21T06:30:59Z","snapshot_observed_at":"2026-08-10T07:54:14.180718Z","submitted_at":"2025-06-21T06:30:59Z","title":"OpusLM: A Family of Open Unified Speech Language Models","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-06T23:35:35.928366Z"},"links":{"citing_paper":"/paper/2506.17611"},"observation_digest":"sha256:08986038dbb6575969baee64c450db73906443fa0000eb6c3ae3f79460c1bc12","observation_id":"5673b951-608c-4260-8a48-770788453204","resolution":{"observed_at":"2026-08-06T23:35:42.894750Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2303.08774","last_updated":"2024-03-04T06:01:33Z","snapshot_observed_at":"2026-08-07T07:30:12.213965Z","submitted_at":"2023-03-15T17:15:04Z","title":"GPT-4 Technical Report","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.08774","snapshot_observed_at":"2026-08-06T23:35:35.964871Z","title":"GPT-4 technical report,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.17611","last_updated":"2025-06-21T06:30:59Z","snapshot_observed_at":"2026-08-10T07:54:14.180718Z","submitted_at":"2025-06-21T06:30:59Z","title":"OpusLM: A Family of Open Unified Speech Language Models","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-06T23:35:35.964871Z"},"links":{"cited_paper":"/paper/2303.08774","citing_paper":"/paper/2506.17611"},"observation_digest":"sha256:8897ae5376ebd5b1639cc5a6b906449485f8596b057cb823aef264b46ed78551","observation_id":"3ff11d81-8665-4a31-9c7a-1f0999cb9d6d","resolution":{"observed_at":"2026-08-06T23:35:35.964871Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.21783","last_updated":"2024-11-23T23:27:33Z","snapshot_observed_at":"2026-08-13T17:20:44.002518Z","submitted_at":"2024-07-31T17:54:27Z","title":"The Llama 3 Herd of Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.21783","snapshot_observed_at":"2026-08-06T23:35:35.991787Z","title":"The Llama 3 herd of models,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.17611","last_updated":"2025-06-21T06:30:59Z","snapshot_observed_at":"2026-08-10T07:54:14.180718Z","submitted_at":"2025-06-21T06:30:59Z","title":"OpusLM: A Family of Open Unified Speech Language Models","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-06T23:35:35.991787Z"},"links":{"cited_paper":"/paper/2407.21783","citing_paper":"/paper/2506.17611"},"observation_digest":"sha256:103f9acb57cce9dd24be122a70cdc4f75b91ca1412fcb3ba6e027d7702806a0d","observation_id":"da065035-e9bc-4f03-8750-778e2e82fe75","resolution":{"observed_at":"2026-08-06T23:35:35.991787Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2303.18223","last_updated":"2026-03-18T05:34:39Z","snapshot_observed_at":"2026-08-14T10:40:26.323157Z","submitted_at":"2023-03-31T17:28:46Z","title":"A Survey of Large Language Models","version":19},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.18223","snapshot_observed_at":"2026-08-06T23:35:35.998119Z","title":"A survey of large language models,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.17611","last_updated":"2025-06-21T06:30:59Z","snapshot_observed_at":"2026-08-10T07:54:14.180718Z","submitted_at":"2025-06-21T06:30:59Z","title":"OpusLM: A Family of Open Unified Speech Language Models","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-06T23:35:35.998119Z"},"links":{"cited_paper":"/paper/2303.18223","citing_paper":"/paper/2506.17611"},"observation_digest":"sha256:e3df0178f034b76c582d8e0515db1106ebb3a2c693cee150f1249bf695efa4ed","observation_id":"ff696368-a817-4e6b-9932-d2321378b2c5","resolution":{"observed_at":"2026-08-06T23:35:35.998119Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.03751","last_updated":"2025-08-07T13:29:43Z","snapshot_observed_at":"2026-08-13T04:26:19.215530Z","submitted_at":"2024-10-01T21:48:12Z","title":"Recent Advances in Speech Language Models: A Survey","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.03751","snapshot_observed_at":"2026-08-06T23:35:36.004978Z","title":"Recent advances in speech language models: A survey,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.17611","last_updated":"2025-06-21T06:30:59Z","snapshot_observed_at":"2026-08-10T07:54:14.180718Z","submitted_at":"2025-06-21T06:30:59Z","title":"OpusLM: A Family of Open Unified Speech Language Models","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-06T23:35:36.004978Z"},"links":{"cited_paper":"/paper/2410.03751","citing_paper":"/paper/2506.17611"},"observation_digest":"sha256:74c8a313ac463e8b6fa99dbd2a6f199107a4169bdace66a8d4db05f6adefe6c1","observation_id":"bb72e72e-eb31-46a0-8cd5-6748b6f876b0","resolution":{"observed_at":"2026-08-06T23:35:36.004978Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:35:36.046876Z","title":"A survey on speech large language models,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.17611","last_updated":"2025-06-21T06:30:59Z","snapshot_observed_at":"2026-08-10T07:54:14.180718Z","submitted_at":"2025-06-21T06:30:59Z","title":"OpusLM: A Family of Open Unified Speech Language Models","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-06T23:35:36.046876Z"},"links":{"citing_paper":"/paper/2506.17611"},"observation_digest":"sha256:83bed200d51aac59a3cc20922ed410a52ad0a673c001e1f87bae8f7d91ba4789","observation_id":"73bd60e5-4c44-43e7-b345-b972a9be184a","resolution":{"observed_at":"2026-08-06T23:35:36.046876Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2411.13577","last_updated":"2024-11-26T09:20:48Z","snapshot_observed_at":"2026-08-12T20:06:41.245137Z","submitted_at":"2024-11-15T04:16:45Z","title":"WavChat: A Survey of Spoken Dialogue Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.13577","snapshot_observed_at":"2026-08-06T23:35:36.084747Z","title":"Wavchat: A survey of spoken dialogue models,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.17611","last_updated":"2025-06-21T06:30:59Z","snapshot_observed_at":"2026-08-10T07:54:14.180718Z","submitted_at":"2025-06-21T06:30:59Z","title":"OpusLM: A Family of Open Unified Speech Language Models","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-06T23:35:36.084747Z"},"links":{"cited_paper":"/paper/2411.13577","citing_paper":"/paper/2506.17611"},"observation_digest":"sha256:dc3dce09cd790e171ced89f931bf63f724a7aeed7b6d6f184b9aec4f7c7070a9","observation_id":"b65c5f37-2a5f-4cad-b67c-2cbb5e689769","resolution":{"observed_at":"2026-08-06T23:35:36.084747Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.10759","last_updated":"2024-07-15T14:38:09Z","snapshot_observed_at":"2026-08-14T01:27:16.843576Z","submitted_at":"2024-07-15T14:38:09Z","title":"Qwen2-Audio Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.10759","snapshot_observed_at":"2026-08-06T23:35:36.144749Z","title":"Qwen2-audio technical report,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.17611","last_updated":"2025-06-21T06:30:59Z","snapshot_observed_at":"2026-08-10T07:54:14.180718Z","submitted_at":"2025-06-21T06:30:59Z","title":"OpusLM: A Family of Open Unified Speech Language Models","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-06T23:35:36.144749Z"},"links":{"cited_paper":"/paper/2407.10759","citing_paper":"/paper/2506.17611"},"observation_digest":"sha256:2e45a84f2dfe374fd934c4841bc95b7bb28d15fa8d7f1b2c730d20e35b65428d","observation_id":"8ef6a9b0-5cb3-4c18-af6d-6e8ef37cb0ea","resolution":{"observed_at":"2026-08-06T23:35:36.144749Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:35:42.668023Z","title":"V oxtlm: Unified decoder-only models for consoli- dating speech recognition, synthesis and speech, text continuation tasks,","venue":null,"work_id":"b2385a76-30fe-47d5-8dc9-72f44e4182ec","year":2024},"citing_paper":{"arxiv_id":"2506.17611","last_updated":"2025-06-21T06:30:59Z","snapshot_observed_at":"2026-08-10T07:54:14.180718Z","submitted_at":"2025-06-21T06:30:59Z","title":"OpusLM: A Family of Open Unified Speech Language Models","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-06T23:35:36.184826Z"},"links":{"citing_paper":"/paper/2506.17611"},"observation_digest":"sha256:67fe9cd01408aff249111fad86f0af3888d69b2800df21a9f6b1bfdd156f2928","observation_id":"1116a37e-1c1a-4135-8dc9-802542cac382","resolution":{"observed_at":"2026-08-06T23:35:42.712790Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:35:42.564747Z","title":"Uniaudio: Towards universal audio generation with large language models,","venue":null,"work_id":"8daae779-5373-4baa-a998-7d5c0a4441e6","year":2024},"citing_paper":{"arxiv_id":"2506.17611","last_updated":"2025-06-21T06:30:59Z","snapshot_observed_at":"2026-08-10T07:54:14.180718Z","submitted_at":"2025-06-21T06:30:59Z","title":"OpusLM: A Family of Open Unified Speech Language Models","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-06T23:35:36.226145Z"},"links":{"citing_paper":"/paper/2506.17611"},"observation_digest":"sha256:f12e58fadeab56cac6da2dd89092befee7aa7fad137899ce12fd3cd010b190c5","observation_id":"bb2df365-0857-4293-8b3a-fe758f918271","resolution":{"observed_at":"2026-08-06T23:35:42.598157Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:35:42.474830Z","title":"SpeechX: Neural codec language model as a ver- satile speech transformer,","venue":null,"work_id":"ca3403f7-3bd2-4dbb-a060-787250d9880c","year":2024},"citing_paper":{"arxiv_id":"2506.17611","last_updated":"2025-06-21T06:30:59Z","snapshot_observed_at":"2026-08-10T07:54:14.180718Z","submitted_at":"2025-06-21T06:30:59Z","title":"OpusLM: A Family of Open Unified Speech Language Models","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-06T23:35:36.284828Z"},"links":{"citing_paper":"/paper/2506.17611"},"observation_digest":"sha256:8a6e1d851341465ad8099cdf6ae84c17428d8993c52161e4a6311b604b145fef","observation_id":"91e9715e-1895-40cf-980a-feaa593d1713","resolution":{"observed_at":"2026-08-06T23:35:42.497580Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2303.03926","last_updated":"2023-03-07T14:31:55Z","snapshot_observed_at":"2026-08-13T12:29:52.281350Z","submitted_at":"2023-03-07T14:31:55Z","title":"Speak Foreign Languages with Your Own Voice: Cross-Lingual Neural Codec Language Modeling","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.03926","snapshot_observed_at":"2026-08-06T23:35:36.334752Z","title":"Speak foreign languages with your own voice: Cross-lingual neural codec language modeling,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.17611","last_updated":"2025-06-21T06:30:59Z","snapshot_observed_at":"2026-08-10T07:54:14.180718Z","submitted_at":"2025-06-21T06:30:59Z","title":"OpusLM: A Family of Open Unified Speech Language Models","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-06T23:35:36.334752Z"},"links":{"cited_paper":"/paper/2303.03926","citing_paper":"/paper/2506.17611"},"observation_digest":"sha256:3ad8b29078550674750d5b04b737261ea78ebe8d2dde4bacd3cbd122860bbf89","observation_id":"e58d9ddf-40d0-4d10-893d-ff661ecaf7eb","resolution":{"observed_at":"2026-08-06T23:35:36.334752Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.00037","last_updated":"2024-10-02T09:11:45Z","snapshot_observed_at":"2026-07-30T10:21:14.474746Z","submitted_at":"2024-09-17T17:55:39Z","title":"Moshi: a speech-text foundation model for real-time dialogue","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.00037","snapshot_observed_at":"2026-08-06T23:35:36.384751Z","title":"Moshi: a speech-text foundation model for real-time dialogue,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.17611","last_updated":"2025-06-21T06:30:59Z","snapshot_observed_at":"2026-08-10T07:54:14.180718Z","submitted_at":"2025-06-21T06:30:59Z","title":"OpusLM: A Family of Open Unified Speech Language Models","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-06T23:35:36.384751Z"},"links":{"cited_paper":"/paper/2410.00037","citing_paper":"/paper/2506.17611"},"observation_digest":"sha256:4ea2b4a59a7650596f9456325ee8b1388db795269af0343d94da0a2299ac97e1","observation_id":"8be3e27d-70a3-4345-aa55-5203dfe1087e","resolution":{"observed_at":"2026-08-06T23:35:36.384751Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.01957","last_updated":"2025-10-24T02:32:10Z","snapshot_observed_at":"2026-08-12T20:39:04.708938Z","submitted_at":"2025-01-03T18:59:52Z","title":"VITA-1.5: Towards GPT-4o Level Real-Time Vision and Speech Interaction","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.01957","snapshot_observed_at":"2026-08-06T23:35:36.434750Z","title":"VITA-1.5: Towards gpt-4o level real-time vision and speech interaction,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.17611","last_updated":"2025-06-21T06:30:59Z","snapshot_observed_at":"2026-08-10T07:54:14.180718Z","submitted_at":"2025-06-21T06:30:59Z","title":"OpusLM: A Family of Open Unified Speech Language Models","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-06T23:35:36.434750Z"},"links":{"cited_paper":"/paper/2501.01957","citing_paper":"/paper/2506.17611"},"observation_digest":"sha256:4e2a447533cfa35dd13f2ed6c66e9b4df02f4fa98abc3c247cc9e9b08f88c61d","observation_id":"4671bcde-ba59-4488-adc5-c0b8b2c4d638","resolution":{"observed_at":"2026-08-06T23:35:36.434750Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.11190","last_updated":"2024-11-05T02:27:57Z","snapshot_observed_at":"2026-08-12T22:23:10.507095Z","submitted_at":"2024-10-15T02:10:45Z","title":"Mini-Omni2: Towards Open-source GPT-4o with Vision, Speech and Duplex Capabilities","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.11190","snapshot_observed_at":"2026-08-06T23:35:36.459737Z","title":"Mini-omni2: Towards open-source gpt- 4o with vision, speech and duplex capabilities,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.17611","last_updated":"2025-06-21T06:30:59Z","snapshot_observed_at":"2026-08-10T07:54:14.180718Z","submitted_at":"2025-06-21T06:30:59Z","title":"OpusLM: A Family of Open Unified Speech Language Models","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-06T23:35:36.459737Z"},"links":{"cited_paper":"/paper/2410.11190","citing_paper":"/paper/2506.17611"},"observation_digest":"sha256:89d53bef7f634b07c0aea4d13575e08e74403f4968b2e3a8a0b5b418cd123363","observation_id":"6c5dedfc-9ad4-4aea-a19b-e1f21db0a1b9","resolution":{"observed_at":"2026-08-06T23:35:36.459737Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:35:42.431796Z","title":"GLM-4-V oice: Towards intelligent and human- like end-to-end spoken chatbot,","venue":null,"work_id":"b2f04575-e707-4406-a9bc-e14234b87cc4","year":2024},"citing_paper":{"arxiv_id":"2506.17611","last_updated":"2025-06-21T06:30:59Z","snapshot_observed_at":"2026-08-10T07:54:14.180718Z","submitted_at":"2025-06-21T06:30:59Z","title":"OpusLM: A Family of Open Unified Speech Language Models","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-06T23:35:36.484883Z"},"links":{"citing_paper":"/paper/2506.17611"},"observation_digest":"sha256:6669d0fe4fde97f3cd0387107d374ef9148fcf37b978204eef3bd8d024f8f2e6","observation_id":"4ea713a3-5306-4c83-8481-dcaf28e86912","resolution":{"observed_at":"2026-08-06T23:35:42.447416Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:35:36.524956Z","title":"Ocean-omni: To understand the world with omni- modality,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.17611","last_updated":"2025-06-21T06:30:59Z","snapshot_observed_at":"2026-08-10T07:54:14.180718Z","submitted_at":"2025-06-21T06:30:59Z","title":"OpusLM: A Family of Open Unified Speech Language Models","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-06T23:35:36.524956Z"},"links":{"citing_paper":"/paper/2506.17611"},"observation_digest":"sha256:0e76342091af089a3ec2befbb5211d37e154e6bfc9251a6bf8bdd343e8bd4e78","observation_id":"c52f4991-75aa-4ad9-bc57-22d18667c366","resolution":{"observed_at":"2026-08-06T23:35:36.524956Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:35:42.176322Z","title":"V oiceTextBlender: Augmenting Large Language Models with Speech Capabilities via Single-Stage Joint Speech- Text Supervised Fine-Tuning,","venue":null,"work_id":"22ac2c10-5e8e-4ac5-9ac7-9e9cd2cf6d5f","year":2025},"citing_paper":{"arxiv_id":"2506.17611","last_updated":"2025-06-21T06:30:59Z","snapshot_observed_at":"2026-08-10T07:54:14.180718Z","submitted_at":"2025-06-21T06:30:59Z","title":"OpusLM: A Family of Open Unified Speech Language Models","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-06T23:35:36.551512Z"},"links":{"citing_paper":"/paper/2506.17611"},"observation_digest":"sha256:32af93573627541ddc0858784f3eb3928167c4eb60ced96a25562a9e1b61b9b3","observation_id":"a8d48137-7d0c-489f-86b0-9e6e0c7883a8","resolution":{"observed_at":"2026-08-06T23:35:42.325354Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:35:41.865121Z","title":"Role of intelligence tests in speech/language,","venue":null,"work_id":"cf1e746d-b50b-4adb-b18e-32fe72a72346","year":1996},"citing_paper":{"arxiv_id":"2506.17611","last_updated":"2025-06-21T06:30:59Z","snapshot_observed_at":"2026-08-10T07:54:14.180718Z","submitted_at":"2025-06-21T06:30:59Z","title":"OpusLM: A Family of Open Unified Speech Language Models","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-06T23:35:36.568157Z"},"links":{"citing_paper":"/paper/2506.17611"},"observation_digest":"sha256:dfbe87a5292c9144149efef0066e62482c3dd2e8778632afd0cbfd0b2fdeba34","observation_id":"1302e537-cbc1-4284-b308-3a2af68d494c","resolution":{"observed_at":"2026-08-06T23:35:42.026476Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.21276","last_updated":"2024-10-25T17:43:01Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-10-25T17:43:01Z","title":"GPT-4o System Card","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.21276","snapshot_observed_at":"2026-08-06T23:35:36.580526Z","title":"GPT-4o system card,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.17611","last_updated":"2025-06-21T06:30:59Z","snapshot_observed_at":"2026-08-10T07:54:14.180718Z","submitted_at":"2025-06-21T06:30:59Z","title":"OpusLM: A Family of Open Unified Speech Language Models","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-06T23:35:36.580526Z"},"links":{"cited_paper":"/paper/2410.21276","citing_paper":"/paper/2506.17611"},"observation_digest":"sha256:d340d52998c10bd91406cf5783be8a991005b5526b5eeea76600e9ef627dc7fc","observation_id":"8f3ab886-beea-43fa-973c-b2a58273f08a","resolution":{"observed_at":"2026-08-06T23:35:36.580526Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.11805","last_updated":"2025-05-09T21:04:06Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-12-19T02:39:27Z","title":"Gemini: A Family of Highly Capable Multimodal Models","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.11805","snapshot_observed_at":"2026-08-06T23:35:36.595070Z","title":"Gemini: a family of highly capable multimodal mod- els,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.17611","last_updated":"2025-06-21T06:30:59Z","snapshot_observed_at":"2026-08-10T07:54:14.180718Z","submitted_at":"2025-06-21T06:30:59Z","title":"OpusLM: A Family of Open Unified Speech Language Models","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-06T23:35:36.595070Z"},"links":{"cited_paper":"/paper/2312.11805","citing_paper":"/paper/2506.17611"},"observation_digest":"sha256:8e4d3c0c88a74e4c058dff6c3c660782629418ea544d97dd7e179e3f72e000e4","observation_id":"4f1d3656-06bc-49ae-8278-a3baecccb410","resolution":{"observed_at":"2026-08-06T23:35:36.595070Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:35:41.634955Z","title":"Owsm v3.1: Better and faster open whisper-style speech models based on e-branchformer,","venue":null,"work_id":"790adeb5-81d9-4bc3-826c-bd7e681a5412","year":2024},"citing_paper":{"arxiv_id":"2506.17611","last_updated":"2025-06-21T06:30:59Z","snapshot_observed_at":"2026-08-10T07:54:14.180718Z","submitted_at":"2025-06-21T06:30:59Z","title":"OpusLM: A Family of Open Unified Speech Language Models","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-06T23:35:36.640226Z"},"links":{"citing_paper":"/paper/2506.17611"},"observation_digest":"sha256:476fa0f9106505d912024aa42dc8db2dca73ef6fc1a4093d757c4f9bcac33c51","observation_id":"26861933-ce1a-4d5e-9135-504cbd478843","resolution":{"observed_at":"2026-08-06T23:35:41.664808Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:35:41.484746Z","title":"On the effects of heterogeneous data sources on speech-to-text foundation models,","venue":null,"work_id":"fc72d9bf-200d-4786-a266-88cb9cfd2681","year":2024},"citing_paper":{"arxiv_id":"2506.17611","last_updated":"2025-06-21T06:30:59Z","snapshot_observed_at":"2026-08-10T07:54:14.180718Z","submitted_at":"2025-06-21T06:30:59Z","title":"OpusLM: A Family of Open Unified Speech Language Models","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-06T23:35:36.659701Z"},"links":{"citing_paper":"/paper/2506.17611"},"observation_digest":"sha256:25f6d7e19d3f9d1fcbd3823079c60e4b1bbdcd3b9c583dc0bb8f01b0ba20e819","observation_id":"fde3f299-ccb8-4ab8-b995-f13370bbca2c","resolution":{"observed_at":"2026-08-06T23:35:41.531325Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.00656","last_updated":"2025-10-08T07:50:45Z","snapshot_observed_at":"2026-08-08T06:58:44.493777Z","submitted_at":"2024-12-31T21:55:10Z","title":"2 OLMo 2 Furious","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.00656","snapshot_observed_at":"2026-08-06T23:35:36.704077Z","title":"Olmo 2 furious,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.17611","last_updated":"2025-06-21T06:30:59Z","snapshot_observed_at":"2026-08-10T07:54:14.180718Z","submitted_at":"2025-06-21T06:30:59Z","title":"OpusLM: A Family of Open Unified Speech Language Models","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-06T23:35:36.704077Z"},"links":{"cited_paper":"/paper/2501.00656","citing_paper":"/paper/2506.17611"},"observation_digest":"sha256:f55324f5959e95541e935081f6057faf70b771df3da0f8a8c4420c32b9ab1101","observation_id":"7d548fb4-ed25-440b-a023-a30419e2dd8a","resolution":{"observed_at":"2026-08-06T23:35:36.704077Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:35:41.364806Z","title":"Parler-tts,","venue":null,"work_id":"21c1437c-2297-4cb1-8403-3da4dab45ca8","year":2024},"citing_paper":{"arxiv_id":"2506.17611","last_updated":"2025-06-21T06:30:59Z","snapshot_observed_at":"2026-08-10T07:54:14.180718Z","submitted_at":"2025-06-21T06:30:59Z","title":"OpusLM: A Family of Open Unified Speech Language Models","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-06T23:35:36.735394Z"},"links":{"citing_paper":"/paper/2506.17611"},"observation_digest":"sha256:9f9ccc1a4786d248ee06d2e04068c425f57727820dd6726d29de7b99e61aea68","observation_id":"cc165af1-575a-49b4-8216-c7e6b40122ee","resolution":{"observed_at":"2026-08-06T23:35:41.394807Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:35:41.277395Z","title":"ESPnet-SpeechLM: An open speech language model toolkit,","venue":null,"work_id":"86d243c2-9799-481d-beb5-7cd7e64f2046","year":2024},"citing_paper":{"arxiv_id":"2506.17611","last_updated":"2025-06-21T06:30:59Z","snapshot_observed_at":"2026-08-10T07:54:14.180718Z","submitted_at":"2025-06-21T06:30:59Z","title":"OpusLM: A Family of Open Unified Speech Language Models","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-06T23:35:36.766750Z"},"links":{"citing_paper":"/paper/2506.17611"},"observation_digest":"sha256:7adfa9078f7aa7c2bed5e88da4d5451e2afd389359b4bf88a7ce85dc2a86e2d7","observation_id":"09dcac45-0ef7-426b-a577-a7b8666813e9","resolution":{"observed_at":"2026-08-06T23:35:41.315783Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:35:41.144739Z","title":"Librispeech: an ASR corpus based on public domain audio books,","venue":null,"work_id":"5e59c31c-a9d1-4060-b920-fdca18d9ef84","year":2015},"citing_paper":{"arxiv_id":"2506.17611","last_updated":"2025-06-21T06:30:59Z","snapshot_observed_at":"2026-08-10T07:54:14.180718Z","submitted_at":"2025-06-21T06:30:59Z","title":"OpusLM: A Family of Open Unified Speech Language Models","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-06T23:35:36.795731Z"},"links":{"citing_paper":"/paper/2506.17611"},"observation_digest":"sha256:d058864d6c52621a1a164c21ae2e36562ff3956d1965a03db33bf3cfcc73934c","observation_id":"b92efcad-d929-43fa-b14b-628ecd758c33","resolution":{"observed_at":"2026-08-06T23:35:41.183085Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2009.03300","last_updated":"2021-01-12T18:57:11Z","snapshot_observed_at":"2026-08-13T20:44:28.824685Z","submitted_at":"2020-09-07T17:59:25Z","title":"Measuring Massive Multitask Language Understanding","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2009.03300","snapshot_observed_at":"2026-08-06T23:35:36.816221Z","title":"Measuring massive multitask language un- derstanding,","venue":null,"work_id":null,"year":2009},"citing_paper":{"arxiv_id":"2506.17611","last_updated":"2025-06-21T06:30:59Z","snapshot_observed_at":"2026-08-10T07:54:14.180718Z","submitted_at":"2025-06-21T06:30:59Z","title":"OpusLM: A Family of Open Unified Speech Language Models","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-06T23:35:36.816221Z"},"links":{"cited_paper":"/paper/2009.03300","citing_paper":"/paper/2506.17611"},"observation_digest":"sha256:b585aea713df881c771d044309b2ef8f5e8253500b76296ef184aa14f82c370b","observation_id":"5d1a4c94-3f59-4a24-883d-c38a21e028bd","resolution":{"observed_at":"2026-08-06T23:35:36.816221Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:35:36.834754Z","title":"SALMONN: Towards generic hearing abilities for large language models,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.17611","last_updated":"2025-06-21T06:30:59Z","snapshot_observed_at":"2026-08-10T07:54:14.180718Z","submitted_at":"2025-06-21T06:30:59Z","title":"OpusLM: A Family of Open Unified Speech Language Models","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-06T23:35:36.834754Z"},"links":{"citing_paper":"/paper/2506.17611"},"observation_digest":"sha256:04174555610b44a34db7365bb8edb19e96922dda752c112c0ff7626f7be28a1c","observation_id":"5e0c97e7-7dd4-4d1e-add7-3e9cf29eccd5","resolution":{"observed_at":"2026-08-06T23:35:36.834754Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:35:41.003947Z","title":"Speak, read and prompt: High-fidelity text- to-speech with minimal supervision,","venue":null,"work_id":"d2d2bb02-ebeb-4f62-9982-7c20c0578092","year":2023},"citing_paper":{"arxiv_id":"2506.17611","last_updated":"2025-06-21T06:30:59Z","snapshot_observed_at":"2026-08-10T07:54:14.180718Z","submitted_at":"2025-06-21T06:30:59Z","title":"OpusLM: A Family of Open Unified Speech Language Models","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-06T23:35:36.880206Z"},"links":{"citing_paper":"/paper/2506.17611"},"observation_digest":"sha256:9436d38667e8de5d68d04261c39a7fadb887e4e6324419d0426fd84fae9e7e33","observation_id":"9c573230-f601-4b7c-ac62-6424680a70b1","resolution":{"observed_at":"2026-08-06T23:35:41.025369Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:35:40.908855Z","title":"Audiolm: a language modeling approach to au- dio generation,","venue":null,"work_id":"1b9dc1a9-9e67-4373-bced-5210d0f0d63e","year":2023},"citing_paper":{"arxiv_id":"2506.17611","last_updated":"2025-06-21T06:30:59Z","snapshot_observed_at":"2026-08-10T07:54:14.180718Z","submitted_at":"2025-06-21T06:30:59Z","title":"OpusLM: A Family of Open Unified Speech Language Models","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-06T23:35:36.905232Z"},"links":{"citing_paper":"/paper/2506.17611"},"observation_digest":"sha256:7921729410329fc30853c15cc30b4e0449a18d31fd704105ca5477f586b2088f","observation_id":"1ee27a7c-4577-4596-9748-7656a98eb793","resolution":{"observed_at":"2026-08-06T23:35:40.926122Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:35:40.802352Z","title":"Soundstream: An end-to-end neural audio codec,","venue":null,"work_id":"41ea802a-4fb1-4ac2-a269-76667bf1fb9a","year":2021},"citing_paper":{"arxiv_id":"2506.17611","last_updated":"2025-06-21T06:30:59Z","snapshot_observed_at":"2026-08-10T07:54:14.180718Z","submitted_at":"2025-06-21T06:30:59Z","title":"OpusLM: A Family of Open Unified Speech Language Models","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-06T23:35:36.954999Z"},"links":{"citing_paper":"/paper/2506.17611"},"observation_digest":"sha256:1257ca9753bacc4ad6141d0d66cd57947d610cad1fc587f78b720475810b845a","observation_id":"8b28a046-c13e-47e0-83bb-8465db3a9f11","resolution":{"observed_at":"2026-08-06T23:35:40.834738Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:35:40.686383Z","title":"Robust speech recognition via large-scale weak supervision,","venue":null,"work_id":"73aed164-2bc7-404f-a5a6-96f332abb230","year":2023},"citing_paper":{"arxiv_id":"2506.17611","last_updated":"2025-06-21T06:30:59Z","snapshot_observed_at":"2026-08-10T07:54:14.180718Z","submitted_at":"2025-06-21T06:30:59Z","title":"OpusLM: A Family of Open Unified Speech Language Models","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-06T23:35:36.993493Z"},"links":{"citing_paper":"/paper/2506.17611"},"observation_digest":"sha256:f3d696ff84a9c3961894bcfd7442437105068a34af19098d87d89983ee9f704f","observation_id":"ec395036-1136-4f94-aa1d-8f93c6921728","resolution":{"observed_at":"2026-08-06T23:35:40.709792Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:35:40.575074Z","title":"Chattts: A generative speech model for daily dialogue","venue":null,"work_id":"8e03c6ae-146d-4bcd-adb1-ad3335424f18","year":2024},"citing_paper":{"arxiv_id":"2506.17611","last_updated":"2025-06-21T06:30:59Z","snapshot_observed_at":"2026-08-10T07:54:14.180718Z","submitted_at":"2025-06-21T06:30:59Z","title":"OpusLM: A Family of Open Unified Speech Language Models","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-06T23:35:37.024923Z"},"links":{"citing_paper":"/paper/2506.17611"},"observation_digest":"sha256:e4279c098a1b17e49aff16c0e2c53c179760e6854727e5139a573263e18bfeeb","observation_id":"e48e996f-b2a4-4258-9e71-c0d01fd405a6","resolution":{"observed_at":"2026-08-06T23:35:40.625504Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.05407","last_updated":"2024-07-09T07:42:51Z","snapshot_observed_at":"2026-08-10T17:49:50.848957Z","submitted_at":"2024-07-07T15:16:19Z","title":"CosyVoice: A Scalable Multilingual Zero-shot Text-to-speech Synthesizer based on Supervised Semantic Tokens","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.05407","snapshot_observed_at":"2026-08-06T23:35:37.056647Z","title":"Cosyvoice: A scalable multilingual zero-shot text-to-speech synthesizer based on supervised semantic tokens,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.17611","last_updated":"2025-06-21T06:30:59Z","snapshot_observed_at":"2026-08-10T07:54:14.180718Z","submitted_at":"2025-06-21T06:30:59Z","title":"OpusLM: A Family of Open Unified Speech Language Models","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-06T23:35:37.056647Z"},"links":{"cited_paper":"/paper/2407.05407","citing_paper":"/paper/2506.17611"},"observation_digest":"sha256:e78990c874229e901be82ea28abc15eabd7abecdb237d773d09672ecd5e2d301","observation_id":"52c982af-42cf-4abd-b1fe-a57526a91a20","resolution":{"observed_at":"2026-08-06T23:35:37.056647Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.08295","last_updated":"2024-04-16T12:52:47Z","snapshot_observed_at":"2026-08-03T03:29:01.959523Z","submitted_at":"2024-03-13T06:59:16Z","title":"Gemma: Open Models Based on Gemini Research and Technology","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.08295","snapshot_observed_at":"2026-08-06T23:35:37.094892Z","title":"Gemma: Open models based on gemini research and technology,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.17611","last_updated":"2025-06-21T06:30:59Z","snapshot_observed_at":"2026-08-10T07:54:14.180718Z","submitted_at":"2025-06-21T06:30:59Z","title":"OpusLM: A Family of Open Unified Speech Language Models","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-06T23:35:37.094892Z"},"links":{"cited_paper":"/paper/2403.08295","citing_paper":"/paper/2506.17611"},"observation_digest":"sha256:54122ff991a5ce4353efd549b660dc80f5a7b7fe4f3213298694ecff8df7a64d","observation_id":"9e742353-f459-4b9c-ac78-b736f50fc1cf","resolution":{"observed_at":"2026-08-06T23:35:37.094892Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.02737","last_updated":"2025-02-04T21:43:16Z","snapshot_observed_at":"2026-08-14T05:03:05.661970Z","submitted_at":"2025-02-04T21:43:16Z","title":"SmolLM2: When Smol Goes Big -- Data-Centric Training of a Small Language Model","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.02737","snapshot_observed_at":"2026-08-06T23:35:37.134608Z","title":"Smollm2: When smol goes big–data- centric training of a small language model,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.17611","last_updated":"2025-06-21T06:30:59Z","snapshot_observed_at":"2026-08-10T07:54:14.180718Z","submitted_at":"2025-06-21T06:30:59Z","title":"OpusLM: A Family of Open Unified Speech Language Models","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-06T23:35:37.134608Z"},"links":{"cited_paper":"/paper/2502.02737","citing_paper":"/paper/2506.17611"},"observation_digest":"sha256:8074c2d100cd1990e582467279e1b31cf084b7d18122dfa8c24f8cd021919547","observation_id":"db665f08-39dd-412a-adc2-67c86da45994","resolution":{"observed_at":"2026-08-06T23:35:37.134608Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2307.09288","last_updated":"2023-07-19T17:08:59Z","snapshot_observed_at":"2026-08-07T12:56:43.323460Z","submitted_at":"2023-07-18T14:31:57Z","title":"Llama 2: Open Foundation and Fine-Tuned Chat Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.09288","snapshot_observed_at":"2026-08-06T23:35:37.174496Z","title":"Llama 2: Open foundation and fine-tuned chat models,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.17611","last_updated":"2025-06-21T06:30:59Z","snapshot_observed_at":"2026-08-10T07:54:14.180718Z","submitted_at":"2025-06-21T06:30:59Z","title":"OpusLM: A Family of Open Unified Speech Language Models","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-06T23:35:37.174496Z"},"links":{"cited_paper":"/paper/2307.09288","citing_paper":"/paper/2506.17611"},"observation_digest":"sha256:660515ba7f1de785b474c34fc71eb2b5acddeb532de03fea14b3e65de2af1f44","observation_id":"85ea1877-d18b-41a0-930e-5a3f1e7bed1f","resolution":{"observed_at":"2026-08-06T23:35:37.174496Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.05755","last_updated":"2024-10-18T19:18:41Z","snapshot_observed_at":"2026-08-13T04:23:17.954624Z","submitted_at":"2024-02-08T15:39:32Z","title":"Spirit LM: Interleaved Spoken and Written Language Model","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.05755","snapshot_observed_at":"2026-08-06T23:35:37.204906Z","title":"Spirit-lm: Interleaved spoken and written language model,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.17611","last_updated":"2025-06-21T06:30:59Z","snapshot_observed_at":"2026-08-10T07:54:14.180718Z","submitted_at":"2025-06-21T06:30:59Z","title":"OpusLM: A Family of Open Unified Speech Language Models","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-06T23:35:37.204906Z"},"links":{"cited_paper":"/paper/2402.05755","citing_paper":"/paper/2506.17611"},"observation_digest":"sha256:2cf3a95f3d456bd83854cafd03462d3c16270a386f1898cd1239deff5ed1c72d","observation_id":"ca0fb67c-5e01-41e9-8158-5e48fa6eec11","resolution":{"observed_at":"2026-08-06T23:35:37.204906Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2301.02111","last_updated":"2023-01-05T15:37:15Z","snapshot_observed_at":"2026-08-07T10:11:17.796562Z","submitted_at":"2023-01-05T15:37:15Z","title":"Neural Codec Language Models are Zero-Shot Text to Speech Synthesizers","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2301.02111","snapshot_observed_at":"2026-08-06T23:35:37.245740Z","title":"Neural codec language models are zero-shot text to speech synthesizers,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.17611","last_updated":"2025-06-21T06:30:59Z","snapshot_observed_at":"2026-08-10T07:54:14.180718Z","submitted_at":"2025-06-21T06:30:59Z","title":"OpusLM: A Family of Open Unified Speech Language Models","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-06T23:35:37.245740Z"},"links":{"cited_paper":"/paper/2301.02111","citing_paper":"/paper/2506.17611"},"observation_digest":"sha256:9fe5f5c3ce339d1aa987cfff5961527539a9162e3449f8e68d67c34885fa6e76","observation_id":"187d76d5-0bd2-4fa4-8b85-ed7273abebba","resolution":{"observed_at":"2026-08-06T23:35:37.245740Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:35:40.461437Z","title":"Simple and controllable music generation,","venue":null,"work_id":"b64f8a59-574d-4f96-8c84-d0007ed9dca4","year":2024},"citing_paper":{"arxiv_id":"2506.17611","last_updated":"2025-06-21T06:30:59Z","snapshot_observed_at":"2026-08-10T07:54:14.180718Z","submitted_at":"2025-06-21T06:30:59Z","title":"OpusLM: A Family of Open Unified Speech Language Models","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-06T23:35:37.300784Z"},"links":{"citing_paper":"/paper/2506.17611"},"observation_digest":"sha256:55a563c08eb58c390e7f40e1d16e45d7fe0db01dad791a69416a648b1b61b5bb","observation_id":"4bac999b-59ee-4a72-a9a4-2d16557f4151","resolution":{"observed_at":"2026-08-06T23:35:40.490526Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:35:40.322591Z","title":"Yodas: Youtube-oriented dataset for audio and speech,","venue":null,"work_id":"2eccbdf8-90b7-46cc-a19e-77e954112d38","year":2023},"citing_paper":{"arxiv_id":"2506.17611","last_updated":"2025-06-21T06:30:59Z","snapshot_observed_at":"2026-08-10T07:54:14.180718Z","submitted_at":"2025-06-21T06:30:59Z","title":"OpusLM: A Family of Open Unified Speech Language Models","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-06T23:35:37.372656Z"},"links":{"citing_paper":"/paper/2506.17611"},"observation_digest":"sha256:9af90c98eb1d0efb86d9f6c83ecaa51dba4c4d0cc8a92ffbf62815a48cc99fa1","observation_id":"9a757072-8620-42d5-a437-5f474632bdf8","resolution":{"observed_at":"2026-08-06T23:35:40.367605Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:35:40.132308Z","title":"Emilia: An extensive, multilingual, and diverse speech dataset for large-scale speech generation,","venue":null,"work_id":"782f945b-8c29-4504-bca6-dad2ffc5752f","year":2024},"citing_paper":{"arxiv_id":"2506.17611","last_updated":"2025-06-21T06:30:59Z","snapshot_observed_at":"2026-08-10T07:54:14.180718Z","submitted_at":"2025-06-21T06:30:59Z","title":"OpusLM: A Family of Open Unified Speech Language Models","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-06T23:35:37.405956Z"},"links":{"citing_paper":"/paper/2506.17611"},"observation_digest":"sha256:892537ef83a0e4fa612fb1981a3dcb6ecfb07fadc88bfd8929fe13851af8a72a","observation_id":"ca97a751-3b71-4ba0-8951-a4cf453e6657","resolution":{"observed_at":"2026-08-06T23:35:40.184279Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:35:40.021470Z","title":"Zero: Memory optimizations toward train- ing trillion parameter models,","venue":null,"work_id":"12acce86-0aab-432a-94b5-5500cc197749","year":2020},"citing_paper":{"arxiv_id":"2506.17611","last_updated":"2025-06-21T06:30:59Z","snapshot_observed_at":"2026-08-10T07:54:14.180718Z","submitted_at":"2025-06-21T06:30:59Z","title":"OpusLM: A Family of Open Unified Speech Language Models","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-06T23:35:37.442538Z"},"links":{"citing_paper":"/paper/2506.17611"},"observation_digest":"sha256:23e4530c0690be27a92fcbf2bc31602cbfb77432d4eb1f6c021a8bcb527d8e87","observation_id":"65ddbee9-59c0-436a-aab1-22171199b815","resolution":{"observed_at":"2026-08-06T23:35:40.045832Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:35:39.944751Z","title":"PaLM: Scaling language modeling with pathways,","venue":null,"work_id":"2357d3b0-f6b3-4ff0-9966-8e4d15cc7b40","year":2023},"citing_paper":{"arxiv_id":"2506.17611","last_updated":"2025-06-21T06:30:59Z","snapshot_observed_at":"2026-08-10T07:54:14.180718Z","submitted_at":"2025-06-21T06:30:59Z","title":"OpusLM: A Family of Open Unified Speech Language Models","version":1},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-06T23:35:37.458194Z"},"links":{"citing_paper":"/paper/2506.17611"},"observation_digest":"sha256:513631baf1dbcc585603337744cb369376ffa5e07e63a2acdd733b6b702e4b1d","observation_id":"d9b3c04b-0266-4fb1-95c4-a650d1126fec","resolution":{"observed_at":"2026-08-06T23:35:39.974737Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:35:39.839600Z","title":"FLEURS: Few-Shot Learning Evaluation of Universal Representations of Speech,","venue":null,"work_id":"2710659b-c4f7-4eea-bdd1-cebd8c00a2f6","year":2022},"citing_paper":{"arxiv_id":"2506.17611","last_updated":"2025-06-21T06:30:59Z","snapshot_observed_at":"2026-08-10T07:54:14.180718Z","submitted_at":"2025-06-21T06:30:59Z","title":"OpusLM: A Family of Open Unified Speech Language Models","version":1},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-06T23:35:37.461483Z"},"links":{"citing_paper":"/paper/2506.17611"},"observation_digest":"sha256:ec4ec75966e2c691d813bcac50613a5915448c5ced48ee07da463b7ec76822f3","observation_id":"dd4aadb3-8619-433c-bae1-7017716076b2","resolution":{"observed_at":"2026-08-06T23:35:39.856931Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:35:39.797075Z","title":"Espnet-spk: full pipeline speaker embedding toolkit with reproducible recipes, self-supervised front-ends, and off-the-shelf models,","venue":null,"work_id":"ab6f8f2c-090f-4024-97df-8aa83eb6df8f","year":2024},"citing_paper":{"arxiv_id":"2506.17611","last_updated":"2025-06-21T06:30:59Z","snapshot_observed_at":"2026-08-10T07:54:14.180718Z","submitted_at":"2025-06-21T06:30:59Z","title":"OpusLM: A Family of Open Unified Speech Language Models","version":1},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-06T23:35:37.465720Z"},"links":{"citing_paper":"/paper/2506.17611"},"observation_digest":"sha256:ac774faf92177b715ed189b4e6ba7e7599ec5780a6d9b9bed4fe9d62b18d8f6e","observation_id":"3fc516ab-3b33-4181-8635-6bca30a8bc91","resolution":{"observed_at":"2026-08-06T23:35:39.810512Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:35:39.745651Z","title":"Utmos: Utokyo-sarulab system for voicemos challenge 2022,","venue":null,"work_id":"88c1d36c-1614-4a0e-a680-9f48bcf81c85","year":2022},"citing_paper":{"arxiv_id":"2506.17611","last_updated":"2025-06-21T06:30:59Z","snapshot_observed_at":"2026-08-10T07:54:14.180718Z","submitted_at":"2025-06-21T06:30:59Z","title":"OpusLM: A Family of Open Unified Speech Language Models","version":1},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-06T23:35:37.468734Z"},"links":{"citing_paper":"/paper/2506.17611"},"observation_digest":"sha256:3b031e8aad6a53d9acb6f625b7eea4a2482c4aa7c7faebbd787bd8823a7c754c","observation_id":"08caaae5-b12d-4ccb-b00d-ae804b134964","resolution":{"observed_at":"2026-08-06T23:35:39.766985Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.17667","last_updated":"2025-03-27T03:50:10Z","snapshot_observed_at":"2026-08-11T15:07:28.270038Z","submitted_at":"2024-12-23T15:53:21Z","title":"VERSA: A Versatile Evaluation Toolkit for Speech, Audio, and Music","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.17667","snapshot_observed_at":"2026-08-06T23:35:37.473556Z","title":"Versa: A versatile evaluation toolkit for speech, au- dio, and music,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.17611","last_updated":"2025-06-21T06:30:59Z","snapshot_observed_at":"2026-08-10T07:54:14.180718Z","submitted_at":"2025-06-21T06:30:59Z","title":"OpusLM: A Family of Open Unified Speech Language Models","version":1},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-06T23:35:37.473556Z"},"links":{"cited_paper":"/paper/2412.17667","citing_paper":"/paper/2506.17611"},"observation_digest":"sha256:d859d9894a432fe2579bea513cdc253dcfde102bb2551af986e5a958e336af5f","observation_id":"65ee1f7f-35da-48d7-a95e-209464a251ed","resolution":{"observed_at":"2026-08-06T23:35:37.473556Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:35:37.496340Z","title":"Libritts: A corpus derived from librispeech for text-to-speech,","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2506.17611","last_updated":"2025-06-21T06:30:59Z","snapshot_observed_at":"2026-08-10T07:54:14.180718Z","submitted_at":"2025-06-21T06:30:59Z","title":"OpusLM: A Family of Open Unified Speech Language Models","version":1},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-08-06T23:35:37.496340Z"},"links":{"citing_paper":"/paper/2506.17611"},"observation_digest":"sha256:07f76b88b5a7be6aaa90390eac39a7e1fe094e538c6bc24ceba7aeeafad4e9f8","observation_id":"a9101987-efe9-471d-ac91-c6d6b31b1f83","resolution":{"observed_at":"2026-08-06T23:35:37.496340Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:35:39.688016Z","title":"CSTR VCTK Corpus: English Multi-speaker Corpus for CSTR V oice Cloning Toolkit,","venue":null,"work_id":"20a71248-3dfe-47c5-b6a7-c8ead271d4d2","year":2019},"citing_paper":{"arxiv_id":"2506.17611","last_updated":"2025-06-21T06:30:59Z","snapshot_observed_at":"2026-08-10T07:54:14.180718Z","submitted_at":"2025-06-21T06:30:59Z","title":"OpusLM: A Family of Open Unified Speech Language Models","version":1},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-08-06T23:35:37.500919Z"},"links":{"citing_paper":"/paper/2506.17611"},"observation_digest":"sha256:0cfad67c02079cf95ad73e9649352a10575d9d83707af259434fe0b2b8298d54","observation_id":"daa7046c-f4db-4b86-b692-c43c444eba75","resolution":{"observed_at":"2026-08-06T23:35:39.691760Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:35:39.669460Z","title":"GigaSpeech: An Evolving, Multi-Domain ASR Corpus with 10,000 Hours of Transcribed Audio,","venue":null,"work_id":"6fe5e62e-f592-4dcf-bb44-3fd09ff835f3","year":2021},"citing_paper":{"arxiv_id":"2506.17611","last_updated":"2025-06-21T06:30:59Z","snapshot_observed_at":"2026-08-10T07:54:14.180718Z","submitted_at":"2025-06-21T06:30:59Z","title":"OpusLM: A Family of Open Unified Speech Language Models","version":1},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-08-06T23:35:37.509743Z"},"links":{"citing_paper":"/paper/2506.17611"},"observation_digest":"sha256:8063c8201f2cb5d57e06e1e00b8f177384c06b903d11b64327ca1d2d679de451","observation_id":"7a57c7ba-333d-4465-bc03-0569157b14cd","resolution":{"observed_at":"2026-08-06T23:35:39.673426Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:35:39.655810Z","title":"Libriheavy: a 50,000 hours asr corpus with punc- tuation casing and context,","venue":null,"work_id":"77680d6f-ab78-4fbc-a7f7-419e7ddd0048","year":2023},"citing_paper":{"arxiv_id":"2506.17611","last_updated":"2025-06-21T06:30:59Z","snapshot_observed_at":"2026-08-10T07:54:14.180718Z","submitted_at":"2025-06-21T06:30:59Z","title":"OpusLM: A Family of Open Unified Speech Language Models","version":1},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-08-06T23:35:37.514349Z"},"links":{"citing_paper":"/paper/2506.17611"},"observation_digest":"sha256:7c0e7828f46c21de98a86105da3c2da599b1c6e8c79c53b1e41164c9e572ebf6","observation_id":"6c9ed181-5e46-4ca3-851f-922926ed02af","resolution":{"observed_at":"2026-08-06T23:35:39.661422Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2506.17611","last_updated":"2025-06-21T06:30:59Z","latest_version":1,"primary_category":"cs.CL","snapshot_observed_at":"2026-08-10T07:54:14.180718Z","submitted_at":"2025-06-21T06:30:59Z","title":"OpusLM: A Family of Open Unified Speech Language Models"},"reference_resolution":{"displayed":57,"state_counts":{"malformed_identifier":1,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":25,"verified_exact":1,"verified_fuzzy":30},"total_outbound_references":57},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"thesis":"As of 14 August 2026, this Paper Citation Record lists 57 of 57 outbound references and 4 inbound Pith citation observations for arXiv:2506.17611."}