{"as_of":"2026-08-10T05:01:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:3d1444f81edb90b802f25a9ebc1aa8fe31d1b28017349d417782287c5c1919fc","coverage":[{"denominator":58,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":58,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-06T14:50:04.331322Z","state":"measured"},{"denominator":62,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":62,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-09T06:31:02.800959+00:00","state":"measured"},{"denominator":4,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":4,"source":"paper_references, paper_reference_links","source_observed_at":"2026-07-31T23:06:43.144630Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":1,"source":"arxiv_reference","source_observed_at":"2026-08-05T02:28:24.338817Z","state":"measured"}],"external_citation_measurements":[{"count":0,"observed_at":"2026-08-05T02:28:24.338817Z","source":"arxiv_reference"}],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2507.17563","last_updated":"2025-07-23T14:53:50Z","snapshot_observed_at":"2026-08-07T18:31:16.203029Z","submitted_at":"2025-07-23T14:53:50Z","title":"BoSS: Beyond-Semantic Speech","version":1},"cited_work":{"arxiv_id":"2507.17563","doi":"10.48550/arxiv.2507.17563","metadata_source":"arxiv_reference","pith_arxiv_id":"2507.17563","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Boss: Beyond-semantic speech,","venue":"ArXiv.org","work_id":"03af9241-116d-4c15-87e2-b24d3bd9bb3f","year":2025},"citing_paper":{"arxiv_id":"2606.01016","last_updated":"2026-05-31T05:13:32Z","snapshot_observed_at":"2026-07-06T23:41:39.172310Z","submitted_at":"2026-05-31T05:13:32Z","title":"PolySpeech-100: A Large-Scale Benchmark for Speech Understanding Across 100+ Languages and Dialects","version":1},"reference_index":84,"source":"pdf_text","source_observed_at":"2026-06-28T17:44:07.669223Z"},"links":{"cited_paper":"/paper/2507.17563","citing_paper":"/paper/2606.01016"},"observation_digest":"sha256:e9d4a8ff1808a4915684af5946ee34e288af4a2617fa0aa16dc3690660794757","observation_id":"d50d2668-13ce-4769-ab2f-1f23653570c2","resolution":{"observed_at":"2026-06-28T17:52:27.034536Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2507.17563","last_updated":"2025-07-23T14:53:50Z","snapshot_observed_at":"2026-08-07T18:31:16.203029Z","submitted_at":"2025-07-23T14:53:50Z","title":"BoSS: Beyond-Semantic Speech","version":1},"cited_work":{"arxiv_id":"2507.17563","doi":"10.48550/arxiv.2507.17563","metadata_source":"arxiv_reference","pith_arxiv_id":"2507.17563","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Boss: Beyond-semantic speech,","venue":"ArXiv.org","work_id":"03af9241-116d-4c15-87e2-b24d3bd9bb3f","year":2025},"citing_paper":{"arxiv_id":"2606.05911","last_updated":"2026-06-04T09:16:26Z","snapshot_observed_at":"2026-08-06T13:48:13.385785Z","submitted_at":"2026-06-04T09:16:26Z","title":"DBHN-Net: Dual-Branch Hybrid Neural Network For Low-Complexity Monaural Speech Enhancement","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-06-27T23:49:05.871422Z"},"links":{"cited_paper":"/paper/2507.17563","citing_paper":"/paper/2606.05911"},"observation_digest":"sha256:a18cbcb5c9adaf7c881c9c7dd2f1628c9d37c041b1c5fd6946b55e93ecce2b6f","observation_id":"0bfbeeef-bea8-4266-87cb-a94e28ad5ad6","resolution":{"observed_at":"2026-07-02T15:37:06.111137Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2507.17563","last_updated":"2025-07-23T14:53:50Z","snapshot_observed_at":"2026-08-07T18:31:16.203029Z","submitted_at":"2025-07-23T14:53:50Z","title":"BoSS: Beyond-Semantic Speech","version":1},"cited_work":{"arxiv_id":"2507.17563","doi":"10.48550/arxiv.2507.17563","metadata_source":"arxiv_reference","pith_arxiv_id":"2507.17563","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Boss: Beyond-semantic speech,","venue":"ArXiv.org","work_id":"03af9241-116d-4c15-87e2-b24d3bd9bb3f","year":2025},"citing_paper":{"arxiv_id":"2606.11219","last_updated":"2026-05-11T20:27:40Z","snapshot_observed_at":"2026-08-05T20:46:41.277498Z","submitted_at":"2026-05-11T20:27:40Z","title":"Afrispeech Semantics: Evaluating Audio Semantic Reasoning in Spoken Language Models Across Domains and Accents","version":1},"reference_index":199,"source":"arxiv_source","source_observed_at":"2026-06-30T22:11:44.891731Z"},"links":{"cited_paper":"/paper/2507.17563","citing_paper":"/paper/2606.11219"},"observation_digest":"sha256:0933ff73e2de4e4bcc7b1f3bd807c91339dac192d5d896e31c73811e01a92045","observation_id":"b9ee2352-bbe0-4f44-af84-1d529dd38a98","resolution":{"observed_at":"2026-06-30T22:15:05.252383Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2507.17563","last_updated":"2025-07-23T14:53:50Z","snapshot_observed_at":"2026-08-07T18:31:16.203029Z","submitted_at":"2025-07-23T14:53:50Z","title":"BoSS: Beyond-Semantic Speech","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2507.17563","snapshot_observed_at":"2026-07-31T23:06:43.144630Z","title":"Boss: Beyond-semantic speech,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.24082","last_updated":"2026-07-27T07:23:22Z","snapshot_observed_at":"2026-08-10T02:27:27.637894Z","submitted_at":"2026-07-27T07:23:22Z","title":"Towards High-Level Semantic Intelligence","version":1},"reference_index":236,"source":"pdf_text","source_observed_at":"2026-07-31T23:06:43.144630Z"},"links":{"cited_paper":"/paper/2507.17563","citing_paper":"/paper/2607.24082"},"observation_digest":"sha256:e5a2b379d07072cdba864c4dda87d838ff2fde1bf62039c791ab3e908140e51b","observation_id":"54a1eb9f-62df-4ce3-b53c-0390882d0a03","resolution":{"observed_at":"2026-07-31T23:06:43.144630Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2507.17563/citation-record","integrity":"/paper/2507.17563/integrity","json":"/paper/2507.17563/citation-record.json","paper":"/paper/2507.17563"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T14:50:04.923155Z","title":"SAE International, Warrendale, PA (2021)","venue":null,"work_id":"8749ce7a-f693-420a-b0eb-3e5c62c3b052","year":2021},"citing_paper":{"arxiv_id":"2507.17563","last_updated":"2025-07-23T14:53:50Z","snapshot_observed_at":"2026-08-07T18:31:16.203029Z","submitted_at":"2025-07-23T14:53:50Z","title":"BoSS: Beyond-Semantic Speech","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-06T14:50:04.155586Z"},"links":{"citing_paper":"/paper/2507.17563"},"observation_digest":"sha256:304eaafeceff66716f3a9cde32d5974171150d634a32abf581ee3ab1a6e33815","observation_id":"144efdf1-5336-4413-ad50-a9de1feb330c","resolution":{"observed_at":"2026-08-06T14:50:04.926040Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T14:50:04.916272Z","title":"The philosophical review 66(3), 377–388 (1957)","venue":null,"work_id":"bef87704-2723-4681-9c96-9ec03241317b","year":1957},"citing_paper":{"arxiv_id":"2507.17563","last_updated":"2025-07-23T14:53:50Z","snapshot_observed_at":"2026-08-07T18:31:16.203029Z","submitted_at":"2025-07-23T14:53:50Z","title":"BoSS: Beyond-Semantic Speech","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-06T14:50:04.159782Z"},"links":{"citing_paper":"/paper/2507.17563"},"observation_digest":"sha256:7dd2c8e18fab948e4b3822227b95b36f872628b10f1ac911d93fa1ce500d136f","observation_id":"81d6b79e-51ec-4c40-9e9e-1beee426e510","resolution":{"observed_at":"2026-08-06T14:50:04.918804Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T14:50:04.909353Z","title":"Wadsworth, Belmont, CA (1971)","venue":null,"work_id":"902e36b0-1429-4252-bb03-a7a7bd8dd062","year":1971},"citing_paper":{"arxiv_id":"2507.17563","last_updated":"2025-07-23T14:53:50Z","snapshot_observed_at":"2026-08-07T18:31:16.203029Z","submitted_at":"2025-07-23T14:53:50Z","title":"BoSS: Beyond-Semantic Speech","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-06T14:50:04.162719Z"},"links":{"citing_paper":"/paper/2507.17563"},"observation_digest":"sha256:d912686a1a6ec4bf02678023cc44087d64b5b9a12b521f634d011afea7913e4d","observation_id":"e9b7cf0f-03a1-42b4-a1e2-57a6d5d236f8","resolution":{"observed_at":"2026-08-06T14:50:04.911798Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T14:50:04.902391Z","title":"The body as a medium of expression 162, 174 (1975) 19","venue":null,"work_id":"6e097f32-93be-4a47-a8a6-38d13c227050","year":1975},"citing_paper":{"arxiv_id":"2507.17563","last_updated":"2025-07-23T14:53:50Z","snapshot_observed_at":"2026-08-07T18:31:16.203029Z","submitted_at":"2025-07-23T14:53:50Z","title":"BoSS: Beyond-Semantic Speech","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-06T14:50:04.165477Z"},"links":{"citing_paper":"/paper/2507.17563"},"observation_digest":"sha256:3424bbbc2ba7d1acfdeeb3371d0b309d695a5e09f15f21b0649c2522602b6068","observation_id":"e3d1a037-9ff5-4002-a459-175dbb11e27c","resolution":{"observed_at":"2026-08-06T14:50:04.904816Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T14:50:04.895457Z","title":null,"venue":null,"work_id":"7e313dad-4871-4aee-a927-951831ba53e3","year":1958},"citing_paper":{"arxiv_id":"2507.17563","last_updated":"2025-07-23T14:53:50Z","snapshot_observed_at":"2026-08-07T18:31:16.203029Z","submitted_at":"2025-07-23T14:53:50Z","title":"BoSS: Beyond-Semantic Speech","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-06T14:50:04.168918Z"},"links":{"citing_paper":"/paper/2507.17563"},"observation_digest":"sha256:79928315dfe1e50d8bcbc600787f8d8b0f597c3254f4bc79d8b785f4e8696592","observation_id":"9d2eba4a-2b0f-4783-aa85-40ff6944a0fb","resolution":{"observed_at":"2026-08-06T14:50:04.897921Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T14:50:04.888379Z","title":null,"venue":null,"work_id":"c7d32b2c-eb35-4ba9-b169-ccfa0d1174ca","year":1969},"citing_paper":{"arxiv_id":"2507.17563","last_updated":"2025-07-23T14:53:50Z","snapshot_observed_at":"2026-08-07T18:31:16.203029Z","submitted_at":"2025-07-23T14:53:50Z","title":"BoSS: Beyond-Semantic Speech","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-06T14:50:04.171999Z"},"links":{"citing_paper":"/paper/2507.17563"},"observation_digest":"sha256:0787dbd6a49cd5031d3b98ad7804ca9cf3deda6501653e3437a3a660d0392da5","observation_id":"50bd445d-fe5d-4c82-b6f1-326b72570dae","resolution":{"observed_at":"2026-08-06T14:50:04.890956Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T14:50:04.880362Z","title":"Syntax and semantics 3, 43–58 (1975)","venue":null,"work_id":"2cc0f6ae-8285-4e85-b0fd-1c2c02e336cb","year":1975},"citing_paper":{"arxiv_id":"2507.17563","last_updated":"2025-07-23T14:53:50Z","snapshot_observed_at":"2026-08-07T18:31:16.203029Z","submitted_at":"2025-07-23T14:53:50Z","title":"BoSS: Beyond-Semantic Speech","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-06T14:50:04.175090Z"},"links":{"citing_paper":"/paper/2507.17563"},"observation_digest":"sha256:7fb9b7a3daef67a7088fc3a57919b6d62087dae26f95dc66c2639810461114e6","observation_id":"fdbe0d7e-b146-41dc-bdf3-901bcfdab278","resolution":{"observed_at":"2026-08-06T14:50:04.882544Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T14:50:04.873429Z","title":"PhD thesis, Massachusetts Institute of Technology (1980)","venue":null,"work_id":"100f26dd-e1a2-4348-a356-653dd5773834","year":1980},"citing_paper":{"arxiv_id":"2507.17563","last_updated":"2025-07-23T14:53:50Z","snapshot_observed_at":"2026-08-07T18:31:16.203029Z","submitted_at":"2025-07-23T14:53:50Z","title":"BoSS: Beyond-Semantic Speech","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-06T14:50:04.177998Z"},"links":{"citing_paper":"/paper/2507.17563"},"observation_digest":"sha256:d555ddccd915b3bb6ae1cd4c2c6799586853a7d87c82c9fb77c03a3ea6acf7c5","observation_id":"f2a3a8fa-b164-46e8-afbc-7a3b37acd4cc","resolution":{"observed_at":"2026-08-06T14:50:04.875980Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T14:50:04.866537Z","title":"Language and speech40(2), 141–201 (1997)","venue":null,"work_id":"2175012b-e01b-4fc9-8290-9b926be23fc0","year":1997},"citing_paper":{"arxiv_id":"2507.17563","last_updated":"2025-07-23T14:53:50Z","snapshot_observed_at":"2026-08-07T18:31:16.203029Z","submitted_at":"2025-07-23T14:53:50Z","title":"BoSS: Beyond-Semantic Speech","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-06T14:50:04.180588Z"},"links":{"citing_paper":"/paper/2507.17563"},"observation_digest":"sha256:2fd620bd64222721b22fa0de4512d4d7d6a10461c74acc154e5214fd3945b2bf","observation_id":"582a3f9b-fa91-4895-ae16-8b6927b2f2c7","resolution":{"observed_at":"2026-08-06T14:50:04.869014Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T14:50:04.859421Z","title":"Harvard University Press, Cambridge, MA (1986)","venue":null,"work_id":"05bc2ae3-0ee7-401c-a3fb-f8abfde908e7","year":1986},"citing_paper":{"arxiv_id":"2507.17563","last_updated":"2025-07-23T14:53:50Z","snapshot_observed_at":"2026-08-07T18:31:16.203029Z","submitted_at":"2025-07-23T14:53:50Z","title":"BoSS: Beyond-Semantic Speech","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-06T14:50:04.183025Z"},"links":{"citing_paper":"/paper/2507.17563"},"observation_digest":"sha256:01df7680512e403426377e0b3eea11e4423b15ea1990e7c1ba2594d4901c8276","observation_id":"15a45424-9b7f-4f36-bec6-2356c198d9a0","resolution":{"observed_at":"2026-08-06T14:50:04.862013Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T14:50:04.852983Z","title":"MIT press, Cambridge, MA (2000)","venue":null,"work_id":"78ba2033-8629-4c70-80e6-3d5bea989691","year":2000},"citing_paper":{"arxiv_id":"2507.17563","last_updated":"2025-07-23T14:53:50Z","snapshot_observed_at":"2026-08-07T18:31:16.203029Z","submitted_at":"2025-07-23T14:53:50Z","title":"BoSS: Beyond-Semantic Speech","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-06T14:50:04.186272Z"},"links":{"citing_paper":"/paper/2507.17563"},"observation_digest":"sha256:0b23686930d8ae98c2bd5ea33fa0cbaf17188443b041cc203604eb23c21b446e","observation_id":"e6b51073-a067-4d0c-81a6-e7a321f40643","resolution":{"observed_at":"2026-08-06T14:50:04.855343Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T14:50:04.843696Z","title":"Computer Speech & Language 27(1), 4–39 (2013)","venue":null,"work_id":"871cb691-44ac-4c35-b746-75739969c3af","year":2013},"citing_paper":{"arxiv_id":"2507.17563","last_updated":"2025-07-23T14:53:50Z","snapshot_observed_at":"2026-08-07T18:31:16.203029Z","submitted_at":"2025-07-23T14:53:50Z","title":"BoSS: Beyond-Semantic Speech","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-06T14:50:04.189035Z"},"links":{"citing_paper":"/paper/2507.17563"},"observation_digest":"sha256:e30178ef41560ec5028c17f0c6a3c6d911f9dce27fc72dcc38784f639307540b","observation_id":"7c614a42-538a-4298-be80-2c79a3bea31f","resolution":{"observed_at":"2026-08-06T14:50:04.846829Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T14:50:04.836914Z","title":"In: International Conference on Machine Learning (2022)","venue":null,"work_id":"fe714d70-22a8-4b6a-878b-e3d2bf89746c","year":2022},"citing_paper":{"arxiv_id":"2507.17563","last_updated":"2025-07-23T14:53:50Z","snapshot_observed_at":"2026-08-07T18:31:16.203029Z","submitted_at":"2025-07-23T14:53:50Z","title":"BoSS: Beyond-Semantic Speech","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-06T14:50:04.191519Z"},"links":{"citing_paper":"/paper/2507.17563"},"observation_digest":"sha256:84ab1b2d7e843f7ca47d151b609924da91c3057550e781ffae5ac59f0fc6dc46","observation_id":"a30b930e-7837-47c9-8494-cd72aae9fd1b","resolution":{"observed_at":"2026-08-06T14:50:04.839461Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2305.19269","last_updated":"2023-05-30T17:59:26Z","snapshot_observed_at":"2026-08-06T18:04:17.368236Z","submitted_at":"2023-05-30T17:59:26Z","title":"Make-A-Voice: Unified Voice Synthesis With Discrete Representation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.19269","snapshot_observed_at":"2026-08-06T14:50:04.194224Z","title":"ArXiv abs/2305.19269 (2023)","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.17563","last_updated":"2025-07-23T14:53:50Z","snapshot_observed_at":"2026-08-07T18:31:16.203029Z","submitted_at":"2025-07-23T14:53:50Z","title":"BoSS: Beyond-Semantic Speech","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-06T14:50:04.194224Z"},"links":{"cited_paper":"/paper/2305.19269","citing_paper":"/paper/2507.17563"},"observation_digest":"sha256:575678f31bf1bce9d31d222979866685062dedc4f7e2ec8f52170084f4ed42cc","observation_id":"2ff3d354-6a17-4261-a3a8-75bc2856df60","resolution":{"observed_at":"2026-08-06T14:50:04.194224Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2411.01156","last_updated":"2024-11-09T05:58:10Z","snapshot_observed_at":"2026-08-10T00:08:15.031162Z","submitted_at":"2024-11-02T07:04:02Z","title":"Fish-Speech: Leveraging Large Language Models for Advanced Multilingual Text-to-Speech Synthesis","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.01156","snapshot_observed_at":"2026-08-06T14:50:04.197119Z","title":"ArXiv abs/2411.01156 (2024)","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.17563","last_updated":"2025-07-23T14:53:50Z","snapshot_observed_at":"2026-08-07T18:31:16.203029Z","submitted_at":"2025-07-23T14:53:50Z","title":"BoSS: Beyond-Semantic Speech","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-06T14:50:04.197119Z"},"links":{"cited_paper":"/paper/2411.01156","citing_paper":"/paper/2507.17563"},"observation_digest":"sha256:7e4710c97863c7f5ce403d451bafea3494491ba8eeb428e760586971aae27527","observation_id":"f5804bb3-fddd-4e20-a57e-7810b4c9c2af","resolution":{"observed_at":"2026-08-06T14:50:04.197119Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.00704","last_updated":"2024-12-10T03:17:56Z","snapshot_observed_at":"2026-08-08T23:01:50.650593Z","submitted_at":"2023-10-01T15:49:46Z","title":"UniAudio: An Audio Foundation Model Toward Universal Audio Generation","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.00704","snapshot_observed_at":"2026-08-06T14:50:04.199707Z","title":"ArXiv abs/2310.00704 (2023)","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.17563","last_updated":"2025-07-23T14:53:50Z","snapshot_observed_at":"2026-08-07T18:31:16.203029Z","submitted_at":"2025-07-23T14:53:50Z","title":"BoSS: Beyond-Semantic Speech","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-06T14:50:04.199707Z"},"links":{"cited_paper":"/paper/2310.00704","citing_paper":"/paper/2507.17563"},"observation_digest":"sha256:85636ce8ce78bb94faef30f3152c7a58848b86917852755347047c05acd237ba","observation_id":"8ff6b37b-4359-4374-8562-1d9f47b94cca","resolution":{"observed_at":"2026-08-06T14:50:04.199707Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T14:50:04.828332Z","title":"In: Annual Meeting of the Association for Computational Linguistics (2024)","venue":null,"work_id":"5e93587b-45fc-4d63-95a1-64375705f13c","year":2024},"citing_paper":{"arxiv_id":"2507.17563","last_updated":"2025-07-23T14:53:50Z","snapshot_observed_at":"2026-08-07T18:31:16.203029Z","submitted_at":"2025-07-23T14:53:50Z","title":"BoSS: Beyond-Semantic Speech","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-06T14:50:04.202392Z"},"links":{"citing_paper":"/paper/2507.17563"},"observation_digest":"sha256:f72247e9f7746dd2ce437a1023c352f89e97155813a3874b8400bf18d2dc3fad","observation_id":"9ef71935-49fd-494b-96e9-b3f7f0eeedb8","resolution":{"observed_at":"2026-08-06T14:50:04.831208Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T14:50:04.820161Z","title":"ICASSP 2024 - 2024 IEEE International Conference on Acoustics, Speech and Signal Processing (ICASSP), 11341–11345 (2023) 20","venue":null,"work_id":"ef15cf50-78da-4e29-b546-a5a34ea3e059","year":2023},"citing_paper":{"arxiv_id":"2507.17563","last_updated":"2025-07-23T14:53:50Z","snapshot_observed_at":"2026-08-07T18:31:16.203029Z","submitted_at":"2025-07-23T14:53:50Z","title":"BoSS: Beyond-Semantic Speech","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-06T14:50:04.204734Z"},"links":{"citing_paper":"/paper/2507.17563"},"observation_digest":"sha256:2925df7bd6fe5e0e9f32cbd4d7c072324f5c6dd73d2abdb8e0e8bcce0fb40e1f","observation_id":"cd577069-11ce-417f-ba83-147b3cf2a151","resolution":{"observed_at":"2026-08-06T14:50:04.822907Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.02430","last_updated":"2024-06-04T15:48:29Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-06-04T15:48:29Z","title":"Seed-TTS: A Family of High-Quality Versatile Speech Generation Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.02430","snapshot_observed_at":"2026-08-06T14:50:04.208123Z","title":"ArXiv abs/2406.02430 (2024)","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.17563","last_updated":"2025-07-23T14:53:50Z","snapshot_observed_at":"2026-08-07T18:31:16.203029Z","submitted_at":"2025-07-23T14:53:50Z","title":"BoSS: Beyond-Semantic Speech","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-06T14:50:04.208123Z"},"links":{"cited_paper":"/paper/2406.02430","citing_paper":"/paper/2507.17563"},"observation_digest":"sha256:9ca6079513040596df6bda7c5fb2456b8edc556218417ec3fbae344a512b3972","observation_id":"be7f1afa-59f8-436c-94e5-b0b99ba1b117","resolution":{"observed_at":"2026-08-06T14:50:04.208123Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.06885","last_updated":"2025-05-20T15:53:10Z","snapshot_observed_at":"2026-08-01T23:52:25.071174Z","submitted_at":"2024-10-09T13:46:34Z","title":"F5-TTS: A Fairytaler that Fakes Fluent and Faithful Speech with Flow Matching","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.06885","snapshot_observed_at":"2026-08-06T14:50:04.211687Z","title":"ArXiv abs/2410.06885 (2024)","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.17563","last_updated":"2025-07-23T14:53:50Z","snapshot_observed_at":"2026-08-07T18:31:16.203029Z","submitted_at":"2025-07-23T14:53:50Z","title":"BoSS: Beyond-Semantic Speech","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-06T14:50:04.211687Z"},"links":{"cited_paper":"/paper/2410.06885","citing_paper":"/paper/2507.17563"},"observation_digest":"sha256:583c423e8fb9f7bd22313aebc496e92ebad6f3e2e447264dfb5ed9cb69e3a734","observation_id":"16cf8ede-836a-4fc0-a25f-fed09d5b15d8","resolution":{"observed_at":"2026-08-06T14:50:04.211687Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.01912","last_updated":"2024-02-02T21:29:34Z","snapshot_observed_at":"2026-08-10T02:15:41.685360Z","submitted_at":"2024-02-02T21:29:34Z","title":"Natural language guidance of high-fidelity text-to-speech with synthetic annotations","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.01912","snapshot_observed_at":"2026-08-06T14:50:04.214444Z","title":"ArXiv abs/2402.01912 (2024)","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.17563","last_updated":"2025-07-23T14:53:50Z","snapshot_observed_at":"2026-08-07T18:31:16.203029Z","submitted_at":"2025-07-23T14:53:50Z","title":"BoSS: Beyond-Semantic Speech","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-06T14:50:04.214444Z"},"links":{"cited_paper":"/paper/2402.01912","citing_paper":"/paper/2507.17563"},"observation_digest":"sha256:9ead9193b8e1738390262127177274316b218908cf9b553b7249601472bf1c28","observation_id":"aea71d72-4db1-4369-9af7-bc31544e2993","resolution":{"observed_at":"2026-08-06T14:50:04.214444Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2301.11325","last_updated":"2023-01-26T18:58:53Z","snapshot_observed_at":"2026-07-06T14:45:00.730733Z","submitted_at":"2023-01-26T18:58:53Z","title":"MusicLM: Generating Music From Text","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2301.11325","snapshot_observed_at":"2026-08-06T14:50:04.217789Z","title":"ArXiv abs/2301.11325 (2023)","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.17563","last_updated":"2025-07-23T14:53:50Z","snapshot_observed_at":"2026-08-07T18:31:16.203029Z","submitted_at":"2025-07-23T14:53:50Z","title":"BoSS: Beyond-Semantic Speech","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-06T14:50:04.217789Z"},"links":{"cited_paper":"/paper/2301.11325","citing_paper":"/paper/2507.17563"},"observation_digest":"sha256:d50dedf77e2dcf8730bd763db77cb4992e97ebd867a126b7f404a358afde4caa","observation_id":"4bfbdca1-ddcf-452a-8f25-bb52088e1373","resolution":{"observed_at":"2026-08-06T14:50:04.217789Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T14:50:04.812969Z","title":"IEEE/ACM Transactions on Audio, Speech, and Language Processing 31, 1720–1733 (2022)","venue":null,"work_id":"9e986a33-829a-4a35-abe2-32869a5e01e1","year":2022},"citing_paper":{"arxiv_id":"2507.17563","last_updated":"2025-07-23T14:53:50Z","snapshot_observed_at":"2026-08-07T18:31:16.203029Z","submitted_at":"2025-07-23T14:53:50Z","title":"BoSS: Beyond-Semantic Speech","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-06T14:50:04.221317Z"},"links":{"citing_paper":"/paper/2507.17563"},"observation_digest":"sha256:32dd72a5e3292b1aa3c4a8fd9900de637608f3fb4908a518d4a41ec68cc19501","observation_id":"dfa9b936-8c72-4570-aed2-0cbf35b50e21","resolution":{"observed_at":"2026-08-06T14:50:04.815746Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2312.15185","last_updated":"2023-12-23T07:46:55Z","snapshot_observed_at":"2026-08-08T00:25:44.100410Z","submitted_at":"2023-12-23T07:46:55Z","title":"emotion2vec: Self-Supervised Pre-Training for Speech Emotion Representation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.15185","snapshot_observed_at":"2026-08-06T14:50:04.223838Z","title":"ArXiv abs/2312.15185 (2023)","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.17563","last_updated":"2025-07-23T14:53:50Z","snapshot_observed_at":"2026-08-07T18:31:16.203029Z","submitted_at":"2025-07-23T14:53:50Z","title":"BoSS: Beyond-Semantic Speech","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-06T14:50:04.223838Z"},"links":{"cited_paper":"/paper/2312.15185","citing_paper":"/paper/2507.17563"},"observation_digest":"sha256:0817163f57a1b5cde7fffca68e22fd1d0b28961263020fefef9a70c61f916d7a","observation_id":"f780c7fd-ff9e-48e9-abaf-946cd67323b8","resolution":{"observed_at":"2026-08-06T14:50:04.223838Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2308.16692","last_updated":"2024-01-23T01:56:57Z","snapshot_observed_at":"2026-08-07T03:22:13.424379Z","submitted_at":"2023-08-31T12:53:09Z","title":"SpeechTokenizer: Unified Speech Tokenizer for Speech Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2308.16692","snapshot_observed_at":"2026-08-06T14:50:04.227252Z","title":"ArXiv abs/2308.16692 (2023)","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.17563","last_updated":"2025-07-23T14:53:50Z","snapshot_observed_at":"2026-08-07T18:31:16.203029Z","submitted_at":"2025-07-23T14:53:50Z","title":"BoSS: Beyond-Semantic Speech","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-06T14:50:04.227252Z"},"links":{"cited_paper":"/paper/2308.16692","citing_paper":"/paper/2507.17563"},"observation_digest":"sha256:9f07a1b71026d7d3ff2f5c75e9bebafdee7f74a1648523409a583a5b7dc1ab0e","observation_id":"47d3455b-71bd-4369-ac2b-a73a517a9c6c","resolution":{"observed_at":"2026-08-06T14:50:04.227252Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.13289","last_updated":"2024-04-08T06:12:52Z","snapshot_observed_at":"2026-08-02T21:51:36.809095Z","submitted_at":"2023-10-20T05:41:57Z","title":"SALMONN: Towards Generic Hearing Abilities for Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.13289","snapshot_observed_at":"2026-08-06T14:50:04.231008Z","title":"ArXiv abs/2310.13289 (2023)","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.17563","last_updated":"2025-07-23T14:53:50Z","snapshot_observed_at":"2026-08-07T18:31:16.203029Z","submitted_at":"2025-07-23T14:53:50Z","title":"BoSS: Beyond-Semantic Speech","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-06T14:50:04.231008Z"},"links":{"cited_paper":"/paper/2310.13289","citing_paper":"/paper/2507.17563"},"observation_digest":"sha256:5a08eedd431a0d4ff1e2daa08704d682874094039476d2f0da03dfc571233b4f","observation_id":"ed01461a-ad74-4d8f-88af-523974785d7c","resolution":{"observed_at":"2026-08-06T14:50:04.231008Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2304.12995","last_updated":"2023-04-25T17:05:38Z","snapshot_observed_at":"2026-08-04T09:21:35.342211Z","submitted_at":"2023-04-25T17:05:38Z","title":"AudioGPT: Understanding and Generating Speech, Music, Sound, and Talking Head","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2304.12995","snapshot_observed_at":"2026-08-06T14:50:04.234259Z","title":"ArXiv abs/2304.12995 (2023)","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.17563","last_updated":"2025-07-23T14:53:50Z","snapshot_observed_at":"2026-08-07T18:31:16.203029Z","submitted_at":"2025-07-23T14:53:50Z","title":"BoSS: Beyond-Semantic Speech","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-06T14:50:04.234259Z"},"links":{"cited_paper":"/paper/2304.12995","citing_paper":"/paper/2507.17563"},"observation_digest":"sha256:b1237b6c300406b32ca1ae90dd1f482f9ee41c51c757ed3228d36ed8f12d25ae","observation_id":"8ba8c8cd-b93f-40a6-aff1-73af69f6d99b","resolution":{"observed_at":"2026-08-06T14:50:04.234259Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.06355","last_updated":"2024-01-04T02:06:07Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-05-10T17:59:04Z","title":"VideoChat: Chat-Centric Video Understanding","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.06355","snapshot_observed_at":"2026-08-06T14:50:04.237904Z","title":"ArXiv abs/2305.06355 (2023)","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.17563","last_updated":"2025-07-23T14:53:50Z","snapshot_observed_at":"2026-08-07T18:31:16.203029Z","submitted_at":"2025-07-23T14:53:50Z","title":"BoSS: Beyond-Semantic Speech","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-06T14:50:04.237904Z"},"links":{"cited_paper":"/paper/2305.06355","citing_paper":"/paper/2507.17563"},"observation_digest":"sha256:2732f2a3da07e86760a7294eae34253c4f00783cb2a629cf99acb811b6228edd","observation_id":"19a71ef7-81d6-4628-b705-b012d9329c01","resolution":{"observed_at":"2026-08-06T14:50:04.237904Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2306.12925","last_updated":"2023-06-22T14:37:54Z","snapshot_observed_at":"2026-08-07T01:18:02.068918Z","submitted_at":"2023-06-22T14:37:54Z","title":"AudioPaLM: A Large Language Model That Can Speak and Listen","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.12925","snapshot_observed_at":"2026-08-06T14:50:04.241511Z","title":"ArXiv abs/2306.12925 (2023)","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.17563","last_updated":"2025-07-23T14:53:50Z","snapshot_observed_at":"2026-08-07T18:31:16.203029Z","submitted_at":"2025-07-23T14:53:50Z","title":"BoSS: Beyond-Semantic Speech","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-06T14:50:04.241511Z"},"links":{"cited_paper":"/paper/2306.12925","citing_paper":"/paper/2507.17563"},"observation_digest":"sha256:1b133af9a03fbd35cefdeb7b297b7ca31285661fd5bac89d9d6ea2ab1b53ea7c","observation_id":"78ff2eb6-73a7-4078-b11a-27ce9f872942","resolution":{"observed_at":"2026-08-06T14:50:04.241511Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T14:50:04.803780Z","title":"2023 IEEE Automatic Speech Recognition and Understanding Workshop (ASRU), 1–8 (2023)","venue":null,"work_id":"b8db8790-7009-4767-8b57-87f9ce288189","year":2023},"citing_paper":{"arxiv_id":"2507.17563","last_updated":"2025-07-23T14:53:50Z","snapshot_observed_at":"2026-08-07T18:31:16.203029Z","submitted_at":"2025-07-23T14:53:50Z","title":"BoSS: Beyond-Semantic Speech","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-06T14:50:04.244219Z"},"links":{"citing_paper":"/paper/2507.17563"},"observation_digest":"sha256:35afc4230eecd4a1a5e41c73d83d2bc916ae0bd47d70397dfc036d73c55bd008","observation_id":"1cde944a-8303-4aff-b4a3-f702f09b7c88","resolution":{"observed_at":"2026-08-06T14:50:04.808123Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.04673","last_updated":"2024-07-03T02:38:03Z","snapshot_observed_at":"2026-08-02T08:46:39.076208Z","submitted_at":"2023-10-07T03:17:59Z","title":"LauraGPT: Listen, Attend, Understand, and Regenerate Audio with GPT","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.04673","snapshot_observed_at":"2026-08-06T14:50:04.247739Z","title":"ArXiv abs/2310.04673 (2023)","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.17563","last_updated":"2025-07-23T14:53:50Z","snapshot_observed_at":"2026-08-07T18:31:16.203029Z","submitted_at":"2025-07-23T14:53:50Z","title":"BoSS: Beyond-Semantic Speech","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-06T14:50:04.247739Z"},"links":{"cited_paper":"/paper/2310.04673","citing_paper":"/paper/2507.17563"},"observation_digest":"sha256:8faf08e550b86f2777ef0e7948dbbe2df6ec932decf1d5c0891c04d3a0f97b8e","observation_id":"1dc0d152-f8f7-4e86-bc7e-a8fbaa3b0b19","resolution":{"observed_at":"2026-08-06T14:50:04.247739Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T14:50:04.796149Z","title":"In: Conference on Empirical Methods in Natural Language Processing (2024)","venue":null,"work_id":"e950e689-f6e4-4846-888b-c20c6ab195ae","year":2024},"citing_paper":{"arxiv_id":"2507.17563","last_updated":"2025-07-23T14:53:50Z","snapshot_observed_at":"2026-08-07T18:31:16.203029Z","submitted_at":"2025-07-23T14:53:50Z","title":"BoSS: Beyond-Semantic Speech","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-06T14:50:04.251222Z"},"links":{"citing_paper":"/paper/2507.17563"},"observation_digest":"sha256:6e0fd7f27b11913f5648a78546e74c79d3b7e7e98fad9b37cff98a43c3175133","observation_id":"7f022cd7-28ef-47ee-b047-348f9003a2d8","resolution":{"observed_at":"2026-08-06T14:50:04.799006Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.11768","last_updated":"2024-06-17T17:31:01Z","snapshot_observed_at":"2026-08-01T20:00:05.737836Z","submitted_at":"2024-06-17T17:31:01Z","title":"GAMA: A Large Audio-Language Model with Advanced Audio Understanding and Complex Reasoning Abilities","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.11768","snapshot_observed_at":"2026-08-06T14:50:04.254194Z","title":"ArXiv abs/2406.11768 (2024)","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.17563","last_updated":"2025-07-23T14:53:50Z","snapshot_observed_at":"2026-08-07T18:31:16.203029Z","submitted_at":"2025-07-23T14:53:50Z","title":"BoSS: Beyond-Semantic Speech","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-06T14:50:04.254194Z"},"links":{"cited_paper":"/paper/2406.11768","citing_paper":"/paper/2507.17563"},"observation_digest":"sha256:7fb4a5709fe487f6a6f7ad8a629f5035c7d6363569edae28cbb2deaed54f6760","observation_id":"97846861-2b18-4eba-a1bd-0d568262121a","resolution":{"observed_at":"2026-08-06T14:50:04.254194Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.01831","last_updated":"2024-05-28T05:44:53Z","snapshot_observed_at":"2026-08-07T19:26:44.980429Z","submitted_at":"2024-02-02T18:58:34Z","title":"Audio Flamingo: A Novel Audio Language Model with Few-Shot Learning and Dialogue Abilities","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.01831","snapshot_observed_at":"2026-08-06T14:50:04.257799Z","title":"ArXiv abs/2402.01831 (2024)","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.17563","last_updated":"2025-07-23T14:53:50Z","snapshot_observed_at":"2026-08-07T18:31:16.203029Z","submitted_at":"2025-07-23T14:53:50Z","title":"BoSS: Beyond-Semantic Speech","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-06T14:50:04.257799Z"},"links":{"cited_paper":"/paper/2402.01831","citing_paper":"/paper/2507.17563"},"observation_digest":"sha256:9071ea484a3afe8a00f73175ea1571e35ebec34433ded0832d7037f43d1a79f9","observation_id":"6ca1a476-2bc3-4290-8e2c-f0eb071a36ca","resolution":{"observed_at":"2026-08-06T14:50:04.257799Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.03983","last_updated":"2025-03-06T00:10:26Z","snapshot_observed_at":"2026-08-07T17:26:13.091608Z","submitted_at":"2025-03-06T00:10:26Z","title":"Audio Flamingo 2: An Audio-Language Model with Long-Audio Understanding and Expert Reasoning Abilities","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.03983","snapshot_observed_at":"2026-08-06T14:50:04.261844Z","title":"ArXiv abs/2503.03983 (2025)","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.17563","last_updated":"2025-07-23T14:53:50Z","snapshot_observed_at":"2026-08-07T18:31:16.203029Z","submitted_at":"2025-07-23T14:53:50Z","title":"BoSS: Beyond-Semantic Speech","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-06T14:50:04.261844Z"},"links":{"cited_paper":"/paper/2503.03983","citing_paper":"/paper/2507.17563"},"observation_digest":"sha256:093309fb27757e054050772a6ab954d2de52c68c71e1b7e044ba08b1cd1ebaf3","observation_id":"790b06dd-25e5-44b1-8942-25f3c8f43102","resolution":{"observed_at":"2026-08-06T14:50:04.261844Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T14:50:04.264610Z","title":"ArXiv abs/2503.02318 (2025)","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.17563","last_updated":"2025-07-23T14:53:50Z","snapshot_observed_at":"2026-08-07T18:31:16.203029Z","submitted_at":"2025-07-23T14:53:50Z","title":"BoSS: Beyond-Semantic Speech","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-06T14:50:04.264610Z"},"links":{"citing_paper":"/paper/2507.17563"},"observation_digest":"sha256:631bee2fc6cbcfe1458fe6d549070a7b3a0847b7cb5898e556a7571a76aee6d1","observation_id":"cc5371a5-38ec-4876-a922-c91115530337","resolution":{"observed_at":"2026-08-06T14:50:04.264610Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T14:50:04.788014Z","title":"In: North American Chapter of the Association for Computational Linguistics (2024)","venue":null,"work_id":"503a1ff6-8a67-4e28-9e09-69a7b9cd8cbf","year":2024},"citing_paper":{"arxiv_id":"2507.17563","last_updated":"2025-07-23T14:53:50Z","snapshot_observed_at":"2026-08-07T18:31:16.203029Z","submitted_at":"2025-07-23T14:53:50Z","title":"BoSS: Beyond-Semantic Speech","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-06T14:50:04.267756Z"},"links":{"citing_paper":"/paper/2507.17563"},"observation_digest":"sha256:dad5a5e9ed312002d1f22810e9f9abd1299a687ef1747fd348cce2bbf8ec294d","observation_id":"b076e571-fa30-4a86-a5a4-0615a155e7f2","resolution":{"observed_at":"2026-08-06T14:50:04.790960Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T14:50:04.778374Z","title":"ICASSP 2024 - 2024 IEEE International Conference on Acoustics, Speech and Signal Processing (ICASSP), 12136–12140 (2023)","venue":null,"work_id":"49771e4f-c9cf-4ebf-9831-c39dbee143c1","year":2023},"citing_paper":{"arxiv_id":"2507.17563","last_updated":"2025-07-23T14:53:50Z","snapshot_observed_at":"2026-08-07T18:31:16.203029Z","submitted_at":"2025-07-23T14:53:50Z","title":"BoSS: Beyond-Semantic Speech","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-06T14:50:04.270945Z"},"links":{"citing_paper":"/paper/2507.17563"},"observation_digest":"sha256:bbd7ae290968248479755bf4111a520673e121a9effc63915cbae484f53447be","observation_id":"3d94390d-76b0-4ab0-91b8-5a107de7e782","resolution":{"observed_at":"2026-08-06T14:50:04.781637Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T14:50:04.768094Z","title":"In: Annual Meeting of the Association for Computational Linguistics (2024)","venue":null,"work_id":"112043de-a3ca-4d5c-aa16-8dd78e7c33d0","year":2024},"citing_paper":{"arxiv_id":"2507.17563","last_updated":"2025-07-23T14:53:50Z","snapshot_observed_at":"2026-08-07T18:31:16.203029Z","submitted_at":"2025-07-23T14:53:50Z","title":"BoSS: Beyond-Semantic Speech","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-06T14:50:04.273350Z"},"links":{"citing_paper":"/paper/2507.17563"},"observation_digest":"sha256:0fc850a3eae61a21f393a2891bce6d50f52b2b32a8e54cba348286b9aaa0f8e8","observation_id":"f06420fe-ae72-42c5-8412-8f6c1b7206d4","resolution":{"observed_at":"2026-08-06T14:50:04.771636Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T14:50:04.758609Z","title":"IEEE/ACM Transactions on Audio, Speech, and Language Processing 31, 775–788 (2023)","venue":null,"work_id":"5a643af0-7960-43a5-bea8-436521d50c41","year":2023},"citing_paper":{"arxiv_id":"2507.17563","last_updated":"2025-07-23T14:53:50Z","snapshot_observed_at":"2026-08-07T18:31:16.203029Z","submitted_at":"2025-07-23T14:53:50Z","title":"BoSS: Beyond-Semantic Speech","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-06T14:50:04.275886Z"},"links":{"citing_paper":"/paper/2507.17563"},"observation_digest":"sha256:15ac6c6a12ceb2bd4010d26bff96a40eeb151bb76fd60dd473a47fd16f90620d","observation_id":"0047cc10-8a7b-4551-9b15-aa53afb609fa","resolution":{"observed_at":"2026-08-06T14:50:04.762026Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2311.07919","last_updated":"2023-12-21T10:20:42Z","snapshot_observed_at":"2026-08-07T10:17:55.688598Z","submitted_at":"2023-11-14T05:34:50Z","title":"Qwen-Audio: Advancing Universal Audio Understanding via Unified Large-Scale Audio-Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.07919","snapshot_observed_at":"2026-08-06T14:50:04.278940Z","title":"ArXiv abs/2311.07919 (2023)","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.17563","last_updated":"2025-07-23T14:53:50Z","snapshot_observed_at":"2026-08-07T18:31:16.203029Z","submitted_at":"2025-07-23T14:53:50Z","title":"BoSS: Beyond-Semantic Speech","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-06T14:50:04.278940Z"},"links":{"cited_paper":"/paper/2311.07919","citing_paper":"/paper/2507.17563"},"observation_digest":"sha256:56b18ed6c57f26ff11bd7546954bed12358cba30bade641107e22964cd903cd7","observation_id":"0ba5a472-a878-48d0-8d0e-de619200d9ed","resolution":{"observed_at":"2026-08-06T14:50:04.278940Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.10759","last_updated":"2024-07-15T14:38:09Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-07-15T14:38:09Z","title":"Qwen2-Audio Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.10759","snapshot_observed_at":"2026-08-06T14:50:04.281604Z","title":"ArXiv abs/2407.10759 (2024)","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.17563","last_updated":"2025-07-23T14:53:50Z","snapshot_observed_at":"2026-08-07T18:31:16.203029Z","submitted_at":"2025-07-23T14:53:50Z","title":"BoSS: Beyond-Semantic Speech","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-06T14:50:04.281604Z"},"links":{"cited_paper":"/paper/2407.10759","citing_paper":"/paper/2507.17563"},"observation_digest":"sha256:1f8da152697fcf897025cdbc57add455ca0075ace63fa4d139d2de6335bb5c18","observation_id":"d41018c7-7871-4f49-bd03-8065e8646b61","resolution":{"observed_at":"2026-08-06T14:50:04.281604Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T14:50:04.749575Z","title":"ICASSP 2024 - 2024 IEEE International Conference on Acoustics, Speech and Signal Processing (ICASSP), 10316–10320 (2023)","venue":null,"work_id":"7da36a9a-c882-4a2d-8299-fa8843d796ce","year":2023},"citing_paper":{"arxiv_id":"2507.17563","last_updated":"2025-07-23T14:53:50Z","snapshot_observed_at":"2026-08-07T18:31:16.203029Z","submitted_at":"2025-07-23T14:53:50Z","title":"BoSS: Beyond-Semantic Speech","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-06T14:50:04.284304Z"},"links":{"citing_paper":"/paper/2507.17563"},"observation_digest":"sha256:2c8c776aeb9bde4348c9f783410a2af140ff0007477b3ab63f0da6fab2eb8ac8","observation_id":"c9aacbf8-7d49-4efc-b8c9-e3d305dd46fb","resolution":{"observed_at":"2026-08-06T14:50:04.752715Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T14:50:04.738706Z","title":"2024 IEEE 14th International Symposium on Chinese Spoken Language Processing (ISCSLP), 586–590 (2023)","venue":null,"work_id":"ac2e0ce9-dd4d-4879-a5f3-c8a94a771567","year":2023},"citing_paper":{"arxiv_id":"2507.17563","last_updated":"2025-07-23T14:53:50Z","snapshot_observed_at":"2026-08-07T18:31:16.203029Z","submitted_at":"2025-07-23T14:53:50Z","title":"BoSS: Beyond-Semantic Speech","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-06T14:50:04.287643Z"},"links":{"citing_paper":"/paper/2507.17563"},"observation_digest":"sha256:66553f33197bb3d2811cf5fd05c73e292d523427b1f337a8d4d3f11cc753f6ed","observation_id":"d97d9af7-4d15-47dc-931b-30a37b2cc3e2","resolution":{"observed_at":"2026-08-06T14:50:04.742200Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2409.06666","last_updated":"2025-03-01T12:59:49Z","snapshot_observed_at":"2026-07-06T19:13:20.458958Z","submitted_at":"2024-09-10T17:34:34Z","title":"LLaMA-Omni: Seamless Speech Interaction with Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.06666","snapshot_observed_at":"2026-08-06T14:50:04.291383Z","title":"ArXiv abs/2409.06666 (2024)","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.17563","last_updated":"2025-07-23T14:53:50Z","snapshot_observed_at":"2026-08-07T18:31:16.203029Z","submitted_at":"2025-07-23T14:53:50Z","title":"BoSS: Beyond-Semantic Speech","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-06T14:50:04.291383Z"},"links":{"cited_paper":"/paper/2409.06666","citing_paper":"/paper/2507.17563"},"observation_digest":"sha256:1100c2b79da2f058b3a293b77484f342c104b39e0fa2ecb570f405fce94942ba","observation_id":"275754a4-9a8c-48fc-8896-d67dea81c1d9","resolution":{"observed_at":"2026-08-06T14:50:04.291383Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.02612","last_updated":"2024-12-03T17:41:24Z","snapshot_observed_at":"2026-08-02T21:27:26.884251Z","submitted_at":"2024-12-03T17:41:24Z","title":"GLM-4-Voice: Towards Intelligent and Human-Like End-to-End Spoken Chatbot","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.02612","snapshot_observed_at":"2026-08-06T14:50:04.294343Z","title":"arXiv preprint arXiv:2412.02612 (2024)","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.17563","last_updated":"2025-07-23T14:53:50Z","snapshot_observed_at":"2026-08-07T18:31:16.203029Z","submitted_at":"2025-07-23T14:53:50Z","title":"BoSS: Beyond-Semantic Speech","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-06T14:50:04.294343Z"},"links":{"cited_paper":"/paper/2412.02612","citing_paper":"/paper/2507.17563"},"observation_digest":"sha256:92cccb57c0cea31fafeaeb44e75fb3607c52cff6088bd2d4fce4eefaf052e610","observation_id":"134ce70d-1692-43cd-9080-f731de608cff","resolution":{"observed_at":"2026-08-06T14:50:04.294343Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.01800","last_updated":"2024-08-03T15:02:21Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-08-03T15:02:21Z","title":"MiniCPM-V: A GPT-4V Level MLLM on Your Phone","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.01800","snapshot_observed_at":"2026-08-06T14:50:04.298059Z","title":"arXiv preprint arXiv:2408.01800 (2024)","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.17563","last_updated":"2025-07-23T14:53:50Z","snapshot_observed_at":"2026-08-07T18:31:16.203029Z","submitted_at":"2025-07-23T14:53:50Z","title":"BoSS: Beyond-Semantic Speech","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-06T14:50:04.298059Z"},"links":{"cited_paper":"/paper/2408.01800","citing_paper":"/paper/2507.17563"},"observation_digest":"sha256:f299d3a4391056292357135f0c7f019ae12dd6f078279bb47ad39b9d2231ad1a","observation_id":"91a32126-e326-4141-9b4a-581e26e943c1","resolution":{"observed_at":"2026-08-06T14:50:04.298059Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T14:50:04.300962Z","title":"arXiv preprint arXiv:2501.15368 (2025)","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.17563","last_updated":"2025-07-23T14:53:50Z","snapshot_observed_at":"2026-08-07T18:31:16.203029Z","submitted_at":"2025-07-23T14:53:50Z","title":"BoSS: Beyond-Semantic Speech","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-06T14:50:04.300962Z"},"links":{"citing_paper":"/paper/2507.17563"},"observation_digest":"sha256:ac3899477196dc15f2417d6d7d56ca397a923b7ee46a63ab30acf2e77004a012","observation_id":"37aa05cf-a5eb-46f2-b9e6-a44c247380a8","resolution":{"observed_at":"2026-08-06T14:50:04.300962Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T14:50:04.730814Z","title":"GitHub (2025)","venue":null,"work_id":"c3a9269a-2a4c-43ef-a348-eb95c106f623","year":2025},"citing_paper":{"arxiv_id":"2507.17563","last_updated":"2025-07-23T14:53:50Z","snapshot_observed_at":"2026-08-07T18:31:16.203029Z","submitted_at":"2025-07-23T14:53:50Z","title":"BoSS: Beyond-Semantic Speech","version":1},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-06T14:50:04.303746Z"},"links":{"citing_paper":"/paper/2507.17563"},"observation_digest":"sha256:85b2e60b1a38897d3fe9f1eb99621dde1d2d2db6f20a26974a188dca7dcda19a","observation_id":"7faffdba-969d-44c7-8bf5-06c027f5df08","resolution":{"observed_at":"2026-08-06T14:50:04.733609Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2411.00774","last_updated":"2024-12-08T05:41:56Z","snapshot_observed_at":"2026-08-04T02:03:05.931925Z","submitted_at":"2024-11-01T17:59:51Z","title":"Freeze-Omni: A Smart and Low Latency Speech-to-speech Dialogue Model with Frozen LLM","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.00774","snapshot_observed_at":"2026-08-06T14:50:04.306448Z","title":"arXiv preprint arXiv:2411.00774 (2024)","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.17563","last_updated":"2025-07-23T14:53:50Z","snapshot_observed_at":"2026-08-07T18:31:16.203029Z","submitted_at":"2025-07-23T14:53:50Z","title":"BoSS: Beyond-Semantic Speech","version":1},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-06T14:50:04.306448Z"},"links":{"cited_paper":"/paper/2411.00774","citing_paper":"/paper/2507.17563"},"observation_digest":"sha256:fbe1b17f0adc439d3daf450d698230677bf1350549703b8b30972b3e4236bc65","observation_id":"9411af84-8233-4e5b-af70-fcd682a869a0","resolution":{"observed_at":"2026-08-06T14:50:04.306448Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.20215","last_updated":"2025-03-26T04:17:55Z","snapshot_observed_at":"2026-08-06T08:46:20.194739Z","submitted_at":"2025-03-26T04:17:55Z","title":"Qwen2.5-Omni Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.20215","snapshot_observed_at":"2026-08-06T14:50:04.310026Z","title":"5-omni technical report","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.17563","last_updated":"2025-07-23T14:53:50Z","snapshot_observed_at":"2026-08-07T18:31:16.203029Z","submitted_at":"2025-07-23T14:53:50Z","title":"BoSS: Beyond-Semantic Speech","version":1},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-06T14:50:04.310026Z"},"links":{"cited_paper":"/paper/2503.20215","citing_paper":"/paper/2507.17563"},"observation_digest":"sha256:790e742ff39d02be01e7025bd7146ff14c3ce8805bc24bfc6dc6f65c484039f4","observation_id":"2c5d77d4-6657-4926-9681-09065d3c91de","resolution":{"observed_at":"2026-08-06T14:50:04.310026Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.18425","last_updated":"2025-04-25T15:31:46Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-04-25T15:31:46Z","title":"Kimi-Audio Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.18425","snapshot_observed_at":"2026-08-06T14:50:04.312753Z","title":"arXiv preprint arXiv:2504.18425 (2025)","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.17563","last_updated":"2025-07-23T14:53:50Z","snapshot_observed_at":"2026-08-07T18:31:16.203029Z","submitted_at":"2025-07-23T14:53:50Z","title":"BoSS: Beyond-Semantic Speech","version":1},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-06T14:50:04.312753Z"},"links":{"cited_paper":"/paper/2504.18425","citing_paper":"/paper/2507.17563"},"observation_digest":"sha256:2869fec13cb376d1f08dc8c677a9bd3e0231a957015bb27158fb3121e5c8a5ff","observation_id":"528c4e6b-c8c1-47ad-bd4c-5c83c30d74bc","resolution":{"observed_at":"2026-08-06T14:50:04.312753Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2203.16844","last_updated":"2022-03-31T07:01:06Z","snapshot_observed_at":"2026-07-06T12:55:09.694305Z","submitted_at":"2022-03-31T07:01:06Z","title":"Open Source MagicData-RAMC: A Rich Annotated Mandarin Conversational(RAMC) Speech Dataset","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2203.16844","snapshot_observed_at":"2026-08-06T14:50:04.315499Z","title":"arXiv preprint arXiv:2203.16844 (2022)","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2507.17563","last_updated":"2025-07-23T14:53:50Z","snapshot_observed_at":"2026-08-07T18:31:16.203029Z","submitted_at":"2025-07-23T14:53:50Z","title":"BoSS: Beyond-Semantic Speech","version":1},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-06T14:50:04.315499Z"},"links":{"cited_paper":"/paper/2203.16844","citing_paper":"/paper/2507.17563"},"observation_digest":"sha256:c81237fef76c225f3b26bf13044b842ea9b5186e5e31dc3903e1a477759c84a6","observation_id":"b8e85c11-7a2f-49b9-a68b-6864ce52396e","resolution":{"observed_at":"2026-08-06T14:50:04.315499Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.04962","last_updated":"2025-05-27T16:14:30Z","snapshot_observed_at":"2026-08-04T13:52:59.504745Z","submitted_at":"2025-01-09T04:30:12Z","title":"VoxEval: Benchmarking the Knowledge Understanding Capabilities of End-to-End Spoken Language Models","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.04962","snapshot_observed_at":"2026-08-06T14:50:04.318974Z","title":"arXiv preprint arXiv:2501.04962 (2025)","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.17563","last_updated":"2025-07-23T14:53:50Z","snapshot_observed_at":"2026-08-07T18:31:16.203029Z","submitted_at":"2025-07-23T14:53:50Z","title":"BoSS: Beyond-Semantic Speech","version":1},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-08-06T14:50:04.318974Z"},"links":{"cited_paper":"/paper/2501.04962","citing_paper":"/paper/2507.17563"},"observation_digest":"sha256:6d14c5605ba9ca2db49c9dd25bf2132777a1825960266596dfb1191d7499451f","observation_id":"a829bc1c-343f-4a9a-a9f3-66f18d204e8a","resolution":{"observed_at":"2026-08-06T14:50:04.318974Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.12339","last_updated":"2025-05-28T14:24:12Z","snapshot_observed_at":"2026-08-07T16:05:41.407099Z","submitted_at":"2025-04-15T01:44:56Z","title":"GOAT-TTS: Expressive and Realistic Speech Generation via A Dual-Branch LLM","version":2},"cited_work":{"arxiv_id":"2504.12339","doi":null,"metadata_source":"pith","pith_arxiv_id":"2504.12339","snapshot_observed_at":"2026-08-06T14:50:04.360551Z","title":"GOAT-TTS: Expressive and Realistic Speech Generation via A Dual-Branch LLM","venue":"cs.CL","work_id":"7213bc2c-dc82-4709-9218-0d18cae35692","year":2025},"citing_paper":{"arxiv_id":"2507.17563","last_updated":"2025-07-23T14:53:50Z","snapshot_observed_at":"2026-08-07T18:31:16.203029Z","submitted_at":"2025-07-23T14:53:50Z","title":"BoSS: Beyond-Semantic Speech","version":1},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-08-06T14:50:04.322306Z"},"links":{"cited_paper":"/paper/2504.12339","citing_paper":"/paper/2507.17563"},"observation_digest":"sha256:70b299994a6431bc5c575676eda1743a74a6707016bb17a2f96d926e99d12b09","observation_id":"dc44700a-2646-4892-aca5-e51cb3dbce49","resolution":{"observed_at":"2026-08-06T14:50:04.365397Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.11230","last_updated":"2024-04-10T02:35:38Z","snapshot_observed_at":"2026-07-06T16:34:31.299748Z","submitted_at":"2023-10-17T13:01:10Z","title":"Zipformer: A faster and better encoder for automatic speech recognition","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.11230","snapshot_observed_at":"2026-08-06T14:50:04.324971Z","title":"arXiv preprint arXiv:2310.11230 (2023)","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.17563","last_updated":"2025-07-23T14:53:50Z","snapshot_observed_at":"2026-08-07T18:31:16.203029Z","submitted_at":"2025-07-23T14:53:50Z","title":"BoSS: Beyond-Semantic Speech","version":1},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-08-06T14:50:04.324971Z"},"links":{"cited_paper":"/paper/2310.11230","citing_paper":"/paper/2507.17563"},"observation_digest":"sha256:6cb4cea4fde4a61a599fbf205a9ce62b4b8751512adf3a055c02ba47ae38ea07","observation_id":"a022cac8-8adc-4ed1-b89f-2c25917be940","resolution":{"observed_at":"2026-08-06T14:50:04.324971Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T14:50:04.721838Z","title":"In: International Conference on Machine Learning, pp","venue":null,"work_id":"c5a07248-6def-4002-b2f5-9c1819ff0a76","year":2018},"citing_paper":{"arxiv_id":"2507.17563","last_updated":"2025-07-23T14:53:50Z","snapshot_observed_at":"2026-08-07T18:31:16.203029Z","submitted_at":"2025-07-23T14:53:50Z","title":"BoSS: Beyond-Semantic Speech","version":1},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-08-06T14:50:04.328064Z"},"links":{"citing_paper":"/paper/2507.17563"},"observation_digest":"sha256:817d1fa4882efbf0af52b9fb7c9418231ea34cd3082ff464d98af1cd23023fad","observation_id":"6ce36a8f-ad4a-449a-86f3-944a0b06a97e","resolution":{"observed_at":"2026-08-06T14:50:04.724655Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T14:50:04.712280Z","title":"IEEE Signal processing magazine 18(1), 32–80 (2001) 24","venue":null,"work_id":"bd82ae70-91cb-4f63-8383-e6432b7c6865","year":2001},"citing_paper":{"arxiv_id":"2507.17563","last_updated":"2025-07-23T14:53:50Z","snapshot_observed_at":"2026-08-07T18:31:16.203029Z","submitted_at":"2025-07-23T14:53:50Z","title":"BoSS: Beyond-Semantic Speech","version":1},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-08-06T14:50:04.331322Z"},"links":{"citing_paper":"/paper/2507.17563"},"observation_digest":"sha256:8d2665ad06cae859b5640bb94beacfd2298ca8ead115d352b3bef5f92496d00f","observation_id":"c829955e-8240-4c2b-965e-400c39a0a1fe","resolution":{"observed_at":"2026-08-06T14:50:04.715667Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2507.17563","last_updated":"2025-07-23T14:53:50Z","latest_version":1,"primary_category":"cs.SD","snapshot_observed_at":"2026-08-07T18:31:16.203029Z","submitted_at":"2025-07-23T14:53:50Z","title":"BoSS: Beyond-Semantic Speech"},"reference_resolution":{"displayed":58,"state_counts":{"malformed_identifier":0,"metadata_mismatch":1,"parse_uncertain":0,"unresolved":32,"verified_exact":0,"verified_fuzzy":25},"total_outbound_references":58},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"thesis":"As of 10 August 2026, this Paper Citation Record lists 58 of 58 outbound references and 4 inbound Pith citation observations for arXiv:2507.17563."}