{"as_of":"2026-08-20T21:20:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:c18042fa899bd46a9f8fb62a0e8beea7edd735ffeb2f2d57aa565d7eb42631e7","coverage":[{"denominator":48,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":48,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T15:36:46.248344Z","state":"measured"},{"denominator":50,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":50,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-20T06:33:59.587034+00:00","state":"measured"},{"denominator":2,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":2,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T15:36:41.638006Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-07-03T12:48:12.260808Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2505.14470","last_updated":"2025-06-04T08:23:18Z","snapshot_observed_at":"2026-08-16T21:38:58.815524Z","submitted_at":"2025-05-20T15:05:14Z","title":"PAST: Phonetic-Acoustic Speech Tokenizer","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.14470","snapshot_observed_at":"2026-08-07T15:36:41.638006Z","title":"Acoustic tokenizersaim to compress speech into discrete rep- arXiv:2505.14470v2 [cs.SD] 4 Jun 2025 resentations optimized for high-fidelity reconstruction","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.14470","last_updated":"2025-06-04T08:23:18Z","snapshot_observed_at":"2026-08-16T21:38:58.815524Z","submitted_at":"2025-05-20T15:05:14Z","title":"PAST: Phonetic-Acoustic Speech Tokenizer","version":2},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-07T15:36:41.638006Z"},"links":{"cited_paper":"/paper/2505.14470","citing_paper":"/paper/2505.14470"},"observation_digest":"sha256:cde8d325496131dc1b09cb0390b3c84758f6dc6d7554a6a6fa9d67fc804eca98","observation_id":"fd002efa-0613-4dbf-80fe-94327ad589b8","resolution":{"observed_at":"2026-08-07T15:36:41.638006Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.14470","last_updated":"2025-06-04T08:23:18Z","snapshot_observed_at":"2026-08-16T21:38:58.815524Z","submitted_at":"2025-05-20T15:05:14Z","title":"PAST: Phonetic-Acoustic Speech Tokenizer","version":2},"cited_work":{"arxiv_id":"2505.14470","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2505.14470","snapshot_observed_at":"2026-07-03T12:48:12.260808Z","title":"Past: Phonetic-acoustic speech tok- enizer,","venue":null,"work_id":"00d843a2-7aa4-4bef-9143-d17e145d8739","year":2025},"citing_paper":{"arxiv_id":"2606.11631","last_updated":"2026-06-10T03:49:54Z","snapshot_observed_at":"2026-08-02T17:57:49.398213Z","submitted_at":"2026-06-10T03:49:54Z","title":"Benchmarking Neural Speech Compression from a Rate-Distortion Perspective","version":1},"reference_index":77,"source":"pdf_text","source_observed_at":"2026-06-27T08:43:35.279033Z"},"links":{"cited_paper":"/paper/2505.14470","citing_paper":"/paper/2606.11631"},"observation_digest":"sha256:a658c92c9c58e4c6201528d4be5b497f55ff72c487918d9f2d06612689c8fd7b","observation_id":"af391476-d310-4819-81f2-fea65bdf6141","resolution":{"observed_at":"2026-07-03T12:48:12.262338Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2505.14470/citation-record","integrity":"/paper/2505.14470/integrity","json":"/paper/2505.14470/citation-record.json","paper":"/paper/2505.14470"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:36:52.328683Z","title":"These models usually operate over acoustic tokens or phonetic speech tokens (also known as semantic tokens)","venue":null,"work_id":"bfc4a6ea-7fc1-45b8-8046-69013f6b4308","year":null},"citing_paper":{"arxiv_id":"2505.14470","last_updated":"2025-06-04T08:23:18Z","snapshot_observed_at":"2026-08-16T21:38:58.815524Z","submitted_at":"2025-05-20T15:05:14Z","title":"PAST: Phonetic-Acoustic Speech Tokenizer","version":2},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-07T15:36:41.113789Z"},"links":{"citing_paper":"/paper/2505.14470"},"observation_digest":"sha256:6d990748954715145546bf1bd8763935a26de758b76f1116968d39acbe888524","observation_id":"6d1d0618-b4ee-44a9-8e73-da79dbbe5c50","resolution":{"observed_at":"2026-08-07T15:36:52.440433Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:36:52.060167Z","title":null,"venue":null,"work_id":"15c129df-09c3-46b5-85c8-d8577039d8e8","year":null},"citing_paper":{"arxiv_id":"2505.14470","last_updated":"2025-06-04T08:23:18Z","snapshot_observed_at":"2026-08-16T21:38:58.815524Z","submitted_at":"2025-05-20T15:05:14Z","title":"PAST: Phonetic-Acoustic Speech Tokenizer","version":2},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-07T15:36:41.232581Z"},"links":{"citing_paper":"/paper/2505.14470"},"observation_digest":"sha256:af1b8a0995fa7faf5818ecd26fe56499292691d0946f4b14ad2be6288d25db1e","observation_id":"24be95c4-b49a-460b-b670-fa9d1c2ba676","resolution":{"observed_at":"2026-08-07T15:36:52.213664Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:36:51.775149Z","title":null,"venue":null,"work_id":"76ec1a31-5c2d-4d1a-851d-8facdaed5f97","year":null},"citing_paper":{"arxiv_id":"2505.14470","last_updated":"2025-06-04T08:23:18Z","snapshot_observed_at":"2026-08-16T21:38:58.815524Z","submitted_at":"2025-05-20T15:05:14Z","title":"PAST: Phonetic-Acoustic Speech Tokenizer","version":2},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-07T15:36:41.364786Z"},"links":{"citing_paper":"/paper/2505.14470"},"observation_digest":"sha256:cc3a01161d7a23e141ac42ef22fa028d767e60b49d8da0fc16717b175e6f8e7f","observation_id":"8e225647-b7d9-4597-9a81-c995d783fc67","resolution":{"observed_at":"2026-08-07T15:36:51.919616Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:36:51.456015Z","title":null,"venue":null,"work_id":"dd19b632-6306-4902-bd90-c80f92432de0","year":null},"citing_paper":{"arxiv_id":"2505.14470","last_updated":"2025-06-04T08:23:18Z","snapshot_observed_at":"2026-08-16T21:38:58.815524Z","submitted_at":"2025-05-20T15:05:14Z","title":"PAST: Phonetic-Acoustic Speech Tokenizer","version":2},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-07T15:36:41.471072Z"},"links":{"citing_paper":"/paper/2505.14470"},"observation_digest":"sha256:acecf0a464a29c233935c91d1aa8c9ec60e03a6378c483aabfd6fd10f489a15d","observation_id":"2073e341-ac4e-420d-a8c5-69758a47bf76","resolution":{"observed_at":"2026-08-07T15:36:51.608579Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:36:51.156818Z","title":null,"venue":null,"work_id":"2076bd99-c992-4e17-99d0-8e5d6c518bcb","year":null},"citing_paper":{"arxiv_id":"2505.14470","last_updated":"2025-06-04T08:23:18Z","snapshot_observed_at":"2026-08-16T21:38:58.815524Z","submitted_at":"2025-05-20T15:05:14Z","title":"PAST: Phonetic-Acoustic Speech Tokenizer","version":2},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-07T15:36:41.550800Z"},"links":{"citing_paper":"/paper/2505.14470"},"observation_digest":"sha256:3a23e9869e9bc96467ac49e979dbc70d7c0f3549cc326149c7f8b285cec2d81d","observation_id":"3bd6c800-6965-417d-a7ae-ccea8cbdb256","resolution":{"observed_at":"2026-08-07T15:36:51.301505Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.14470","last_updated":"2025-06-04T08:23:18Z","snapshot_observed_at":"2026-08-16T21:38:58.815524Z","submitted_at":"2025-05-20T15:05:14Z","title":"PAST: Phonetic-Acoustic Speech Tokenizer","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.14470","snapshot_observed_at":"2026-08-07T15:36:41.638006Z","title":"Acoustic tokenizersaim to compress speech into discrete rep- arXiv:2505.14470v2 [cs.SD] 4 Jun 2025 resentations optimized for high-fidelity reconstruction","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.14470","last_updated":"2025-06-04T08:23:18Z","snapshot_observed_at":"2026-08-16T21:38:58.815524Z","submitted_at":"2025-05-20T15:05:14Z","title":"PAST: Phonetic-Acoustic Speech Tokenizer","version":2},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-07T15:36:41.638006Z"},"links":{"cited_paper":"/paper/2505.14470","citing_paper":"/paper/2505.14470"},"observation_digest":"sha256:cde8d325496131dc1b09cb0390b3c84758f6dc6d7554a6a6fa9d67fc804eca98","observation_id":"fd002efa-0613-4dbf-80fe-94327ad589b8","resolution":{"observed_at":"2026-08-07T15:36:41.638006Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:36:50.883903Z","title":"Problem Setup Our model is composed of three main components: Encoder, Quantizer, and Decoder","venue":null,"work_id":"7ef7240b-f8dd-49e4-b86d-8b071f9438e3","year":null},"citing_paper":{"arxiv_id":"2505.14470","last_updated":"2025-06-04T08:23:18Z","snapshot_observed_at":"2026-08-16T21:38:58.815524Z","submitted_at":"2025-05-20T15:05:14Z","title":"PAST: Phonetic-Acoustic Speech Tokenizer","version":2},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-07T15:36:41.730614Z"},"links":{"citing_paper":"/paper/2505.14470"},"observation_digest":"sha256:edf62655b342fe2e8054f271b4b57827596ed98e52ffb0cdb8e9bbb8d9f7320c","observation_id":"5a9ed943-e7c3-4768-ad3c-9a6b1bb4955c","resolution":{"observed_at":"2026-08-07T15:36:51.009788Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:36:43.064970Z","title":"Soundstream: An end-to-end neural audio codec,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2505.14470","last_updated":"2025-06-04T08:23:18Z","snapshot_observed_at":"2026-08-16T21:38:58.815524Z","submitted_at":"2025-05-20T15:05:14Z","title":"PAST: Phonetic-Acoustic Speech Tokenizer","version":2},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-07T15:36:43.064970Z"},"links":{"citing_paper":"/paper/2505.14470"},"observation_digest":"sha256:63212489154d8d65c38b0aed6522de65e8b9ff89d4f699fb2bdada30454e1f61","observation_id":"51300dc2-8046-4718-b918-da187b26b91a","resolution":{"observed_at":"2026-08-07T15:36:43.064970Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:36:50.475244Z","title":"Data We use all training subsets of LibriSpeech [29] and TIMIT [30] for our training set, yielding a total of965hours of raw audio","venue":null,"work_id":"4ca59370-68d3-4901-bab6-3cdc047eff13","year":null},"citing_paper":{"arxiv_id":"2505.14470","last_updated":"2025-06-04T08:23:18Z","snapshot_observed_at":"2026-08-16T21:38:58.815524Z","submitted_at":"2025-05-20T15:05:14Z","title":"PAST: Phonetic-Acoustic Speech Tokenizer","version":2},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-07T15:36:41.861572Z"},"links":{"citing_paper":"/paper/2505.14470"},"observation_digest":"sha256:7f716a68c13a759d01d7808f1ce2fa2e5634269a61416d98fee8f5b639371183","observation_id":"92fd0231-a65c-4b49-8483-1dddd9a223bd","resolution":{"observed_at":"2026-08-07T15:36:50.579406Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:36:50.295740Z","title":"Baseline Comparison We compare PAST with two baseline hybrid models, Speech- Tokenizer and X-Codec, on both reconstruction and phonetic information metrics","venue":null,"work_id":"329e2af4-903d-448a-b31e-fbba599635f0","year":null},"citing_paper":{"arxiv_id":"2505.14470","last_updated":"2025-06-04T08:23:18Z","snapshot_observed_at":"2026-08-16T21:38:58.815524Z","submitted_at":"2025-05-20T15:05:14Z","title":"PAST: Phonetic-Acoustic Speech Tokenizer","version":2},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-07T15:36:41.954031Z"},"links":{"citing_paper":"/paper/2505.14470"},"observation_digest":"sha256:d95a25bbf454e978a67e0dabb59a70d5e414f291184015464df59d017e638c93","observation_id":"a4d1ca86-875f-44c2-b182-6aeb909450aa","resolution":{"observed_at":"2026-08-07T15:36:50.396232Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:36:50.134538Z","title":null,"venue":null,"work_id":"b310425e-8bd0-4ebd-a996-8903fcafe284","year":null},"citing_paper":{"arxiv_id":"2505.14470","last_updated":"2025-06-04T08:23:18Z","snapshot_observed_at":"2026-08-16T21:38:58.815524Z","submitted_at":"2025-05-20T15:05:14Z","title":"PAST: Phonetic-Acoustic Speech Tokenizer","version":2},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-07T15:36:42.029656Z"},"links":{"citing_paper":"/paper/2505.14470"},"observation_digest":"sha256:ea55947081ba63a54f72eed6595f06efc601d82e8f5e2f1a7ae4f720b90fe118","observation_id":"6e8e1277-a058-4f74-b933-60c5cf533c7b","resolution":{"observed_at":"2026-08-07T15:36:50.215266Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:36:49.990963Z","title":"Generative spoken language model based on continuous word-sized audio tokens,","venue":null,"work_id":"0755805a-b3b0-4eef-ae5a-670b6dd77266","year":2023},"citing_paper":{"arxiv_id":"2505.14470","last_updated":"2025-06-04T08:23:18Z","snapshot_observed_at":"2026-08-16T21:38:58.815524Z","submitted_at":"2025-05-20T15:05:14Z","title":"PAST: Phonetic-Acoustic Speech Tokenizer","version":2},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-07T15:36:42.157713Z"},"links":{"citing_paper":"/paper/2505.14470"},"observation_digest":"sha256:9e616f49237679d91e9934192e477a989c2eb05daab99717eb93d4a6d3101cce","observation_id":"c69020ab-9cb6-4e28-ae47-4ad8073d2623","resolution":{"observed_at":"2026-08-07T15:36:50.067667Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:36:49.840360Z","title":"Textless acoustic model with self-supervised distillation for noise-robust expressive speech-to-speech transla- tion,","venue":null,"work_id":"bbad9a97-5168-4fb4-9bef-1aaf5ac6840b","year":2024},"citing_paper":{"arxiv_id":"2505.14470","last_updated":"2025-06-04T08:23:18Z","snapshot_observed_at":"2026-08-16T21:38:58.815524Z","submitted_at":"2025-05-20T15:05:14Z","title":"PAST: Phonetic-Acoustic Speech Tokenizer","version":2},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-07T15:36:42.293050Z"},"links":{"citing_paper":"/paper/2505.14470"},"observation_digest":"sha256:f6aed7b78579b2ebad5071c03e2236aff73054b990987e9596871fe165652236","observation_id":"91225a23-a38d-4679-a578-fe8950aea761","resolution":{"observed_at":"2026-08-07T15:36:49.907843Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:36:49.681640Z","title":"Audiolm: a language modeling approach to au- dio generation,","venue":null,"work_id":"f26db381-3eab-474a-91cd-3da6a1437b29","year":2023},"citing_paper":{"arxiv_id":"2505.14470","last_updated":"2025-06-04T08:23:18Z","snapshot_observed_at":"2026-08-16T21:38:58.815524Z","submitted_at":"2025-05-20T15:05:14Z","title":"PAST: Phonetic-Acoustic Speech Tokenizer","version":2},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-07T15:36:42.467128Z"},"links":{"citing_paper":"/paper/2505.14470"},"observation_digest":"sha256:339edac8ef7634ac5a9b72bfb4a693674dd7aba97efaddf1324c157ddfde801c","observation_id":"2b67d8cf-cf05-4e28-820a-7ef18474dfc2","resolution":{"observed_at":"2026-08-07T15:36:49.760241Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:36:49.501681Z","title":"Text-free prosody-aware generative spoken language modeling,","venue":null,"work_id":"c571e26f-0265-4dd6-a7d4-601586eae1bb","year":2022},"citing_paper":{"arxiv_id":"2505.14470","last_updated":"2025-06-04T08:23:18Z","snapshot_observed_at":"2026-08-16T21:38:58.815524Z","submitted_at":"2025-05-20T15:05:14Z","title":"PAST: Phonetic-Acoustic Speech Tokenizer","version":2},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-07T15:36:42.590165Z"},"links":{"citing_paper":"/paper/2505.14470"},"observation_digest":"sha256:afca6b382396aea5301b87d31f609198321f83522785a00f069ca5c4b87409fd","observation_id":"c14e6a54-8a6b-4e38-ac5d-5e1881a85c0b","resolution":{"observed_at":"2026-08-07T15:36:49.588890Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:36:49.355527Z","title":"On generative spoken language modeling from raw audio,","venue":null,"work_id":"6b5323bd-b380-405e-b9b8-922b1f6c48ec","year":2021},"citing_paper":{"arxiv_id":"2505.14470","last_updated":"2025-06-04T08:23:18Z","snapshot_observed_at":"2026-08-16T21:38:58.815524Z","submitted_at":"2025-05-20T15:05:14Z","title":"PAST: Phonetic-Acoustic Speech Tokenizer","version":2},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-07T15:36:42.723486Z"},"links":{"citing_paper":"/paper/2505.14470"},"observation_digest":"sha256:dc28ec2dfff90fb24ebf6bbe5116f03927b457e41665a7bc6facd5768dbfc221","observation_id":"9ae9b94b-4759-4cd1-bf42-0a0da3dece75","resolution":{"observed_at":"2026-08-07T15:36:49.409764Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:36:49.218729Z","title":"Textually pretrained speech language mod- els,","venue":null,"work_id":"320bf366-db21-4f76-86a6-a46ebaae7189","year":2024},"citing_paper":{"arxiv_id":"2505.14470","last_updated":"2025-06-04T08:23:18Z","snapshot_observed_at":"2026-08-16T21:38:58.815524Z","submitted_at":"2025-05-20T15:05:14Z","title":"PAST: Phonetic-Acoustic Speech Tokenizer","version":2},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-07T15:36:42.863861Z"},"links":{"citing_paper":"/paper/2505.14470"},"observation_digest":"sha256:9ccd153db5ad5c6db805b17d5bac46f2348ab67b2067debaf13178b18a09fd84","observation_id":"c37f05e4-a93e-4275-bdd8-d56991b118f6","resolution":{"observed_at":"2026-08-07T15:36:49.263010Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2210.13438","last_updated":"2022-10-24T17:52:02Z","snapshot_observed_at":"2026-08-15T04:43:16.361751Z","submitted_at":"2022-10-24T17:52:02Z","title":"High Fidelity Neural Audio Compression","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2210.13438","snapshot_observed_at":"2026-08-07T15:36:42.972992Z","title":"High fidelity neural audio compression,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2505.14470","last_updated":"2025-06-04T08:23:18Z","snapshot_observed_at":"2026-08-16T21:38:58.815524Z","submitted_at":"2025-05-20T15:05:14Z","title":"PAST: Phonetic-Acoustic Speech Tokenizer","version":2},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-07T15:36:42.972992Z"},"links":{"cited_paper":"/paper/2210.13438","citing_paper":"/paper/2505.14470"},"observation_digest":"sha256:fc6cc42ef8944b4ba0336f8135f54f34d5a0ed2924728dc87d655ae9f3c5e071","observation_id":"093fc44b-671b-450c-b501-926022514b33","resolution":{"observed_at":"2026-08-07T15:36:42.972992Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:36:48.109115Z","title":"Pyramidcodec: Hierarchical codec for long-form music generation in audio domain,","venue":null,"work_id":"f4a65b55-fe6e-4ad4-a210-f2d5fdf7e446","year":2024},"citing_paper":{"arxiv_id":"2505.14470","last_updated":"2025-06-04T08:23:18Z","snapshot_observed_at":"2026-08-16T21:38:58.815524Z","submitted_at":"2025-05-20T15:05:14Z","title":"PAST: Phonetic-Acoustic Speech Tokenizer","version":2},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-07T15:36:44.394744Z"},"links":{"citing_paper":"/paper/2505.14470"},"observation_digest":"sha256:a3c1e78c3abcda6f55d042387105d6098ab0081afb20c644dbb776e88a2da914","observation_id":"9ad809f5-5aec-45ed-9b29-cc3bc56237f8","resolution":{"observed_at":"2026-08-07T15:36:48.210900Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:36:43.217290Z","title":"wav2vec 2.0: A framework for self-supervised learning of speech repre- sentations,","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2505.14470","last_updated":"2025-06-04T08:23:18Z","snapshot_observed_at":"2026-08-16T21:38:58.815524Z","submitted_at":"2025-05-20T15:05:14Z","title":"PAST: Phonetic-Acoustic Speech Tokenizer","version":2},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-07T15:36:43.217290Z"},"links":{"citing_paper":"/paper/2505.14470"},"observation_digest":"sha256:92272aca4079dc76b680627227611c4066199ad56a60aaa789096a5d0bcab5d7","observation_id":"41a88ea8-e634-44c9-a273-a8d22177ed8b","resolution":{"observed_at":"2026-08-07T15:36:43.217290Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:36:43.335300Z","title":"Hubert: Self-supervised speech represen- tation learning by masked prediction of hidden units,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2505.14470","last_updated":"2025-06-04T08:23:18Z","snapshot_observed_at":"2026-08-16T21:38:58.815524Z","submitted_at":"2025-05-20T15:05:14Z","title":"PAST: Phonetic-Acoustic Speech Tokenizer","version":2},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-07T15:36:43.335300Z"},"links":{"citing_paper":"/paper/2505.14470"},"observation_digest":"sha256:2e2e3f543d2e7dfb53c87131f465bb676547a266cdc4e544deadeac367aeea6a","observation_id":"c6552382-832e-4c72-bdb3-c74f93108585","resolution":{"observed_at":"2026-08-07T15:36:43.335300Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:36:49.085317Z","title":"Analysing discrete self supervised speech representation for spoken language modeling,","venue":null,"work_id":"bed79abf-9161-4067-8d1d-4d633ea08801","year":2023},"citing_paper":{"arxiv_id":"2505.14470","last_updated":"2025-06-04T08:23:18Z","snapshot_observed_at":"2026-08-16T21:38:58.815524Z","submitted_at":"2025-05-20T15:05:14Z","title":"PAST: Phonetic-Acoustic Speech Tokenizer","version":2},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-07T15:36:43.431637Z"},"links":{"citing_paper":"/paper/2505.14470"},"observation_digest":"sha256:0573b0319d555796e5121a75781b0bd4f4fa510fe2951a84b73d1ad734c64c6d","observation_id":"f4541b15-f6fc-48f2-a527-dd324dc16ca4","resolution":{"observed_at":"2026-08-07T15:36:49.132860Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:36:43.497780Z","title":"Hifi-gan: Generative adversarial net- works for efficient and high fidelity speech synthesis,","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2505.14470","last_updated":"2025-06-04T08:23:18Z","snapshot_observed_at":"2026-08-16T21:38:58.815524Z","submitted_at":"2025-05-20T15:05:14Z","title":"PAST: Phonetic-Acoustic Speech Tokenizer","version":2},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-07T15:36:43.497780Z"},"links":{"citing_paper":"/paper/2505.14470"},"observation_digest":"sha256:d7b927ce7c6b48a66002341f358fee39f96c3f057471d6098cc89364466262e0","observation_id":"fce9e7a6-b01d-4b23-badc-691f7bf72840","resolution":{"observed_at":"2026-08-07T15:36:43.497780Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:36:43.576586Z","title":"Speechtok- enizer: Unified speech tokenizer for speech language models,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.14470","last_updated":"2025-06-04T08:23:18Z","snapshot_observed_at":"2026-08-16T21:38:58.815524Z","submitted_at":"2025-05-20T15:05:14Z","title":"PAST: Phonetic-Acoustic Speech Tokenizer","version":2},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-07T15:36:43.576586Z"},"links":{"citing_paper":"/paper/2505.14470"},"observation_digest":"sha256:d6ed3289cd202af2b2be2f988100a0ace360efb4497499af15cc271923d27184","observation_id":"5ea204e1-eb42-41a0-a676-61cebaea42d3","resolution":{"observed_at":"2026-08-07T15:36:43.576586Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.17175","last_updated":"2024-11-27T11:47:45Z","snapshot_observed_at":"2026-08-16T20:33:30.347717Z","submitted_at":"2024-08-30T10:24:07Z","title":"Codec Does Matter: Exploring the Semantic Shortcoming of Codec for Audio Language Model","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.17175","snapshot_observed_at":"2026-08-07T15:36:43.700479Z","title":"Codec does matter: Exploring the semantic short- coming of codec for audio language model,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.14470","last_updated":"2025-06-04T08:23:18Z","snapshot_observed_at":"2026-08-16T21:38:58.815524Z","submitted_at":"2025-05-20T15:05:14Z","title":"PAST: Phonetic-Acoustic Speech Tokenizer","version":2},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-07T15:36:43.700479Z"},"links":{"cited_paper":"/paper/2408.17175","citing_paper":"/paper/2505.14470"},"observation_digest":"sha256:fb712391d205ccda16603d2e0503abdbe88aeb2ed9e030a3bf0e910cca34a13f","observation_id":"65286334-7429-4af7-a48b-ad9146096970","resolution":{"observed_at":"2026-08-07T15:36:43.700479Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:36:48.842562Z","title":"Moshi: a speech-text foundation model for real-time dialogue,","venue":null,"work_id":"bcebe38b-8b9a-4686-82c8-363dc36ca984","year":2024},"citing_paper":{"arxiv_id":"2505.14470","last_updated":"2025-06-04T08:23:18Z","snapshot_observed_at":"2026-08-16T21:38:58.815524Z","submitted_at":"2025-05-20T15:05:14Z","title":"PAST: Phonetic-Acoustic Speech Tokenizer","version":2},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-07T15:36:43.818074Z"},"links":{"citing_paper":"/paper/2505.14470"},"observation_digest":"sha256:2df6071f54d390389cf4a2d1f812254c85ad0191c472a5608b66328dc7afc837","observation_id":"bbf55102-cca8-4a26-b575-518bf7a68b9d","resolution":{"observed_at":"2026-08-07T15:36:48.972558Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:36:48.558039Z","title":"Wavlm: Large-scale self-supervised pre-training for full stack speech processing,","venue":null,"work_id":"185ca240-4e8f-4156-ba47-c43181dcad2d","year":2022},"citing_paper":{"arxiv_id":"2505.14470","last_updated":"2025-06-04T08:23:18Z","snapshot_observed_at":"2026-08-16T21:38:58.815524Z","submitted_at":"2025-05-20T15:05:14Z","title":"PAST: Phonetic-Acoustic Speech Tokenizer","version":2},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-07T15:36:43.938820Z"},"links":{"citing_paper":"/paper/2505.14470"},"observation_digest":"sha256:aaf4820434932ec71ed8e188f9bc8636eff98c9b4f39f8bb535558686d22c6de","observation_id":"356517eb-c842-450f-85a4-0c0e666dcdab","resolution":{"observed_at":"2026-08-07T15:36:48.715687Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:36:50.700978Z","title":null,"venue":null,"work_id":"c4eb7c19-831c-4a48-8663-49565483a01c","year":null},"citing_paper":{"arxiv_id":"2505.14470","last_updated":"2025-06-04T08:23:18Z","snapshot_observed_at":"2026-08-16T21:38:58.815524Z","submitted_at":"2025-05-20T15:05:14Z","title":"PAST: Phonetic-Acoustic Speech Tokenizer","version":2},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-07T15:36:41.796360Z"},"links":{"citing_paper":"/paper/2505.14470"},"observation_digest":"sha256:89f9656ea59b64dbb87c7041acf80c1ac228ad10f6f089e316f735413d3f94fd","observation_id":"467667de-8c01-4e10-ac1f-b910263e95df","resolution":{"observed_at":"2026-08-07T15:36:50.782575Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2305.02765","last_updated":"2023-05-07T09:22:04Z","snapshot_observed_at":"2026-08-16T15:35:40.710158Z","submitted_at":"2023-05-04T12:11:13Z","title":"HiFi-Codec: Group-residual Vector quantization for High Fidelity Audio Codec","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.02765","snapshot_observed_at":"2026-08-07T15:36:44.119792Z","title":"Hifi- codec: Group-residual vector quantization for high fidelity audio codec,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.14470","last_updated":"2025-06-04T08:23:18Z","snapshot_observed_at":"2026-08-16T21:38:58.815524Z","submitted_at":"2025-05-20T15:05:14Z","title":"PAST: Phonetic-Acoustic Speech Tokenizer","version":2},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-07T15:36:44.119792Z"},"links":{"cited_paper":"/paper/2305.02765","citing_paper":"/paper/2505.14470"},"observation_digest":"sha256:5fbf7a1df0a535c60110dd42532f7d442a1b255cde4cbd9a8712a9a11b2aa0a8","observation_id":"ae2a569d-ba4b-42a9-a956-bcf254094187","resolution":{"observed_at":"2026-08-07T15:36:44.119792Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:36:48.321218Z","title":"High fidelity neural audio compression,","venue":null,"work_id":"19dabeb3-184e-4abd-9378-8c7be6d3d08e","year":2023},"citing_paper":{"arxiv_id":"2505.14470","last_updated":"2025-06-04T08:23:18Z","snapshot_observed_at":"2026-08-16T21:38:58.815524Z","submitted_at":"2025-05-20T15:05:14Z","title":"PAST: Phonetic-Acoustic Speech Tokenizer","version":2},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-07T15:36:44.241497Z"},"links":{"citing_paper":"/paper/2505.14470"},"observation_digest":"sha256:457a5c4979563c93f66409101ff66fa1ec78c340be0a6252f9528fb127ac1fd6","observation_id":"a7c73625-ae79-45d1-9199-36b2bc83944a","resolution":{"observed_at":"2026-08-07T15:36:48.445553Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:36:47.869318Z","title":"Audiodec: An open-source streaming high- fidelity neural audio codec,","venue":null,"work_id":"a1e3b363-1bdb-4e37-8dcd-3936c287b1ae","year":2023},"citing_paper":{"arxiv_id":"2505.14470","last_updated":"2025-06-04T08:23:18Z","snapshot_observed_at":"2026-08-16T21:38:58.815524Z","submitted_at":"2025-05-20T15:05:14Z","title":"PAST: Phonetic-Acoustic Speech Tokenizer","version":2},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-07T15:36:44.527302Z"},"links":{"citing_paper":"/paper/2505.14470"},"observation_digest":"sha256:3508c6f31851143e66ee77ec17358aa91bee3baa00778536fcb869d389f9a430","observation_id":"722f6378-a58a-4deb-81f4-32f4f5f10418","resolution":{"observed_at":"2026-08-07T15:36:47.971760Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:36:44.656266Z","title":"Funcodec: A funda- mental, reproducible and integrable open-source toolkit for neural speech codec,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.14470","last_updated":"2025-06-04T08:23:18Z","snapshot_observed_at":"2026-08-16T21:38:58.815524Z","submitted_at":"2025-05-20T15:05:14Z","title":"PAST: Phonetic-Acoustic Speech Tokenizer","version":2},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-07T15:36:44.656266Z"},"links":{"citing_paper":"/paper/2505.14470"},"observation_digest":"sha256:1a9ad4a53d0bb4301f26922a75522c0dfd91e853fa7b4f472301b0ac616d8486","observation_id":"3945ee03-0863-472a-9fb8-29c097240400","resolution":{"observed_at":"2026-08-07T15:36:44.656266Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:36:47.571083Z","title":"Wavtokenizer: an efficient acoustic discrete codec tokenizer for audio language modeling,","venue":null,"work_id":"40466bd8-38fa-4e3b-a78c-273c45c02328","year":2024},"citing_paper":{"arxiv_id":"2505.14470","last_updated":"2025-06-04T08:23:18Z","snapshot_observed_at":"2026-08-16T21:38:58.815524Z","submitted_at":"2025-05-20T15:05:14Z","title":"PAST: Phonetic-Acoustic Speech Tokenizer","version":2},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-07T15:36:44.766303Z"},"links":{"citing_paper":"/paper/2505.14470"},"observation_digest":"sha256:4cc8b97fc78443a5c7e2032e2816e2013be66c9b8f1c07cb0b955dac802db15b","observation_id":"5e8865d9-12f2-4ef8-872f-9f91f8d12791","resolution":{"observed_at":"2026-08-07T15:36:47.689975Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2411.17607","last_updated":"2024-12-02T16:13:24Z","snapshot_observed_at":"2026-08-19T05:24:09.876190Z","submitted_at":"2024-11-26T17:19:09Z","title":"Scaling Speech-Text Pre-training with Synthetic Interleaved Data","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.17607","snapshot_observed_at":"2026-08-07T15:36:44.886879Z","title":"Scaling speech-text pre-training with synthetic interleaved data,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.14470","last_updated":"2025-06-04T08:23:18Z","snapshot_observed_at":"2026-08-16T21:38:58.815524Z","submitted_at":"2025-05-20T15:05:14Z","title":"PAST: Phonetic-Acoustic Speech Tokenizer","version":2},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-07T15:36:44.886879Z"},"links":{"cited_paper":"/paper/2411.17607","citing_paper":"/paper/2505.14470"},"observation_digest":"sha256:f9228f688630cfe19bff3c9f7871342764b58e9c9168109709aa04ae407cac90","observation_id":"35126764-2f60-4e9d-8e58-84d1b7e60eeb","resolution":{"observed_at":"2026-08-07T15:36:44.886879Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:36:44.992730Z","title":"Robust speech recognition via large-scale weak supervision,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.14470","last_updated":"2025-06-04T08:23:18Z","snapshot_observed_at":"2026-08-16T21:38:58.815524Z","submitted_at":"2025-05-20T15:05:14Z","title":"PAST: Phonetic-Acoustic Speech Tokenizer","version":2},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-07T15:36:44.992730Z"},"links":{"citing_paper":"/paper/2505.14470"},"observation_digest":"sha256:144b22dcd303a355fb5c8cd2d0c5cbe81be4bd0f06469893b8f1d9c0e830a846","observation_id":"5a62e195-0f55-469f-a96c-04642d3a81fe","resolution":{"observed_at":"2026-08-07T15:36:44.992730Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.03701","last_updated":"2024-09-10T14:45:15Z","snapshot_observed_at":"2026-08-16T13:20:59.520858Z","submitted_at":"2024-09-05T16:57:39Z","title":"LAST: Language Model Aware Speech Tokenization","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.03701","snapshot_observed_at":"2026-08-07T15:36:45.112795Z","title":"Last: Language model aware speech tokenization,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.14470","last_updated":"2025-06-04T08:23:18Z","snapshot_observed_at":"2026-08-16T21:38:58.815524Z","submitted_at":"2025-05-20T15:05:14Z","title":"PAST: Phonetic-Acoustic Speech Tokenizer","version":2},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-07T15:36:45.112795Z"},"links":{"cited_paper":"/paper/2409.03701","citing_paper":"/paper/2505.14470"},"observation_digest":"sha256:0e28864f89e05f44280b9764f9531b75ea6caa6b566ff3261275d1a17dc15db3","observation_id":"9b62e96f-ebfd-4928-8e66-23090e9c5428","resolution":{"observed_at":"2026-08-07T15:36:45.112795Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.11037","last_updated":"2024-06-16T18:20:45Z","snapshot_observed_at":"2026-08-16T13:42:30.726973Z","submitted_at":"2024-06-16T18:20:45Z","title":"NAST: Noise Aware Speech Tokenization for Speech Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.11037","snapshot_observed_at":"2026-08-07T15:36:45.240767Z","title":"Nast: Noise aware speech tokenization for speech language models,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.14470","last_updated":"2025-06-04T08:23:18Z","snapshot_observed_at":"2026-08-16T21:38:58.815524Z","submitted_at":"2025-05-20T15:05:14Z","title":"PAST: Phonetic-Acoustic Speech Tokenizer","version":2},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-07T15:36:45.240767Z"},"links":{"cited_paper":"/paper/2406.11037","citing_paper":"/paper/2505.14470"},"observation_digest":"sha256:119937c002a021462141dae45f57da28207b7ae2843bdb8aedba68825b935b45","observation_id":"2f90e1a3-4ff1-4f91-9f46-27076370343f","resolution":{"observed_at":"2026-08-07T15:36:45.240767Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:36:47.282454Z","title":"A systematic compar- ison of phonetic aware techniques for speech enhancement,","venue":null,"work_id":"4b30463e-742e-433c-aace-aebf8f326c64","year":2022},"citing_paper":{"arxiv_id":"2505.14470","last_updated":"2025-06-04T08:23:18Z","snapshot_observed_at":"2026-08-16T21:38:58.815524Z","submitted_at":"2025-05-20T15:05:14Z","title":"PAST: Phonetic-Acoustic Speech Tokenizer","version":2},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-07T15:36:45.347084Z"},"links":{"citing_paper":"/paper/2505.14470"},"observation_digest":"sha256:73cc64fd77f0227f1636f9139e28f67598419012b73f4fa2ef53a258fa5dd304","observation_id":"9620259b-327c-4042-8f3c-652536fdf4b1","resolution":{"observed_at":"2026-08-07T15:36:47.409472Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:36:45.445023Z","title":"Con- nectionist temporal classification: labelling unsegmented se- quence data with recurrent neural networks,","venue":null,"work_id":null,"year":2006},"citing_paper":{"arxiv_id":"2505.14470","last_updated":"2025-06-04T08:23:18Z","snapshot_observed_at":"2026-08-16T21:38:58.815524Z","submitted_at":"2025-05-20T15:05:14Z","title":"PAST: Phonetic-Acoustic Speech Tokenizer","version":2},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-07T15:36:45.445023Z"},"links":{"citing_paper":"/paper/2505.14470"},"observation_digest":"sha256:d685874d611140c7c128388f8818648b0775b6a6fe1e1b175806b68b1205067a","observation_id":"cc04afe2-3599-4af3-8073-c2bfb689ab90","resolution":{"observed_at":"2026-08-07T15:36:45.445023Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:36:45.562599Z","title":"Lib- rispeech: An asr corpus based on public domain audio books,","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2505.14470","last_updated":"2025-06-04T08:23:18Z","snapshot_observed_at":"2026-08-16T21:38:58.815524Z","submitted_at":"2025-05-20T15:05:14Z","title":"PAST: Phonetic-Acoustic Speech Tokenizer","version":2},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-07T15:36:45.562599Z"},"links":{"citing_paper":"/paper/2505.14470"},"observation_digest":"sha256:4689e1a1b38f88b488e116f32477761ee6ce2bb2473db0bbc8a3026be07c7703","observation_id":"ef3f6159-93f0-405c-8250-5d7ade4b97f2","resolution":{"observed_at":"2026-08-07T15:36:45.562599Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:36:47.058369Z","title":"Timit acoustic-phonetic continuous speech corpus,","venue":null,"work_id":"ffc2fc19-7b35-4319-a8b0-94275bbd7aae","year":1992},"citing_paper":{"arxiv_id":"2505.14470","last_updated":"2025-06-04T08:23:18Z","snapshot_observed_at":"2026-08-16T21:38:58.815524Z","submitted_at":"2025-05-20T15:05:14Z","title":"PAST: Phonetic-Acoustic Speech Tokenizer","version":2},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-07T15:36:45.656172Z"},"links":{"citing_paper":"/paper/2505.14470"},"observation_digest":"sha256:6fa8f186c893acaee774ba93459d2ac2d1d0f0da0e1df17d49a0c762965c05ba","observation_id":"839a24ed-933d-4929-8277-66023614f503","resolution":{"observed_at":"2026-08-07T15:36:47.162559Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:36:45.725481Z","title":"Visqol v3: An open source production ready objec- tive speech and audio metric,","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2505.14470","last_updated":"2025-06-04T08:23:18Z","snapshot_observed_at":"2026-08-16T21:38:58.815524Z","submitted_at":"2025-05-20T15:05:14Z","title":"PAST: Phonetic-Acoustic Speech Tokenizer","version":2},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-07T15:36:45.725481Z"},"links":{"citing_paper":"/paper/2505.14470"},"observation_digest":"sha256:b5d2c43ea4866aac50b36f0579774e66872c7bf6a6e2d60bde4fa6b7da8a70fc","observation_id":"154029ea-b6bf-4d81-9854-c7ae7695950e","resolution":{"observed_at":"2026-08-07T15:36:45.725481Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:36:45.788652Z","title":"Perceptual eval- uation of speech quality (pesq)-a new method for speech quality assessment of telephone networks and codecs,","venue":null,"work_id":null,"year":2001},"citing_paper":{"arxiv_id":"2505.14470","last_updated":"2025-06-04T08:23:18Z","snapshot_observed_at":"2026-08-16T21:38:58.815524Z","submitted_at":"2025-05-20T15:05:14Z","title":"PAST: Phonetic-Acoustic Speech Tokenizer","version":2},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-07T15:36:45.788652Z"},"links":{"citing_paper":"/paper/2505.14470"},"observation_digest":"sha256:5f05f9844ef60295d972e47eb95e6495b8db2595b79dfd93411c65c4a3012391","observation_id":"bb65a8c7-94e0-44ae-9425-442ed6a4016d","resolution":{"observed_at":"2026-08-07T15:36:45.788652Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:36:46.745347Z","title":"Evaluating speech features with the minimal- pair abx task: analysis of the classical mfc/plp pipeline,","venue":null,"work_id":"88b36fe3-1d8c-41be-8476-84978ee1860e","year":2013},"citing_paper":{"arxiv_id":"2505.14470","last_updated":"2025-06-04T08:23:18Z","snapshot_observed_at":"2026-08-16T21:38:58.815524Z","submitted_at":"2025-05-20T15:05:14Z","title":"PAST: Phonetic-Acoustic Speech Tokenizer","version":2},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-07T15:36:45.874985Z"},"links":{"citing_paper":"/paper/2505.14470"},"observation_digest":"sha256:7ad4519da41b1f242d9d4e9e4f06292a242cecf00d191a24f31273f8ea98409f","observation_id":"01192191-8782-4dca-8efc-a5b90cce4364","resolution":{"observed_at":"2026-08-07T15:36:46.884652Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.14294","last_updated":"2026-04-21T15:27:17Z","snapshot_observed_at":"2026-08-18T09:59:43.769988Z","submitted_at":"2024-06-20T13:23:27Z","title":"DASB - Discrete Audio and Speech Benchmark","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.14294","snapshot_observed_at":"2026-08-07T15:36:45.931571Z","title":"Dasb - discrete audio and speech benchmark,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.14470","last_updated":"2025-06-04T08:23:18Z","snapshot_observed_at":"2026-08-16T21:38:58.815524Z","submitted_at":"2025-05-20T15:05:14Z","title":"PAST: Phonetic-Acoustic Speech Tokenizer","version":2},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-07T15:36:45.931571Z"},"links":{"cited_paper":"/paper/2406.14294","citing_paper":"/paper/2505.14470"},"observation_digest":"sha256:939e18da7821055fe2a6115e822cf05b76a8923a01a178fe0b98cfdc4880ae97","observation_id":"1be950b0-83c3-403c-b17f-6ace2183e66e","resolution":{"observed_at":"2026-08-07T15:36:45.931571Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2209.15352","last_updated":"2023-03-05T09:14:16Z","snapshot_observed_at":"2026-08-16T16:27:53.560021Z","submitted_at":"2022-09-30T10:17:05Z","title":"AudioGen: Textually Guided Audio Generation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2209.15352","snapshot_observed_at":"2026-08-07T15:36:46.052253Z","title":"Audiogen: Textually guided audio generation,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.14470","last_updated":"2025-06-04T08:23:18Z","snapshot_observed_at":"2026-08-16T21:38:58.815524Z","submitted_at":"2025-05-20T15:05:14Z","title":"PAST: Phonetic-Acoustic Speech Tokenizer","version":2},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-07T15:36:46.052253Z"},"links":{"cited_paper":"/paper/2209.15352","citing_paper":"/paper/2505.14470"},"observation_digest":"sha256:5d1bc45fbb736134398bdc7625c2edc183efc020c3c52dbbba58da75129184e3","observation_id":"7a95b9ff-de8a-497d-8d58-def212839c4e","resolution":{"observed_at":"2026-08-07T15:36:46.052253Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:36:46.546835Z","title":"Simple and controllable music gen- eration,","venue":null,"work_id":"efe0b8b7-6296-42f7-a66b-590ff9a78424","year":2024},"citing_paper":{"arxiv_id":"2505.14470","last_updated":"2025-06-04T08:23:18Z","snapshot_observed_at":"2026-08-16T21:38:58.815524Z","submitted_at":"2025-05-20T15:05:14Z","title":"PAST: Phonetic-Acoustic Speech Tokenizer","version":2},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-07T15:36:46.148093Z"},"links":{"citing_paper":"/paper/2505.14470"},"observation_digest":"sha256:27040e6ca4c03fb6bfaeb4e02adcd5d6f52063078c79eebbcdc5563f9533e6ae","observation_id":"1909cf34-ad72-475b-b8b3-427cf0d212b2","resolution":{"observed_at":"2026-08-07T15:36:46.626989Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:36:46.456636Z","title":"The zero resource speech benchmark 2021: Metrics and baselines for unsupervised spoken language model- ing,","venue":null,"work_id":"ef4a0871-fb18-46d1-91ff-748e0ec751e2","year":2021},"citing_paper":{"arxiv_id":"2505.14470","last_updated":"2025-06-04T08:23:18Z","snapshot_observed_at":"2026-08-16T21:38:58.815524Z","submitted_at":"2025-05-20T15:05:14Z","title":"PAST: Phonetic-Acoustic Speech Tokenizer","version":2},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-07T15:36:46.248344Z"},"links":{"citing_paper":"/paper/2505.14470"},"observation_digest":"sha256:048c02a72d1c6fe25d5e39bed50f51da36d2c0ab2c6b5b6abbc579e1976de096","observation_id":"f5e42fd6-873a-4829-94b9-d8e497fbe07f","resolution":{"observed_at":"2026-08-07T15:36:46.529710Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2505.14470","last_updated":"2025-06-04T08:23:18Z","latest_version":2,"primary_category":"cs.SD","snapshot_observed_at":"2026-08-16T21:38:58.815524Z","submitted_at":"2025-05-20T15:05:14Z","title":"PAST: Phonetic-Acoustic Speech Tokenizer"},"reference_resolution":{"displayed":48,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":26,"verified_exact":0,"verified_fuzzy":22},"total_outbound_references":48},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"thesis":"As of 20 August 2026, this Paper Citation Record lists 48 of 48 outbound references and 2 inbound Pith citation observations for arXiv:2505.14470."}