{"as_of":"2026-08-14T10:43:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:aabe7b38287b662f1baab5bb8da5a5dab72ef66114c92a5953fdc7dca57f9ae6","coverage":[{"denominator":43,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":43,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T15:16:45.290095Z","state":"measured"},{"denominator":44,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":44,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-14T06:32:32.682623+00:00","state":"measured"},{"denominator":1,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":1,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T15:16:42.871348Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"pith","source_observed_at":"2026-08-07T15:16:45.530174Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2505.15667","last_updated":"2025-05-21T15:44:32Z","snapshot_observed_at":"2026-08-13T20:34:37.563551Z","submitted_at":"2025-05-21T15:44:32Z","title":"Segmentation-Variant Codebooks for Preservation of Paralinguistic and Prosodic Information","version":1},"cited_work":{"arxiv_id":"2505.15667","doi":null,"metadata_source":"pith","pith_arxiv_id":"2505.15667","snapshot_observed_at":"2026-08-07T15:16:45.530174Z","title":"Segmentation-Variant Codebooks for Preservation of Paralinguistic and Prosodic Information","venue":"eess.AS","work_id":"99b55826-e520-424d-8408-277af5286fb7","year":2025},"citing_paper":{"arxiv_id":"2505.15667","last_updated":"2025-05-21T15:44:32Z","snapshot_observed_at":"2026-08-13T20:34:37.563551Z","submitted_at":"2025-05-21T15:44:32Z","title":"Segmentation-Variant Codebooks for Preservation of Paralinguistic and Prosodic Information","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-07T15:16:42.871348Z"},"links":{"cited_paper":"/paper/2505.15667","citing_paper":"/paper/2505.15667"},"observation_digest":"sha256:5d8bfa691486e36e125265186c9cd8ac7a894c603fd354091906ca9f0f7182bb","observation_id":"9bbcac71-74b0-4c85-aebf-96dc035cd577","resolution":{"observed_at":"2026-08-07T15:16:45.591375Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2505.15667/citation-record","integrity":"/paper/2505.15667/integrity","json":"/paper/2505.15667/citation-record.json","paper":"/paper/2505.15667"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:16:49.975163Z","title":null,"venue":null,"work_id":"9408edf8-acd0-4278-a008-9f0cac2c0c3b","year":null},"citing_paper":{"arxiv_id":"2505.15667","last_updated":"2025-05-21T15:44:32Z","snapshot_observed_at":"2026-08-13T20:34:37.563551Z","submitted_at":"2025-05-21T15:44:32Z","title":"Segmentation-Variant Codebooks for Preservation of Paralinguistic and Prosodic Information","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-07T15:16:42.724908Z"},"links":{"citing_paper":"/paper/2505.15667"},"observation_digest":"sha256:27fe3b15f6a3067ed319be8a17a20de22f283927a78d5f064f9ccea58c977b50","observation_id":"5c1a7c5a-f82f-48c0-99d1-dadd05f77c3e","resolution":{"observed_at":"2026-08-07T15:16:50.090889Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:16:49.862759Z","title":"Are you kidding me?!","venue":null,"work_id":"3d2f8d1d-e52d-49c3-b4de-48e7c7346095","year":null},"citing_paper":{"arxiv_id":"2505.15667","last_updated":"2025-05-21T15:44:32Z","snapshot_observed_at":"2026-08-13T20:34:37.563551Z","submitted_at":"2025-05-21T15:44:32Z","title":"Segmentation-Variant Codebooks for Preservation of Paralinguistic and Prosodic Information","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-07T15:16:42.799145Z"},"links":{"citing_paper":"/paper/2505.15667"},"observation_digest":"sha256:68ed4392fd420feddfd2fdfe8f87b80b33410d4b61d741f87be43c06c8d2f020","observation_id":"c65e3999-5a0d-403a-9d95-7cd30b799efe","resolution":{"observed_at":"2026-08-07T15:16:49.909689Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.15667","last_updated":"2025-05-21T15:44:32Z","snapshot_observed_at":"2026-08-13T20:34:37.563551Z","submitted_at":"2025-05-21T15:44:32Z","title":"Segmentation-Variant Codebooks for Preservation of Paralinguistic and Prosodic Information","version":1},"cited_work":{"arxiv_id":"2505.15667","doi":null,"metadata_source":"pith","pith_arxiv_id":"2505.15667","snapshot_observed_at":"2026-08-07T15:16:45.530174Z","title":"Segmentation-Variant Codebooks for Preservation of Paralinguistic and Prosodic Information","venue":"eess.AS","work_id":"99b55826-e520-424d-8408-277af5286fb7","year":2025},"citing_paper":{"arxiv_id":"2505.15667","last_updated":"2025-05-21T15:44:32Z","snapshot_observed_at":"2026-08-13T20:34:37.563551Z","submitted_at":"2025-05-21T15:44:32Z","title":"Segmentation-Variant Codebooks for Preservation of Paralinguistic and Prosodic Information","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-07T15:16:42.871348Z"},"links":{"cited_paper":"/paper/2505.15667","citing_paper":"/paper/2505.15667"},"observation_digest":"sha256:5d8bfa691486e36e125265186c9cd8ac7a894c603fd354091906ca9f0f7182bb","observation_id":"9bbcac71-74b0-4c85-aebf-96dc035cd577","resolution":{"observed_at":"2026-08-07T15:16:45.591375Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:16:49.647806Z","title":"Segmentation-Variant Codebooks We encode speech into continuous representations using the frozen HuBERT-large model [17]","venue":null,"work_id":"23b277ac-e8ba-4a0a-97fa-a315b13030ed","year":2000},"citing_paper":{"arxiv_id":"2505.15667","last_updated":"2025-05-21T15:44:32Z","snapshot_observed_at":"2026-08-13T20:34:37.563551Z","submitted_at":"2025-05-21T15:44:32Z","title":"Segmentation-Variant Codebooks for Preservation of Paralinguistic and Prosodic Information","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-07T15:16:42.966193Z"},"links":{"citing_paper":"/paper/2505.15667"},"observation_digest":"sha256:03a329dfdda644c761aec0b7048931f404c79dcffcfd5f3a95f8a1c226b9adb5","observation_id":"88a1359c-8961-4727-9298-ab4f85eb3114","resolution":{"observed_at":"2026-08-07T15:16:49.763315Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:16:49.457616Z","title":"Datasets and Alignment Process Naver Prosody Control [21] is a dataset designed for study- ing prosody control in TTS systems","venue":null,"work_id":"5f551110-bdda-4dca-9351-592f6889d59b","year":2024},"citing_paper":{"arxiv_id":"2505.15667","last_updated":"2025-05-21T15:44:32Z","snapshot_observed_at":"2026-08-13T20:34:37.563551Z","submitted_at":"2025-05-21T15:44:32Z","title":"Segmentation-Variant Codebooks for Preservation of Paralinguistic and Prosodic Information","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-07T15:16:43.000083Z"},"links":{"citing_paper":"/paper/2505.15667"},"observation_digest":"sha256:1eecc2ca9e443a8270644056c56241e3bd79ae9f30dc34676cf3b4a56d892c39","observation_id":"5ae054a2-2fe4-47d5-81a6-1155e9aade0f","resolution":{"observed_at":"2026-08-07T15:16:49.572574Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:16:49.182615Z","title":null,"venue":null,"work_id":"19c47a50-db92-43ba-8a05-38c3aef8701a","year":2000},"citing_paper":{"arxiv_id":"2505.15667","last_updated":"2025-05-21T15:44:32Z","snapshot_observed_at":"2026-08-13T20:34:37.563551Z","submitted_at":"2025-05-21T15:44:32Z","title":"Segmentation-Variant Codebooks for Preservation of Paralinguistic and Prosodic Information","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-07T15:16:43.040761Z"},"links":{"citing_paper":"/paper/2505.15667"},"observation_digest":"sha256:13b09af4c801c1343a18a350b38b5ce5ff6812f9b745ef335becdbc68238f9d8","observation_id":"795a7989-4c17-4e90-b2f6-b2e979a45480","resolution":{"observed_at":"2026-08-07T15:16:49.350000Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:16:49.012120Z","title":null,"venue":null,"work_id":"07053835-58af-4a07-8ba7-04651b098f93","year":2000},"citing_paper":{"arxiv_id":"2505.15667","last_updated":"2025-05-21T15:44:32Z","snapshot_observed_at":"2026-08-13T20:34:37.563551Z","submitted_at":"2025-05-21T15:44:32Z","title":"Segmentation-Variant Codebooks for Preservation of Paralinguistic and Prosodic Information","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-07T15:16:43.092557Z"},"links":{"citing_paper":"/paper/2505.15667"},"observation_digest":"sha256:43f25e1b2a1019a2bf10ad8d21bd5b0b49662c1710737cfd00ad0ee4e374d094","observation_id":"ece5708e-0da5-4225-88ec-d0e7b934f5fb","resolution":{"observed_at":"2026-08-07T15:16:49.060304Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:16:48.808157Z","title":"The higher the score, the better","venue":null,"work_id":"3d34f876-c523-44ef-9660-5d473db6d555","year":2000},"citing_paper":{"arxiv_id":"2505.15667","last_updated":"2025-05-21T15:44:32Z","snapshot_observed_at":"2026-08-13T20:34:37.563551Z","submitted_at":"2025-05-21T15:44:32Z","title":"Segmentation-Variant Codebooks for Preservation of Paralinguistic and Prosodic Information","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-07T15:16:43.197519Z"},"links":{"citing_paper":"/paper/2505.15667"},"observation_digest":"sha256:bd38a8d82c4d4d2cb2b0696fd84d8e018a084c20e1ad9048e1e6b6dbbcd60cf8","observation_id":"0db052a4-8a80-459f-a483-56bdb38dbcff","resolution":{"observed_at":"2026-08-07T15:16:48.907843Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:16:48.602572Z","title":"This study contributes to ongoing research on the use of DSUs, demonstrating their po- tential in speech representation learning and downstream tasks","venue":null,"work_id":"f7e741f6-a48a-4abe-80e6-58b846c0b619","year":null},"citing_paper":{"arxiv_id":"2505.15667","last_updated":"2025-05-21T15:44:32Z","snapshot_observed_at":"2026-08-13T20:34:37.563551Z","submitted_at":"2025-05-21T15:44:32Z","title":"Segmentation-Variant Codebooks for Preservation of Paralinguistic and Prosodic Information","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-07T15:16:43.270137Z"},"links":{"citing_paper":"/paper/2505.15667"},"observation_digest":"sha256:eb60edb9c313414f91e56ad9ad4eae9394e717ce9318c3e19eacade1fd4cb983","observation_id":"6e272bc9-7c89-410f-a156-539b597a0daa","resolution":{"observed_at":"2026-08-07T15:16:48.689125Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:16:48.456199Z","title":null,"venue":null,"work_id":"f29c1e53-d820-4c9c-b8df-870500a48f47","year":null},"citing_paper":{"arxiv_id":"2505.15667","last_updated":"2025-05-21T15:44:32Z","snapshot_observed_at":"2026-08-13T20:34:37.563551Z","submitted_at":"2025-05-21T15:44:32Z","title":"Segmentation-Variant Codebooks for Preservation of Paralinguistic and Prosodic Information","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-07T15:16:43.351918Z"},"links":{"citing_paper":"/paper/2505.15667"},"observation_digest":"sha256:e2bd000a3f0cc1c1fd440e870af71bbaae2eeec633e2348ef0516558505efd2a","observation_id":"88d2db23-b85e-426a-9398-377d80e93580","resolution":{"observed_at":"2026-08-07T15:16:48.496560Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:16:43.399696Z","title":"wav2vec 2.0: A framework for self-supervised learning of speech repre- sentations,","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2505.15667","last_updated":"2025-05-21T15:44:32Z","snapshot_observed_at":"2026-08-13T20:34:37.563551Z","submitted_at":"2025-05-21T15:44:32Z","title":"Segmentation-Variant Codebooks for Preservation of Paralinguistic and Prosodic Information","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-07T15:16:43.399696Z"},"links":{"citing_paper":"/paper/2505.15667"},"observation_digest":"sha256:d58d167ba20ecb2e0c08f2b4d54fb9b2bd005b3ea46264c1e9ddd0ec1408be46","observation_id":"3f653aa5-3026-4b40-a1f9-f0df0b20afb4","resolution":{"observed_at":"2026-08-07T15:16:43.399696Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:16:48.334775Z","title":"Exploring speech recognition, translation, and understanding with discrete speech units: A com- parative study,","venue":null,"work_id":"085163cf-bb8f-40d7-8184-d3125b312e48","year":2024},"citing_paper":{"arxiv_id":"2505.15667","last_updated":"2025-05-21T15:44:32Z","snapshot_observed_at":"2026-08-13T20:34:37.563551Z","submitted_at":"2025-05-21T15:44:32Z","title":"Segmentation-Variant Codebooks for Preservation of Paralinguistic and Prosodic Information","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-07T15:16:43.437788Z"},"links":{"citing_paper":"/paper/2505.15667"},"observation_digest":"sha256:76c6e881e17bd01b2b94a607a67962065aff76dbeba08c3084d5329ca3a483c4","observation_id":"57c35fe4-7054-47c1-9511-7031d4396df1","resolution":{"observed_at":"2026-08-07T15:16:48.391693Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:16:48.185467Z","title":"On the use of self-supervised speech representations in spontaneous speech synthesis,","venue":null,"work_id":"99e698e4-5934-4b8e-b73f-ba1215dc365b","year":2023},"citing_paper":{"arxiv_id":"2505.15667","last_updated":"2025-05-21T15:44:32Z","snapshot_observed_at":"2026-08-13T20:34:37.563551Z","submitted_at":"2025-05-21T15:44:32Z","title":"Segmentation-Variant Codebooks for Preservation of Paralinguistic and Prosodic Information","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-07T15:16:43.481755Z"},"links":{"citing_paper":"/paper/2505.15667"},"observation_digest":"sha256:8f5cbc3812b91ca6d343eed45e2d420969de519bc8e8a8bea316caa0a7825517","observation_id":"8b8bae58-1fa5-4470-8ac8-5a7e55fd40a7","resolution":{"observed_at":"2026-08-07T15:16:48.247460Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:16:48.086741Z","title":"Selecttts: Syn- thesizing anyone’s voice via discrete unit-based frame selection,","venue":null,"work_id":"b93e0f9d-2092-4f36-a88a-65784a573649","year":2024},"citing_paper":{"arxiv_id":"2505.15667","last_updated":"2025-05-21T15:44:32Z","snapshot_observed_at":"2026-08-13T20:34:37.563551Z","submitted_at":"2025-05-21T15:44:32Z","title":"Segmentation-Variant Codebooks for Preservation of Paralinguistic and Prosodic Information","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-07T15:16:43.540400Z"},"links":{"citing_paper":"/paper/2505.15667"},"observation_digest":"sha256:0358332cfa3a8bca04bce9c200b37d761955fb51089c5aab241d8127b84e7c85","observation_id":"35b2e03c-73d3-467e-af37-12c1cad7df1d","resolution":{"observed_at":"2026-08-07T15:16:48.126458Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:16:47.908668Z","title":"Exploration of a self- supervised speech model: A study on emotional corpora,","venue":null,"work_id":"22b120db-f31c-4313-ae6a-0b726c0dc02c","year":2023},"citing_paper":{"arxiv_id":"2505.15667","last_updated":"2025-05-21T15:44:32Z","snapshot_observed_at":"2026-08-13T20:34:37.563551Z","submitted_at":"2025-05-21T15:44:32Z","title":"Segmentation-Variant Codebooks for Preservation of Paralinguistic and Prosodic Information","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-07T15:16:43.626702Z"},"links":{"citing_paper":"/paper/2505.15667"},"observation_digest":"sha256:18a3dc235bc667c18c1b9a9bdc8e74c6dfa9720dede1a8389fe7051a85886590","observation_id":"72b2e005-e738-4c3b-a928-d33964c18e1f","resolution":{"observed_at":"2026-08-07T15:16:47.995252Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:16:47.782373Z","title":"Exploring Wav2vec 2.0 fine tun- ing for improved speech emotion recognition,","venue":null,"work_id":"5dd8974d-9b0e-4b0a-811f-811ec87df9a7","year":2023},"citing_paper":{"arxiv_id":"2505.15667","last_updated":"2025-05-21T15:44:32Z","snapshot_observed_at":"2026-08-13T20:34:37.563551Z","submitted_at":"2025-05-21T15:44:32Z","title":"Segmentation-Variant Codebooks for Preservation of Paralinguistic and Prosodic Information","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-07T15:16:43.724297Z"},"links":{"citing_paper":"/paper/2505.15667"},"observation_digest":"sha256:3e533d18eebd018c5240de10846a66e5f5103ac95f77af05722b3820f8069c2c","observation_id":"b188d8a3-253b-459b-801c-2ca318becb79","resolution":{"observed_at":"2026-08-07T15:16:47.865776Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:16:47.646266Z","title":"Layer-wise analysis of self-supervised acoustic word embeddings: A study on speech emotion recognition,","venue":null,"work_id":"db0224e5-b5b7-4d9a-ae90-6f952e702a53","year":2024},"citing_paper":{"arxiv_id":"2505.15667","last_updated":"2025-05-21T15:44:32Z","snapshot_observed_at":"2026-08-13T20:34:37.563551Z","submitted_at":"2025-05-21T15:44:32Z","title":"Segmentation-Variant Codebooks for Preservation of Paralinguistic and Prosodic Information","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-07T15:16:43.797913Z"},"links":{"citing_paper":"/paper/2505.15667"},"observation_digest":"sha256:fb7d887f8262899ac125d0ee9d229fe19f0fa3fab080eb70987a50fe54a45a5d","observation_id":"d36e856a-ce21-4066-b3b0-096d6b906caa","resolution":{"observed_at":"2026-08-07T15:16:47.707895Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:16:47.504189Z","title":"Crossmodal ASR error correc- tion with discrete speech units,","venue":null,"work_id":"9ea2e937-6d2e-4818-ad44-8d8df74b79c3","year":2024},"citing_paper":{"arxiv_id":"2505.15667","last_updated":"2025-05-21T15:44:32Z","snapshot_observed_at":"2026-08-13T20:34:37.563551Z","submitted_at":"2025-05-21T15:44:32Z","title":"Segmentation-Variant Codebooks for Preservation of Paralinguistic and Prosodic Information","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-07T15:16:43.897140Z"},"links":{"citing_paper":"/paper/2505.15667"},"observation_digest":"sha256:1d29a4443f50359a828af24539afaddbaa84826ee0e1abcaef8d891cc7ca221a","observation_id":"d14d4f7f-73dd-4beb-aead-02aa54898e94","resolution":{"observed_at":"2026-08-07T15:16:47.557302Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.09345","last_updated":"2024-06-13T17:28:13Z","snapshot_observed_at":"2026-08-12T23:43:21.365417Z","submitted_at":"2024-06-13T17:28:13Z","title":"DiscreteSLU: A Large Language Model with Self-Supervised Discrete Speech Units for Spoken Language Understanding","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.09345","snapshot_observed_at":"2026-08-07T15:16:43.941022Z","title":"Discreteslu: A large language model with self- supervised discrete speech units for spoken language understand- ing,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.15667","last_updated":"2025-05-21T15:44:32Z","snapshot_observed_at":"2026-08-13T20:34:37.563551Z","submitted_at":"2025-05-21T15:44:32Z","title":"Segmentation-Variant Codebooks for Preservation of Paralinguistic and Prosodic Information","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-07T15:16:43.941022Z"},"links":{"cited_paper":"/paper/2406.09345","citing_paper":"/paper/2505.15667"},"observation_digest":"sha256:1b1085678763b184569f2c0c7dd2df7337dcfad947dd07fac4d9738abe7b235d","observation_id":"9c85d235-3631-4b2a-8c01-d735bd2b04d9","resolution":{"observed_at":"2026-08-07T15:16:43.941022Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:16:47.324313Z","title":"Analyzing acoustic word embeddings from pre-trained self-supervised speech models,","venue":null,"work_id":"d2a2bb1f-3a94-4898-8b95-e9d64721e2ac","year":2023},"citing_paper":{"arxiv_id":"2505.15667","last_updated":"2025-05-21T15:44:32Z","snapshot_observed_at":"2026-08-13T20:34:37.563551Z","submitted_at":"2025-05-21T15:44:32Z","title":"Segmentation-Variant Codebooks for Preservation of Paralinguistic and Prosodic Information","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-07T15:16:43.974819Z"},"links":{"citing_paper":"/paper/2505.15667"},"observation_digest":"sha256:c2a18fcd34f53af131fbb4fa37db2d939e0cbdc931d76ad8ebd2a345c9105686","observation_id":"8c79a01d-fdc2-4364-a74b-257daa0a1297","resolution":{"observed_at":"2026-08-07T15:16:47.423247Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:16:47.242973Z","title":"Ex- presso: A benchmark and analysis of discrete expressive speech resynthesis,","venue":null,"work_id":"426e185b-d309-48ad-96a5-6c58b5faf70d","year":2023},"citing_paper":{"arxiv_id":"2505.15667","last_updated":"2025-05-21T15:44:32Z","snapshot_observed_at":"2026-08-13T20:34:37.563551Z","submitted_at":"2025-05-21T15:44:32Z","title":"Segmentation-Variant Codebooks for Preservation of Paralinguistic and Prosodic Information","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-07T15:16:44.049595Z"},"links":{"citing_paper":"/paper/2505.15667"},"observation_digest":"sha256:4c3576bdd54d95ab002ae4c024208d17defe9021a1da988350e3cdde2ef87ab6","observation_id":"a11d4300-c46c-4f5a-90ea-c8b1a0c6d2a0","resolution":{"observed_at":"2026-08-07T15:16:47.278145Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:16:47.119013Z","title":"Emo-codec: An in-depth look at emotion preservation capacity of legacy and neural codec models with subjective and objective evaluations,","venue":null,"work_id":"ec339bde-e839-43b9-b5d9-86ef7be969b5","year":2024},"citing_paper":{"arxiv_id":"2505.15667","last_updated":"2025-05-21T15:44:32Z","snapshot_observed_at":"2026-08-13T20:34:37.563551Z","submitted_at":"2025-05-21T15:44:32Z","title":"Segmentation-Variant Codebooks for Preservation of Paralinguistic and Prosodic Information","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-07T15:16:44.115212Z"},"links":{"citing_paper":"/paper/2505.15667"},"observation_digest":"sha256:4853d48b08c38efbb7e9416900e5a5ab0be5bc8218b6d3125d7afc557de0c3a9","observation_id":"6b5ad4b3-752d-4953-a95f-8457fd82eab2","resolution":{"observed_at":"2026-08-07T15:16:47.171102Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:16:44.156454Z","title":"Neural discrete represen- tation learning,","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2505.15667","last_updated":"2025-05-21T15:44:32Z","snapshot_observed_at":"2026-08-13T20:34:37.563551Z","submitted_at":"2025-05-21T15:44:32Z","title":"Segmentation-Variant Codebooks for Preservation of Paralinguistic and Prosodic Information","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-07T15:16:44.156454Z"},"links":{"citing_paper":"/paper/2505.15667"},"observation_digest":"sha256:d847df35def01202b1d0ce5ff9df6d09bdbea5c22f0c12081e82ffc22675ef54","observation_id":"bbf3e34f-2dda-491a-a99d-b68783173e64","resolution":{"observed_at":"2026-08-07T15:16:44.156454Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:16:47.013390Z","title":"vq-wav2vec: Self- supervised learning of discrete speech representations,","venue":null,"work_id":"09d32135-9485-498c-9100-56fb51aef755","year":2020},"citing_paper":{"arxiv_id":"2505.15667","last_updated":"2025-05-21T15:44:32Z","snapshot_observed_at":"2026-08-13T20:34:37.563551Z","submitted_at":"2025-05-21T15:44:32Z","title":"Segmentation-Variant Codebooks for Preservation of Paralinguistic and Prosodic Information","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-07T15:16:44.199984Z"},"links":{"citing_paper":"/paper/2505.15667"},"observation_digest":"sha256:57d40bdb330567d68b03b84b0ff77299974ac458ad1152fdb0dd100265dcc8d9","observation_id":"4c0be852-d92c-423b-88e8-88c50b532cce","resolution":{"observed_at":"2026-08-07T15:16:47.047351Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2210.13438","last_updated":"2022-10-24T17:52:02Z","snapshot_observed_at":"2026-08-09T07:12:13.721596Z","submitted_at":"2022-10-24T17:52:02Z","title":"High Fidelity Neural Audio Compression","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2210.13438","snapshot_observed_at":"2026-08-07T15:16:44.240679Z","title":"High fidelity neural audio compression,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2505.15667","last_updated":"2025-05-21T15:44:32Z","snapshot_observed_at":"2026-08-13T20:34:37.563551Z","submitted_at":"2025-05-21T15:44:32Z","title":"Segmentation-Variant Codebooks for Preservation of Paralinguistic and Prosodic Information","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-07T15:16:44.240679Z"},"links":{"cited_paper":"/paper/2210.13438","citing_paper":"/paper/2505.15667"},"observation_digest":"sha256:089c9b4b732f81b9afde2b68a119cc52b3f227d134a4a4bd22a6326dfd5a7e02","observation_id":"8eafc58b-0597-44a9-ac22-ff1ceba174d8","resolution":{"observed_at":"2026-08-07T15:16:44.240679Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:16:44.302788Z","title":"Soundstream: An end-to-end neural audio codec,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2505.15667","last_updated":"2025-05-21T15:44:32Z","snapshot_observed_at":"2026-08-13T20:34:37.563551Z","submitted_at":"2025-05-21T15:44:32Z","title":"Segmentation-Variant Codebooks for Preservation of Paralinguistic and Prosodic Information","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-07T15:16:44.302788Z"},"links":{"citing_paper":"/paper/2505.15667"},"observation_digest":"sha256:8bdd76d656f5c501e0428414278d45c11d547ff0b485763469fb8f7bcfd5490f","observation_id":"4d15db86-6185-4789-8f19-c1e0798d2143","resolution":{"observed_at":"2026-08-07T15:16:44.302788Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:16:44.430963Z","title":"Hubert: Self-supervised speech represen- tation learning by masked prediction of hidden units,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2505.15667","last_updated":"2025-05-21T15:44:32Z","snapshot_observed_at":"2026-08-13T20:34:37.563551Z","submitted_at":"2025-05-21T15:44:32Z","title":"Segmentation-Variant Codebooks for Preservation of Paralinguistic and Prosodic Information","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-07T15:16:44.430963Z"},"links":{"citing_paper":"/paper/2505.15667"},"observation_digest":"sha256:10da75d1df6917edbee42853f23ed3c3580b4fc6b2ea329289624b23d2dfc3e1","observation_id":"a408aa65-4d83-4929-b89a-a68074fb7725","resolution":{"observed_at":"2026-08-07T15:16:44.430963Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:16:46.843134Z","title":"Phonetic analysis of self-supervised representations of english speech,","venue":null,"work_id":"cb320a16-0c69-493a-bb57-fc956d221056","year":2022},"citing_paper":{"arxiv_id":"2505.15667","last_updated":"2025-05-21T15:44:32Z","snapshot_observed_at":"2026-08-13T20:34:37.563551Z","submitted_at":"2025-05-21T15:44:32Z","title":"Segmentation-Variant Codebooks for Preservation of Paralinguistic and Prosodic Information","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-07T15:16:44.504728Z"},"links":{"citing_paper":"/paper/2505.15667"},"observation_digest":"sha256:fea344277a909b6562b57193c0435697627f7b9045795e57afa1403aeab25a1b","observation_id":"a7b29f47-7768-4684-8867-28bd5bc6838c","resolution":{"observed_at":"2026-08-07T15:16:46.901418Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:16:46.750785Z","title":"Analysing discrete self supervised speech representation for spoken language modeling,","venue":null,"work_id":"9297fd74-bfc8-408f-af79-a1c6a46f876d","year":2023},"citing_paper":{"arxiv_id":"2505.15667","last_updated":"2025-05-21T15:44:32Z","snapshot_observed_at":"2026-08-13T20:34:37.563551Z","submitted_at":"2025-05-21T15:44:32Z","title":"Segmentation-Variant Codebooks for Preservation of Paralinguistic and Prosodic Information","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-07T15:16:44.560689Z"},"links":{"citing_paper":"/paper/2505.15667"},"observation_digest":"sha256:3c8789cb83968e150f5fb2acae9f38f493accc6d5d5c393ef54093407d4b229b","observation_id":"7d56b6eb-9f5e-466b-a8d7-2fe03012f0e7","resolution":{"observed_at":"2026-08-07T15:16:46.791664Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.07725","last_updated":"2024-06-11T21:08:47Z","snapshot_observed_at":"2026-08-12T23:45:06.763778Z","submitted_at":"2024-06-11T21:08:47Z","title":"The Interspeech 2024 Challenge on Speech Processing Using Discrete Units","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.07725","snapshot_observed_at":"2026-08-07T15:16:44.632634Z","title":"The Interspeech 2024 chal- lenge on speech processing using discrete units,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.15667","last_updated":"2025-05-21T15:44:32Z","snapshot_observed_at":"2026-08-13T20:34:37.563551Z","submitted_at":"2025-05-21T15:44:32Z","title":"Segmentation-Variant Codebooks for Preservation of Paralinguistic and Prosodic Information","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-07T15:16:44.632634Z"},"links":{"cited_paper":"/paper/2406.07725","citing_paper":"/paper/2505.15667"},"observation_digest":"sha256:7599bc2d89322bf426de5b4c4250fec33bf28d39f51d3111c5185af13a0e79cd","observation_id":"89422f5a-da23-452f-81c1-21090ab9d992","resolution":{"observed_at":"2026-08-07T15:16:44.632634Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:16:46.592920Z","title":"Controlling prosody in end-to-end TTS: A case study on contrastive focus generation,","venue":null,"work_id":"adabc90d-b04b-4202-8e23-4d0eb7919700","year":2021},"citing_paper":{"arxiv_id":"2505.15667","last_updated":"2025-05-21T15:44:32Z","snapshot_observed_at":"2026-08-13T20:34:37.563551Z","submitted_at":"2025-05-21T15:44:32Z","title":"Segmentation-Variant Codebooks for Preservation of Paralinguistic and Prosodic Information","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-07T15:16:44.708653Z"},"links":{"citing_paper":"/paper/2505.15667"},"observation_digest":"sha256:0fae890a55bf6d1cd182a5536d65b8b20b7d7e9b5cfeaf5658cb7b18e8868e72","observation_id":"65ef997c-b806-4173-ae93-9404b37028de","resolution":{"observed_at":"2026-08-07T15:16:46.672049Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:16:44.767109Z","title":"IEMOCAP: Interactive emotional dyadic motion capture database,","venue":null,"work_id":null,"year":2008},"citing_paper":{"arxiv_id":"2505.15667","last_updated":"2025-05-21T15:44:32Z","snapshot_observed_at":"2026-08-13T20:34:37.563551Z","submitted_at":"2025-05-21T15:44:32Z","title":"Segmentation-Variant Codebooks for Preservation of Paralinguistic and Prosodic Information","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-07T15:16:44.767109Z"},"links":{"citing_paper":"/paper/2505.15667"},"observation_digest":"sha256:f180228d3366a6062265fd1f07686fd3b456c29e5fcd89d906bdcf6fd84fe96e","observation_id":"11f3a1a4-3e78-4702-b64c-88b285f5efd8","resolution":{"observed_at":"2026-08-07T15:16:44.767109Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:16:46.421736Z","title":"Montreal forced aligner: Trainable text-speech align- ment using Kaldi,","venue":null,"work_id":"2e0b7392-b765-4e61-aa23-5ac7613c00e7","year":2017},"citing_paper":{"arxiv_id":"2505.15667","last_updated":"2025-05-21T15:44:32Z","snapshot_observed_at":"2026-08-13T20:34:37.563551Z","submitted_at":"2025-05-21T15:44:32Z","title":"Segmentation-Variant Codebooks for Preservation of Paralinguistic and Prosodic Information","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-07T15:16:44.798029Z"},"links":{"citing_paper":"/paper/2505.15667"},"observation_digest":"sha256:ef53362ac191eb33a994b51c8a120036e9a885be025e0ae95511137799bdfba9","observation_id":"d0956122-9443-4441-8c7b-08d9fa0bf926","resolution":{"observed_at":"2026-08-07T15:16:46.487028Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:16:46.331684Z","title":"The HTK book,","venue":null,"work_id":"9fecc10f-7705-4b01-857b-2f822d744ee5","year":2002},"citing_paper":{"arxiv_id":"2505.15667","last_updated":"2025-05-21T15:44:32Z","snapshot_observed_at":"2026-08-13T20:34:37.563551Z","submitted_at":"2025-05-21T15:44:32Z","title":"Segmentation-Variant Codebooks for Preservation of Paralinguistic and Prosodic Information","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-07T15:16:44.842896Z"},"links":{"citing_paper":"/paper/2505.15667"},"observation_digest":"sha256:a35f99e149f554fa944159c638572c23ff5edde9d5cbac7b8c8d2b02793777c3","observation_id":"1afc9f5f-e468-4347-ba72-1dba800550b7","resolution":{"observed_at":"2026-08-07T15:16:46.363396Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:16:44.900505Z","title":"k-means++: The advantages of careful seeding,","venue":null,"work_id":null,"year":2006},"citing_paper":{"arxiv_id":"2505.15667","last_updated":"2025-05-21T15:44:32Z","snapshot_observed_at":"2026-08-13T20:34:37.563551Z","submitted_at":"2025-05-21T15:44:32Z","title":"Segmentation-Variant Codebooks for Preservation of Paralinguistic and Prosodic Information","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-07T15:16:44.900505Z"},"links":{"citing_paper":"/paper/2505.15667"},"observation_digest":"sha256:18fd67d959f678e5d6c43d0e1f6022b6985b09f533a75309e792645a1275feef","observation_id":"c9acfe29-2a41-421d-9171-ed54aad14be2","resolution":{"observed_at":"2026-08-07T15:16:44.900505Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:16:44.972228Z","title":"Hifi-gan: Generative adversarial net- works for efficient and high fidelity speech synthesis,","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2505.15667","last_updated":"2025-05-21T15:44:32Z","snapshot_observed_at":"2026-08-13T20:34:37.563551Z","submitted_at":"2025-05-21T15:44:32Z","title":"Segmentation-Variant Codebooks for Preservation of Paralinguistic and Prosodic Information","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-07T15:16:44.972228Z"},"links":{"citing_paper":"/paper/2505.15667"},"observation_digest":"sha256:3043441320f72506bc6bd8398cc82c2295248296bd91d1c4228db90fac1be3e4","observation_id":"e277a6ef-0e09-4456-a720-351c89d10147","resolution":{"observed_at":"2026-08-07T15:16:44.972228Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:16:46.162322Z","title":"Su- perb: Speech processing universal performance benchmark,","venue":null,"work_id":"e59a69ec-7d4c-481d-abcc-4b89f7975925","year":2021},"citing_paper":{"arxiv_id":"2505.15667","last_updated":"2025-05-21T15:44:32Z","snapshot_observed_at":"2026-08-13T20:34:37.563551Z","submitted_at":"2025-05-21T15:44:32Z","title":"Segmentation-Variant Codebooks for Preservation of Paralinguistic and Prosodic Information","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-07T15:16:45.013346Z"},"links":{"citing_paper":"/paper/2505.15667"},"observation_digest":"sha256:6e59e11d1d12354596862ec686d68766e8fc7973df49aafa5c49640859f63666","observation_id":"fa69722a-ed3e-4821-98c7-1861a4afbdca","resolution":{"observed_at":"2026-08-07T15:16:46.199145Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2111.02735","last_updated":"2022-10-03T20:50:54Z","snapshot_observed_at":"2026-08-13T17:39:47.282600Z","submitted_at":"2021-11-04T10:39:06Z","title":"A Fine-tuned Wav2vec 2.0/HuBERT Benchmark For Speech Emotion Recognition, Speaker Verification and Spoken Language Understanding","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2111.02735","snapshot_observed_at":"2026-08-07T15:16:45.044605Z","title":"A fine-tuned Wav2vec 2.0/HuBERT benchmark for speech emotion recognition, speaker verification and spoken language understanding,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2505.15667","last_updated":"2025-05-21T15:44:32Z","snapshot_observed_at":"2026-08-13T20:34:37.563551Z","submitted_at":"2025-05-21T15:44:32Z","title":"Segmentation-Variant Codebooks for Preservation of Paralinguistic and Prosodic Information","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-07T15:16:45.044605Z"},"links":{"cited_paper":"/paper/2111.02735","citing_paper":"/paper/2505.15667"},"observation_digest":"sha256:dc09eb03f6d856420115acfa26f2c8aa8b43965e9749670c9178eb93a7210549","observation_id":"e54207ef-db25-4e0b-9637-4f8ba3a6ea1d","resolution":{"observed_at":"2026-08-07T15:16:45.044605Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:16:46.012627Z","title":"Speech emotion di- arization: Which emotion appears when?","venue":null,"work_id":"b5d77267-ae77-4e63-ab8e-b191e395ed11","year":2023},"citing_paper":{"arxiv_id":"2505.15667","last_updated":"2025-05-21T15:44:32Z","snapshot_observed_at":"2026-08-13T20:34:37.563551Z","submitted_at":"2025-05-21T15:44:32Z","title":"Segmentation-Variant Codebooks for Preservation of Paralinguistic and Prosodic Information","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-07T15:16:45.083406Z"},"links":{"citing_paper":"/paper/2505.15667"},"observation_digest":"sha256:2d5f4b9692011a3a4119bf69a2b16b9c4ebfd1534f7759efdceb802a04530b39","observation_id":"910719cb-7426-431a-a585-091dc3b4fa4f","resolution":{"observed_at":"2026-08-07T15:16:46.101884Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2312.14069","last_updated":"2024-10-14T07:57:06Z","snapshot_observed_at":"2026-08-13T04:55:55.097872Z","submitted_at":"2023-12-21T17:47:33Z","title":"EmphAssess : a Prosodic Benchmark on Assessing Emphasis Transfer in Speech-to-Speech Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.14069","snapshot_observed_at":"2026-08-07T15:16:45.122530Z","title":"Em- phassess: a prosodic benchmark on assessing emphasis transfer in speech-to-speech models,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.15667","last_updated":"2025-05-21T15:44:32Z","snapshot_observed_at":"2026-08-13T20:34:37.563551Z","submitted_at":"2025-05-21T15:44:32Z","title":"Segmentation-Variant Codebooks for Preservation of Paralinguistic and Prosodic Information","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-07T15:16:45.122530Z"},"links":{"cited_paper":"/paper/2312.14069","citing_paper":"/paper/2505.15667"},"observation_digest":"sha256:545391d9b37d3a6ded94ef2a1761e7b002eaf0bd1fb2ce85e971e55f9ea6da47","observation_id":"88baefd7-917e-467f-99c3-cda2827ab1bc","resolution":{"observed_at":"2026-08-07T15:16:45.122530Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:16:45.867082Z","title":"UTMOS: UTokyo-SaruLab system for voice- mos challenge 2022,","venue":null,"work_id":"99b2680f-5c97-4111-893c-c6de9041038f","year":2022},"citing_paper":{"arxiv_id":"2505.15667","last_updated":"2025-05-21T15:44:32Z","snapshot_observed_at":"2026-08-13T20:34:37.563551Z","submitted_at":"2025-05-21T15:44:32Z","title":"Segmentation-Variant Codebooks for Preservation of Paralinguistic and Prosodic Information","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-07T15:16:45.173094Z"},"links":{"citing_paper":"/paper/2505.15667"},"observation_digest":"sha256:fe2e7f1396d2303a1924d9a4c50b378abdbd1dba80738df64e224bd7bae34be3","observation_id":"19febf02-e693-4e25-bf7f-eaebb37e1834","resolution":{"observed_at":"2026-08-07T15:16:45.932575Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:16:45.726235Z","title":"A layer-wise analysis of man- darin and english suprasegmentals in ssl speech models,","venue":null,"work_id":"518cfc8f-4508-4eae-be1f-a2a8528d1bac","year":2024},"citing_paper":{"arxiv_id":"2505.15667","last_updated":"2025-05-21T15:44:32Z","snapshot_observed_at":"2026-08-13T20:34:37.563551Z","submitted_at":"2025-05-21T15:44:32Z","title":"Segmentation-Variant Codebooks for Preservation of Paralinguistic and Prosodic Information","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-07T15:16:45.232249Z"},"links":{"citing_paper":"/paper/2505.15667"},"observation_digest":"sha256:15dec681bbb19e98453acaf2f3e2a7b3f2d2b9c0171f47ed01dc183f0c8d061c","observation_id":"a6a144a5-47dc-4424-ac23-037deb7e233c","resolution":{"observed_at":"2026-08-07T15:16:45.774824Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:16:45.630281Z","title":"blind speech segmentation: au- tomatic segmentation of speech without linguistic knowledge,","venue":null,"work_id":"e4a24598-67cf-49c5-b5df-f7751732696b","year":1996},"citing_paper":{"arxiv_id":"2505.15667","last_updated":"2025-05-21T15:44:32Z","snapshot_observed_at":"2026-08-13T20:34:37.563551Z","submitted_at":"2025-05-21T15:44:32Z","title":"Segmentation-Variant Codebooks for Preservation of Paralinguistic and Prosodic Information","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-07T15:16:45.290095Z"},"links":{"citing_paper":"/paper/2505.15667"},"observation_digest":"sha256:617347edb3c7a9a750d2294c16e9c32f9461aa94e30bb7374bb81e975353a2fd","observation_id":"ad4fea51-e328-4b6c-84fe-4195775c3f69","resolution":{"observed_at":"2026-08-07T15:16:45.662287Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2505.15667","last_updated":"2025-05-21T15:44:32Z","latest_version":1,"primary_category":"eess.AS","snapshot_observed_at":"2026-08-13T20:34:37.563551Z","submitted_at":"2025-05-21T15:44:32Z","title":"Segmentation-Variant Codebooks for Preservation of Paralinguistic and Prosodic Information"},"reference_resolution":{"displayed":43,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":16,"verified_exact":1,"verified_fuzzy":26},"total_outbound_references":43},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"thesis":"As of 14 August 2026, this Paper Citation Record lists 43 of 43 outbound references and 1 inbound Pith citation observation for arXiv:2505.15667."}