{"as_of":"2026-08-19T14:50:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:8382782e59fd31ea766fd87d76c53dca4026a1c9b0432da73bbf5c9a516d8f32","coverage":[{"denominator":37,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":37,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T12:01:43.372701Z","state":"measured"},{"denominator":40,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":40,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-19T06:32:44.657259+00:00","state":"measured"},{"denominator":3,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":3,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T12:01:43.249937Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-05-11T19:46:15.415472Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2506.00843","last_updated":"2025-06-01T05:38:39Z","snapshot_observed_at":"2026-08-18T17:49:44.131321Z","submitted_at":"2025-06-01T05:38:39Z","title":"HASRD: Hierarchical Acoustic and Semantic Representation Disentanglement","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.00843","snapshot_observed_at":"2026-08-07T12:01:43.249937Z","title":"This framework enables good word error rate (WER) performance, strong com- pression, and high-quality reconstruction","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.00843","last_updated":"2025-06-01T05:38:39Z","snapshot_observed_at":"2026-08-18T17:49:44.131321Z","submitted_at":"2025-06-01T05:38:39Z","title":"HASRD: Hierarchical Acoustic and Semantic Representation Disentanglement","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-07T12:01:43.249937Z"},"links":{"cited_paper":"/paper/2506.00843","citing_paper":"/paper/2506.00843"},"observation_digest":"sha256:da0dddff62ab3e3efa8a446ad8a80788110a3550b90659523a6528913c20d40d","observation_id":"8bd3210c-2a8c-4609-9fee-b50842449518","resolution":{"observed_at":"2026-08-07T12:01:43.249937Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.00843","last_updated":"2025-06-01T05:38:39Z","snapshot_observed_at":"2026-08-18T17:49:44.131321Z","submitted_at":"2025-06-01T05:38:39Z","title":"HASRD: Hierarchical Acoustic and Semantic Representation Disentanglement","version":1},"cited_work":{"arxiv_id":"2506.00843","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2506.00843","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Hasrd: Hierarchical acoustic and semantic representation disentanglement","venue":null,"work_id":"a0d49889-3d32-47ae-ae72-329c81bc0f86","year":2025},"citing_paper":{"arxiv_id":"2605.05927","last_updated":"2026-05-08T01:27:50Z","snapshot_observed_at":"2026-08-11T04:20:01.560211Z","submitted_at":"2026-05-07T09:32:05Z","title":"Minimizing Modality Gap from the Input Side: Your Speech LLM Can Be a Prosody-Aware Text LLM","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-05-08T11:00:52.196039Z"},"links":{"cited_paper":"/paper/2506.00843","citing_paper":"/paper/2605.05927"},"observation_digest":"sha256:d07398f6c164c7e72bc393c18ebfb5d2f4b8b26d99cf14c6b673838ae79e1ed1","observation_id":"da8f0ff8-c3eb-4a88-8fbf-6acdd6e5f6ab","resolution":{"observed_at":"2026-05-11T19:46:15.417161Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.00843","last_updated":"2025-06-01T05:38:39Z","snapshot_observed_at":"2026-08-18T17:49:44.131321Z","submitted_at":"2025-06-01T05:38:39Z","title":"HASRD: Hierarchical Acoustic and Semantic Representation Disentanglement","version":1},"cited_work":{"arxiv_id":"2506.00843","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2506.00843","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Hasrd: Hierarchical acoustic and semantic representation disentanglement","venue":null,"work_id":"a0d49889-3d32-47ae-ae72-329c81bc0f86","year":2025},"citing_paper":{"arxiv_id":"2605.05927","last_updated":"2026-05-08T01:27:50Z","snapshot_observed_at":"2026-08-11T04:20:01.560211Z","submitted_at":"2026-05-07T09:32:05Z","title":"Minimizing Modality Gap from the Input Side: Your Speech LLM Can Be a Prosody-Aware Text LLM","version":2},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-05-11T00:49:26.507281Z"},"links":{"cited_paper":"/paper/2506.00843","citing_paper":"/paper/2605.05927"},"observation_digest":"sha256:447546c64b8d7e9d42b747fb57592e85c0ba545b03ed97d788af4c63339165d3","observation_id":"98a9678c-94cd-430a-88af-17b774c73b52","resolution":{"observed_at":"2026-05-11T00:50:49.653335Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2506.00843/citation-record","integrity":"/paper/2506.00843/integrity","json":"/paper/2506.00843/citation-record.json","paper":"/paper/2506.00843"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:01:43.867466Z","title":null,"venue":null,"work_id":"e4a18197-0a8f-46c9-8cce-9961f35314c5","year":2025},"citing_paper":{"arxiv_id":"2506.00843","last_updated":"2025-06-01T05:38:39Z","snapshot_observed_at":"2026-08-18T17:49:44.131321Z","submitted_at":"2025-06-01T05:38:39Z","title":"HASRD: Hierarchical Acoustic and Semantic Representation Disentanglement","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-07T12:01:43.240637Z"},"links":{"citing_paper":"/paper/2506.00843"},"observation_digest":"sha256:aaf5905d937918df45c011bfdc667aa542630a6df943b4c44694a0b4ec1d33ab","observation_id":"db0b3957-29f6-4b6f-b8cd-57d4aaa09ccb","resolution":{"observed_at":"2026-08-07T12:01:43.870474Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:01:43.857515Z","title":null,"venue":null,"work_id":"d855736c-67a3-42ef-8fc1-5177a41760b2","year":null},"citing_paper":{"arxiv_id":"2506.00843","last_updated":"2025-06-01T05:38:39Z","snapshot_observed_at":"2026-08-18T17:49:44.131321Z","submitted_at":"2025-06-01T05:38:39Z","title":"HASRD: Hierarchical Acoustic and Semantic Representation Disentanglement","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-07T12:01:43.244948Z"},"links":{"citing_paper":"/paper/2506.00843"},"observation_digest":"sha256:a23c9b7e4a4122d37697f5776bae5d660aa787b44c2604c6edcef296d1de76af","observation_id":"b4929345-79bb-4128-8beb-68d305901ca9","resolution":{"observed_at":"2026-08-07T12:01:43.860707Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.00843","last_updated":"2025-06-01T05:38:39Z","snapshot_observed_at":"2026-08-18T17:49:44.131321Z","submitted_at":"2025-06-01T05:38:39Z","title":"HASRD: Hierarchical Acoustic and Semantic Representation Disentanglement","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.00843","snapshot_observed_at":"2026-08-07T12:01:43.249937Z","title":"This framework enables good word error rate (WER) performance, strong com- pression, and high-quality reconstruction","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.00843","last_updated":"2025-06-01T05:38:39Z","snapshot_observed_at":"2026-08-18T17:49:44.131321Z","submitted_at":"2025-06-01T05:38:39Z","title":"HASRD: Hierarchical Acoustic and Semantic Representation Disentanglement","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-07T12:01:43.249937Z"},"links":{"cited_paper":"/paper/2506.00843","citing_paper":"/paper/2506.00843"},"observation_digest":"sha256:da0dddff62ab3e3efa8a446ad8a80788110a3550b90659523a6528913c20d40d","observation_id":"8bd3210c-2a8c-4609-9fee-b50842449518","resolution":{"observed_at":"2026-08-07T12:01:43.249937Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:01:43.847170Z","title":"For acoustic training, we adopt the DAC framework [16], extracting random 5-second segments (vs","venue":null,"work_id":"b6b9bd4a-3218-45e1-9bc0-db993be4bd38","year":null},"citing_paper":{"arxiv_id":"2506.00843","last_updated":"2025-06-01T05:38:39Z","snapshot_observed_at":"2026-08-18T17:49:44.131321Z","submitted_at":"2025-06-01T05:38:39Z","title":"HASRD: Hierarchical Acoustic and Semantic Representation Disentanglement","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-07T12:01:43.253983Z"},"links":{"citing_paper":"/paper/2506.00843"},"observation_digest":"sha256:983da1a02b5cb07a1248b27a0686e57c396b97779a20d4266c52d5ea0455a678","observation_id":"eeba0d67-d4b5-4d19-b4af-2ae36ba30a39","resolution":{"observed_at":"2026-08-07T12:01:43.851385Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:01:43.836700Z","title":null,"venue":null,"work_id":"d14ab154-b803-435e-a90d-f4e6c5e8ed6d","year":null},"citing_paper":{"arxiv_id":"2506.00843","last_updated":"2025-06-01T05:38:39Z","snapshot_observed_at":"2026-08-18T17:49:44.131321Z","submitted_at":"2025-06-01T05:38:39Z","title":"HASRD: Hierarchical Acoustic and Semantic Representation Disentanglement","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-07T12:01:43.258313Z"},"links":{"citing_paper":"/paper/2506.00843"},"observation_digest":"sha256:bfabc11f796e76bbcb222b4eaa2fcabb182760fd7446a4b5c367ab0ba6b619dd","observation_id":"82947716-31aa-43ff-bbdf-3dc0d1a48e89","resolution":{"observed_at":"2026-08-07T12:01:43.840244Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:01:43.825004Z","title":"Our approach effectively preserves semantic performance for ASR while achieving reconstruction quality comparable to state-of-the-art neural audio codecs like DAC","venue":null,"work_id":"0adb8beb-6afd-44c3-83a5-2f8102c08455","year":null},"citing_paper":{"arxiv_id":"2506.00843","last_updated":"2025-06-01T05:38:39Z","snapshot_observed_at":"2026-08-18T17:49:44.131321Z","submitted_at":"2025-06-01T05:38:39Z","title":"HASRD: Hierarchical Acoustic and Semantic Representation Disentanglement","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-07T12:01:43.262122Z"},"links":{"citing_paper":"/paper/2506.00843"},"observation_digest":"sha256:406fb789a621d41bc43bbfc31ece938e6cff4bf96ef09cb754cf8a86a9b875d7","observation_id":"1e0b5dee-e1bc-4f0a-8c5a-9f05b98671d7","resolution":{"observed_at":"2026-08-07T12:01:43.828795Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2409.00800","last_updated":"2024-09-01T18:29:45Z","snapshot_observed_at":"2026-08-16T13:22:16.860009Z","submitted_at":"2024-09-01T18:29:45Z","title":"Comparing Discrete and Continuous Space LLMs for Speech Recognition","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.00800","snapshot_observed_at":"2026-08-07T12:01:43.265309Z","title":"Comparing dis- crete and continuous space LLMs for speech recognition,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.00843","last_updated":"2025-06-01T05:38:39Z","snapshot_observed_at":"2026-08-18T17:49:44.131321Z","submitted_at":"2025-06-01T05:38:39Z","title":"HASRD: Hierarchical Acoustic and Semantic Representation Disentanglement","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-07T12:01:43.265309Z"},"links":{"cited_paper":"/paper/2409.00800","citing_paper":"/paper/2506.00843"},"observation_digest":"sha256:6d3b69d0ed155c215839ffbe81e1c0ced02c2e5894fb2052583b628d3975fb2b","observation_id":"0da11723-e0cd-4d2b-9188-999a55a0e457","resolution":{"observed_at":"2026-08-07T12:01:43.265309Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:01:43.810666Z","title":"AudioLM: A language modeling approach to audio generation,","venue":null,"work_id":"4506d07c-6dcd-4110-9827-e8a75a0b21bb","year":2023},"citing_paper":{"arxiv_id":"2506.00843","last_updated":"2025-06-01T05:38:39Z","snapshot_observed_at":"2026-08-18T17:49:44.131321Z","submitted_at":"2025-06-01T05:38:39Z","title":"HASRD: Hierarchical Acoustic and Semantic Representation Disentanglement","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-07T12:01:43.268694Z"},"links":{"citing_paper":"/paper/2506.00843"},"observation_digest":"sha256:69b7ddf5fa95e3e2bad02b0a6e9f9a316c83cbfb219a94b478605050ab444aff","observation_id":"aa2e66cf-500f-461a-a0b3-adc34cf2a18f","resolution":{"observed_at":"2026-08-07T12:01:43.816128Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:01:43.272054Z","title":"A survey on speech large language models,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.00843","last_updated":"2025-06-01T05:38:39Z","snapshot_observed_at":"2026-08-18T17:49:44.131321Z","submitted_at":"2025-06-01T05:38:39Z","title":"HASRD: Hierarchical Acoustic and Semantic Representation Disentanglement","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-07T12:01:43.272054Z"},"links":{"citing_paper":"/paper/2506.00843"},"observation_digest":"sha256:59d9e772c0f25edec9e55392bde38fadec319c40bf800faaef24e74522fbd36d","observation_id":"2693840c-85e6-414a-85aa-b7687e230ab6","resolution":{"observed_at":"2026-08-07T12:01:43.272054Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:01:43.796674Z","title":"SpeechGPT: Empowering large language models with in- trinsic cross-modal conversational abilities,","venue":null,"work_id":"4d9ce960-b8c8-4e44-8010-6f55d9d24672","year":2023},"citing_paper":{"arxiv_id":"2506.00843","last_updated":"2025-06-01T05:38:39Z","snapshot_observed_at":"2026-08-18T17:49:44.131321Z","submitted_at":"2025-06-01T05:38:39Z","title":"HASRD: Hierarchical Acoustic and Semantic Representation Disentanglement","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-07T12:01:43.275346Z"},"links":{"citing_paper":"/paper/2506.00843"},"observation_digest":"sha256:8d9f30e836d2f510997a74fd4bb9d19f2f05d1980a903e1b8c5d729facf0515d","observation_id":"99b8b4a1-1f61-4892-aff3-7334e25a17f6","resolution":{"observed_at":"2026-08-07T12:01:43.800601Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2308.16692","last_updated":"2024-01-23T01:56:57Z","snapshot_observed_at":"2026-08-16T15:04:18.834535Z","submitted_at":"2023-08-31T12:53:09Z","title":"SpeechTokenizer: Unified Speech Tokenizer for Speech Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2308.16692","snapshot_observed_at":"2026-08-07T12:01:43.278401Z","title":"SpeechTok- enizer: Unified speech tokenizer for speech large language mod- els,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.00843","last_updated":"2025-06-01T05:38:39Z","snapshot_observed_at":"2026-08-18T17:49:44.131321Z","submitted_at":"2025-06-01T05:38:39Z","title":"HASRD: Hierarchical Acoustic and Semantic Representation Disentanglement","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-07T12:01:43.278401Z"},"links":{"cited_paper":"/paper/2308.16692","citing_paper":"/paper/2506.00843"},"observation_digest":"sha256:0c070ae49cc2347df5aa0f8ec4a8dda7fadb036546d0dce6b1c82c8ab4bfd042","observation_id":"8267a6c4-ff08-4903-b453-4e3fed29d9db","resolution":{"observed_at":"2026-08-07T12:01:43.278401Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:01:43.785702Z","title":"Exploring speech recognition, translation, and understanding with discrete speech units: A comparative study,","venue":null,"work_id":"912a6640-06b1-4861-9659-84c133c54bf8","year":2024},"citing_paper":{"arxiv_id":"2506.00843","last_updated":"2025-06-01T05:38:39Z","snapshot_observed_at":"2026-08-18T17:49:44.131321Z","submitted_at":"2025-06-01T05:38:39Z","title":"HASRD: Hierarchical Acoustic and Semantic Representation Disentanglement","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-07T12:01:43.281631Z"},"links":{"citing_paper":"/paper/2506.00843"},"observation_digest":"sha256:449f55659904f77b7329c0d5b63196e73933f2f2ec116af246e784e5cc1072e8","observation_id":"7f951cb4-542c-4b3a-b069-28b70dc236dd","resolution":{"observed_at":"2026-08-07T12:01:43.788909Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:01:43.776115Z","title":"HuBERT: Self-supervised speech representation learning by masked prediction of hidden units,","venue":null,"work_id":"b952276d-3593-4ea0-8fcb-7bd1d21dac16","year":2021},"citing_paper":{"arxiv_id":"2506.00843","last_updated":"2025-06-01T05:38:39Z","snapshot_observed_at":"2026-08-18T17:49:44.131321Z","submitted_at":"2025-06-01T05:38:39Z","title":"HASRD: Hierarchical Acoustic and Semantic Representation Disentanglement","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-07T12:01:43.285176Z"},"links":{"citing_paper":"/paper/2506.00843"},"observation_digest":"sha256:2e1e30c1043542ca39bfec43bc63ffde2fd5d8326e76009b2c87957dd73cc93c","observation_id":"a28f4ebe-6fac-4bd1-9202-ff7f9a27a104","resolution":{"observed_at":"2026-08-07T12:01:43.779218Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:01:43.767214Z","title":"WavLM: Large-scale self- supervised pre-training for full stack speech processing,","venue":null,"work_id":"85313746-88cb-4ea6-ae97-dbf25ca6e443","year":2022},"citing_paper":{"arxiv_id":"2506.00843","last_updated":"2025-06-01T05:38:39Z","snapshot_observed_at":"2026-08-18T17:49:44.131321Z","submitted_at":"2025-06-01T05:38:39Z","title":"HASRD: Hierarchical Acoustic and Semantic Representation Disentanglement","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-07T12:01:43.288493Z"},"links":{"citing_paper":"/paper/2506.00843"},"observation_digest":"sha256:c3c55c7ef2842a6a0a5b29451858cf52671263b0f7b0fd1d603f22999e6c97f8","observation_id":"62870af1-70b1-4e6b-add9-e5cae4802663","resolution":{"observed_at":"2026-08-07T12:01:43.770201Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:01:43.757351Z","title":"W2v-BERT: Combining contrastive learning and masked language modeling for self-supervised speech pre- training,","venue":null,"work_id":"fecfbef8-8fb1-4cd7-980d-7b30e84b57b1","year":2021},"citing_paper":{"arxiv_id":"2506.00843","last_updated":"2025-06-01T05:38:39Z","snapshot_observed_at":"2026-08-18T17:49:44.131321Z","submitted_at":"2025-06-01T05:38:39Z","title":"HASRD: Hierarchical Acoustic and Semantic Representation Disentanglement","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-07T12:01:43.293070Z"},"links":{"citing_paper":"/paper/2506.00843"},"observation_digest":"sha256:3ddc347766146969bdfb1063e123b1f65097a3bf503da463d1c852310eaa4736","observation_id":"39eac272-4f3c-464f-ab0c-9e0b666e396d","resolution":{"observed_at":"2026-08-07T12:01:43.761050Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:01:43.747251Z","title":"Ex- ploration of efficient end-to-end ASR using discretized input from self-supervised learning,","venue":null,"work_id":"990e901b-4118-43f0-b081-a48eba40e414","year":2023},"citing_paper":{"arxiv_id":"2506.00843","last_updated":"2025-06-01T05:38:39Z","snapshot_observed_at":"2026-08-18T17:49:44.131321Z","submitted_at":"2025-06-01T05:38:39Z","title":"HASRD: Hierarchical Acoustic and Semantic Representation Disentanglement","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-07T12:01:43.297026Z"},"links":{"citing_paper":"/paper/2506.00843"},"observation_digest":"sha256:20fdbc6471c7d280d0fd75f8b43b5aabde1839ea3b9d0d564f044408db75473e","observation_id":"b7bc03b7-2eb0-481f-9ebb-67c954e0e0d9","resolution":{"observed_at":"2026-08-07T12:01:43.750837Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:01:43.737805Z","title":"Speech resynthesis from discrete disentangled self-supervised representations,","venue":null,"work_id":"dd5b9b0d-b815-4655-bbac-05b73bc1645b","year":2021},"citing_paper":{"arxiv_id":"2506.00843","last_updated":"2025-06-01T05:38:39Z","snapshot_observed_at":"2026-08-18T17:49:44.131321Z","submitted_at":"2025-06-01T05:38:39Z","title":"HASRD: Hierarchical Acoustic and Semantic Representation Disentanglement","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-07T12:01:43.300050Z"},"links":{"citing_paper":"/paper/2506.00843"},"observation_digest":"sha256:55883356d3c4b03487227341e26053405afb498655d1ae09fdef8359fde6f091","observation_id":"63762711-6ffb-4f12-9c90-beb58a970dd6","resolution":{"observed_at":"2026-08-07T12:01:43.740820Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:01:43.727533Z","title":"Ex- presso: A benchmark and analysis of discrete expressive speech resynthesis,","venue":null,"work_id":"12f391d8-9e8f-4594-913b-8860c0ea2e2d","year":2023},"citing_paper":{"arxiv_id":"2506.00843","last_updated":"2025-06-01T05:38:39Z","snapshot_observed_at":"2026-08-18T17:49:44.131321Z","submitted_at":"2025-06-01T05:38:39Z","title":"HASRD: Hierarchical Acoustic and Semantic Representation Disentanglement","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-07T12:01:43.303897Z"},"links":{"citing_paper":"/paper/2506.00843"},"observation_digest":"sha256:33abc72de285c2954dbbdcfb2b3eb2f582fc75e03adb95927ee1e6540c6005e7","observation_id":"1debd9fd-98c2-4a19-af30-efeb8f8a53c2","resolution":{"observed_at":"2026-08-07T12:01:43.731052Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:01:43.716454Z","title":"SoundStream: An end-to-end neural audio codec,","venue":null,"work_id":"81255d95-e70f-408e-a0c7-bd7903fc3055","year":2021},"citing_paper":{"arxiv_id":"2506.00843","last_updated":"2025-06-01T05:38:39Z","snapshot_observed_at":"2026-08-18T17:49:44.131321Z","submitted_at":"2025-06-01T05:38:39Z","title":"HASRD: Hierarchical Acoustic and Semantic Representation Disentanglement","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-07T12:01:43.307670Z"},"links":{"citing_paper":"/paper/2506.00843"},"observation_digest":"sha256:1cc5b635aac57507ac16317f84d486389c9b3eac58055e13e5403ac047593fb1","observation_id":"ad690667-0ceb-4340-948d-a5881e8ed5dc","resolution":{"observed_at":"2026-08-07T12:01:43.720715Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2210.13438","last_updated":"2022-10-24T17:52:02Z","snapshot_observed_at":"2026-08-15T04:43:16.361751Z","submitted_at":"2022-10-24T17:52:02Z","title":"High Fidelity Neural Audio Compression","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2210.13438","snapshot_observed_at":"2026-08-07T12:01:43.311743Z","title":"High fidelity neural audio compression,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.00843","last_updated":"2025-06-01T05:38:39Z","snapshot_observed_at":"2026-08-18T17:49:44.131321Z","submitted_at":"2025-06-01T05:38:39Z","title":"HASRD: Hierarchical Acoustic and Semantic Representation Disentanglement","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-07T12:01:43.311743Z"},"links":{"cited_paper":"/paper/2210.13438","citing_paper":"/paper/2506.00843"},"observation_digest":"sha256:03c303345c6a5284271104fd2341cb4858736afa09e2f4373b280565fbff2bf8","observation_id":"14e5435b-bbc6-4a45-84ca-5fc60c5ad807","resolution":{"observed_at":"2026-08-07T12:01:43.311743Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.00037","last_updated":"2024-10-02T09:11:45Z","snapshot_observed_at":"2026-07-30T10:21:14.474746Z","submitted_at":"2024-09-17T17:55:39Z","title":"Moshi: a speech-text foundation model for real-time dialogue","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.00037","snapshot_observed_at":"2026-08-07T12:01:43.315618Z","title":"Moshi: A speech-text foundation model for real-time dialogue,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.00843","last_updated":"2025-06-01T05:38:39Z","snapshot_observed_at":"2026-08-18T17:49:44.131321Z","submitted_at":"2025-06-01T05:38:39Z","title":"HASRD: Hierarchical Acoustic and Semantic Representation Disentanglement","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-07T12:01:43.315618Z"},"links":{"cited_paper":"/paper/2410.00037","citing_paper":"/paper/2506.00843"},"observation_digest":"sha256:ba40f73fc64e70eaf0de1987042e5b077fdbaadb998c21e92323b6cccd16ed40","observation_id":"1bec4980-6a30-4924-a5a5-417b5b962cdc","resolution":{"observed_at":"2026-08-07T12:01:43.315618Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:01:43.704846Z","title":"High-fidelity audio compression with improved rvqgan,","venue":null,"work_id":"19d87de9-7405-409f-89e6-77782e607a02","year":2023},"citing_paper":{"arxiv_id":"2506.00843","last_updated":"2025-06-01T05:38:39Z","snapshot_observed_at":"2026-08-18T17:49:44.131321Z","submitted_at":"2025-06-01T05:38:39Z","title":"HASRD: Hierarchical Acoustic and Semantic Representation Disentanglement","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-07T12:01:43.319166Z"},"links":{"citing_paper":"/paper/2506.00843"},"observation_digest":"sha256:c1ac282f8d4d7a8f62a54a400b2644cc2e6a3eb1e543759a8e2c6025c2d74072","observation_id":"69d89b07-bf94-43c7-b1d9-5e91394365e4","resolution":{"observed_at":"2026-08-07T12:01:43.708488Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2408.17175","last_updated":"2024-11-27T11:47:45Z","snapshot_observed_at":"2026-08-16T20:33:30.347717Z","submitted_at":"2024-08-30T10:24:07Z","title":"Codec Does Matter: Exploring the Semantic Shortcoming of Codec for Audio Language Model","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.17175","snapshot_observed_at":"2026-08-07T12:01:43.322223Z","title":"Codec does matter: Exploring the semantic shortcoming of codec for audio language model,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.00843","last_updated":"2025-06-01T05:38:39Z","snapshot_observed_at":"2026-08-18T17:49:44.131321Z","submitted_at":"2025-06-01T05:38:39Z","title":"HASRD: Hierarchical Acoustic and Semantic Representation Disentanglement","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-07T12:01:43.322223Z"},"links":{"cited_paper":"/paper/2408.17175","citing_paper":"/paper/2506.00843"},"observation_digest":"sha256:c4f413a3adde523feb806493580f5e956f20abf447fda47b6ebdaee4ea488a57","observation_id":"5b674017-f082-4303-b5d2-94a79dfa57b3","resolution":{"observed_at":"2026-08-07T12:01:43.322223Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2411.16147","last_updated":"2025-09-10T13:42:20Z","snapshot_observed_at":"2026-08-18T17:48:44.520019Z","submitted_at":"2024-11-25T07:14:26Z","title":"QR-VC: Leveraging Quantization Residuals for Linear Disentanglement in Zero-Shot Voice Conversion","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.16147","snapshot_observed_at":"2026-08-07T12:01:43.325585Z","title":"SKQVC: One-shot voice con- version by k-means quantization with self-supervised speech representations,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.00843","last_updated":"2025-06-01T05:38:39Z","snapshot_observed_at":"2026-08-18T17:49:44.131321Z","submitted_at":"2025-06-01T05:38:39Z","title":"HASRD: Hierarchical Acoustic and Semantic Representation Disentanglement","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-07T12:01:43.325585Z"},"links":{"cited_paper":"/paper/2411.16147","citing_paper":"/paper/2506.00843"},"observation_digest":"sha256:0fcda5a67711b544c2523a8f3f2a8457fe809e973534b36f9611fb955276aafd","observation_id":"2c5d41c7-f072-4f97-8fc0-eb203deab3ff","resolution":{"observed_at":"2026-08-07T12:01:43.325585Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:01:43.694036Z","title":"MMM: Multi-layer multi-residual multi-stream discrete speech repre- sentation from self-supervised learning model,","venue":null,"work_id":"6741ad07-03ca-443a-a5e0-48a6715243a1","year":2024},"citing_paper":{"arxiv_id":"2506.00843","last_updated":"2025-06-01T05:38:39Z","snapshot_observed_at":"2026-08-18T17:49:44.131321Z","submitted_at":"2025-06-01T05:38:39Z","title":"HASRD: Hierarchical Acoustic and Semantic Representation Disentanglement","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-07T12:01:43.329456Z"},"links":{"citing_paper":"/paper/2506.00843"},"observation_digest":"sha256:8081a966426ffb72d479e78640610eef6a8944111e770fba00869309b4233eda","observation_id":"ac8b6874-1279-488e-ab19-fcd25f5d331f","resolution":{"observed_at":"2026-08-07T12:01:43.697823Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:01:43.683642Z","title":"Towards universal speech discrete tokens: A case study for ASR and TTS,","venue":null,"work_id":"4eb69515-c629-47bc-814c-af791f32fda6","year":2024},"citing_paper":{"arxiv_id":"2506.00843","last_updated":"2025-06-01T05:38:39Z","snapshot_observed_at":"2026-08-18T17:49:44.131321Z","submitted_at":"2025-06-01T05:38:39Z","title":"HASRD: Hierarchical Acoustic and Semantic Representation Disentanglement","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-07T12:01:43.332570Z"},"links":{"citing_paper":"/paper/2506.00843"},"observation_digest":"sha256:c334b23259ffc34f8497799a1203350d88fb90b56625b2585acc56d47b26866c","observation_id":"9550b58b-0ce6-43f0-9933-47545d4125e1","resolution":{"observed_at":"2026-08-07T12:01:43.687447Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:01:43.671548Z","title":"ReVISE: Self-supervised speech resynthesis with visual input for univer- sal and generalized speech regeneration,","venue":null,"work_id":"4eddb75e-352a-488b-a11a-0164f08a4d81","year":2023},"citing_paper":{"arxiv_id":"2506.00843","last_updated":"2025-06-01T05:38:39Z","snapshot_observed_at":"2026-08-18T17:49:44.131321Z","submitted_at":"2025-06-01T05:38:39Z","title":"HASRD: Hierarchical Acoustic and Semantic Representation Disentanglement","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-07T12:01:43.335931Z"},"links":{"citing_paper":"/paper/2506.00843"},"observation_digest":"sha256:956a4a77985af434deeb8f9586180c5101d70af45dedd592ff5f4441c898c154","observation_id":"5229250d-6dd1-4705-8258-566427df1879","resolution":{"observed_at":"2026-08-07T12:01:43.675974Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:01:43.660689Z","title":"Self-supervised disentan- gled representation learning for robust target speech extraction,","venue":null,"work_id":"8af8861c-1bb6-4b59-9ecd-d54cf7aa8363","year":2024},"citing_paper":{"arxiv_id":"2506.00843","last_updated":"2025-06-01T05:38:39Z","snapshot_observed_at":"2026-08-18T17:49:44.131321Z","submitted_at":"2025-06-01T05:38:39Z","title":"HASRD: Hierarchical Acoustic and Semantic Representation Disentanglement","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-07T12:01:43.339284Z"},"links":{"citing_paper":"/paper/2506.00843"},"observation_digest":"sha256:2dd0306fd330483b2b46007cc6c17f992c29b537f46f72bb833ac51314adcaa4","observation_id":"c93f827d-aab7-45c8-ab08-d67d4ec6893a","resolution":{"observed_at":"2026-08-07T12:01:43.664679Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:01:43.650635Z","title":"A ConvNet for the 2020s,","venue":null,"work_id":"fa133539-8617-4eeb-8860-19355cf99911","year":2022},"citing_paper":{"arxiv_id":"2506.00843","last_updated":"2025-06-01T05:38:39Z","snapshot_observed_at":"2026-08-18T17:49:44.131321Z","submitted_at":"2025-06-01T05:38:39Z","title":"HASRD: Hierarchical Acoustic and Semantic Representation Disentanglement","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-07T12:01:43.342683Z"},"links":{"citing_paper":"/paper/2506.00843"},"observation_digest":"sha256:cc13348111f1732b328e1f4e3ec6f9f5e3cb84f8bf5ee81dc9211b1112dd11a2","observation_id":"5457c13d-fa21-4af3-aece-434aff075c76","resolution":{"observed_at":"2026-08-07T12:01:43.653509Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:01:43.640233Z","title":"Self-supervised learning with random-projection quantizer for speech recogni- tion,","venue":null,"work_id":"7281a7cb-6354-462b-84c3-0a9f21ed5182","year":2022},"citing_paper":{"arxiv_id":"2506.00843","last_updated":"2025-06-01T05:38:39Z","snapshot_observed_at":"2026-08-18T17:49:44.131321Z","submitted_at":"2025-06-01T05:38:39Z","title":"HASRD: Hierarchical Acoustic and Semantic Representation Disentanglement","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-07T12:01:43.345879Z"},"links":{"citing_paper":"/paper/2506.00843"},"observation_digest":"sha256:b83d3e023c1279b67c8e676d5d3de9c8f3166eade722fa0f17e7a91de6c58f09","observation_id":"1c0dc1e9-17c3-4a52-841d-b2ddf644724c","resolution":{"observed_at":"2026-08-07T12:01:43.643567Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:01:43.629279Z","title":"Mel- GAN: Generative adversarial networks for conditional wave- form synthesis,","venue":null,"work_id":"3441c396-3911-4e5f-8265-3677c1721a1f","year":2019},"citing_paper":{"arxiv_id":"2506.00843","last_updated":"2025-06-01T05:38:39Z","snapshot_observed_at":"2026-08-18T17:49:44.131321Z","submitted_at":"2025-06-01T05:38:39Z","title":"HASRD: Hierarchical Acoustic and Semantic Representation Disentanglement","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-07T12:01:43.349431Z"},"links":{"citing_paper":"/paper/2506.00843"},"observation_digest":"sha256:777181bb283b9bec643c7c9347b18347c329b2a08a5861b355b09d53166bbf85","observation_id":"7cbdc036-e0b1-4139-b856-a6d2a7927a1a","resolution":{"observed_at":"2026-08-07T12:01:43.633237Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:01:43.353811Z","title":"HiFi-GAN: Generative adversarial networks for efficient and high fidelity speech synthesis,","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2506.00843","last_updated":"2025-06-01T05:38:39Z","snapshot_observed_at":"2026-08-18T17:49:44.131321Z","submitted_at":"2025-06-01T05:38:39Z","title":"HASRD: Hierarchical Acoustic and Semantic Representation Disentanglement","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-07T12:01:43.353811Z"},"links":{"citing_paper":"/paper/2506.00843"},"observation_digest":"sha256:16f5cfceb0dddc63a6df8a697da694cc72dedae638d824b05ce10a1624ccfca5","observation_id":"46499834-a384-4020-954c-719ab49dde7d","resolution":{"observed_at":"2026-08-07T12:01:43.353811Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:01:43.612812Z","title":"Lib- riSpeech: An ASR corpus based on public domain audio books,","venue":null,"work_id":"2ef6ed5b-57ba-4405-b5b4-e4824a5ddb4d","year":2015},"citing_paper":{"arxiv_id":"2506.00843","last_updated":"2025-06-01T05:38:39Z","snapshot_observed_at":"2026-08-18T17:49:44.131321Z","submitted_at":"2025-06-01T05:38:39Z","title":"HASRD: Hierarchical Acoustic and Semantic Representation Disentanglement","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-07T12:01:43.357062Z"},"links":{"citing_paper":"/paper/2506.00843"},"observation_digest":"sha256:a09dc832a7bee1c89b85339946b33b7348f9dfec6d8a66050288b8b5292005e5","observation_id":"8f28f306-a4f7-4dee-a2c4-9d2e8bdd0af8","resolution":{"observed_at":"2026-08-07T12:01:43.615831Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:01:43.602154Z","title":"Lhotse: A speech data representation library for the modern deep learning ecosystem,","venue":null,"work_id":"78bf0e5e-b604-4d00-b3c7-b1e874057685","year":2021},"citing_paper":{"arxiv_id":"2506.00843","last_updated":"2025-06-01T05:38:39Z","snapshot_observed_at":"2026-08-18T17:49:44.131321Z","submitted_at":"2025-06-01T05:38:39Z","title":"HASRD: Hierarchical Acoustic and Semantic Representation Disentanglement","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-07T12:01:43.360747Z"},"links":{"citing_paper":"/paper/2506.00843"},"observation_digest":"sha256:dfe5189077fd4f5ff54b358b355a6c44314e5bf884353e3de866c6a869cdda61","observation_id":"13b65055-9954-4a90-baa7-7cd5312b1987","resolution":{"observed_at":"2026-08-07T12:01:43.605540Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2405.04296","last_updated":"2024-09-04T10:23:04Z","snapshot_observed_at":"2026-08-16T13:54:41.873921Z","submitted_at":"2024-05-07T13:11:37Z","title":"Open Implementation and Study of BEST-RQ for Speech Processing","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.04296","snapshot_observed_at":"2026-08-07T12:01:43.364043Z","title":"Open implementation and study of BEST-RQ for speech processing,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.00843","last_updated":"2025-06-01T05:38:39Z","snapshot_observed_at":"2026-08-18T17:49:44.131321Z","submitted_at":"2025-06-01T05:38:39Z","title":"HASRD: Hierarchical Acoustic and Semantic Representation Disentanglement","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-07T12:01:43.364043Z"},"links":{"cited_paper":"/paper/2405.04296","citing_paper":"/paper/2506.00843"},"observation_digest":"sha256:3cc5e445048a59cd8862437bd3593c538793b22c5aa35cbe740fe8c821c7fe91","observation_id":"e29dcf14-9587-42e5-ac29-b1656da52e00","resolution":{"observed_at":"2026-08-07T12:01:43.364043Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:01:43.591448Z","title":"Con- nectionist temporal classification: Labelling unsegmented se- quence data with recurrent neural networks,","venue":null,"work_id":"520ecab4-0529-423a-a8eb-78c4fd4f260c","year":2006},"citing_paper":{"arxiv_id":"2506.00843","last_updated":"2025-06-01T05:38:39Z","snapshot_observed_at":"2026-08-18T17:49:44.131321Z","submitted_at":"2025-06-01T05:38:39Z","title":"HASRD: Hierarchical Acoustic and Semantic Representation Disentanglement","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-07T12:01:43.368593Z"},"links":{"citing_paper":"/paper/2506.00843"},"observation_digest":"sha256:91ab196dd28e8c1386da1bf7a68f76d63277b91d97bf69a79102698ad20cf4c7","observation_id":"a8a9fc1d-9240-4912-9dd7-2837dee109f3","resolution":{"observed_at":"2026-08-07T12:01:43.595072Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:01:43.579032Z","title":"ECAPA- TDNN: Emphasized channel attention, propagation and aggre- gation in TDNN based speaker verification,","venue":null,"work_id":"b5e04908-a0a8-4ac7-805b-b164c46ee304","year":2020},"citing_paper":{"arxiv_id":"2506.00843","last_updated":"2025-06-01T05:38:39Z","snapshot_observed_at":"2026-08-18T17:49:44.131321Z","submitted_at":"2025-06-01T05:38:39Z","title":"HASRD: Hierarchical Acoustic and Semantic Representation Disentanglement","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-07T12:01:43.372701Z"},"links":{"citing_paper":"/paper/2506.00843"},"observation_digest":"sha256:63d3fc90a78abdeac9b423996000db682bc69d48612a42b2775d50faf177af1f","observation_id":"d64d0e91-ea06-4e9c-87b0-c57f1cf42165","resolution":{"observed_at":"2026-08-07T12:01:43.584006Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2506.00843","last_updated":"2025-06-01T05:38:39Z","latest_version":1,"primary_category":"eess.AS","snapshot_observed_at":"2026-08-18T17:49:44.131321Z","submitted_at":"2025-06-01T05:38:39Z","title":"HASRD: Hierarchical Acoustic and Semantic Representation Disentanglement"},"reference_resolution":{"displayed":37,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":13,"verified_exact":0,"verified_fuzzy":24},"total_outbound_references":37},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"thesis":"As of 19 August 2026, this Paper Citation Record lists 37 of 37 outbound references and 3 inbound Pith citation observations for arXiv:2506.00843."}