{"as_of":"2026-08-22T07:12:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:75059c402ac25e306c43dc9f8c15ddbf572f6478289329c48a8dcb7416b8349f","coverage":[{"denominator":33,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":33,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-06T21:51:37.442979Z","state":"measured"},{"denominator":42,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":42,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-22T06:32:14.747728+00:00","state":"measured"},{"denominator":9,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":9,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-15T15:37:36.541957Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-07-02T19:57:20.080166Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2506.23325","last_updated":"2025-07-09T17:40:35Z","snapshot_observed_at":"2026-08-17T17:41:09.789585Z","submitted_at":"2025-06-29T16:51:50Z","title":"XY-Tokenizer: Mitigating the Semantic-Acoustic Conflict in Low-Bitrate Speech Codecs","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.23325","snapshot_observed_at":"2026-08-05T11:40:59.738880Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2509.02349","last_updated":"2025-09-04T14:25:57Z","snapshot_observed_at":"2026-08-16T11:26:28.123684Z","submitted_at":"2025-09-02T14:15:22Z","title":"AudioCodecBench: A Comprehensive Benchmark for Audio Codec Evaluation","version":2},"reference_index":13,"source":"arxiv_source","source_observed_at":"2026-08-05T11:40:59.738880Z"},"links":{"cited_paper":"/paper/2506.23325","citing_paper":"/paper/2509.02349"},"observation_digest":"sha256:641a060ba38fcb4214a1d9e8095d958e62df20ab7fff60b15b21098aa5084be1","observation_id":"827d65ca-cae9-4b43-9f3c-912e7370c341","resolution":{"observed_at":"2026-08-05T11:40:59.738880Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.23325","last_updated":"2025-07-09T17:40:35Z","snapshot_observed_at":"2026-08-17T17:41:09.789585Z","submitted_at":"2025-06-29T16:51:50Z","title":"XY-Tokenizer: Mitigating the Semantic-Acoustic Conflict in Low-Bitrate Speech Codecs","version":2},"cited_work":{"arxiv_id":"2506.23325","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2506.23325","snapshot_observed_at":"2026-07-02T19:57:20.080166Z","title":"Xy-tokenizer: Mitigating the semantic-acoustic conflict in low-bitrate speech codecs","venue":null,"work_id":"453b7eda-caeb-41c4-a224-0efdd79e9820","year":2025},"citing_paper":{"arxiv_id":"2601.15621","last_updated":"2026-01-22T03:51:43Z","snapshot_observed_at":"2026-08-13T01:33:42.158497Z","submitted_at":"2026-01-22T03:51:43Z","title":"Qwen3-TTS Technical Report","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-05-16T19:24:56.057631Z"},"links":{"cited_paper":"/paper/2506.23325","citing_paper":"/paper/2601.15621"},"observation_digest":"sha256:06da72986b7c9c55dd3620d7d238d0b23f814995ef6a307cf9440f0f4cd159bb","observation_id":"68ea7121-7178-46a9-853f-f6eea513ebac","resolution":{"observed_at":"2026-05-16T19:24:56.099066Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.23325","last_updated":"2025-07-09T17:40:35Z","snapshot_observed_at":"2026-08-17T17:41:09.789585Z","submitted_at":"2025-06-29T16:51:50Z","title":"XY-Tokenizer: Mitigating the Semantic-Acoustic Conflict in Low-Bitrate Speech Codecs","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.23325","snapshot_observed_at":"2026-07-12T21:34:30.078813Z","title":"Xy-tokenizer: Mitigating the semantic-acoustic conflict in low-bitrate speech codecs,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2604.12144","last_updated":"2026-07-01T22:34:57Z","snapshot_observed_at":"2026-08-12T14:41:56.904894Z","submitted_at":"2026-04-13T23:48:35Z","title":"VERITAS: A Multi-Agent Co-Scientist for Verifiable Image-Derived Hypothesis Testing","version":2},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-07-12T21:34:30.078813Z"},"links":{"cited_paper":"/paper/2506.23325","citing_paper":"/paper/2604.12144"},"observation_digest":"sha256:f46dfb4cfbbb716109d2d9ca565a3fa2ef91beb028a2b89bcbebcb0d93f6542d","observation_id":"8868fc17-160d-4d5d-af6a-863c6956a272","resolution":{"observed_at":"2026-07-12T21:34:30.078813Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.23325","last_updated":"2025-07-09T17:40:35Z","snapshot_observed_at":"2026-08-17T17:41:09.789585Z","submitted_at":"2025-06-29T16:51:50Z","title":"XY-Tokenizer: Mitigating the Semantic-Acoustic Conflict in Low-Bitrate Speech Codecs","version":2},"cited_work":{"arxiv_id":"2506.23325","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2506.23325","snapshot_observed_at":"2026-07-02T19:57:20.080166Z","title":"Xy-tokenizer: Mitigating the semantic-acoustic conflict in low-bitrate speech codecs","venue":null,"work_id":"453b7eda-caeb-41c4-a224-0efdd79e9820","year":2025},"citing_paper":{"arxiv_id":"2604.12145","last_updated":"2026-04-13T23:49:27Z","snapshot_observed_at":"2026-07-30T03:55:58.250974Z","submitted_at":"2026-04-13T23:49:27Z","title":"Why Your Tokenizer Fails in Information Fusion: A Timing-Aware Pre-Quantization Fusion for Video-Enhanced Audio Tokenization","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-05-10T14:49:51.481873Z"},"links":{"cited_paper":"/paper/2506.23325","citing_paper":"/paper/2604.12145"},"observation_digest":"sha256:ad19a492a156a02cba4003c7f3153aaa0d16483886a985cac3ca1eec232d5abe","observation_id":"022ec4b3-f695-4420-9a06-905f81ca4397","resolution":{"observed_at":"2026-05-11T11:31:01.898524Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.23325","last_updated":"2025-07-09T17:40:35Z","snapshot_observed_at":"2026-08-17T17:41:09.789585Z","submitted_at":"2025-06-29T16:51:50Z","title":"XY-Tokenizer: Mitigating the Semantic-Acoustic Conflict in Low-Bitrate Speech Codecs","version":2},"cited_work":{"arxiv_id":"2506.23325","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2506.23325","snapshot_observed_at":"2026-07-02T19:57:20.080166Z","title":"Xy-tokenizer: Mitigating the semantic-acoustic conflict in low-bitrate speech codecs","venue":null,"work_id":"453b7eda-caeb-41c4-a224-0efdd79e9820","year":2025},"citing_paper":{"arxiv_id":"2605.06765","last_updated":"2026-05-07T17:59:56Z","snapshot_observed_at":"2026-08-11T13:23:12.680939Z","submitted_at":"2026-05-07T17:59:56Z","title":"VITA-QinYu: Expressive Spoken Language Model for Role-Playing and Singing","version":1},"reference_index":17,"source":"arxiv_source","source_observed_at":"2026-05-11T01:03:09.942984Z"},"links":{"cited_paper":"/paper/2506.23325","citing_paper":"/paper/2605.06765"},"observation_digest":"sha256:6e9c9ed22e4d3bc85079efaa9f756aac7555514ae94a780158b2932c92b4c3f1","observation_id":"919d90bb-c069-4a92-9139-adee8d952b25","resolution":{"observed_at":"2026-05-11T04:50:56.020011Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.23325","last_updated":"2025-07-09T17:40:35Z","snapshot_observed_at":"2026-08-17T17:41:09.789585Z","submitted_at":"2025-06-29T16:51:50Z","title":"XY-Tokenizer: Mitigating the Semantic-Acoustic Conflict in Low-Bitrate Speech Codecs","version":2},"cited_work":{"arxiv_id":"2506.23325","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2506.23325","snapshot_observed_at":"2026-07-02T19:57:20.080166Z","title":"Xy-tokenizer: Mitigating the semantic-acoustic conflict in low-bitrate speech codecs","venue":null,"work_id":"453b7eda-caeb-41c4-a224-0efdd79e9820","year":2025},"citing_paper":{"arxiv_id":"2605.08608","last_updated":"2026-05-09T02:07:57Z","snapshot_observed_at":"2026-08-13T03:16:49.822860Z","submitted_at":"2026-05-09T02:07:57Z","title":"Reducing Linguistic Hallucination in LM-Based Speech Enhancement via Noise-Invariant Acoustic-Semantic Distillation","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-05-12T01:11:50.733585Z"},"links":{"cited_paper":"/paper/2506.23325","citing_paper":"/paper/2605.08608"},"observation_digest":"sha256:20b94801cc9e260e45163d20953b76005acd72556337dd9b1a70555d2110184e","observation_id":"594065c4-4506-4376-87c6-54f77b9c3ff2","resolution":{"observed_at":"2026-05-12T08:26:23.233947Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.23325","last_updated":"2025-07-09T17:40:35Z","snapshot_observed_at":"2026-08-17T17:41:09.789585Z","submitted_at":"2025-06-29T16:51:50Z","title":"XY-Tokenizer: Mitigating the Semantic-Acoustic Conflict in Low-Bitrate Speech Codecs","version":2},"cited_work":{"arxiv_id":"2506.23325","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2506.23325","snapshot_observed_at":"2026-07-02T19:57:20.080166Z","title":"Xy-tokenizer: Mitigating the semantic-acoustic conflict in low-bitrate speech codecs","venue":null,"work_id":"453b7eda-caeb-41c4-a224-0efdd79e9820","year":2025},"citing_paper":{"arxiv_id":"2606.07080","last_updated":"2026-08-10T06:38:24Z","snapshot_observed_at":"2026-08-20T11:48:30.207892Z","submitted_at":"2026-06-05T09:19:24Z","title":"dots.tts Technical Report","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-06-27T21:10:25.911203Z"},"links":{"cited_paper":"/paper/2506.23325","citing_paper":"/paper/2606.07080"},"observation_digest":"sha256:b24af6de14f7ff97aab18f5c98461f77620ee24374bc238fb85c87405d154edc","observation_id":"da31b60e-9d12-4c5a-ab33-74f6270c59ac","resolution":{"observed_at":"2026-07-02T19:57:20.081577Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.23325","last_updated":"2025-07-09T17:40:35Z","snapshot_observed_at":"2026-08-17T17:41:09.789585Z","submitted_at":"2025-06-29T16:51:50Z","title":"XY-Tokenizer: Mitigating the Semantic-Acoustic Conflict in Low-Bitrate Speech Codecs","version":2},"cited_work":{"arxiv_id":"2506.23325","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2506.23325","snapshot_observed_at":"2026-07-02T19:57:20.080166Z","title":"Xy-tokenizer: Mitigating the semantic-acoustic conflict in low-bitrate speech codecs","venue":null,"work_id":"453b7eda-caeb-41c4-a224-0efdd79e9820","year":2025},"citing_paper":{"arxiv_id":"2606.31247","last_updated":"2026-06-30T07:24:10Z","snapshot_observed_at":"2026-08-13T09:35:09.713263Z","submitted_at":"2026-06-30T07:24:10Z","title":"FlexiSLM: A Dynamic and Controllable Frame Rate Spoken Language Model","version":1},"reference_index":109,"source":"arxiv_source","source_observed_at":"2026-07-01T03:50:26.873406Z"},"links":{"cited_paper":"/paper/2506.23325","citing_paper":"/paper/2606.31247"},"observation_digest":"sha256:44dc2a7537a07d3dacdb6aac0333d00310442f2e56cfb6f8f437e1413f8a0c76","observation_id":"4c74f3f1-d424-4b63-a725-7f1931abe1aa","resolution":{"observed_at":"2026-07-01T11:55:42.290110Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.23325","last_updated":"2025-07-09T17:40:35Z","snapshot_observed_at":"2026-08-17T17:41:09.789585Z","submitted_at":"2025-06-29T16:51:50Z","title":"XY-Tokenizer: Mitigating the Semantic-Acoustic Conflict in Low-Bitrate Speech Codecs","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.23325","snapshot_observed_at":"2026-08-15T15:37:36.541957Z","title":"Xy-tokenizer: Mitigating the semantic-acoustic conflict in low-bitrate speech codecs,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.19033","last_updated":"2026-07-21T12:19:38Z","snapshot_observed_at":"2026-08-20T08:57:09.823901Z","submitted_at":"2026-07-21T12:19:38Z","title":"Content is What Remains: Invariant Speech Tokenization from Parallel Utterances","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-15T15:37:36.541957Z"},"links":{"cited_paper":"/paper/2506.23325","citing_paper":"/paper/2607.19033"},"observation_digest":"sha256:48f60ff925d91f6564b94a1416399fb93d4df89d0207d621a3f5c020639d75dc","observation_id":"ecb525e6-c774-4269-aad9-03ca55301624","resolution":{"observed_at":"2026-08-15T15:37:36.541957Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2506.23325/citation-record","integrity":"/paper/2506.23325/integrity","json":"/paper/2506.23325/citation-record.json","paper":"/paper/2506.23325"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2303.08774","last_updated":"2024-03-04T06:01:33Z","snapshot_observed_at":"2026-08-17T09:58:46.058102Z","submitted_at":"2023-03-15T17:15:04Z","title":"GPT-4 Technical Report","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.08774","snapshot_observed_at":"2026-08-06T21:51:33.740032Z","title":"Gpt-4 technical report","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.23325","last_updated":"2025-07-09T17:40:35Z","snapshot_observed_at":"2026-08-17T17:41:09.789585Z","submitted_at":"2025-06-29T16:51:50Z","title":"XY-Tokenizer: Mitigating the Semantic-Acoustic Conflict in Low-Bitrate Speech Codecs","version":2},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-06T21:51:33.740032Z"},"links":{"cited_paper":"/paper/2303.08774","citing_paper":"/paper/2506.23325"},"observation_digest":"sha256:d7bdfe42015944793ec3e811e56d13dcb57475c10295ac6a845512754c6d60e6","observation_id":"3a7c3175-3b79-49de-852c-4d8effdb4a49","resolution":{"observed_at":"2026-08-06T21:51:33.740032Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.00037","last_updated":"2024-10-02T09:11:45Z","snapshot_observed_at":"2026-07-30T10:21:14.474746Z","submitted_at":"2024-09-17T17:55:39Z","title":"Moshi: a speech-text foundation model for real-time dialogue","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.00037","snapshot_observed_at":"2026-08-06T21:51:34.365210Z","title":"Moshi: a speech-text foundation model for real-time dialogue","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.23325","last_updated":"2025-07-09T17:40:35Z","snapshot_observed_at":"2026-08-17T17:41:09.789585Z","submitted_at":"2025-06-29T16:51:50Z","title":"XY-Tokenizer: Mitigating the Semantic-Acoustic Conflict in Low-Bitrate Speech Codecs","version":2},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-06T21:51:34.365210Z"},"links":{"cited_paper":"/paper/2410.00037","citing_paper":"/paper/2506.23325"},"observation_digest":"sha256:b47297f2650acc4ac33a9204f526f883c77a58b609f989286a4c6a159beb52e5","observation_id":"f8961e6d-6e17-4a20-8b2d-45e4adda53b7","resolution":{"observed_at":"2026-08-06T21:51:34.365210Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:51:40.550195Z","title":"Bert: Pre-training of deep bidirectional transformers for language understanding","venue":null,"work_id":"f4f450a1-7005-48d0-a957-2db4d993c8fa","year":2019},"citing_paper":{"arxiv_id":"2506.23325","last_updated":"2025-07-09T17:40:35Z","snapshot_observed_at":"2026-08-17T17:41:09.789585Z","submitted_at":"2025-06-29T16:51:50Z","title":"XY-Tokenizer: Mitigating the Semantic-Acoustic Conflict in Low-Bitrate Speech Codecs","version":2},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-06T21:51:34.446168Z"},"links":{"citing_paper":"/paper/2506.23325"},"observation_digest":"sha256:5bebccc5accfe8670d29808d3fc3b1c32c270f077092d40a3bda7fd3bd81168a","observation_id":"7985bc61-4f57-436e-a2a0-4ee9939435d8","resolution":{"observed_at":"2026-08-06T21:51:40.699479Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1606.08415","last_updated":"2023-06-06T01:53:32Z","snapshot_observed_at":"2026-08-13T19:48:28.322536Z","submitted_at":"2016-06-27T19:20:40Z","title":"Gaussian Error Linear Units (GELUs)","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1606.08415","snapshot_observed_at":"2026-08-06T21:51:34.904183Z","title":"Gaussian error linear units (gelus)","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.23325","last_updated":"2025-07-09T17:40:35Z","snapshot_observed_at":"2026-08-17T17:41:09.789585Z","submitted_at":"2025-06-29T16:51:50Z","title":"XY-Tokenizer: Mitigating the Semantic-Acoustic Conflict in Low-Bitrate Speech Codecs","version":2},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-06T21:51:34.904183Z"},"links":{"cited_paper":"/paper/1606.08415","citing_paper":"/paper/2506.23325"},"observation_digest":"sha256:7dcfc2418d0552b13a1624f21124c199e948840b508cdd1ae1abfbc71680b729","observation_id":"270fa8d5-7e1f-4bbb-9997-77ee954e258a","resolution":{"observed_at":"2026-08-06T21:51:34.904183Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2106.07447","last_updated":"2021-06-14T14:14:28Z","snapshot_observed_at":"2026-08-17T11:07:54.315530Z","submitted_at":"2021-06-14T14:14:28Z","title":"HuBERT: Self-Supervised Speech Representation Learning by Masked Prediction of Hidden Units","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2106.07447","snapshot_observed_at":"2026-08-06T21:51:35.040172Z","title":"Shengpeng Ji, Yifu Chen, Minghui Fang, Jialong Zuo, Jingyu Lu, Hanting Wang, Ziyue Jiang, Long Zhou, Shujie Liu, Xize Cheng, et al","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.23325","last_updated":"2025-07-09T17:40:35Z","snapshot_observed_at":"2026-08-17T17:41:09.789585Z","submitted_at":"2025-06-29T16:51:50Z","title":"XY-Tokenizer: Mitigating the Semantic-Acoustic Conflict in Low-Bitrate Speech Codecs","version":2},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-06T21:51:35.040172Z"},"links":{"cited_paper":"/paper/2106.07447","citing_paper":"/paper/2506.23325"},"observation_digest":"sha256:f2716d704a524669c207d4bbaa4023229bce95ba650cdb5693a18e8dcdd40d41","observation_id":"762248e0-df10-4ea3-ac8f-a499ded69049","resolution":{"observed_at":"2026-08-06T21:51:35.040172Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.17239","last_updated":"2025-02-24T15:16:34Z","snapshot_observed_at":"2026-08-16T12:55:42.223198Z","submitted_at":"2025-02-24T15:16:34Z","title":"Baichuan-Audio: A Unified Framework for End-to-End Speech Interaction","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.17239","snapshot_observed_at":"2026-08-06T21:51:35.263754Z","title":"Baichuan-audio: A unified framework for end-to-end speech interaction","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.23325","last_updated":"2025-07-09T17:40:35Z","snapshot_observed_at":"2026-08-17T17:41:09.789585Z","submitted_at":"2025-06-29T16:51:50Z","title":"XY-Tokenizer: Mitigating the Semantic-Acoustic Conflict in Low-Bitrate Speech Codecs","version":2},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-06T21:51:35.263754Z"},"links":{"cited_paper":"/paper/2502.17239","citing_paper":"/paper/2506.23325"},"observation_digest":"sha256:2dbd3842c01c5c1025d10dc9a6735441bd6d7020d23a56e94d8629ea6a28fcc7","observation_id":"b0168cde-54d0-420f-92bd-c76a6392a6e2","resolution":{"observed_at":"2026-08-06T21:51:35.263754Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1711.05101","last_updated":"2019-01-04T21:01:49Z","snapshot_observed_at":"2026-08-14T20:13:52.872565Z","submitted_at":"2017-11-14T14:24:06Z","title":"Decoupled Weight Decay Regularization","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1711.05101","snapshot_observed_at":"2026-08-06T21:51:35.500706Z","title":"Decoupled weight decay regularization","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.23325","last_updated":"2025-07-09T17:40:35Z","snapshot_observed_at":"2026-08-17T17:41:09.789585Z","submitted_at":"2025-06-29T16:51:50Z","title":"XY-Tokenizer: Mitigating the Semantic-Acoustic Conflict in Low-Bitrate Speech Codecs","version":2},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-06T21:51:35.500706Z"},"links":{"cited_paper":"/paper/1711.05101","citing_paper":"/paper/2506.23325"},"observation_digest":"sha256:397a658eb861fa44c9a3da45940659134475db311917c181560af0df4cf1f483","observation_id":"a1156adc-ae8c-422e-89ea-20d90a542ded","resolution":{"observed_at":"2026-08-06T21:51:35.500706Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2212.04356","last_updated":"2022-12-06T18:46:04Z","snapshot_observed_at":"2026-08-21T19:17:37.837527Z","submitted_at":"2022-12-06T18:46:04Z","title":"Robust Speech Recognition via Large-Scale Weak Supervision","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2212.04356","snapshot_observed_at":"2026-08-06T21:51:35.718054Z","title":"Samyam Rajbhandari, Jeff Rasley, Olatunji Ruwase, and Yuxiong He","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.23325","last_updated":"2025-07-09T17:40:35Z","snapshot_observed_at":"2026-08-17T17:41:09.789585Z","submitted_at":"2025-06-29T16:51:50Z","title":"XY-Tokenizer: Mitigating the Semantic-Acoustic Conflict in Low-Bitrate Speech Codecs","version":2},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-06T21:51:35.718054Z"},"links":{"cited_paper":"/paper/2212.04356","citing_paper":"/paper/2506.23325"},"observation_digest":"sha256:595bac5f2e1279e226e5e9a5893200bb41cb818f3b2b82fcc171800327f1dd6e","observation_id":"155da7b2-5768-40fa-a998-96514840291a","resolution":{"observed_at":"2026-08-06T21:51:35.718054Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:51:39.566688Z","title":"A short-time objective intelligibility measure for time-frequency weighted noisy speech","venue":null,"work_id":"e5256a2e-73d1-4490-9ab3-e09258bf24fc","year":2010},"citing_paper":{"arxiv_id":"2506.23325","last_updated":"2025-07-09T17:40:35Z","snapshot_observed_at":"2026-08-17T17:41:09.789585Z","submitted_at":"2025-06-29T16:51:50Z","title":"XY-Tokenizer: Mitigating the Semantic-Acoustic Conflict in Low-Bitrate Speech Codecs","version":2},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-06T21:51:35.979072Z"},"links":{"citing_paper":"/paper/2506.23325"},"observation_digest":"sha256:f0519a4bf4eba2aa2cab102a3a7f70a20508c2fe94a89645b016b1ef43e924f2","observation_id":"fb92abd5-8c07-4867-89f9-8af0cdb9ea6f","resolution":{"observed_at":"2026-08-06T21:51:39.721809Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2204.05409","last_updated":"2022-04-11T20:59:51Z","snapshot_observed_at":"2026-08-20T09:14:51.788701Z","submitted_at":"2022-04-11T20:59:51Z","title":"Unified Speech-Text Pre-training for Speech Translation and Recognition","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2204.05409","snapshot_observed_at":"2026-08-06T21:51:36.079536Z","title":"Ashish Vaswani, Noam Shazeer, Niki Parmar, Jakob Uszkoreit, Llion Jones, Aidan N Gomez, Łukasz Kaiser, and Illia Polosukhin","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.23325","last_updated":"2025-07-09T17:40:35Z","snapshot_observed_at":"2026-08-17T17:41:09.789585Z","submitted_at":"2025-06-29T16:51:50Z","title":"XY-Tokenizer: Mitigating the Semantic-Acoustic Conflict in Low-Bitrate Speech Codecs","version":2},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-06T21:51:36.079536Z"},"links":{"cited_paper":"/paper/2204.05409","citing_paper":"/paper/2506.23325"},"observation_digest":"sha256:b1fd0eabd62d207803bf086053d28c3941328a213c962d133d706cd61718a530","observation_id":"dc09ecda-a6e5-439a-862e-d73db211cc55","resolution":{"observed_at":"2026-08-06T21:51:36.079536Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2301.02111","last_updated":"2023-01-05T15:37:15Z","snapshot_observed_at":"2026-08-07T10:11:17.796562Z","submitted_at":"2023-01-05T15:37:15Z","title":"Neural Codec Language Models are Zero-Shot Text to Speech Synthesizers","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2301.02111","snapshot_observed_at":"2026-08-06T21:51:36.176279Z","title":"Neural codec language models are zero-shot text to speech synthesizers","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.23325","last_updated":"2025-07-09T17:40:35Z","snapshot_observed_at":"2026-08-17T17:41:09.789585Z","submitted_at":"2025-06-29T16:51:50Z","title":"XY-Tokenizer: Mitigating the Semantic-Acoustic Conflict in Low-Bitrate Speech Codecs","version":2},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-06T21:51:36.176279Z"},"links":{"cited_paper":"/paper/2301.02111","citing_paper":"/paper/2506.23325"},"observation_digest":"sha256:0ff9c90a4b47e27a0cb48e50b062068d7b68fe9c8f00f8cf00496dbb94027aed","observation_id":"294e4a4a-e8e3-4cbd-8a99-078047d1f6d8","resolution":{"observed_at":"2026-08-06T21:51:36.176279Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.13236","last_updated":"2024-02-20T18:50:25Z","snapshot_observed_at":"2026-08-20T12:20:52.955680Z","submitted_at":"2024-02-20T18:50:25Z","title":"Towards audio language modeling -- an overview","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.13236","snapshot_observed_at":"2026-08-06T21:51:36.281078Z","title":"Towards audio language modeling–an overview","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.23325","last_updated":"2025-07-09T17:40:35Z","snapshot_observed_at":"2026-08-17T17:41:09.789585Z","submitted_at":"2025-06-29T16:51:50Z","title":"XY-Tokenizer: Mitigating the Semantic-Acoustic Conflict in Low-Bitrate Speech Codecs","version":2},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-06T21:51:36.281078Z"},"links":{"cited_paper":"/paper/2402.13236","citing_paper":"/paper/2506.23325"},"observation_digest":"sha256:d14fe8e9393f8e97036136f90d4f854f29fc87f0b853278b9d188130d2ffabd3","observation_id":"429258a5-fdab-4c66-94c3-0078deb08521","resolution":{"observed_at":"2026-08-06T21:51:36.281078Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.05377","last_updated":"2024-09-09T07:18:07Z","snapshot_observed_at":"2026-08-16T20:32:23.736592Z","submitted_at":"2024-09-09T07:18:07Z","title":"BigCodec: Pushing the Limits of Low-Bitrate Neural Speech Codec","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.05377","snapshot_observed_at":"2026-08-06T21:51:36.381830Z","title":"Bigcodec: Pushing the limits of low-bitrate neural speech codec","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.23325","last_updated":"2025-07-09T17:40:35Z","snapshot_observed_at":"2026-08-17T17:41:09.789585Z","submitted_at":"2025-06-29T16:51:50Z","title":"XY-Tokenizer: Mitigating the Semantic-Acoustic Conflict in Low-Bitrate Speech Codecs","version":2},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-06T21:51:36.381830Z"},"links":{"cited_paper":"/paper/2409.05377","citing_paper":"/paper/2506.23325"},"observation_digest":"sha256:22a0dd2a9174908f03c54b5dd85e67030b3ef9eea34c4aff91789f5b2a93a870","observation_id":"8b56d155-f599-4703-a5f6-958f59f252f0","resolution":{"observed_at":"2026-08-06T21:51:36.381830Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.04128","last_updated":"2025-02-22T11:32:13Z","snapshot_observed_at":"2026-08-20T00:56:34.754853Z","submitted_at":"2025-02-06T15:04:00Z","title":"Llasa: Scaling Train-Time and Inference-Time Compute for Llama-based Speech Synthesis","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.04128","snapshot_observed_at":"2026-08-06T21:51:36.537269Z","title":"Neil Zeghidour, Alejandro Luebs, Ahmed Omran, Jan Skoglund, and Marco Tagliasacchi","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.23325","last_updated":"2025-07-09T17:40:35Z","snapshot_observed_at":"2026-08-17T17:41:09.789585Z","submitted_at":"2025-06-29T16:51:50Z","title":"XY-Tokenizer: Mitigating the Semantic-Acoustic Conflict in Low-Bitrate Speech Codecs","version":2},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-06T21:51:36.537269Z"},"links":{"cited_paper":"/paper/2502.04128","citing_paper":"/paper/2506.23325"},"observation_digest":"sha256:49578bbb945b869f08c1a6d47eac0269d2a98f03c26328eec1919178dd510fbf","observation_id":"15e22bf4-f8da-44ae-a13f-7632dbec2ef2","resolution":{"observed_at":"2026-08-06T21:51:36.537269Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.02612","last_updated":"2024-12-03T17:41:24Z","snapshot_observed_at":"2026-08-12T12:50:46.995038Z","submitted_at":"2024-12-03T17:41:24Z","title":"GLM-4-Voice: Towards Intelligent and Human-Like End-to-End Spoken Chatbot","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.02612","snapshot_observed_at":"2026-08-06T21:51:36.668481Z","title":"Glm-4-voice: Towards intelligent and human-like end-to-end spoken chatbot","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.23325","last_updated":"2025-07-09T17:40:35Z","snapshot_observed_at":"2026-08-17T17:41:09.789585Z","submitted_at":"2025-06-29T16:51:50Z","title":"XY-Tokenizer: Mitigating the Semantic-Acoustic Conflict in Low-Bitrate Speech Codecs","version":2},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-06T21:51:36.668481Z"},"links":{"cited_paper":"/paper/2412.02612","citing_paper":"/paper/2506.23325"},"observation_digest":"sha256:05e1a903ff7f7ef131da079b67d9151265ef0f386a1fcac0db2de201e4618555","observation_id":"7ed8cb77-4e20-4711-b181-e625ac32b5ec","resolution":{"observed_at":"2026-08-06T21:51:36.668481Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.11000","last_updated":"2023-05-19T14:41:16Z","snapshot_observed_at":"2026-08-19T05:23:55.031463Z","submitted_at":"2023-05-18T14:23:25Z","title":"SpeechGPT: Empowering Large Language Models with Intrinsic Cross-Modal Conversational Abilities","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.11000","snapshot_observed_at":"2026-08-06T21:51:36.827023Z","title":"Speechgpt: Empowering large language models with intrinsic cross-modal conversational abilities","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.23325","last_updated":"2025-07-09T17:40:35Z","snapshot_observed_at":"2026-08-17T17:41:09.789585Z","submitted_at":"2025-06-29T16:51:50Z","title":"XY-Tokenizer: Mitigating the Semantic-Acoustic Conflict in Low-Bitrate Speech Codecs","version":2},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-06T21:51:36.827023Z"},"links":{"cited_paper":"/paper/2305.11000","citing_paper":"/paper/2506.23325"},"observation_digest":"sha256:547ac75215214d1eb452d66febb57f4c3faf688f862c625e0c079503f0cc196e","observation_id":"f5a9656d-2e5f-47eb-8e74-63c39c1aca01","resolution":{"observed_at":"2026-08-06T21:51:36.827023Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2401.13527","last_updated":"2024-01-25T17:24:52Z","snapshot_observed_at":"2026-08-21T12:59:42.910800Z","submitted_at":"2024-01-24T15:25:01Z","title":"SpeechGPT-Gen: Scaling Chain-of-Information Speech Generation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.13527","snapshot_observed_at":"2026-08-06T21:51:36.963958Z","title":"Speechgpt-gen: Scaling chain-of-information speech generation","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.23325","last_updated":"2025-07-09T17:40:35Z","snapshot_observed_at":"2026-08-17T17:41:09.789585Z","submitted_at":"2025-06-29T16:51:50Z","title":"XY-Tokenizer: Mitigating the Semantic-Acoustic Conflict in Low-Bitrate Speech Codecs","version":2},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-06T21:51:36.963958Z"},"links":{"cited_paper":"/paper/2401.13527","citing_paper":"/paper/2506.23325"},"observation_digest":"sha256:7b5bce22315fccd0f5192e28b5ef11dddcc299caa3fb4c30c13e6f813950c02f","observation_id":"371d1574-2abe-408c-bb78-31d12a2e3bb2","resolution":{"observed_at":"2026-08-06T21:51:36.963958Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:51:39.237488Z","title":"Each adapter consists of a 4-layer Transformer with a hidden dimension of 768, a feed-forward network (FFN) dimension of 3072, and 12 attention heads","venue":null,"work_id":"ade52f7e-a2c3-4eb8-a0a4-a8eac8e20cea","year":2016},"citing_paper":{"arxiv_id":"2506.23325","last_updated":"2025-07-09T17:40:35Z","snapshot_observed_at":"2026-08-17T17:41:09.789585Z","submitted_at":"2025-06-29T16:51:50Z","title":"XY-Tokenizer: Mitigating the Semantic-Acoustic Conflict in Low-Bitrate Speech Codecs","version":2},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-06T21:51:37.038424Z"},"links":{"citing_paper":"/paper/2506.23325"},"observation_digest":"sha256:36170bb7ad494eb54c9f1972a0abf103ea037671d01dbf97d864fc26d07f12a1","observation_id":"7a83db08-20cf-467e-848d-1b4ae1d757d6","resolution":{"observed_at":"2026-08-06T21:51:39.368558Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:51:38.987840Z","title":null,"venue":null,"work_id":"8f17dc8c-ec17-4692-a517-50782a2f04b5","year":2020},"citing_paper":{"arxiv_id":"2506.23325","last_updated":"2025-07-09T17:40:35Z","snapshot_observed_at":"2026-08-17T17:41:09.789585Z","submitted_at":"2025-06-29T16:51:50Z","title":"XY-Tokenizer: Mitigating the Semantic-Acoustic Conflict in Low-Bitrate Speech Codecs","version":2},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-06T21:51:37.085694Z"},"links":{"citing_paper":"/paper/2506.23325"},"observation_digest":"sha256:4b501a84fa33b08de5d53217bd0a31cc67a7dd5e97267f299dfc6f341fe75768","observation_id":"23b56d3a-3cde-4619-98e9-be2d5bfde1ba","resolution":{"observed_at":"2026-08-06T21:51:39.100411Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:51:38.753985Z","title":null,"venue":null,"work_id":"c58628de-304f-48a6-8b83-0505287f6be5","year":2023},"citing_paper":{"arxiv_id":"2506.23325","last_updated":"2025-07-09T17:40:35Z","snapshot_observed_at":"2026-08-17T17:41:09.789585Z","submitted_at":"2025-06-29T16:51:50Z","title":"XY-Tokenizer: Mitigating the Semantic-Acoustic Conflict in Low-Bitrate Speech Codecs","version":2},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-06T21:51:37.144477Z"},"links":{"citing_paper":"/paper/2506.23325"},"observation_digest":"sha256:5656ff5e8c7ab2b6efe09af01ff24e44ff1244c85eef9c34fb4c3306f137b8d4","observation_id":"3073077d-3b1a-420a-ad5f-7af336c8af43","resolution":{"observed_at":"2026-08-06T21:51:38.871784Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:51:38.514848Z","title":null,"venue":null,"work_id":"d0d3550b-accc-4106-b73e-40367f4738f3","year":2023},"citing_paper":{"arxiv_id":"2506.23325","last_updated":"2025-07-09T17:40:35Z","snapshot_observed_at":"2026-08-17T17:41:09.789585Z","submitted_at":"2025-06-29T16:51:50Z","title":"XY-Tokenizer: Mitigating the Semantic-Acoustic Conflict in Low-Bitrate Speech Codecs","version":2},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-06T21:51:37.218866Z"},"links":{"citing_paper":"/paper/2506.23325"},"observation_digest":"sha256:22f125524a0a5e59013ac78ba9154cbbfb9c71aef794a7a8073ae138eb5268bc","observation_id":"1daa3878-b8a5-4747-b686-b452da095a2d","resolution":{"observed_at":"2026-08-06T21:51:38.588276Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:51:38.280729Z","title":"foreign language","venue":null,"work_id":"14a90db3-97b2-4631-b9e6-94ae6c5a8c84","year":2021},"citing_paper":{"arxiv_id":"2506.23325","last_updated":"2025-07-09T17:40:35Z","snapshot_observed_at":"2026-08-17T17:41:09.789585Z","submitted_at":"2025-06-29T16:51:50Z","title":"XY-Tokenizer: Mitigating the Semantic-Acoustic Conflict in Low-Bitrate Speech Codecs","version":2},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-06T21:51:37.333548Z"},"links":{"citing_paper":"/paper/2506.23325"},"observation_digest":"sha256:d864a311a4023fd33aeb64e9771121b9f07dad0cbbc2b3b7645b7fb1c9c36088","observation_id":"a0053048-6b25-49ee-a7e9-30d98e65bab3","resolution":{"observed_at":"2026-08-06T21:51:38.436659Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:51:38.063965Z","title":null,"venue":null,"work_id":"32bd2f5f-0566-4134-a3de-f9f176d78529","year":2022},"citing_paper":{"arxiv_id":"2506.23325","last_updated":"2025-07-09T17:40:35Z","snapshot_observed_at":"2026-08-17T17:41:09.789585Z","submitted_at":"2025-06-29T16:51:50Z","title":"XY-Tokenizer: Mitigating the Semantic-Acoustic Conflict in Low-Bitrate Speech Codecs","version":2},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-06T21:51:37.442979Z"},"links":{"citing_paper":"/paper/2506.23325"},"observation_digest":"sha256:ceb32f2c5da8e6081cb2382eb451fbc0bf491bfdb439d64c5080f1702461e5a4","observation_id":"39b1a29b-a44c-43b1-9016-faed2ed8dca4","resolution":{"observed_at":"2026-08-06T21:51:38.167437Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2306.00814","last_updated":"2024-05-29T14:21:47Z","snapshot_observed_at":"2026-08-18T17:50:53.134857Z","submitted_at":"2023-06-01T15:40:32Z","title":"Vocos: Closing the gap between time-domain and Fourier-based neural vocoders for high-quality audio synthesis","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.00814","snapshot_observed_at":"2026-08-06T21:51:35.862909Z","title":"V ocos: Closing the gap between time-domain and fourier-based neural vocoders for high-quality audio synthesis","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.23325","last_updated":"2025-07-09T17:40:35Z","snapshot_observed_at":"2026-08-17T17:41:09.789585Z","submitted_at":"2025-06-29T16:51:50Z","title":"XY-Tokenizer: Mitigating the Semantic-Acoustic Conflict in Low-Bitrate Speech Codecs","version":2},"reference_index":2001,"source":"pdf_text","source_observed_at":"2026-08-06T21:51:35.862909Z"},"links":{"cited_paper":"/paper/2306.00814","citing_paper":"/paper/2506.23325"},"observation_digest":"sha256:63fe8615a32e39c21e90216848f388d70de092122801bb607b29c2f952dceebf","observation_id":"16507183-20b4-4104-8119-91ffd070184e","resolution":{"observed_at":"2026-08-06T21:51:35.862909Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:51:40.239548Z","title":"Emilia: An extensive, multilingual, and diverse speech dataset for large-scale speech generation","venue":null,"work_id":"911822c8-8991-4008-a055-78738da1ca3b","year":2024},"citing_paper":{"arxiv_id":"2506.23325","last_updated":"2025-07-09T17:40:35Z","snapshot_observed_at":"2026-08-17T17:41:09.789585Z","submitted_at":"2025-06-29T16:51:50Z","title":"XY-Tokenizer: Mitigating the Semantic-Acoustic Conflict in Low-Bitrate Speech Codecs","version":2},"reference_index":2006,"source":"pdf_text","source_observed_at":"2026-08-06T21:51:34.773420Z"},"links":{"citing_paper":"/paper/2506.23325"},"observation_digest":"sha256:f3e24a1b66d1adb5deff39931ace7981b157d0c81164a75eb2262fbf823c8b74","observation_id":"390e4e58-c607-483b-91c9-a4730a8080ce","resolution":{"observed_at":"2026-08-06T21:51:40.385701Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:51:35.623910Z","title":"Librispeech: an asr corpus based on public domain audio books","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2506.23325","last_updated":"2025-07-09T17:40:35Z","snapshot_observed_at":"2026-08-17T17:41:09.789585Z","submitted_at":"2025-06-29T16:51:50Z","title":"XY-Tokenizer: Mitigating the Semantic-Acoustic Conflict in Low-Bitrate Speech Codecs","version":2},"reference_index":2017,"source":"pdf_text","source_observed_at":"2026-08-06T21:51:35.623910Z"},"links":{"citing_paper":"/paper/2506.23325"},"observation_digest":"sha256:776a3fc45f916c5bb11c57d8b7862c2162c45693ad56ccdb354223077e940470","observation_id":"b842017e-59b4-4f45-a7c8-c50e5b39e8aa","resolution":{"observed_at":"2026-08-06T21:51:35.623910Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.18425","last_updated":"2025-04-25T15:31:46Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-04-25T15:31:46Z","title":"Kimi-Audio Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.18425","snapshot_observed_at":"2026-08-06T21:51:34.544816Z","title":"Kimi-audio technical report","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.23325","last_updated":"2025-07-09T17:40:35Z","snapshot_observed_at":"2026-08-17T17:41:09.789585Z","submitted_at":"2025-06-29T16:51:50Z","title":"XY-Tokenizer: Mitigating the Semantic-Acoustic Conflict in Low-Bitrate Speech Codecs","version":2},"reference_index":2019,"source":"pdf_text","source_observed_at":"2026-08-06T21:51:34.544816Z"},"links":{"cited_paper":"/paper/2504.18425","citing_paper":"/paper/2506.23325"},"observation_digest":"sha256:c7dcfd478b383a53916e92651e93568bd70a2f2e262b72964f446d23e5501562","observation_id":"d2c491a1-b8c1-4810-8c63-8db7a26621c1","resolution":{"observed_at":"2026-08-06T21:51:34.544816Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:51:39.901145Z","title":"Perceptual evaluation of speech quality (pesq)-a new method for speech quality assessment of telephone networks and codecs","venue":null,"work_id":"058b6d77-ccf1-40c6-b4b7-9e6494412a96","year":2001},"citing_paper":{"arxiv_id":"2506.23325","last_updated":"2025-07-09T17:40:35Z","snapshot_observed_at":"2026-08-17T17:41:09.789585Z","submitted_at":"2025-06-29T16:51:50Z","title":"XY-Tokenizer: Mitigating the Semantic-Acoustic Conflict in Low-Bitrate Speech Codecs","version":2},"reference_index":2020,"source":"pdf_text","source_observed_at":"2026-08-06T21:51:35.819686Z"},"links":{"citing_paper":"/paper/2506.23325"},"observation_digest":"sha256:ad0fbc0483885123f3127ddd5362b1906ae432b5e8abd051682fa5ac641969b3","observation_id":"000e211a-5b01-4ec4-a8c4-6173650183aa","resolution":{"observed_at":"2026-08-06T21:51:40.055159Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2210.13438","last_updated":"2022-10-24T17:52:02Z","snapshot_observed_at":"2026-08-15T04:43:16.361751Z","submitted_at":"2022-10-24T17:52:02Z","title":"High Fidelity Neural Audio Compression","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2210.13438","snapshot_observed_at":"2026-08-06T21:51:34.229293Z","title":"High fidelity neural audio compression","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.23325","last_updated":"2025-07-09T17:40:35Z","snapshot_observed_at":"2026-08-17T17:41:09.789585Z","submitted_at":"2025-06-29T16:51:50Z","title":"XY-Tokenizer: Mitigating the Semantic-Acoustic Conflict in Low-Bitrate Speech Codecs","version":2},"reference_index":2021,"source":"pdf_text","source_observed_at":"2026-08-06T21:51:34.229293Z"},"links":{"cited_paper":"/paper/2210.13438","citing_paper":"/paper/2506.23325"},"observation_digest":"sha256:6c72f721a8a72ea7d22ad92c0154f60b6763ab8fc07917dcb74fc7a2dc7e3190","observation_id":"7959a35b-01db-44b9-aa0f-728901b69685","resolution":{"observed_at":"2026-08-06T21:51:34.229293Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:51:33.872073Z","title":"doi: 10.1109/jstsp.2022.3188113","venue":null,"work_id":null,"year":1941},"citing_paper":{"arxiv_id":"2506.23325","last_updated":"2025-07-09T17:40:35Z","snapshot_observed_at":"2026-08-17T17:41:09.789585Z","submitted_at":"2025-06-29T16:51:50Z","title":"XY-Tokenizer: Mitigating the Semantic-Acoustic Conflict in Low-Bitrate Speech Codecs","version":2},"reference_index":2022,"source":"pdf_text","source_observed_at":"2026-08-06T21:51:33.872073Z"},"links":{"citing_paper":"/paper/2506.23325"},"observation_digest":"sha256:8acf6d07095d5538b08af9b0ea8a39bbcc6bc8fb7284c78238b53298e002f00d","observation_id":"19ff56c0-2839-46fa-9e34-4f9a7d54da0f","resolution":{"observed_at":"2026-08-06T21:51:33.872073Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2308.12792","last_updated":"2023-09-22T01:44:46Z","snapshot_observed_at":"2026-08-18T23:30:52.275198Z","submitted_at":"2023-08-24T13:47:16Z","title":"Sparks of Large Audio Models: A Survey and Outlook","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2308.12792","snapshot_observed_at":"2026-08-06T21:51:35.148862Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.23325","last_updated":"2025-07-09T17:40:35Z","snapshot_observed_at":"2026-08-17T17:41:09.789585Z","submitted_at":"2025-06-29T16:51:50Z","title":"XY-Tokenizer: Mitigating the Semantic-Acoustic Conflict in Low-Bitrate Speech Codecs","version":2},"reference_index":2023,"source":"pdf_text","source_observed_at":"2026-08-06T21:51:35.148862Z"},"links":{"cited_paper":"/paper/2308.12792","citing_paper":"/paper/2506.23325"},"observation_digest":"sha256:81da7ae72c910957f69f00bcd1bdbb5068221cd059342b1bb5784d989b7be32b","observation_id":"b81e8bff-6915-42ea-a251-eb248a06c311","resolution":{"observed_at":"2026-08-06T21:51:35.148862Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:51:40.892606Z","title":"W2v-bert: Combining contrastive learning and masked language modeling for self-supervised speech pre-training","venue":null,"work_id":"336f71fc-4646-4f76-961a-8e731d4044c9","year":2021},"citing_paper":{"arxiv_id":"2506.23325","last_updated":"2025-07-09T17:40:35Z","snapshot_observed_at":"2026-08-17T17:41:09.789585Z","submitted_at":"2025-06-29T16:51:50Z","title":"XY-Tokenizer: Mitigating the Semantic-Acoustic Conflict in Low-Bitrate Speech Codecs","version":2},"reference_index":2024,"source":"pdf_text","source_observed_at":"2026-08-06T21:51:34.082036Z"},"links":{"citing_paper":"/paper/2506.23325"},"observation_digest":"sha256:c624f1ee53b4e6aed05a44f90770a075011137f4b2c3543029f9d7513f7e4d93","observation_id":"891805ed-fab5-43a8-8948-f4277db70652","resolution":{"observed_at":"2026-08-06T21:51:40.999128Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2210.02747","last_updated":"2023-02-08T15:46:05Z","snapshot_observed_at":"2026-08-16T02:30:42.660030Z","submitted_at":"2022-10-06T08:32:20Z","title":"Flow Matching for Generative Modeling","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2210.02747","snapshot_observed_at":"2026-08-06T21:51:35.387371Z","title":"Flow matching for generative modeling","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.23325","last_updated":"2025-07-09T17:40:35Z","snapshot_observed_at":"2026-08-17T17:41:09.789585Z","submitted_at":"2025-06-29T16:51:50Z","title":"XY-Tokenizer: Mitigating the Semantic-Acoustic Conflict in Low-Bitrate Speech Codecs","version":2},"reference_index":2025,"source":"pdf_text","source_observed_at":"2026-08-06T21:51:35.387371Z"},"links":{"cited_paper":"/paper/2210.02747","citing_paper":"/paper/2506.23325"},"observation_digest":"sha256:32bd5ca72fd58512ed502382801fc5969a28495fbd51dd8960abcbf2b5eb997a","observation_id":"5b8dfb06-9aca-4ad5-ab64-86ced8db648f","resolution":{"observed_at":"2026-08-06T21:51:35.387371Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2506.23325","last_updated":"2025-07-09T17:40:35Z","latest_version":2,"primary_category":"cs.SD","snapshot_observed_at":"2026-08-17T17:41:09.789585Z","submitted_at":"2025-06-29T16:51:50Z","title":"XY-Tokenizer: Mitigating the Semantic-Acoustic Conflict in Low-Bitrate Speech Codecs"},"reference_resolution":{"displayed":33,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":26,"verified_exact":0,"verified_fuzzy":7},"total_outbound_references":33},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"thesis":"As of 22 August 2026, this Paper Citation Record lists 33 of 33 outbound references and 9 inbound Pith citation observations for arXiv:2506.23325."}