{"as_of":"2026-08-10T14:36:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:5e8e8da9b29236f576b0455f2f214eec381af6d85babb8ac9819437512288417","coverage":[{"denominator":36,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":36,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T12:29:42.730075Z","state":"measured"},{"denominator":38,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":38,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-10T06:31:04.303077+00:00","state":"measured"},{"denominator":2,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":2,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T12:29:38.143308Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-07-03T12:58:08.378519Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2505.24314","last_updated":"2025-05-30T07:53:01Z","snapshot_observed_at":"2026-08-10T04:01:32.887991Z","submitted_at":"2025-05-30T07:53:01Z","title":"DS-Codec: Dual-Stage Training with Mirror-to-NonMirror Architecture Switching for Speech Codec","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.24314","snapshot_observed_at":"2026-08-07T12:29:38.143308Z","title":"Model Architecture The overall framework of our model adopts a non-mirrored ar- chitecture, as illustrated in Figure 1","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.24314","last_updated":"2025-05-30T07:53:01Z","snapshot_observed_at":"2026-08-10T04:01:32.887991Z","submitted_at":"2025-05-30T07:53:01Z","title":"DS-Codec: Dual-Stage Training with Mirror-to-NonMirror Architecture Switching for Speech Codec","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-07T12:29:38.143308Z"},"links":{"cited_paper":"/paper/2505.24314","citing_paper":"/paper/2505.24314"},"observation_digest":"sha256:cdb60543b05c1336358f008ac4f8e04b1962b0daf16ea1230182b249c391173f","observation_id":"76b3dc45-1f91-4739-b897-3356dcbba6c3","resolution":{"observed_at":"2026-08-07T12:29:38.143308Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.24314","last_updated":"2025-05-30T07:53:01Z","snapshot_observed_at":"2026-08-10T04:01:32.887991Z","submitted_at":"2025-05-30T07:53:01Z","title":"DS-Codec: Dual-Stage Training with Mirror-to-NonMirror Architecture Switching for Speech Codec","version":1},"cited_work":{"arxiv_id":"2505.24314","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2505.24314","snapshot_observed_at":"2026-07-03T12:58:08.378519Z","title":"Ds-codec: Dual-stage training with mirror-to- nonmirror architecture switching for speech codec,","venue":null,"work_id":"391e75f7-4374-49d2-9005-2e560921b711","year":2025},"citing_paper":{"arxiv_id":"2606.11611","last_updated":"2026-06-10T03:23:21Z","snapshot_observed_at":"2026-08-02T19:31:55.030656Z","submitted_at":"2026-06-10T03:23:21Z","title":"SARA: A Dual-Stream VAE for High-Fidelity Speech Generation via Integrating Semantic and Acoustic Representations","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-06-27T08:38:51.371500Z"},"links":{"cited_paper":"/paper/2505.24314","citing_paper":"/paper/2606.11611"},"observation_digest":"sha256:79b707f94285942a32e96af303f83188290fea45e61614ef4a4cc91afcdc5735","observation_id":"8fceee68-b136-429c-92a9-30fb9d09d7bd","resolution":{"observed_at":"2026-07-03T12:58:08.380228Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2505.24314/citation-record","integrity":"/paper/2505.24314/integrity","json":"/paper/2505.24314/citation-record.json","paper":"/paper/2505.24314"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:29:45.328674Z","title":"A pivotal challenge is the transformation of continuous speech signals into interpretable representations suitable for inference and training within large language models","venue":null,"work_id":"616b5d87-cbf3-47c7-930f-29d7380bf293","year":null},"citing_paper":{"arxiv_id":"2505.24314","last_updated":"2025-05-30T07:53:01Z","snapshot_observed_at":"2026-08-10T04:01:32.887991Z","submitted_at":"2025-05-30T07:53:01Z","title":"DS-Codec: Dual-Stage Training with Mirror-to-NonMirror Architecture Switching for Speech Codec","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-07T12:29:38.015315Z"},"links":{"citing_paper":"/paper/2505.24314"},"observation_digest":"sha256:c17413f3cbef7c46ad1492da7b5fa86bf71a605b4bd823562963e6dcd1ab6779","observation_id":"2fa164f2-80ec-4a8d-b819-b94dfee2e5c0","resolution":{"observed_at":"2026-08-07T12:29:45.426994Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.24314","last_updated":"2025-05-30T07:53:01Z","snapshot_observed_at":"2026-08-10T04:01:32.887991Z","submitted_at":"2025-05-30T07:53:01Z","title":"DS-Codec: Dual-Stage Training with Mirror-to-NonMirror Architecture Switching for Speech Codec","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.24314","snapshot_observed_at":"2026-08-07T12:29:38.143308Z","title":"Model Architecture The overall framework of our model adopts a non-mirrored ar- chitecture, as illustrated in Figure 1","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.24314","last_updated":"2025-05-30T07:53:01Z","snapshot_observed_at":"2026-08-10T04:01:32.887991Z","submitted_at":"2025-05-30T07:53:01Z","title":"DS-Codec: Dual-Stage Training with Mirror-to-NonMirror Architecture Switching for Speech Codec","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-07T12:29:38.143308Z"},"links":{"cited_paper":"/paper/2505.24314","citing_paper":"/paper/2505.24314"},"observation_digest":"sha256:cdb60543b05c1336358f008ac4f8e04b1962b0daf16ea1230182b249c391173f","observation_id":"76b3dc45-1f91-4739-b897-3356dcbba6c3","resolution":{"observed_at":"2026-08-07T12:29:38.143308Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:29:45.118824Z","title":"Dataset and Metrics We use LibriSpeech [27] to train the speech codec we proposed","venue":null,"work_id":"9c5e201b-8b64-483c-a147-cea599b5580a","year":2000},"citing_paper":{"arxiv_id":"2505.24314","last_updated":"2025-05-30T07:53:01Z","snapshot_observed_at":"2026-08-10T04:01:32.887991Z","submitted_at":"2025-05-30T07:53:01Z","title":"DS-Codec: Dual-Stage Training with Mirror-to-NonMirror Architecture Switching for Speech Codec","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-07T12:29:38.356758Z"},"links":{"citing_paper":"/paper/2505.24314"},"observation_digest":"sha256:3384805e5b662ab70ace2087d6d4d2673a7c525b86da62e77c9d56264278f35b","observation_id":"c0c0a5dc-6434-47c6-b322-762abc0e66cd","resolution":{"observed_at":"2026-08-07T12:29:45.216566Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:29:44.921212Z","title":null,"venue":null,"work_id":"9df4bcdc-9abd-48cf-b7f4-16b2031b2f10","year":null},"citing_paper":{"arxiv_id":"2505.24314","last_updated":"2025-05-30T07:53:01Z","snapshot_observed_at":"2026-08-10T04:01:32.887991Z","submitted_at":"2025-05-30T07:53:01Z","title":"DS-Codec: Dual-Stage Training with Mirror-to-NonMirror Architecture Switching for Speech Codec","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-07T12:29:38.550836Z"},"links":{"citing_paper":"/paper/2505.24314"},"observation_digest":"sha256:51e70fa0638a5ea4a81fc9a4470fe0a23b7ce6803fb68c1b7b10cc248987d4ef","observation_id":"50daa269-e8bb-427e-85fa-e338e3a0802c","resolution":{"observed_at":"2026-08-07T12:29:45.003225Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:29:38.724956Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.24314","last_updated":"2025-05-30T07:53:01Z","snapshot_observed_at":"2026-08-10T04:01:32.887991Z","submitted_at":"2025-05-30T07:53:01Z","title":"DS-Codec: Dual-Stage Training with Mirror-to-NonMirror Architecture Switching for Speech Codec","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-07T12:29:38.724956Z"},"links":{"citing_paper":"/paper/2505.24314"},"observation_digest":"sha256:9a9bfa2216646d12e0573443f9058a92c0fc63159ab5304af6fb432c3fd8fb36","observation_id":"135c561d-84a1-4b24-ad73-6fd213a3eb8b","resolution":{"observed_at":"2026-08-07T12:29:38.724956Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2303.08774","last_updated":"2024-03-04T06:01:33Z","snapshot_observed_at":"2026-08-07T07:30:12.213965Z","submitted_at":"2023-03-15T17:15:04Z","title":"GPT-4 Technical Report","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.08774","snapshot_observed_at":"2026-08-07T12:29:38.877708Z","title":"Gpt-4 technical report,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.24314","last_updated":"2025-05-30T07:53:01Z","snapshot_observed_at":"2026-08-10T04:01:32.887991Z","submitted_at":"2025-05-30T07:53:01Z","title":"DS-Codec: Dual-Stage Training with Mirror-to-NonMirror Architecture Switching for Speech Codec","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-07T12:29:38.877708Z"},"links":{"cited_paper":"/paper/2303.08774","citing_paper":"/paper/2505.24314"},"observation_digest":"sha256:e9fcf588ae3172beeff5890dad9e30653bf8d8da53cebaf447d9f7cc72596e01","observation_id":"c93301bc-58d4-4e4a-895d-74c5133d163b","resolution":{"observed_at":"2026-08-07T12:29:38.877708Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.21276","last_updated":"2024-10-25T17:43:01Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-10-25T17:43:01Z","title":"GPT-4o System Card","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.21276","snapshot_observed_at":"2026-08-07T12:29:38.995350Z","title":"Gpt-4o system card,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.24314","last_updated":"2025-05-30T07:53:01Z","snapshot_observed_at":"2026-08-10T04:01:32.887991Z","submitted_at":"2025-05-30T07:53:01Z","title":"DS-Codec: Dual-Stage Training with Mirror-to-NonMirror Architecture Switching for Speech Codec","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-07T12:29:38.995350Z"},"links":{"cited_paper":"/paper/2410.21276","citing_paper":"/paper/2505.24314"},"observation_digest":"sha256:680462c55b42fc86a5cf9553de4f42fe2367d94539bac47eb81ce84dc969d829","observation_id":"df8710a3-de5f-4dc5-a521-9e6086b4050e","resolution":{"observed_at":"2026-08-07T12:29:38.995350Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2301.02111","last_updated":"2023-01-05T15:37:15Z","snapshot_observed_at":"2026-08-07T10:11:17.796562Z","submitted_at":"2023-01-05T15:37:15Z","title":"Neural Codec Language Models are Zero-Shot Text to Speech Synthesizers","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2301.02111","snapshot_observed_at":"2026-08-07T12:29:39.170430Z","title":"Neural codec language mod- els are zero-shot text to speech synthesizers,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.24314","last_updated":"2025-05-30T07:53:01Z","snapshot_observed_at":"2026-08-10T04:01:32.887991Z","submitted_at":"2025-05-30T07:53:01Z","title":"DS-Codec: Dual-Stage Training with Mirror-to-NonMirror Architecture Switching for Speech Codec","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-07T12:29:39.170430Z"},"links":{"cited_paper":"/paper/2301.02111","citing_paper":"/paper/2505.24314"},"observation_digest":"sha256:1ebb159494af6069ec908bbcc325e72b90090c74c80d450f68917c429238cbc4","observation_id":"66668e64-fd4e-4e02-80ef-9a0e7aedb0c6","resolution":{"observed_at":"2026-08-07T12:29:39.170430Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:29:44.703422Z","title":"Audiolm: a language modeling approach to audio gener- ation,","venue":null,"work_id":"c71ba3f7-d28c-4a3a-bec8-03106216e0b6","year":2023},"citing_paper":{"arxiv_id":"2505.24314","last_updated":"2025-05-30T07:53:01Z","snapshot_observed_at":"2026-08-10T04:01:32.887991Z","submitted_at":"2025-05-30T07:53:01Z","title":"DS-Codec: Dual-Stage Training with Mirror-to-NonMirror Architecture Switching for Speech Codec","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-07T12:29:39.311348Z"},"links":{"citing_paper":"/paper/2505.24314"},"observation_digest":"sha256:defe090ebb81b6bb948b7380fcd9ede3566e3f286160d32d099463ea9c1540ea","observation_id":"4d20e720-c46f-429d-940e-18ebc9537d45","resolution":{"observed_at":"2026-08-07T12:29:44.799493Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2209.15352","last_updated":"2023-03-05T09:14:16Z","snapshot_observed_at":"2026-08-07T16:54:38.689558Z","submitted_at":"2022-09-30T10:17:05Z","title":"AudioGen: Textually Guided Audio Generation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2209.15352","snapshot_observed_at":"2026-08-07T12:29:39.487610Z","title":"Audiogen: Textu- ally guided audio generation,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2505.24314","last_updated":"2025-05-30T07:53:01Z","snapshot_observed_at":"2026-08-10T04:01:32.887991Z","submitted_at":"2025-05-30T07:53:01Z","title":"DS-Codec: Dual-Stage Training with Mirror-to-NonMirror Architecture Switching for Speech Codec","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-07T12:29:39.487610Z"},"links":{"cited_paper":"/paper/2209.15352","citing_paper":"/paper/2505.24314"},"observation_digest":"sha256:67c551edca7fedc3795095b09a33f12c2d94ed9affc4c31e88863bf71cd1c653","observation_id":"dd6f89eb-99a1-4a4f-b2c3-2541d03efd3c","resolution":{"observed_at":"2026-08-07T12:29:39.487610Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:29:44.412900Z","title":"Slim- speech: Lightweight and efficient text-to-speech with slim recti- fied flow,","venue":null,"work_id":"d2aa0a18-c230-47d4-802d-17fc58852f15","year":2025},"citing_paper":{"arxiv_id":"2505.24314","last_updated":"2025-05-30T07:53:01Z","snapshot_observed_at":"2026-08-10T04:01:32.887991Z","submitted_at":"2025-05-30T07:53:01Z","title":"DS-Codec: Dual-Stage Training with Mirror-to-NonMirror Architecture Switching for Speech Codec","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-07T12:29:39.605523Z"},"links":{"citing_paper":"/paper/2505.24314"},"observation_digest":"sha256:05a30038930876f37089d1c97e201eb92ac909ed37781dd4682e5c445c0bd42c","observation_id":"52a05e72-d8c6-460b-8948-185223fca620","resolution":{"observed_at":"2026-08-07T12:29:44.553668Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:29:39.703511Z","title":"wav2vec 2.0: A framework for self-supervised learning of speech repre- sentations,","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2505.24314","last_updated":"2025-05-30T07:53:01Z","snapshot_observed_at":"2026-08-10T04:01:32.887991Z","submitted_at":"2025-05-30T07:53:01Z","title":"DS-Codec: Dual-Stage Training with Mirror-to-NonMirror Architecture Switching for Speech Codec","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-07T12:29:39.703511Z"},"links":{"citing_paper":"/paper/2505.24314"},"observation_digest":"sha256:379e75506f3166da562ea28fabe8961af8c9e7d1df3ad43daadede0ab2ba1ed0","observation_id":"8aed8f60-4168-402d-833e-330fb7cca6b2","resolution":{"observed_at":"2026-08-07T12:29:39.703511Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1904.05862","last_updated":"2019-09-11T08:19:49Z","snapshot_observed_at":"2026-08-06T05:33:37.746688Z","submitted_at":"2019-04-11T17:29:30Z","title":"wav2vec: Unsupervised Pre-training for Speech Recognition","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1904.05862","snapshot_observed_at":"2026-08-07T12:29:39.796888Z","title":"wav2vec: Unsupervised pre-training for speech recognition,","venue":null,"work_id":null,"year":1904},"citing_paper":{"arxiv_id":"2505.24314","last_updated":"2025-05-30T07:53:01Z","snapshot_observed_at":"2026-08-10T04:01:32.887991Z","submitted_at":"2025-05-30T07:53:01Z","title":"DS-Codec: Dual-Stage Training with Mirror-to-NonMirror Architecture Switching for Speech Codec","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-07T12:29:39.796888Z"},"links":{"cited_paper":"/paper/1904.05862","citing_paper":"/paper/2505.24314"},"observation_digest":"sha256:049e6e8a76fe17d5b3cad357cfdb95da5cf52fdfa4ed3f7f6099d233fa5f9388","observation_id":"e7f091b9-a0e6-4a24-993f-f5a1d4d7890b","resolution":{"observed_at":"2026-08-07T12:29:39.796888Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:29:39.892248Z","title":"Hubert: Self-supervised speech represen- tation learning by masked prediction of hidden units,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2505.24314","last_updated":"2025-05-30T07:53:01Z","snapshot_observed_at":"2026-08-10T04:01:32.887991Z","submitted_at":"2025-05-30T07:53:01Z","title":"DS-Codec: Dual-Stage Training with Mirror-to-NonMirror Architecture Switching for Speech Codec","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-07T12:29:39.892248Z"},"links":{"citing_paper":"/paper/2505.24314"},"observation_digest":"sha256:dc2612084d9580016d6df699ea5356b2d515116647e711703e0abb2a3cbd53f3","observation_id":"7fbe07b5-6546-48b6-b90f-3772504bdf95","resolution":{"observed_at":"2026-08-07T12:29:39.892248Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:29:44.203132Z","title":"Neural discrete represen- tation learning,","venue":null,"work_id":"8fd2f2c3-7c4b-4e45-a05e-875c0e01a23b","year":2017},"citing_paper":{"arxiv_id":"2505.24314","last_updated":"2025-05-30T07:53:01Z","snapshot_observed_at":"2026-08-10T04:01:32.887991Z","submitted_at":"2025-05-30T07:53:01Z","title":"DS-Codec: Dual-Stage Training with Mirror-to-NonMirror Architecture Switching for Speech Codec","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-07T12:29:39.994883Z"},"links":{"citing_paper":"/paper/2505.24314"},"observation_digest":"sha256:0ff3af989ab220001e5e38cc8bfe8cce023a8c259fc8170029519df96eafe6b6","observation_id":"78a5e2e8-1abb-47ea-85e7-721a5bb96f9d","resolution":{"observed_at":"2026-08-07T12:29:44.307824Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:29:40.070603Z","title":"Soundstream: An end-to-end neural audio codec,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2505.24314","last_updated":"2025-05-30T07:53:01Z","snapshot_observed_at":"2026-08-10T04:01:32.887991Z","submitted_at":"2025-05-30T07:53:01Z","title":"DS-Codec: Dual-Stage Training with Mirror-to-NonMirror Architecture Switching for Speech Codec","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-07T12:29:40.070603Z"},"links":{"citing_paper":"/paper/2505.24314"},"observation_digest":"sha256:85ef628b8e3340f17e8c6dd78f1bfaf58612956048c96da2caae33d6d4f1495e","observation_id":"2523b863-a545-4f77-a382-86958b415664","resolution":{"observed_at":"2026-08-07T12:29:40.070603Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:29:40.192413Z","title":"A review of vector quantization tech- niques,","venue":null,"work_id":null,"year":2006},"citing_paper":{"arxiv_id":"2505.24314","last_updated":"2025-05-30T07:53:01Z","snapshot_observed_at":"2026-08-10T04:01:32.887991Z","submitted_at":"2025-05-30T07:53:01Z","title":"DS-Codec: Dual-Stage Training with Mirror-to-NonMirror Architecture Switching for Speech Codec","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-07T12:29:40.192413Z"},"links":{"citing_paper":"/paper/2505.24314"},"observation_digest":"sha256:a4cb720bcb5d66752bb40618a71653ed5275a3bfbb3e0a44fa8475a7a308a55c","observation_id":"c6b6e291-50a2-419b-bda5-1d403f010a1e","resolution":{"observed_at":"2026-08-07T12:29:40.192413Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:29:40.359010Z","title":"High-fidelity audio compression with improved rvqgan,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.24314","last_updated":"2025-05-30T07:53:01Z","snapshot_observed_at":"2026-08-10T04:01:32.887991Z","submitted_at":"2025-05-30T07:53:01Z","title":"DS-Codec: Dual-Stage Training with Mirror-to-NonMirror Architecture Switching for Speech Codec","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-07T12:29:40.359010Z"},"links":{"citing_paper":"/paper/2505.24314"},"observation_digest":"sha256:f5b246810fde9a1ac32fb01eb5eb1985f6258dcf38a34618588ee4daa7163da6","observation_id":"4f05c427-1b02-471e-9010-8995781d9162","resolution":{"observed_at":"2026-08-07T12:29:40.359010Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2210.13438","last_updated":"2022-10-24T17:52:02Z","snapshot_observed_at":"2026-08-09T07:12:13.721596Z","submitted_at":"2022-10-24T17:52:02Z","title":"High Fidelity Neural Audio Compression","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2210.13438","snapshot_observed_at":"2026-08-07T12:29:40.426238Z","title":"High fidelity neural audio compression,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2505.24314","last_updated":"2025-05-30T07:53:01Z","snapshot_observed_at":"2026-08-10T04:01:32.887991Z","submitted_at":"2025-05-30T07:53:01Z","title":"DS-Codec: Dual-Stage Training with Mirror-to-NonMirror Architecture Switching for Speech Codec","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-07T12:29:40.426238Z"},"links":{"cited_paper":"/paper/2210.13438","citing_paper":"/paper/2505.24314"},"observation_digest":"sha256:4e4d656c03edfa9866efa08addcaad009076d2f4120de1ebf54a0242c2d79e8b","observation_id":"e7be356b-fd57-472e-a7d5-42ef4f47fad2","resolution":{"observed_at":"2026-08-07T12:29:40.426238Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.02765","last_updated":"2023-05-07T09:22:04Z","snapshot_observed_at":"2026-08-06T10:45:04.364170Z","submitted_at":"2023-05-04T12:11:13Z","title":"HiFi-Codec: Group-residual Vector quantization for High Fidelity Audio Codec","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.02765","snapshot_observed_at":"2026-08-07T12:29:40.551229Z","title":"Hifi- codec: Group-residual vector quantization for high fidelity audio codec,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.24314","last_updated":"2025-05-30T07:53:01Z","snapshot_observed_at":"2026-08-10T04:01:32.887991Z","submitted_at":"2025-05-30T07:53:01Z","title":"DS-Codec: Dual-Stage Training with Mirror-to-NonMirror Architecture Switching for Speech Codec","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-07T12:29:40.551229Z"},"links":{"cited_paper":"/paper/2305.02765","citing_paper":"/paper/2505.24314"},"observation_digest":"sha256:6d9c3e4b488602dc5d972902c809f2197a75c3025127036e873460248ce73064","observation_id":"25530ef0-39a0-44ea-99d3-c96a65232ecd","resolution":{"observed_at":"2026-08-07T12:29:40.551229Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.16532","last_updated":"2025-02-25T11:45:12Z","snapshot_observed_at":"2026-08-07T23:06:05.723893Z","submitted_at":"2024-08-29T13:43:36Z","title":"WavTokenizer: an Efficient Acoustic Discrete Codec Tokenizer for Audio Language Modeling","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.16532","snapshot_observed_at":"2026-08-07T12:29:40.695004Z","title":"Wavtokenizer: an efficient acoustic discrete codec tokenizer for audio language modeling,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.24314","last_updated":"2025-05-30T07:53:01Z","snapshot_observed_at":"2026-08-10T04:01:32.887991Z","submitted_at":"2025-05-30T07:53:01Z","title":"DS-Codec: Dual-Stage Training with Mirror-to-NonMirror Architecture Switching for Speech Codec","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-07T12:29:40.695004Z"},"links":{"cited_paper":"/paper/2408.16532","citing_paper":"/paper/2505.24314"},"observation_digest":"sha256:02941985cc4dc07dca8e8dfc7f0200415e3ce61a9745ca187129ada39c33739c","observation_id":"be0e75f5-0f79-433d-a3df-d9d60d153304","resolution":{"observed_at":"2026-08-07T12:29:40.695004Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.05377","last_updated":"2024-09-09T07:18:07Z","snapshot_observed_at":"2026-08-03T20:35:31.539481Z","submitted_at":"2024-09-09T07:18:07Z","title":"BigCodec: Pushing the Limits of Low-Bitrate Neural Speech Codec","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.05377","snapshot_observed_at":"2026-08-07T12:29:40.791796Z","title":"Bigcodec: Pushing the limits of low-bitrate neural speech codec,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.24314","last_updated":"2025-05-30T07:53:01Z","snapshot_observed_at":"2026-08-10T04:01:32.887991Z","submitted_at":"2025-05-30T07:53:01Z","title":"DS-Codec: Dual-Stage Training with Mirror-to-NonMirror Architecture Switching for Speech Codec","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-07T12:29:40.791796Z"},"links":{"cited_paper":"/paper/2409.05377","citing_paper":"/paper/2505.24314"},"observation_digest":"sha256:5a8b96c279f20e8654975c82f8dd9780d4bdb3394154304fc855f7ce8925035c","observation_id":"18ce0122-83d8-410c-a52c-5e72d928fc6a","resolution":{"observed_at":"2026-08-07T12:29:40.791796Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.07422","last_updated":"2024-06-11T16:22:57Z","snapshot_observed_at":"2026-08-10T13:35:57.169341Z","submitted_at":"2024-06-11T16:22:57Z","title":"Single-Codec: Single-Codebook Speech Codec towards High-Performance Speech Generation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.07422","snapshot_observed_at":"2026-08-07T12:29:40.894154Z","title":"Single-codec: Single-codebook speech codec towards high-performance speech generation,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.24314","last_updated":"2025-05-30T07:53:01Z","snapshot_observed_at":"2026-08-10T04:01:32.887991Z","submitted_at":"2025-05-30T07:53:01Z","title":"DS-Codec: Dual-Stage Training with Mirror-to-NonMirror Architecture Switching for Speech Codec","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-07T12:29:40.894154Z"},"links":{"cited_paper":"/paper/2406.07422","citing_paper":"/paper/2505.24314"},"observation_digest":"sha256:be9535c7c265de999e96c3ea4d665a70fbfabc9a273d1a84dde9415a6b467dd0","observation_id":"dd699265-cf72-4969-8c57-dfa127b10c6c","resolution":{"observed_at":"2026-08-07T12:29:40.894154Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.02940","last_updated":"2024-06-05T04:54:49Z","snapshot_observed_at":"2026-07-06T18:25:40.229186Z","submitted_at":"2024-06-05T04:54:49Z","title":"Addressing Index Collapse of Large-Codebook Speech Tokenizer with Dual-Decoding Product-Quantized Variational Auto-Encoder","version":1},"cited_work":{"arxiv_id":"2406.02940","doi":null,"metadata_source":"pith","pith_arxiv_id":"2406.02940","snapshot_observed_at":"2026-08-07T12:29:43.045306Z","title":"Addressing Index Collapse of Large-Codebook Speech Tokenizer with Dual-Decoding Product-Quantized Variational Auto-Encoder","venue":"cs.SD","work_id":"7d74a2f7-c4b1-4ab8-9cc5-c632687abbe7","year":2024},"citing_paper":{"arxiv_id":"2505.24314","last_updated":"2025-05-30T07:53:01Z","snapshot_observed_at":"2026-08-10T04:01:32.887991Z","submitted_at":"2025-05-30T07:53:01Z","title":"DS-Codec: Dual-Stage Training with Mirror-to-NonMirror Architecture Switching for Speech Codec","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-07T12:29:41.008351Z"},"links":{"cited_paper":"/paper/2406.02940","citing_paper":"/paper/2505.24314"},"observation_digest":"sha256:004dcc52479de5f7eec99d1947e576c2f3aeaba612a4796e5f381b3c0caa2851","observation_id":"9bd0c454-47d4-4e4c-a0f1-a5ed8524626a","resolution":{"observed_at":"2026-08-07T12:29:43.140544Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2403.03100","last_updated":"2024-04-23T08:38:03Z","snapshot_observed_at":"2026-08-07T23:22:31.422843Z","submitted_at":"2024-03-05T16:35:25Z","title":"NaturalSpeech 3: Zero-Shot Speech Synthesis with Factorized Codec and Diffusion Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.03100","snapshot_observed_at":"2026-08-07T12:29:41.168284Z","title":"Naturalspeech 3: Zero-shot speech syn- thesis with factorized codec and diffusion models,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.24314","last_updated":"2025-05-30T07:53:01Z","snapshot_observed_at":"2026-08-10T04:01:32.887991Z","submitted_at":"2025-05-30T07:53:01Z","title":"DS-Codec: Dual-Stage Training with Mirror-to-NonMirror Architecture Switching for Speech Codec","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-07T12:29:41.168284Z"},"links":{"cited_paper":"/paper/2403.03100","citing_paper":"/paper/2505.24314"},"observation_digest":"sha256:01cd0d11d10f953671759fd673e3f03a6debdbb81eee6c90095e8757a3637900","observation_id":"446a5104-842b-467a-b0a4-d240d0b57b5b","resolution":{"observed_at":"2026-08-07T12:29:41.168284Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:29:41.272611Z","title":"Neural networks fail to learn periodic functions and how to fix it,","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2505.24314","last_updated":"2025-05-30T07:53:01Z","snapshot_observed_at":"2026-08-10T04:01:32.887991Z","submitted_at":"2025-05-30T07:53:01Z","title":"DS-Codec: Dual-Stage Training with Mirror-to-NonMirror Architecture Switching for Speech Codec","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-07T12:29:41.272611Z"},"links":{"citing_paper":"/paper/2505.24314"},"observation_digest":"sha256:ad123b964b8d5655a511f6bb7db7c626773cfe09cf29c0d7d17883001f37aeef","observation_id":"e4799653-6b8b-4791-8dde-31578b37c5f6","resolution":{"observed_at":"2026-08-07T12:29:41.272611Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2302.13971","last_updated":"2023-02-27T17:11:15Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-02-27T17:11:15Z","title":"LLaMA: Open and Efficient Foundation Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2302.13971","snapshot_observed_at":"2026-08-07T12:29:41.423921Z","title":"Llama: Open and efficient foundation language models,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.24314","last_updated":"2025-05-30T07:53:01Z","snapshot_observed_at":"2026-08-10T04:01:32.887991Z","submitted_at":"2025-05-30T07:53:01Z","title":"DS-Codec: Dual-Stage Training with Mirror-to-NonMirror Architecture Switching for Speech Codec","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-07T12:29:41.423921Z"},"links":{"cited_paper":"/paper/2302.13971","citing_paper":"/paper/2505.24314"},"observation_digest":"sha256:a44a83243e3419c9a21288cd8aaa14cd90a5e0e67639db45e3acbcc8e01bc821","observation_id":"88b08a74-0353-4fc9-bb31-d1c8306b6e77","resolution":{"observed_at":"2026-08-07T12:29:41.423921Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:29:41.569951Z","title":"Hifi-gan: Generative adversarial net- works for efficient and high fidelity speech synthesis,","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2505.24314","last_updated":"2025-05-30T07:53:01Z","snapshot_observed_at":"2026-08-10T04:01:32.887991Z","submitted_at":"2025-05-30T07:53:01Z","title":"DS-Codec: Dual-Stage Training with Mirror-to-NonMirror Architecture Switching for Speech Codec","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-07T12:29:41.569951Z"},"links":{"citing_paper":"/paper/2505.24314"},"observation_digest":"sha256:49442e0499a5918778009de28e2e68ec2535dfffe153200959b9d3d5377fc0ba","observation_id":"ea8bc6fa-13d4-4dc6-b9ed-2dc502f00316","resolution":{"observed_at":"2026-08-07T12:29:41.569951Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2110.04627","last_updated":"2022-06-05T01:57:58Z","snapshot_observed_at":"2026-07-06T11:56:10.689708Z","submitted_at":"2021-10-09T18:36:00Z","title":"Vector-quantized Image Modeling with Improved VQGAN","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2110.04627","snapshot_observed_at":"2026-08-07T12:29:41.764813Z","title":"Vector-quantized image modeling with improved vqgan,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2505.24314","last_updated":"2025-05-30T07:53:01Z","snapshot_observed_at":"2026-08-10T04:01:32.887991Z","submitted_at":"2025-05-30T07:53:01Z","title":"DS-Codec: Dual-Stage Training with Mirror-to-NonMirror Architecture Switching for Speech Codec","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-07T12:29:41.764813Z"},"links":{"cited_paper":"/paper/2110.04627","citing_paper":"/paper/2505.24314"},"observation_digest":"sha256:0b5f3ee47853f7e2d8b9742dc245275359572604b52d68237001795960d30d90","observation_id":"72a21425-ef2f-45e1-b045-18c894474aed","resolution":{"observed_at":"2026-08-07T12:29:41.764813Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:29:41.908267Z","title":"Product quantization for nearest neighbor search,","venue":null,"work_id":null,"year":2010},"citing_paper":{"arxiv_id":"2505.24314","last_updated":"2025-05-30T07:53:01Z","snapshot_observed_at":"2026-08-10T04:01:32.887991Z","submitted_at":"2025-05-30T07:53:01Z","title":"DS-Codec: Dual-Stage Training with Mirror-to-NonMirror Architecture Switching for Speech Codec","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-07T12:29:41.908267Z"},"links":{"citing_paper":"/paper/2505.24314"},"observation_digest":"sha256:5bf46d663d8a27b08c2c9a974f8e5603fb93dc0b59359121e527bc6a064ad435","observation_id":"d7dfcef2-cb64-443f-964a-127c625c7164","resolution":{"observed_at":"2026-08-07T12:29:41.908267Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:29:43.885810Z","title":"Apcodec+: A spectrum-coding-based high-fidelity and high-compression-rate neural audio codec with staged training paradigm,","venue":null,"work_id":"86c0a341-22f9-4dcc-b124-40e42bb90701","year":2024},"citing_paper":{"arxiv_id":"2505.24314","last_updated":"2025-05-30T07:53:01Z","snapshot_observed_at":"2026-08-10T04:01:32.887991Z","submitted_at":"2025-05-30T07:53:01Z","title":"DS-Codec: Dual-Stage Training with Mirror-to-NonMirror Architecture Switching for Speech Codec","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-07T12:29:42.045168Z"},"links":{"citing_paper":"/paper/2505.24314"},"observation_digest":"sha256:c83667b07e761d2fe6bf4b0a02d777227e562cc92627bb4bcd260a1c5ca59521","observation_id":"4d360477-8cb8-4fd3-8c03-57363716f9aa","resolution":{"observed_at":"2026-08-07T12:29:44.001741Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:29:42.189677Z","title":"Lib- rispeech: an asr corpus based on public domain audio books,","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2505.24314","last_updated":"2025-05-30T07:53:01Z","snapshot_observed_at":"2026-08-10T04:01:32.887991Z","submitted_at":"2025-05-30T07:53:01Z","title":"DS-Codec: Dual-Stage Training with Mirror-to-NonMirror Architecture Switching for Speech Codec","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-07T12:29:42.189677Z"},"links":{"citing_paper":"/paper/2505.24314"},"observation_digest":"sha256:96fa8385430eef839cf71255a33f418c015424255202048a1ecde1648207f8a0","observation_id":"78882b71-3869-46ee-be91-9f552fe4d393","resolution":{"observed_at":"2026-08-07T12:29:42.189677Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2306.00814","last_updated":"2024-05-29T14:21:47Z","snapshot_observed_at":"2026-08-08T02:04:12.090464Z","submitted_at":"2023-06-01T15:40:32Z","title":"Vocos: Closing the gap between time-domain and Fourier-based neural vocoders for high-quality audio synthesis","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.00814","snapshot_observed_at":"2026-08-07T12:29:42.327056Z","title":"V ocos: Closing the gap between time-domain and fourier-based neural vocoders for high-quality audio synthesis,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.24314","last_updated":"2025-05-30T07:53:01Z","snapshot_observed_at":"2026-08-10T04:01:32.887991Z","submitted_at":"2025-05-30T07:53:01Z","title":"DS-Codec: Dual-Stage Training with Mirror-to-NonMirror Architecture Switching for Speech Codec","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-07T12:29:42.327056Z"},"links":{"cited_paper":"/paper/2306.00814","citing_paper":"/paper/2505.24314"},"observation_digest":"sha256:203fe12a30d3ce54ea72d2afe9e142c8409e1fb03785b3ac9bed20e186a042d6","observation_id":"f7213156-5f1e-49bc-937f-5e62869b6ad6","resolution":{"observed_at":"2026-08-07T12:29:42.327056Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2204.02152","last_updated":"2022-06-29T13:42:05Z","snapshot_observed_at":"2026-08-04T06:18:23.412967Z","submitted_at":"2022-04-05T12:23:51Z","title":"UTMOS: UTokyo-SaruLab System for VoiceMOS Challenge 2022","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2204.02152","snapshot_observed_at":"2026-08-07T12:29:42.472159Z","title":"Utmos: Utokyo-sarulab system for voicemos challenge 2022,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2505.24314","last_updated":"2025-05-30T07:53:01Z","snapshot_observed_at":"2026-08-10T04:01:32.887991Z","submitted_at":"2025-05-30T07:53:01Z","title":"DS-Codec: Dual-Stage Training with Mirror-to-NonMirror Architecture Switching for Speech Codec","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-07T12:29:42.472159Z"},"links":{"cited_paper":"/paper/2204.02152","citing_paper":"/paper/2505.24314"},"observation_digest":"sha256:dbcccdd36cfe77a81ba8f23cd70978cdbcb2cfe537826324273aeddafa51cd90","observation_id":"e454bdb2-bee3-4c12-b1ac-760223fe8ed8","resolution":{"observed_at":"2026-08-07T12:29:42.472159Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:29:42.622160Z","title":"Perceptual evaluation of speech quality (pesq)-a new method for speech quality assessment of telephone networks and codecs,","venue":null,"work_id":null,"year":2001},"citing_paper":{"arxiv_id":"2505.24314","last_updated":"2025-05-30T07:53:01Z","snapshot_observed_at":"2026-08-10T04:01:32.887991Z","submitted_at":"2025-05-30T07:53:01Z","title":"DS-Codec: Dual-Stage Training with Mirror-to-NonMirror Architecture Switching for Speech Codec","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-07T12:29:42.622160Z"},"links":{"citing_paper":"/paper/2505.24314"},"observation_digest":"sha256:ce91710ced586472d54625e197419f82cad0a803c832efd72b5a91dc2a0f59a0","observation_id":"59040c31-6b56-4635-ba6f-3724689adf01","resolution":{"observed_at":"2026-08-07T12:29:42.622160Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:29:43.647537Z","title":"Fewer-token neural speech codec with time-invariant codes,","venue":null,"work_id":"8e067387-f109-4d15-bf4d-3663e8121ff7","year":2024},"citing_paper":{"arxiv_id":"2505.24314","last_updated":"2025-05-30T07:53:01Z","snapshot_observed_at":"2026-08-10T04:01:32.887991Z","submitted_at":"2025-05-30T07:53:01Z","title":"DS-Codec: Dual-Stage Training with Mirror-to-NonMirror Architecture Switching for Speech Codec","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-07T12:29:42.730075Z"},"links":{"citing_paper":"/paper/2505.24314"},"observation_digest":"sha256:409a45817e56b739f4b7aa4dd516ccb8a364b4cf70a7bcf9f4a29196bc99e469","observation_id":"83dbc189-7a8e-4ccf-b0a1-1a46cc871e63","resolution":{"observed_at":"2026-08-07T12:29:43.717631Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2505.24314","last_updated":"2025-05-30T07:53:01Z","latest_version":1,"primary_category":"cs.SD","snapshot_observed_at":"2026-08-10T04:01:32.887991Z","submitted_at":"2025-05-30T07:53:01Z","title":"DS-Codec: Dual-Stage Training with Mirror-to-NonMirror Architecture Switching for Speech Codec"},"reference_resolution":{"displayed":36,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":28,"verified_exact":1,"verified_fuzzy":7},"total_outbound_references":36},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"thesis":"As of 10 August 2026, this Paper Citation Record lists 36 of 36 outbound references and 2 inbound Pith citation observations for arXiv:2505.24314."}