{"as_of":"2026-08-08T14:12:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:0e65a513c424f95ff6aef3796ea19bfff34b1fe7da410f78c30584a932c165ca","coverage":[{"denominator":31,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":31,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-08T04:20:42.798080Z","state":"measured"},{"denominator":31,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":31,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-08T06:32:00.761636+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2608.03021/citation-record","integrity":"/paper/2608.03021/integrity","json":"/paper/2608.03021/citation-record.json","paper":"/paper/2608.03021"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T04:20:42.490899Z","title":"Soundstream: An end-to-end neural audio codec,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2608.03021","last_updated":"2026-08-04T02:06:46Z","snapshot_observed_at":"2026-08-08T04:12:49.047173Z","submitted_at":"2026-08-04T02:06:46Z","title":"MeloCodec: Harnessing Melodic Priors for High-Fidelity Singing Voice Representation","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-08T04:20:42.490899Z"},"links":{"citing_paper":"/paper/2608.03021"},"observation_digest":"sha256:ee1da27e0ca89187520822e6688f572dad342e03907a0d3cd0bd02c0b9c21203","observation_id":"c48ec5ef-93ba-458c-b48d-85d221fa485d","resolution":{"observed_at":"2026-08-08T04:20:42.490899Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2210.13438","last_updated":"2022-10-24T17:52:02Z","snapshot_observed_at":"2026-08-03T16:47:47.192907Z","submitted_at":"2022-10-24T17:52:02Z","title":"High Fidelity Neural Audio Compression","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2210.13438","snapshot_observed_at":"2026-08-08T04:20:42.496573Z","title":"High fidelity neural audio compression,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2608.03021","last_updated":"2026-08-04T02:06:46Z","snapshot_observed_at":"2026-08-08T04:12:49.047173Z","submitted_at":"2026-08-04T02:06:46Z","title":"MeloCodec: Harnessing Melodic Priors for High-Fidelity Singing Voice Representation","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-08T04:20:42.496573Z"},"links":{"cited_paper":"/paper/2210.13438","citing_paper":"/paper/2608.03021"},"observation_digest":"sha256:ec2933d9e818973402c301c13a9bec520ebe61cbf6ff8f152d7bc55483bce645","observation_id":"7ee4344b-31a1-44a7-b153-63acbfd0edc8","resolution":{"observed_at":"2026-08-08T04:20:42.496573Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T04:20:42.502395Z","title":"Language models are few-shot learners,","venue":null,"work_id":null,"year":1901},"citing_paper":{"arxiv_id":"2608.03021","last_updated":"2026-08-04T02:06:46Z","snapshot_observed_at":"2026-08-08T04:12:49.047173Z","submitted_at":"2026-08-04T02:06:46Z","title":"MeloCodec: Harnessing Melodic Priors for High-Fidelity Singing Voice Representation","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-08T04:20:42.502395Z"},"links":{"citing_paper":"/paper/2608.03021"},"observation_digest":"sha256:b257a4051dd267330d68fac81c9420d186f797a6591c02181e26ec402d5945c2","observation_id":"06ed9330-9b54-4bae-8762-5cb022b7f751","resolution":{"observed_at":"2026-08-08T04:20:42.502395Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T04:20:43.628713Z","title":"Zero-shot text-to-image generation,","venue":null,"work_id":"2e3c638a-b8bd-40c4-9fed-83b88b952187","year":2021},"citing_paper":{"arxiv_id":"2608.03021","last_updated":"2026-08-04T02:06:46Z","snapshot_observed_at":"2026-08-08T04:12:49.047173Z","submitted_at":"2026-08-04T02:06:46Z","title":"MeloCodec: Harnessing Melodic Priors for High-Fidelity Singing Voice Representation","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-08T04:20:42.507927Z"},"links":{"citing_paper":"/paper/2608.03021"},"observation_digest":"sha256:f6e5817ad752c4e7626d05dd8400cd11faa5e5c873d2bf898c469945332c3e80","observation_id":"e3cb3fea-7c16-4ebc-85c5-df80d5f6a30c","resolution":{"observed_at":"2026-08-08T04:20:43.633663Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2301.02111","last_updated":"2023-01-05T15:37:15Z","snapshot_observed_at":"2026-08-07T10:11:17.796562Z","submitted_at":"2023-01-05T15:37:15Z","title":"Neural Codec Language Models are Zero-Shot Text to Speech Synthesizers","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2301.02111","snapshot_observed_at":"2026-08-08T04:20:42.513042Z","title":"Neural codec language models are zero-shot text to speech synthesiz- ers,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2608.03021","last_updated":"2026-08-04T02:06:46Z","snapshot_observed_at":"2026-08-08T04:12:49.047173Z","submitted_at":"2026-08-04T02:06:46Z","title":"MeloCodec: Harnessing Melodic Priors for High-Fidelity Singing Voice Representation","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-08T04:20:42.513042Z"},"links":{"cited_paper":"/paper/2301.02111","citing_paper":"/paper/2608.03021"},"observation_digest":"sha256:cbce56fdec4358da522dd7927e08d8c11b4cbdecfd7e63674f39558e9f029e9f","observation_id":"add13ae3-cab1-4af9-a984-38732bfc7505","resolution":{"observed_at":"2026-08-08T04:20:42.513042Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T04:20:42.519016Z","title":"Audiolm: a language modeling approach to audio generation,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2608.03021","last_updated":"2026-08-04T02:06:46Z","snapshot_observed_at":"2026-08-08T04:12:49.047173Z","submitted_at":"2026-08-04T02:06:46Z","title":"MeloCodec: Harnessing Melodic Priors for High-Fidelity Singing Voice Representation","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-08T04:20:42.519016Z"},"links":{"citing_paper":"/paper/2608.03021"},"observation_digest":"sha256:d29d0355e5672c70ea679adaa77052d34a9f94dc78e8f635797832260d1fcd61","observation_id":"22b9c149-dacb-4662-bc31-3d8d9bab254d","resolution":{"observed_at":"2026-08-08T04:20:42.519016Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T04:20:43.600179Z","title":"Simple and controllable music generation,","venue":null,"work_id":"7e78fae1-95ba-46b2-b2b0-b2eba47b3475","year":2023},"citing_paper":{"arxiv_id":"2608.03021","last_updated":"2026-08-04T02:06:46Z","snapshot_observed_at":"2026-08-08T04:12:49.047173Z","submitted_at":"2026-08-04T02:06:46Z","title":"MeloCodec: Harnessing Melodic Priors for High-Fidelity Singing Voice Representation","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-08T04:20:42.524182Z"},"links":{"citing_paper":"/paper/2608.03021"},"observation_digest":"sha256:4baaaeb9b721fd13a07c8e8197655109550a73631b242aebf190f9d83fb9f1e0","observation_id":"6c8d2918-b001-460b-b8d6-aec5bcdcf6fa","resolution":{"observed_at":"2026-08-08T04:20:43.605938Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T04:20:43.583457Z","title":"Codec does matter: Exploring the semantic shortcoming of codec for audio language model,","venue":null,"work_id":"c0634afe-fba5-49f6-aba1-c8dd11d1eb40","year":2025},"citing_paper":{"arxiv_id":"2608.03021","last_updated":"2026-08-04T02:06:46Z","snapshot_observed_at":"2026-08-08T04:12:49.047173Z","submitted_at":"2026-08-04T02:06:46Z","title":"MeloCodec: Harnessing Melodic Priors for High-Fidelity Singing Voice Representation","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-08T04:20:42.529427Z"},"links":{"citing_paper":"/paper/2608.03021"},"observation_digest":"sha256:abece41ebddc5685f0f87b87fb3a71b0dc4977bba64861ed2d80e865877c95b2","observation_id":"ef762dc9-c2ec-4904-b46b-de4311c0ca1f","resolution":{"observed_at":"2026-08-08T04:20:43.588572Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2308.16692","last_updated":"2024-01-23T01:56:57Z","snapshot_observed_at":"2026-08-07T03:22:13.424379Z","submitted_at":"2023-08-31T12:53:09Z","title":"SpeechTokenizer: Unified Speech Tokenizer for Speech Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2308.16692","snapshot_observed_at":"2026-08-08T04:20:42.533990Z","title":"Speechtokenizer: Unified speech tokenizer for speech large language models,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2608.03021","last_updated":"2026-08-04T02:06:46Z","snapshot_observed_at":"2026-08-08T04:12:49.047173Z","submitted_at":"2026-08-04T02:06:46Z","title":"MeloCodec: Harnessing Melodic Priors for High-Fidelity Singing Voice Representation","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-08T04:20:42.533990Z"},"links":{"cited_paper":"/paper/2308.16692","citing_paper":"/paper/2608.03021"},"observation_digest":"sha256:28f98fb07396ae282f0c0e53668b8b311a5b1491c6a68344a1067ff9e52143a1","observation_id":"0ca0fea9-eb9e-4bb3-8543-ea1ff80a54cc","resolution":{"observed_at":"2026-08-08T04:20:42.533990Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.01710","last_updated":"2025-03-03T16:23:10Z","snapshot_observed_at":"2026-07-06T20:45:50.730195Z","submitted_at":"2025-03-03T16:23:10Z","title":"Spark-TTS: An Efficient LLM-Based Text-to-Speech Model with Single-Stream Decoupled Speech Tokens","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.01710","snapshot_observed_at":"2026-08-08T04:20:42.539324Z","title":"Spark-tts: An efficient llm-based text-to-speech model with single- stream decoupled speech tokens,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.03021","last_updated":"2026-08-04T02:06:46Z","snapshot_observed_at":"2026-08-08T04:12:49.047173Z","submitted_at":"2026-08-04T02:06:46Z","title":"MeloCodec: Harnessing Melodic Priors for High-Fidelity Singing Voice Representation","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-08T04:20:42.539324Z"},"links":{"cited_paper":"/paper/2503.01710","citing_paper":"/paper/2608.03021"},"observation_digest":"sha256:9543ad80356ac15f2f0bbdee0e7377fab93ded9fa88110a745e81e68794d412f","observation_id":"9efab4d2-cd97-49f1-94fa-edeb1e746723","resolution":{"observed_at":"2026-08-08T04:20:42.539324Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.10117","last_updated":"2024-12-25T11:54:03Z","snapshot_observed_at":"2026-08-07T06:02:40.568271Z","submitted_at":"2024-12-13T12:59:39Z","title":"CosyVoice 2: Scalable Streaming Speech Synthesis with Large Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.10117","snapshot_observed_at":"2026-08-08T04:20:42.544907Z","title":"Cosyvoice 2: Scalable streaming speech synthesis with large language models,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.03021","last_updated":"2026-08-04T02:06:46Z","snapshot_observed_at":"2026-08-08T04:12:49.047173Z","submitted_at":"2026-08-04T02:06:46Z","title":"MeloCodec: Harnessing Melodic Priors for High-Fidelity Singing Voice Representation","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-08T04:20:42.544907Z"},"links":{"cited_paper":"/paper/2412.10117","citing_paper":"/paper/2608.03021"},"observation_digest":"sha256:4e58082c5d79b55314effc7298f195d7b0bd78001144ad418a541a240d8ce1e8","observation_id":"960591ba-4569-4579-a413-d242cfde5e92","resolution":{"observed_at":"2026-08-08T04:20:42.544907Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2507.12197","last_updated":"2025-07-16T12:47:09Z","snapshot_observed_at":"2026-08-07T14:59:35.759272Z","submitted_at":"2025-07-16T12:47:09Z","title":"Quantize More, Lose Less: Autoregressive Generation from Residually Quantized Speech Representations","version":1},"cited_work":{"arxiv_id":"2507.12197","doi":null,"metadata_source":"pith","pith_arxiv_id":"2507.12197","snapshot_observed_at":"2026-08-08T04:20:43.349222Z","title":"Quantize More, Lose Less: Autoregressive Generation from Residually Quantized Speech Representations","venue":"cs.SD","work_id":"9bc7feb8-3a8f-47c3-87de-110f4e6a3200","year":2025},"citing_paper":{"arxiv_id":"2608.03021","last_updated":"2026-08-04T02:06:46Z","snapshot_observed_at":"2026-08-08T04:12:49.047173Z","submitted_at":"2026-08-04T02:06:46Z","title":"MeloCodec: Harnessing Melodic Priors for High-Fidelity Singing Voice Representation","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-08T04:20:42.550446Z"},"links":{"cited_paper":"/paper/2507.12197","citing_paper":"/paper/2608.03021"},"observation_digest":"sha256:6f9c935fd9a0f21a56b90d96a3e0260fe0bf39db5e09dd9761e41f33abf21b78","observation_id":"a434ea2d-a5f3-4c61-b77b-df25f926ee55","resolution":{"observed_at":"2026-08-08T04:20:43.354150Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T04:20:43.567222Z","title":"Scaling under-resourced tts: A data-optimized framework with advanced acoustic modeling for thai,","venue":null,"work_id":"4bcb668e-ee95-4ca0-a9b5-a160d4880d8d","year":2025},"citing_paper":{"arxiv_id":"2608.03021","last_updated":"2026-08-04T02:06:46Z","snapshot_observed_at":"2026-08-08T04:12:49.047173Z","submitted_at":"2026-08-04T02:06:46Z","title":"MeloCodec: Harnessing Melodic Priors for High-Fidelity Singing Voice Representation","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-08T04:20:42.555937Z"},"links":{"citing_paper":"/paper/2608.03021"},"observation_digest":"sha256:083ad4286c6fab48326058185760147684fbe8fb1695903e3bf768d510da91f8","observation_id":"74272db4-2a6a-45bc-91b6-432dd1ab0927","resolution":{"observed_at":"2026-08-08T04:20:43.572568Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2403.03100","last_updated":"2024-04-23T08:38:03Z","snapshot_observed_at":"2026-08-07T23:22:31.422843Z","submitted_at":"2024-03-05T16:35:25Z","title":"NaturalSpeech 3: Zero-Shot Speech Synthesis with Factorized Codec and Diffusion Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.03100","snapshot_observed_at":"2026-08-08T04:20:42.560749Z","title":"Naturalspeech 3: Zero-shot speech synthesis with factorized codec and diffusion models,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.03021","last_updated":"2026-08-04T02:06:46Z","snapshot_observed_at":"2026-08-08T04:12:49.047173Z","submitted_at":"2026-08-04T02:06:46Z","title":"MeloCodec: Harnessing Melodic Priors for High-Fidelity Singing Voice Representation","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-08T04:20:42.560749Z"},"links":{"cited_paper":"/paper/2403.03100","citing_paper":"/paper/2608.03021"},"observation_digest":"sha256:f34bec2cbfc8dd89c7e847ec1b5c88acf495b6c6cf84e0835fbb3c1d26bb1480","observation_id":"e53bb86b-848b-4872-8df8-c59b8e3ffc94","resolution":{"observed_at":"2026-08-08T04:20:42.560749Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T04:20:42.566266Z","title":"Vevo2: Bridging controllable speech and singing voice generation via unified prosody learning,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.03021","last_updated":"2026-08-04T02:06:46Z","snapshot_observed_at":"2026-08-08T04:12:49.047173Z","submitted_at":"2026-08-04T02:06:46Z","title":"MeloCodec: Harnessing Melodic Priors for High-Fidelity Singing Voice Representation","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-08T04:20:42.566266Z"},"links":{"citing_paper":"/paper/2608.03021"},"observation_digest":"sha256:c3d6cac9be3969a383f602d734a67f97badf4cb8fa710ee9a99f7bd5f54069a1","observation_id":"c4a2efb6-a068-4e6c-b8f7-f812fa96a3ac","resolution":{"observed_at":"2026-08-08T04:20:42.566266Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.02049","last_updated":"2024-07-02T08:23:38Z","snapshot_observed_at":"2026-07-06T18:40:10.103133Z","submitted_at":"2024-07-02T08:23:38Z","title":"Accompanied Singing Voice Synthesis with Fully Text-controlled Melody","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.02049","snapshot_observed_at":"2026-08-08T04:20:42.571505Z","title":"Accompanied singing voice synthesis with fully text-controlled melody,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.03021","last_updated":"2026-08-04T02:06:46Z","snapshot_observed_at":"2026-08-08T04:12:49.047173Z","submitted_at":"2026-08-04T02:06:46Z","title":"MeloCodec: Harnessing Melodic Priors for High-Fidelity Singing Voice Representation","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-08T04:20:42.571505Z"},"links":{"cited_paper":"/paper/2407.02049","citing_paper":"/paper/2608.03021"},"observation_digest":"sha256:278f579379d5fb7f55c32793b4aae138ec809946556becb125efcb57ba485704","observation_id":"065e4e4a-a1e1-419a-803b-824cdb89d15e","resolution":{"observed_at":"2026-08-08T04:20:42.571505Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T04:20:43.551142Z","title":"Moee: Mixture of emotion experts for audio-driven portrait animation,","venue":null,"work_id":"231da024-d796-4667-b4bc-fd4b8271b3d6","year":2025},"citing_paper":{"arxiv_id":"2608.03021","last_updated":"2026-08-04T02:06:46Z","snapshot_observed_at":"2026-08-08T04:12:49.047173Z","submitted_at":"2026-08-04T02:06:46Z","title":"MeloCodec: Harnessing Melodic Priors for High-Fidelity Singing Voice Representation","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-08T04:20:42.577736Z"},"links":{"citing_paper":"/paper/2608.03021"},"observation_digest":"sha256:29cdc1b086c4650d35cd7309d9bc405fd6fc092ddcf50fcf248d5e82beeb3538","observation_id":"bf76ce6f-7390-45bd-b71f-38ca88797097","resolution":{"observed_at":"2026-08-08T04:20:43.556277Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2509.19883","last_updated":"2026-04-11T06:12:16Z","snapshot_observed_at":"2026-08-02T07:43:41.108992Z","submitted_at":"2025-09-24T08:34:19Z","title":"CoMelSinger: Discrete Token-Based Zero-Shot Singing Synthesis With Structured Melody Control and Guidance","version":2},"cited_work":{"arxiv_id":"2509.19883","doi":null,"metadata_source":"pith","pith_arxiv_id":"2509.19883","snapshot_observed_at":"2026-08-08T04:20:43.180044Z","title":"CoMelSinger: Discrete Token-Based Zero-Shot Singing Synthesis With Structured Melody Control and Guidance","venue":"cs.SD","work_id":"7716e90b-92f3-45ed-8a3c-32ed28798644","year":2025},"citing_paper":{"arxiv_id":"2608.03021","last_updated":"2026-08-04T02:06:46Z","snapshot_observed_at":"2026-08-08T04:12:49.047173Z","submitted_at":"2026-08-04T02:06:46Z","title":"MeloCodec: Harnessing Melodic Priors for High-Fidelity Singing Voice Representation","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-08T04:20:42.582813Z"},"links":{"cited_paper":"/paper/2509.19883","citing_paper":"/paper/2608.03021"},"observation_digest":"sha256:5b960520632d12ae838848d6556179d3dd31a23a7409bdaec707f3cb4b473feb","observation_id":"05eda9be-a5a9-481f-9728-d3cce7c63990","resolution":{"observed_at":"2026-08-08T04:20:43.188175Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T04:20:43.534437Z","title":"Neural audio codecs for prompt- driven universal source separation,","venue":null,"work_id":"6cd8baa1-6e43-46d6-bc29-bda5bd73c3d3","year":2025},"citing_paper":{"arxiv_id":"2608.03021","last_updated":"2026-08-04T02:06:46Z","snapshot_observed_at":"2026-08-08T04:12:49.047173Z","submitted_at":"2026-08-04T02:06:46Z","title":"MeloCodec: Harnessing Melodic Priors for High-Fidelity Singing Voice Representation","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-08T04:20:42.588566Z"},"links":{"citing_paper":"/paper/2608.03021"},"observation_digest":"sha256:c469f16006d8b8db0707b6a3046c1df925f0ca7561400b1f271116197740e036","observation_id":"b05783ca-fdf2-4451-a276-f9e3b75fffad","resolution":{"observed_at":"2026-08-08T04:20:43.539884Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.03444","last_updated":"2023-10-05T10:30:33Z","snapshot_observed_at":"2026-07-06T16:28:09.133233Z","submitted_at":"2023-10-05T10:30:33Z","title":"VaSAB: The variable size adaptive information bottleneck for disentanglement on speech and singing voice","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.03444","snapshot_observed_at":"2026-08-08T04:20:42.593969Z","title":"Vasab: The variable size adaptive in- formation bottleneck for disentanglement on speech and singing voice,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2608.03021","last_updated":"2026-08-04T02:06:46Z","snapshot_observed_at":"2026-08-08T04:12:49.047173Z","submitted_at":"2026-08-04T02:06:46Z","title":"MeloCodec: Harnessing Melodic Priors for High-Fidelity Singing Voice Representation","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-08T04:20:42.593969Z"},"links":{"cited_paper":"/paper/2310.03444","citing_paper":"/paper/2608.03021"},"observation_digest":"sha256:9a41a5c9d25874710989772d1e15b32de36fc495952e7976bbeea671c641d4dc","observation_id":"0da3e5b7-04ef-4702-b681-7569660fc2d6","resolution":{"observed_at":"2026-08-08T04:20:42.593969Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T04:20:43.517578Z","title":"Generative de-quantization for neural speech codec via latent diffusion,","venue":null,"work_id":"b56272f3-d15d-487a-bc03-a3985b53f35d","year":2024},"citing_paper":{"arxiv_id":"2608.03021","last_updated":"2026-08-04T02:06:46Z","snapshot_observed_at":"2026-08-08T04:12:49.047173Z","submitted_at":"2026-08-04T02:06:46Z","title":"MeloCodec: Harnessing Melodic Priors for High-Fidelity Singing Voice Representation","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-08T04:20:42.612516Z"},"links":{"citing_paper":"/paper/2608.03021"},"observation_digest":"sha256:9fbb4456f6523babf13ac68b565d65d16f25d9c6656840ebe769859c5c12ee07","observation_id":"4ea00bab-c182-4192-b1b2-aba2e404c08a","resolution":{"observed_at":"2026-08-08T04:20:43.523262Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T04:20:42.641478Z","title":"Hq-svc: Towards high-quality zero- shot singing voice conversion in low-resource scenarios,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.03021","last_updated":"2026-08-04T02:06:46Z","snapshot_observed_at":"2026-08-08T04:12:49.047173Z","submitted_at":"2026-08-04T02:06:46Z","title":"MeloCodec: Harnessing Melodic Priors for High-Fidelity Singing Voice Representation","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-08T04:20:42.641478Z"},"links":{"citing_paper":"/paper/2608.03021"},"observation_digest":"sha256:b1cb3a38855303812d128bb590310028ab01c580f8603695308bc11b64dd85b0","observation_id":"64724a5d-b20d-420d-af6c-84f4d10c480c","resolution":{"observed_at":"2026-08-08T04:20:42.641478Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T04:20:42.660039Z","title":"Muse: A multi-agent framework for unconstrained story envisioning via closed-loop cognitive orchestration,","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2608.03021","last_updated":"2026-08-04T02:06:46Z","snapshot_observed_at":"2026-08-08T04:12:49.047173Z","submitted_at":"2026-08-04T02:06:46Z","title":"MeloCodec: Harnessing Melodic Priors for High-Fidelity Singing Voice Representation","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-08T04:20:42.660039Z"},"links":{"citing_paper":"/paper/2608.03021"},"observation_digest":"sha256:752364bb9237dc89f3bc0022c5b48d53c41692c622e14b3f48714cb1d0a872cf","observation_id":"bff9680b-a80b-4765-805a-8c75a96ecb0d","resolution":{"observed_at":"2026-08-08T04:20:42.660039Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T04:20:42.690555Z","title":"Anyac- comp: Generalizable accompaniment generation via quantized melodic bottleneck,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.03021","last_updated":"2026-08-04T02:06:46Z","snapshot_observed_at":"2026-08-08T04:12:49.047173Z","submitted_at":"2026-08-04T02:06:46Z","title":"MeloCodec: Harnessing Melodic Priors for High-Fidelity Singing Voice Representation","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-08T04:20:42.690555Z"},"links":{"citing_paper":"/paper/2608.03021"},"observation_digest":"sha256:510a33fc8b1fbd9690d5149a69538dc4d3c05674d5efa3fe887ae4ea501d3721","observation_id":"91213f84-0abe-44fc-b610-c1219d93b31c","resolution":{"observed_at":"2026-08-08T04:20:42.690555Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T04:20:42.706234Z","title":"High-fidelity audio compression with improved rvqgan,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2608.03021","last_updated":"2026-08-04T02:06:46Z","snapshot_observed_at":"2026-08-08T04:12:49.047173Z","submitted_at":"2026-08-04T02:06:46Z","title":"MeloCodec: Harnessing Melodic Priors for High-Fidelity Singing Voice Representation","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-08T04:20:42.706234Z"},"links":{"citing_paper":"/paper/2608.03021"},"observation_digest":"sha256:351f1445ea85f7e69a5869ddd1b235f440ce880c2636fe56488f6df8266a3c5c","observation_id":"0972bb41-116a-44b7-8886-5d6d703f1f66","resolution":{"observed_at":"2026-08-08T04:20:42.706234Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.13216","last_updated":"2025-07-11T13:26:59Z","snapshot_observed_at":"2026-07-06T19:18:32.034335Z","submitted_at":"2024-09-20T05:06:49Z","title":"MuCodec: Ultra Low-Bitrate Music Codec","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.13216","snapshot_observed_at":"2026-08-08T04:20:42.740593Z","title":"Mucodec: Ultra low-bitrate music codec,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.03021","last_updated":"2026-08-04T02:06:46Z","snapshot_observed_at":"2026-08-08T04:12:49.047173Z","submitted_at":"2026-08-04T02:06:46Z","title":"MeloCodec: Harnessing Melodic Priors for High-Fidelity Singing Voice Representation","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-08T04:20:42.740593Z"},"links":{"cited_paper":"/paper/2409.13216","citing_paper":"/paper/2608.03021"},"observation_digest":"sha256:e77d69f609e637a77ef2939c4b35d7647f919d1e1d803bc74359e596aebb30fa","observation_id":"e527c669-83ca-4ce4-85fd-0eaeae17eb4e","resolution":{"observed_at":"2026-08-08T04:20:42.740593Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2201.07429","last_updated":"2022-01-20T02:08:47Z","snapshot_observed_at":"2026-07-06T12:28:39.665369Z","submitted_at":"2022-01-19T06:12:47Z","title":"Opencpop: A High-Quality Open Source Chinese Popular Song Corpus for Singing Voice Synthesis","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2201.07429","snapshot_observed_at":"2026-08-08T04:20:42.775161Z","title":"Opencpop: A high-quality open source chinese popular song corpus for singing voice synthesis,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2608.03021","last_updated":"2026-08-04T02:06:46Z","snapshot_observed_at":"2026-08-08T04:12:49.047173Z","submitted_at":"2026-08-04T02:06:46Z","title":"MeloCodec: Harnessing Melodic Priors for High-Fidelity Singing Voice Representation","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-08T04:20:42.775161Z"},"links":{"cited_paper":"/paper/2201.07429","citing_paper":"/paper/2608.03021"},"observation_digest":"sha256:c6222f3e5a29aa49cc75bf86826acc6f2a1ede3ec9082bda3fe8fd5a94732125","observation_id":"5f5ae095-07c6-4950-b631-9e75e266b7d2","resolution":{"observed_at":"2026-08-08T04:20:42.775161Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T04:20:43.491742Z","title":"Visqol: an objective speech quality model,","venue":null,"work_id":"f997af72-600c-438b-8b8c-53792bf53203","year":2015},"citing_paper":{"arxiv_id":"2608.03021","last_updated":"2026-08-04T02:06:46Z","snapshot_observed_at":"2026-08-08T04:12:49.047173Z","submitted_at":"2026-08-04T02:06:46Z","title":"MeloCodec: Harnessing Melodic Priors for High-Fidelity Singing Voice Representation","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-08T04:20:42.780448Z"},"links":{"citing_paper":"/paper/2608.03021"},"observation_digest":"sha256:0f5b2d4ba21c64ca03ce85674b025be8f5bd72749ec9c16eb3cd941de9c4b145","observation_id":"75f099c2-92fa-4e00-b64f-72aeb23bdc29","resolution":{"observed_at":"2026-08-08T04:20:43.497025Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T04:20:43.475042Z","title":"An algorithm for intelligibility prediction of time–frequency weighted noisy speech,","venue":null,"work_id":"76ea8304-d9bd-49a6-96aa-74aeb1bd9fcb","year":2011},"citing_paper":{"arxiv_id":"2608.03021","last_updated":"2026-08-04T02:06:46Z","snapshot_observed_at":"2026-08-08T04:12:49.047173Z","submitted_at":"2026-08-04T02:06:46Z","title":"MeloCodec: Harnessing Melodic Priors for High-Fidelity Singing Voice Representation","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-08T04:20:42.788441Z"},"links":{"citing_paper":"/paper/2608.03021"},"observation_digest":"sha256:929ec96e8ce61bebf20e2c46c175e70a246abedabd0ef9b9e95b7fd0582c4025","observation_id":"caa3e414-3588-4465-821a-7451fd51e340","resolution":{"observed_at":"2026-08-08T04:20:43.480460Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T04:20:43.461012Z","title":"Resnet 34,","venue":null,"work_id":"c01090f3-e74f-40e9-a9b4-31acd3bc6790","year":2021},"citing_paper":{"arxiv_id":"2608.03021","last_updated":"2026-08-04T02:06:46Z","snapshot_observed_at":"2026-08-08T04:12:49.047173Z","submitted_at":"2026-08-04T02:06:46Z","title":"MeloCodec: Harnessing Melodic Priors for High-Fidelity Singing Voice Representation","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-08T04:20:42.793281Z"},"links":{"citing_paper":"/paper/2608.03021"},"observation_digest":"sha256:ad08b40916fabdf3159f15dcbd23b0bd40d8d16836827abb7b3b8ab548560d53","observation_id":"53c5d624-6bd3-475a-9800-5b664c821e41","resolution":{"observed_at":"2026-08-08T04:20:43.465190Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T04:20:43.446181Z","title":"Towards the next generation of web-based experiments: A case study assessing basic audio quality following the itu-r recommendation bs. 1534 (mushra),","venue":null,"work_id":"34da2733-026d-4717-8dbe-651a3899cda3","year":2015},"citing_paper":{"arxiv_id":"2608.03021","last_updated":"2026-08-04T02:06:46Z","snapshot_observed_at":"2026-08-08T04:12:49.047173Z","submitted_at":"2026-08-04T02:06:46Z","title":"MeloCodec: Harnessing Melodic Priors for High-Fidelity Singing Voice Representation","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-08T04:20:42.798080Z"},"links":{"citing_paper":"/paper/2608.03021"},"observation_digest":"sha256:3f4043c986cd2906a348deb13d8d876cfd4bc73bceccaa2ae7a960fbafe4586d","observation_id":"4dfe5f9e-2eb5-44e8-a35c-e4b7b20446d7","resolution":{"observed_at":"2026-08-08T04:20:43.450570Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2608.03021","last_updated":"2026-08-04T02:06:46Z","latest_version":1,"primary_category":"cs.SD","snapshot_observed_at":"2026-08-08T04:12:49.047173Z","submitted_at":"2026-08-04T02:06:46Z","title":"MeloCodec: Harnessing Melodic Priors for High-Fidelity Singing Voice Representation"},"reference_resolution":{"displayed":31,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":18,"verified_exact":2,"verified_fuzzy":11},"total_outbound_references":31},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"thesis":"As of 8 August 2026, this Paper Citation Record lists 31 of 31 outbound references and 0 inbound Pith citation observations for arXiv:2608.03021."}