{"as_of":"2026-08-10T04:58:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:77558f60da1994c6491d0fa1778f8d198dbc3be36d8a735336eb0720c9050e2a","coverage":[{"denominator":46,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":46,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T15:30:36.587629Z","state":"measured"},{"denominator":48,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":48,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-09T06:31:02.800959+00:00","state":"measured"},{"denominator":2,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":2,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-06T15:57:20.468550Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-07-02T00:46:24.629085Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2505.14910","last_updated":"2025-05-30T10:20:59Z","snapshot_observed_at":"2026-08-07T23:08:37.820059Z","submitted_at":"2025-05-20T21:04:10Z","title":"TCSinger 2: Customizable Multilingual Zero-shot Singing Voice Synthesis","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.14910","snapshot_observed_at":"2026-08-06T15:57:20.468550Z","title":"Tcsinger 2: Customizable multilingual zero-shot singing voice synthesis,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.14534","last_updated":"2025-08-30T16:35:05Z","snapshot_observed_at":"2026-08-07T23:08:16.949133Z","submitted_at":"2025-07-19T08:32:07Z","title":"Conan: A Chunkwise Online Network for Zero-Shot Adaptive Voice Conversion","version":4},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-06T15:57:20.468550Z"},"links":{"cited_paper":"/paper/2505.14910","citing_paper":"/paper/2507.14534"},"observation_digest":"sha256:fae07d9e53781919af0bb209bf033bb02f6afcc88d8e61d2442512fc655a58ed","observation_id":"5fd170c3-41f0-43cd-92d2-d365d32067cf","resolution":{"observed_at":"2026-08-06T15:57:20.468550Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.14910","last_updated":"2025-05-30T10:20:59Z","snapshot_observed_at":"2026-08-07T23:08:37.820059Z","submitted_at":"2025-05-20T21:04:10Z","title":"TCSinger 2: Customizable Multilingual Zero-shot Singing Voice Synthesis","version":3},"cited_work":{"arxiv_id":"2505.14910","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2505.14910","snapshot_observed_at":"2026-07-02T00:46:24.629085Z","title":"arXiv preprint arXiv:2505.14910 , year=","venue":null,"work_id":"91d6fa08-d0ca-4fb2-bf72-8361a7bacceb","year":null},"citing_paper":{"arxiv_id":"2606.01677","last_updated":"2026-06-01T04:35:28Z","snapshot_observed_at":"2026-08-01T15:52:02.822088Z","submitted_at":"2026-06-01T04:35:28Z","title":"UniVocal: Unified Speech-Singing Code-Switching Synthesis","version":1},"reference_index":58,"source":"arxiv_source","source_observed_at":"2026-06-28T13:17:13.510587Z"},"links":{"cited_paper":"/paper/2505.14910","citing_paper":"/paper/2606.01677"},"observation_digest":"sha256:ffd94b30e73a4ccc83f49f1fa89108a6108e2fa5fd4b2702ea77436aec1fec4d","observation_id":"3bcef80d-a48b-4859-b412-ee6193d23a9f","resolution":{"observed_at":"2026-07-02T00:46:24.631288Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2505.14910/citation-record","integrity":"/paper/2505.14910/integrity","json":"/paper/2505.14910/citation-record.json","paper":"/paper/2505.14910"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:30:33.392441Z","title":null,"venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2505.14910","last_updated":"2025-05-30T10:20:59Z","snapshot_observed_at":"2026-08-07T23:08:37.820059Z","submitted_at":"2025-05-20T21:04:10Z","title":"TCSinger 2: Customizable Multilingual Zero-shot Singing Voice Synthesis","version":3},"reference_index":1,"source":"arxiv_source","source_observed_at":"2026-08-07T15:30:33.392441Z"},"links":{"citing_paper":"/paper/2505.14910"},"observation_digest":"sha256:c296526b2e4eedb493cbe989c7a41d47b71ee4762ec6524d7f9bd4c6362a0c14","observation_id":"c9cf087f-3685-424c-ad91-cc13a4a62d59","resolution":{"observed_at":"2026-08-07T15:30:33.392441Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:30:33.420924Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2505.14910","last_updated":"2025-05-30T10:20:59Z","snapshot_observed_at":"2026-08-07T23:08:37.820059Z","submitted_at":"2025-05-20T21:04:10Z","title":"TCSinger 2: Customizable Multilingual Zero-shot Singing Voice Synthesis","version":3},"reference_index":2,"source":"arxiv_source","source_observed_at":"2026-08-07T15:30:33.420924Z"},"links":{"citing_paper":"/paper/2505.14910"},"observation_digest":"sha256:d76158e280535d0cbb8479c78b6107c6b2549b1abdbdb464aac58e43d870cc92","observation_id":"5dcc2ae3-9df9-4a24-8384-048be9f0c8b1","resolution":{"observed_at":"2026-08-07T15:30:33.420924Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:30:37.334035Z","title":null,"venue":null,"work_id":"7c0ba03b-7e91-4ad3-bfcb-de1c097a1bee","year":2022},"citing_paper":{"arxiv_id":"2505.14910","last_updated":"2025-05-30T10:20:59Z","snapshot_observed_at":"2026-08-07T23:08:37.820059Z","submitted_at":"2025-05-20T21:04:10Z","title":"TCSinger 2: Customizable Multilingual Zero-shot Singing Voice Synthesis","version":3},"reference_index":3,"source":"arxiv_source","source_observed_at":"2026-08-07T15:30:33.482630Z"},"links":{"citing_paper":"/paper/2505.14910"},"observation_digest":"sha256:c99ffa2361431e5bfc53027c6f216c09a4055e0d38525d5ac2d8d97302df9e85","observation_id":"05ffc672-d64c-409a-9236-18fc6a2d0a8a","resolution":{"observed_at":"2026-08-07T15:30:37.337796Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2005.08484","last_updated":"2020-08-12T05:55:21Z","snapshot_observed_at":"2026-08-09T12:05:58.275297Z","submitted_at":"2020-05-18T06:55:38Z","title":"Attentron: Few-Shot Text-to-Speech Utilizing Attention-Based Variable-Length Embedding","version":2},"cited_work":{"arxiv_id":"2005.08484","doi":null,"metadata_source":"pith","pith_arxiv_id":"2005.08484","snapshot_observed_at":"2026-08-07T15:30:37.074911Z","title":"Attentron: Few-Shot Text-to-Speech Utilizing Attention-Based Variable-Length Embedding","venue":"eess.AS","work_id":"109821fc-c1d0-498f-b652-f9ace3cbd617","year":2020},"citing_paper":{"arxiv_id":"2505.14910","last_updated":"2025-05-30T10:20:59Z","snapshot_observed_at":"2026-08-07T23:08:37.820059Z","submitted_at":"2025-05-20T21:04:10Z","title":"TCSinger 2: Customizable Multilingual Zero-shot Singing Voice Synthesis","version":3},"reference_index":4,"source":"arxiv_source","source_observed_at":"2026-08-07T15:30:33.557451Z"},"links":{"cited_paper":"/paper/2005.08484","citing_paper":"/paper/2505.14910"},"observation_digest":"sha256:cf1643f109a89c184406f581fb6510fa4feefdb26882de5068cd5fce353f1e2f","observation_id":"f5ef4603-47a0-4063-ae54-59a73d0c6095","resolution":{"observed_at":"2026-08-07T15:30:37.079346Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:30:37.323049Z","title":null,"venue":null,"work_id":"447b1e6b-b741-43f8-93a7-e3b29e3f440b","year":2022},"citing_paper":{"arxiv_id":"2505.14910","last_updated":"2025-05-30T10:20:59Z","snapshot_observed_at":"2026-08-07T23:08:37.820059Z","submitted_at":"2025-05-20T21:04:10Z","title":"TCSinger 2: Customizable Multilingual Zero-shot Singing Voice Synthesis","version":3},"reference_index":5,"source":"arxiv_source","source_observed_at":"2026-08-07T15:30:33.625346Z"},"links":{"citing_paper":"/paper/2505.14910"},"observation_digest":"sha256:48f192c9cb774cc98a12c25a9b831f388aceb0800cffa18665d8f699590f22b7","observation_id":"0c347295-2ed8-4241-ada7-32723b48aa38","resolution":{"observed_at":"2026-08-07T15:30:37.326082Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:30:33.688527Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.14910","last_updated":"2025-05-30T10:20:59Z","snapshot_observed_at":"2026-08-07T23:08:37.820059Z","submitted_at":"2025-05-20T21:04:10Z","title":"TCSinger 2: Customizable Multilingual Zero-shot Singing Voice Synthesis","version":3},"reference_index":6,"source":"arxiv_source","source_observed_at":"2026-08-07T15:30:33.688527Z"},"links":{"citing_paper":"/paper/2505.14910"},"observation_digest":"sha256:fdb5e614e7f6cb39062287aeba27bfab47a8839a9df0bf4d99379b14f20fea77","observation_id":"4191a093-a254-45f8-92db-bb6fb7c14145","resolution":{"observed_at":"2026-08-07T15:30:33.688527Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:30:37.303461Z","title":null,"venue":null,"work_id":"7d73ebe7-1ba6-4acf-a116-07bbfd79d4e1","year":2024},"citing_paper":{"arxiv_id":"2505.14910","last_updated":"2025-05-30T10:20:59Z","snapshot_observed_at":"2026-08-07T23:08:37.820059Z","submitted_at":"2025-05-20T21:04:10Z","title":"TCSinger 2: Customizable Multilingual Zero-shot Singing Voice Synthesis","version":3},"reference_index":7,"source":"arxiv_source","source_observed_at":"2026-08-07T15:30:33.773809Z"},"links":{"citing_paper":"/paper/2505.14910"},"observation_digest":"sha256:7f8b31cff508f561e4d57d002929e9c9eb45085d5268c0f117a6a5580eca08fa","observation_id":"ddb454bf-a35f-4362-8940-2bf6b2a40ba4","resolution":{"observed_at":"2026-08-07T15:30:37.306758Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.05407","last_updated":"2024-07-09T07:42:51Z","snapshot_observed_at":"2026-07-06T18:42:34.958119Z","submitted_at":"2024-07-07T15:16:19Z","title":"CosyVoice: A Scalable Multilingual Zero-shot Text-to-speech Synthesizer based on Supervised Semantic Tokens","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.05407","snapshot_observed_at":"2026-08-07T15:30:33.861323Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.14910","last_updated":"2025-05-30T10:20:59Z","snapshot_observed_at":"2026-08-07T23:08:37.820059Z","submitted_at":"2025-05-20T21:04:10Z","title":"TCSinger 2: Customizable Multilingual Zero-shot Singing Voice Synthesis","version":3},"reference_index":8,"source":"arxiv_source","source_observed_at":"2026-08-07T15:30:33.861323Z"},"links":{"cited_paper":"/paper/2407.05407","citing_paper":"/paper/2505.14910"},"observation_digest":"sha256:0aef888dc989d78afe851d97778e0b6b5f862be4bd5468a4248225056329188e","observation_id":"e4a4e568-c8e5-48be-941b-4306ad37de8a","resolution":{"observed_at":"2026-08-07T15:30:33.861323Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:30:33.938821Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2505.14910","last_updated":"2025-05-30T10:20:59Z","snapshot_observed_at":"2026-08-07T23:08:37.820059Z","submitted_at":"2025-05-20T21:04:10Z","title":"TCSinger 2: Customizable Multilingual Zero-shot Singing Voice Synthesis","version":3},"reference_index":9,"source":"arxiv_source","source_observed_at":"2026-08-07T15:30:33.938821Z"},"links":{"citing_paper":"/paper/2505.14910"},"observation_digest":"sha256:55de42002bc3a99ec7cc7732b319816aafbce3020436ec76755f71d98f6b5570","observation_id":"7eda173a-54a6-4ea5-9de3-43a1a2e1fa0a","resolution":{"observed_at":"2026-08-07T15:30:33.938821Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.12572","last_updated":"2025-04-21T14:43:30Z","snapshot_observed_at":"2026-08-07T18:10:06.113951Z","submitted_at":"2025-02-18T06:25:07Z","title":"TechSinger: Technique Controllable Multilingual Singing Voice Synthesis via Flow Matching","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.12572","snapshot_observed_at":"2026-08-07T15:30:34.033132Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.14910","last_updated":"2025-05-30T10:20:59Z","snapshot_observed_at":"2026-08-07T23:08:37.820059Z","submitted_at":"2025-05-20T21:04:10Z","title":"TCSinger 2: Customizable Multilingual Zero-shot Singing Voice Synthesis","version":3},"reference_index":10,"source":"arxiv_source","source_observed_at":"2026-08-07T15:30:34.033132Z"},"links":{"cited_paper":"/paper/2502.12572","citing_paper":"/paper/2505.14910"},"observation_digest":"sha256:72d5f1fdeb9f98f79562d18a868d19c77c14898026e8d82c20d69aca0fc25d23","observation_id":"169569ea-f3e9-47af-a652-a4d5a2fb200b","resolution":{"observed_at":"2026-08-07T15:30:34.033132Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:30:37.285278Z","title":null,"venue":null,"work_id":"af954885-2cd8-45a5-a217-d5a5f256722a","year":2021},"citing_paper":{"arxiv_id":"2505.14910","last_updated":"2025-05-30T10:20:59Z","snapshot_observed_at":"2026-08-07T23:08:37.820059Z","submitted_at":"2025-05-20T21:04:10Z","title":"TCSinger 2: Customizable Multilingual Zero-shot Singing Voice Synthesis","version":3},"reference_index":11,"source":"arxiv_source","source_observed_at":"2026-08-07T15:30:34.073008Z"},"links":{"citing_paper":"/paper/2505.14910"},"observation_digest":"sha256:dee1f27f0cc0916597bf8ac3e818c4107bccd8d5d0492ca230ddf5557ceec954","observation_id":"f9c9b822-fbd8-49ad-863b-8b3d38e2dd92","resolution":{"observed_at":"2026-08-07T15:30:37.288661Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.18924","last_updated":"2025-03-28T05:34:33Z","snapshot_observed_at":"2026-08-07T23:06:04.015261Z","submitted_at":"2025-02-26T08:22:00Z","title":"MegaTTS 3: Sparse Alignment Enhanced Latent Diffusion Transformer for Zero-Shot Speech Synthesis","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.18924","snapshot_observed_at":"2026-08-07T15:30:34.140760Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.14910","last_updated":"2025-05-30T10:20:59Z","snapshot_observed_at":"2026-08-07T23:08:37.820059Z","submitted_at":"2025-05-20T21:04:10Z","title":"TCSinger 2: Customizable Multilingual Zero-shot Singing Voice Synthesis","version":3},"reference_index":12,"source":"arxiv_source","source_observed_at":"2026-08-07T15:30:34.140760Z"},"links":{"cited_paper":"/paper/2502.18924","citing_paper":"/paper/2505.14910"},"observation_digest":"sha256:d09dcb3a96dab4ccd4922bf8381514b7177299690e24c010a5b1cfebc4ebe6fc","observation_id":"cdbe0ec9-7038-4163-a31d-7bc3d19ebd5f","resolution":{"observed_at":"2026-08-07T15:30:34.140760Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:30:34.315195Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.14910","last_updated":"2025-05-30T10:20:59Z","snapshot_observed_at":"2026-08-07T23:08:37.820059Z","submitted_at":"2025-05-20T21:04:10Z","title":"TCSinger 2: Customizable Multilingual Zero-shot Singing Voice Synthesis","version":3},"reference_index":13,"source":"arxiv_source","source_observed_at":"2026-08-07T15:30:34.315195Z"},"links":{"citing_paper":"/paper/2505.14910"},"observation_digest":"sha256:e33b2714dbd14a00ff3acc1a4a6bbd156d8d9f0831e69b20ba5e9d7b871f0487","observation_id":"d0b3559a-e7e0-45e4-b2fc-ae3dc6a9ffc7","resolution":{"observed_at":"2026-08-07T15:30:34.315195Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2206.11558","last_updated":"2024-06-13T14:48:58Z","snapshot_observed_at":"2026-08-09T15:14:55.850478Z","submitted_at":"2022-06-23T09:11:02Z","title":"Adversarial Multi-Task Learning for Disentangling Timbre and Pitch in Singing Voice Synthesis","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2206.11558","snapshot_observed_at":"2026-08-07T15:30:34.497937Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2505.14910","last_updated":"2025-05-30T10:20:59Z","snapshot_observed_at":"2026-08-07T23:08:37.820059Z","submitted_at":"2025-05-20T21:04:10Z","title":"TCSinger 2: Customizable Multilingual Zero-shot Singing Voice Synthesis","version":3},"reference_index":14,"source":"arxiv_source","source_observed_at":"2026-08-07T15:30:34.497937Z"},"links":{"cited_paper":"/paper/2206.11558","citing_paper":"/paper/2505.14910"},"observation_digest":"sha256:8fb0d86751bfb6b08cad75fc4b37cdf8a41ea3bc2f839d0e8635da2f82a14b6a","observation_id":"238d68eb-c085-4a9b-97f1-ab1824759b3b","resolution":{"observed_at":"2026-08-07T15:30:34.497937Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1312.6114","last_updated":"2022-12-10T21:04:00Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2013-12-20T20:58:10Z","title":"Auto-Encoding Variational Bayes","version":11},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1312.6114","snapshot_observed_at":"2026-08-07T15:30:34.639120Z","title":null,"venue":null,"work_id":null,"year":2013},"citing_paper":{"arxiv_id":"2505.14910","last_updated":"2025-05-30T10:20:59Z","snapshot_observed_at":"2026-08-07T23:08:37.820059Z","submitted_at":"2025-05-20T21:04:10Z","title":"TCSinger 2: Customizable Multilingual Zero-shot Singing Voice Synthesis","version":3},"reference_index":15,"source":"arxiv_source","source_observed_at":"2026-08-07T15:30:34.639120Z"},"links":{"cited_paper":"/paper/1312.6114","citing_paper":"/paper/2505.14910"},"observation_digest":"sha256:a8260703c9e7454b06bead9e30b83700ae4e4b15edcef85fb89a259132c407ae","observation_id":"da96b306-6b19-4f61-84a1-68997a5df930","resolution":{"observed_at":"2026-08-07T15:30:34.639120Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:30:34.761923Z","title":null,"venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2505.14910","last_updated":"2025-05-30T10:20:59Z","snapshot_observed_at":"2026-08-07T23:08:37.820059Z","submitted_at":"2025-05-20T21:04:10Z","title":"TCSinger 2: Customizable Multilingual Zero-shot Singing Voice Synthesis","version":3},"reference_index":16,"source":"arxiv_source","source_observed_at":"2026-08-07T15:30:34.761923Z"},"links":{"citing_paper":"/paper/2505.14910"},"observation_digest":"sha256:9b168a660a71bc2f2fafca459fd577e40dfef42c05ed8062535dde4743a6a200","observation_id":"1c94b954-fb73-460f-b6a2-733016aaaafa","resolution":{"observed_at":"2026-08-07T15:30:34.761923Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:30:37.259980Z","title":null,"venue":null,"work_id":"1358446b-aab2-4c00-aad3-220a6c90c1ee","year":2021},"citing_paper":{"arxiv_id":"2505.14910","last_updated":"2025-05-30T10:20:59Z","snapshot_observed_at":"2026-08-07T23:08:37.820059Z","submitted_at":"2025-05-20T21:04:10Z","title":"TCSinger 2: Customizable Multilingual Zero-shot Singing Voice Synthesis","version":3},"reference_index":17,"source":"arxiv_source","source_observed_at":"2026-08-07T15:30:34.872480Z"},"links":{"citing_paper":"/paper/2505.14910"},"observation_digest":"sha256:7abb4f4aa5706c238e809c6e19db96f4040e7aa06c6c371191908a798eb95dd3","observation_id":"cbd57e01-15f7-40af-bcb7-3371e7cd79ca","resolution":{"observed_at":"2026-08-07T15:30:37.263260Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2405.09940","last_updated":"2024-06-03T17:33:25Z","snapshot_observed_at":"2026-07-06T18:15:11.806744Z","submitted_at":"2024-05-16T09:43:40Z","title":"Robust Singing Voice Transcription Serves Synthesis","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.09940","snapshot_observed_at":"2026-08-07T15:30:34.993541Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.14910","last_updated":"2025-05-30T10:20:59Z","snapshot_observed_at":"2026-08-07T23:08:37.820059Z","submitted_at":"2025-05-20T21:04:10Z","title":"TCSinger 2: Customizable Multilingual Zero-shot Singing Voice Synthesis","version":3},"reference_index":18,"source":"arxiv_source","source_observed_at":"2026-08-07T15:30:34.993541Z"},"links":{"cited_paper":"/paper/2405.09940","citing_paper":"/paper/2505.14910"},"observation_digest":"sha256:546e0dafec8bb65d599807daa8500c37dcb069fde3b75ad298d3837d854f98c0","observation_id":"1f607609-03d1-4526-bea3-2cdff3df44ee","resolution":{"observed_at":"2026-08-07T15:30:34.993541Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2205.15439","last_updated":"2023-11-20T04:31:13Z","snapshot_observed_at":"2026-07-06T13:15:39.751387Z","submitted_at":"2022-05-30T21:34:40Z","title":"StyleTTS: A Style-Based Generative Model for Natural and Diverse Text-to-Speech Synthesis","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2205.15439","snapshot_observed_at":"2026-08-07T15:30:35.054489Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2505.14910","last_updated":"2025-05-30T10:20:59Z","snapshot_observed_at":"2026-08-07T23:08:37.820059Z","submitted_at":"2025-05-20T21:04:10Z","title":"TCSinger 2: Customizable Multilingual Zero-shot Singing Voice Synthesis","version":3},"reference_index":19,"source":"arxiv_source","source_observed_at":"2026-08-07T15:30:35.054489Z"},"links":{"cited_paper":"/paper/2205.15439","citing_paper":"/paper/2505.14910"},"observation_digest":"sha256:55812fb238e5ffafa1ac1f6be54295490cf9a3370c3616bc8b67506b9c5f7e92","observation_id":"dbac7877-7128-4abe-8a4a-fe50e05afa1a","resolution":{"observed_at":"2026-08-07T15:30:35.054489Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:30:35.058498Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.14910","last_updated":"2025-05-30T10:20:59Z","snapshot_observed_at":"2026-08-07T23:08:37.820059Z","submitted_at":"2025-05-20T21:04:10Z","title":"TCSinger 2: Customizable Multilingual Zero-shot Singing Voice Synthesis","version":3},"reference_index":20,"source":"arxiv_source","source_observed_at":"2026-08-07T15:30:35.058498Z"},"links":{"citing_paper":"/paper/2505.14910"},"observation_digest":"sha256:a038b8123ade6e5273c82c680d78d2e97d0e2f4d794de332321461746912fb49","observation_id":"de947884-983c-49f2-a07d-6efde2c27313","resolution":{"observed_at":"2026-08-07T15:30:35.058498Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2202.13277","last_updated":"2022-03-02T11:22:45Z","snapshot_observed_at":"2026-08-02T05:32:20.324935Z","submitted_at":"2022-02-27T03:10:12Z","title":"Learning the Beauty in Songs: Neural Singing Voice Beautifier","version":2},"cited_work":{"arxiv_id":"2202.13277","doi":null,"metadata_source":"pith","pith_arxiv_id":"2202.13277","snapshot_observed_at":"2026-08-07T15:30:36.972088Z","title":"Learning the Beauty in Songs: Neural Singing Voice Beautifier","venue":"eess.AS","work_id":"5dcc180e-e3ea-44fe-9176-083cacfa6774","year":2022},"citing_paper":{"arxiv_id":"2505.14910","last_updated":"2025-05-30T10:20:59Z","snapshot_observed_at":"2026-08-07T23:08:37.820059Z","submitted_at":"2025-05-20T21:04:10Z","title":"TCSinger 2: Customizable Multilingual Zero-shot Singing Voice Synthesis","version":3},"reference_index":21,"source":"arxiv_source","source_observed_at":"2026-08-07T15:30:35.135189Z"},"links":{"cited_paper":"/paper/2202.13277","citing_paper":"/paper/2505.14910"},"observation_digest":"sha256:b0938166a9c7f96d46f59cd97c73e56a0ee3a43c3ae7fa697708063d52f15e59","observation_id":"427c436a-4a51-4db7-811a-231c9c66ac5d","resolution":{"observed_at":"2026-08-07T15:30:36.976503Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:30:37.238668Z","title":null,"venue":null,"work_id":"80b4e36a-82be-4328-9256-84a0dac066f8","year":2022},"citing_paper":{"arxiv_id":"2505.14910","last_updated":"2025-05-30T10:20:59Z","snapshot_observed_at":"2026-08-07T23:08:37.820059Z","submitted_at":"2025-05-20T21:04:10Z","title":"TCSinger 2: Customizable Multilingual Zero-shot Singing Voice Synthesis","version":3},"reference_index":22,"source":"arxiv_source","source_observed_at":"2026-08-07T15:30:35.206291Z"},"links":{"citing_paper":"/paper/2505.14910"},"observation_digest":"sha256:fcaa96aac405b4680143f6e61f74c0104eae2ca5baa4e642175b93a4e6df0cc4","observation_id":"fa4627a1-e6a7-43a7-b865-fbffba966280","resolution":{"observed_at":"2026-08-07T15:30:37.243359Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:30:37.228020Z","title":null,"venue":null,"work_id":"5f957237-0c6d-4f59-bee3-c2e76e29ae87","year":2017},"citing_paper":{"arxiv_id":"2505.14910","last_updated":"2025-05-30T10:20:59Z","snapshot_observed_at":"2026-08-07T23:08:37.820059Z","submitted_at":"2025-05-20T21:04:10Z","title":"TCSinger 2: Customizable Multilingual Zero-shot Singing Voice Synthesis","version":3},"reference_index":23,"source":"arxiv_source","source_observed_at":"2026-08-07T15:30:35.264940Z"},"links":{"citing_paper":"/paper/2505.14910"},"observation_digest":"sha256:e64d9e9905a45a4b9ba80bf63cd7c4681439882e38b8ea25e96967c0f1d757b1","observation_id":"6f4ec927-a97f-4fa1-a912-d9dd2f6eefff","resolution":{"observed_at":"2026-08-07T15:30:37.231596Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:30:35.319332Z","title":null,"venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2505.14910","last_updated":"2025-05-30T10:20:59Z","snapshot_observed_at":"2026-08-07T23:08:37.820059Z","submitted_at":"2025-05-20T21:04:10Z","title":"TCSinger 2: Customizable Multilingual Zero-shot Singing Voice Synthesis","version":3},"reference_index":24,"source":"arxiv_source","source_observed_at":"2026-08-07T15:30:35.319332Z"},"links":{"citing_paper":"/paper/2505.14910"},"observation_digest":"sha256:5785861ea28058185bd97a3bbdff78cdf95db8595cb390656a037cfec53c639f","observation_id":"b31afce6-f9cf-4974-b83d-cb741fa98f3f","resolution":{"observed_at":"2026-08-07T15:30:35.319332Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2112.14397","last_updated":"2022-10-09T12:32:34Z","snapshot_observed_at":"2026-08-01T20:40:28.453199Z","submitted_at":"2021-12-29T04:52:14Z","title":"EvoMoE: An Evolutional Mixture-of-Experts Training Framework via Dense-To-Sparse Gate","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2112.14397","snapshot_observed_at":"2026-08-07T15:30:35.382095Z","title":null,"venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2505.14910","last_updated":"2025-05-30T10:20:59Z","snapshot_observed_at":"2026-08-07T23:08:37.820059Z","submitted_at":"2025-05-20T21:04:10Z","title":"TCSinger 2: Customizable Multilingual Zero-shot Singing Voice Synthesis","version":3},"reference_index":25,"source":"arxiv_source","source_observed_at":"2026-08-07T15:30:35.382095Z"},"links":{"cited_paper":"/paper/2112.14397","citing_paper":"/paper/2505.14910"},"observation_digest":"sha256:8a18744bae4f1570dda7986d4248beb373802a8bba5a55925544eb014aea19f8","observation_id":"70e48860-b676-4071-bf22-be765ed05106","resolution":{"observed_at":"2026-08-07T15:30:35.382095Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:30:35.444570Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.14910","last_updated":"2025-05-30T10:20:59Z","snapshot_observed_at":"2026-08-07T23:08:37.820059Z","submitted_at":"2025-05-20T21:04:10Z","title":"TCSinger 2: Customizable Multilingual Zero-shot Singing Voice Synthesis","version":3},"reference_index":26,"source":"arxiv_source","source_observed_at":"2026-08-07T15:30:35.444570Z"},"links":{"citing_paper":"/paper/2505.14910"},"observation_digest":"sha256:eaa5d05355c66f9677a8b87ca5316eb2cf29170801a0b1a17d97b2f8d4b54e12","observation_id":"50122085-c175-49e7-b1b4-07a5157f2c4f","resolution":{"observed_at":"2026-08-07T15:30:35.444570Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:30:35.516583Z","title":null,"venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2505.14910","last_updated":"2025-05-30T10:20:59Z","snapshot_observed_at":"2026-08-07T23:08:37.820059Z","submitted_at":"2025-05-20T21:04:10Z","title":"TCSinger 2: Customizable Multilingual Zero-shot Singing Voice Synthesis","version":3},"reference_index":27,"source":"arxiv_source","source_observed_at":"2026-08-07T15:30:35.516583Z"},"links":{"citing_paper":"/paper/2505.14910"},"observation_digest":"sha256:0827f7766162a2ba66eb73eb38207efbe16fe6c109a4c6937aec5fb4e3e3526d","observation_id":"791ea4ca-c825-4973-a355-34a4c302c919","resolution":{"observed_at":"2026-08-07T15:30:35.516583Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:30:35.556027Z","title":null,"venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2505.14910","last_updated":"2025-05-30T10:20:59Z","snapshot_observed_at":"2026-08-07T23:08:37.820059Z","submitted_at":"2025-05-20T21:04:10Z","title":"TCSinger 2: Customizable Multilingual Zero-shot Singing Voice Synthesis","version":3},"reference_index":28,"source":"arxiv_source","source_observed_at":"2026-08-07T15:30:35.556027Z"},"links":{"citing_paper":"/paper/2505.14910"},"observation_digest":"sha256:f43545903a4fc089b12fdcd17ec3a431c958775fd3038d50fab4d1bef6c3cf74","observation_id":"534e9ede-d650-45cb-a639-34ad008fb4bf","resolution":{"observed_at":"2026-08-07T15:30:35.556027Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:30:35.632941Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.14910","last_updated":"2025-05-30T10:20:59Z","snapshot_observed_at":"2026-08-07T23:08:37.820059Z","submitted_at":"2025-05-20T21:04:10Z","title":"TCSinger 2: Customizable Multilingual Zero-shot Singing Voice Synthesis","version":3},"reference_index":29,"source":"arxiv_source","source_observed_at":"2026-08-07T15:30:35.632941Z"},"links":{"citing_paper":"/paper/2505.14910"},"observation_digest":"sha256:ac61d1755511f785230808a8e0dd263fb2d0a1c1e0ae926be6228b0285e84b50","observation_id":"0c0a1a61-6b21-4f04-99d7-1545387553d4","resolution":{"observed_at":"2026-08-07T15:30:35.632941Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:30:37.178973Z","title":null,"venue":null,"work_id":"85a6fd8e-929b-4eda-adeb-c204b8811b52","year":2010},"citing_paper":{"arxiv_id":"2505.14910","last_updated":"2025-05-30T10:20:59Z","snapshot_observed_at":"2026-08-07T23:08:37.820059Z","submitted_at":"2025-05-20T21:04:10Z","title":"TCSinger 2: Customizable Multilingual Zero-shot Singing Voice Synthesis","version":3},"reference_index":30,"source":"arxiv_source","source_observed_at":"2026-08-07T15:30:35.740560Z"},"links":{"citing_paper":"/paper/2505.14910"},"observation_digest":"sha256:dd86b85a14581cce6c09b9b948ec32c5e0be5a501f41f4b9027919ee24a10133","observation_id":"d402ae60-0553-4b8f-a4ae-4a58abf192a3","resolution":{"observed_at":"2026-08-07T15:30:37.182824Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2403.11780","last_updated":"2025-01-06T09:08:24Z","snapshot_observed_at":"2026-07-06T17:46:15.903070Z","submitted_at":"2024-03-18T13:39:05Z","title":"Prompt-Singer: Controllable Singing-Voice-Synthesis with Natural Language Prompt","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.11780","snapshot_observed_at":"2026-08-07T15:30:35.813329Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.14910","last_updated":"2025-05-30T10:20:59Z","snapshot_observed_at":"2026-08-07T23:08:37.820059Z","submitted_at":"2025-05-20T21:04:10Z","title":"TCSinger 2: Customizable Multilingual Zero-shot Singing Voice Synthesis","version":3},"reference_index":31,"source":"arxiv_source","source_observed_at":"2026-08-07T15:30:35.813329Z"},"links":{"cited_paper":"/paper/2403.11780","citing_paper":"/paper/2505.14910"},"observation_digest":"sha256:9dfa334779925d7111a06dd9a00b77c9f481923fa191fe4c3aefca726e094720","observation_id":"f26995bc-7a00-48d6-89aa-896d36747227","resolution":{"observed_at":"2026-08-07T15:30:35.813329Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2201.07429","last_updated":"2022-01-20T02:08:47Z","snapshot_observed_at":"2026-07-06T12:28:39.665369Z","submitted_at":"2022-01-19T06:12:47Z","title":"Opencpop: A High-Quality Open Source Chinese Popular Song Corpus for Singing Voice Synthesis","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2201.07429","snapshot_observed_at":"2026-08-07T15:30:35.949124Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2505.14910","last_updated":"2025-05-30T10:20:59Z","snapshot_observed_at":"2026-08-07T23:08:37.820059Z","submitted_at":"2025-05-20T21:04:10Z","title":"TCSinger 2: Customizable Multilingual Zero-shot Singing Voice Synthesis","version":3},"reference_index":32,"source":"arxiv_source","source_observed_at":"2026-08-07T15:30:35.949124Z"},"links":{"cited_paper":"/paper/2201.07429","citing_paper":"/paper/2505.14910"},"observation_digest":"sha256:fb35245b2583356e42f9a0f8bc8e7d37433e9402e852fcae844173d0be2a6722","observation_id":"e12593b5-33ad-4c8e-9fe2-b2dae37edd92","resolution":{"observed_at":"2026-08-07T15:30:35.949124Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2108.02271","last_updated":"2022-04-05T18:06:21Z","snapshot_observed_at":"2026-08-09T19:14:28.791424Z","submitted_at":"2021-08-04T20:13:00Z","title":"Daft-Exprt: Cross-Speaker Prosody Transfer on Any Text for Expressive Speech Synthesis","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2108.02271","snapshot_observed_at":"2026-08-07T15:30:36.001933Z","title":null,"venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2505.14910","last_updated":"2025-05-30T10:20:59Z","snapshot_observed_at":"2026-08-07T23:08:37.820059Z","submitted_at":"2025-05-20T21:04:10Z","title":"TCSinger 2: Customizable Multilingual Zero-shot Singing Voice Synthesis","version":3},"reference_index":33,"source":"arxiv_source","source_observed_at":"2026-08-07T15:30:36.001933Z"},"links":{"cited_paper":"/paper/2108.02271","citing_paper":"/paper/2505.14910"},"observation_digest":"sha256:d9bb51e545497425b31497b7cd621883c69a46317019005b891df42ed198201a","observation_id":"3589c52b-de43-4994-a553-0808f52ec939","resolution":{"observed_at":"2026-08-07T15:30:36.001933Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:30:36.064355Z","title":null,"venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2505.14910","last_updated":"2025-05-30T10:20:59Z","snapshot_observed_at":"2026-08-07T23:08:37.820059Z","submitted_at":"2025-05-20T21:04:10Z","title":"TCSinger 2: Customizable Multilingual Zero-shot Singing Voice Synthesis","version":3},"reference_index":34,"source":"arxiv_source","source_observed_at":"2026-08-07T15:30:36.064355Z"},"links":{"citing_paper":"/paper/2505.14910"},"observation_digest":"sha256:dcbf4f71aa5f4a71ff67359e748904435b0c8a2b3524390d3720aef30449e04e","observation_id":"b2945370-e2dd-4abd-b1e5-a9991b5ff303","resolution":{"observed_at":"2026-08-07T15:30:36.064355Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:30:37.160448Z","title":null,"venue":null,"work_id":"f0530aed-1ee3-4a39-b21a-8e6d29817826","year":2022},"citing_paper":{"arxiv_id":"2505.14910","last_updated":"2025-05-30T10:20:59Z","snapshot_observed_at":"2026-08-07T23:08:37.820059Z","submitted_at":"2025-05-20T21:04:10Z","title":"TCSinger 2: Customizable Multilingual Zero-shot Singing Voice Synthesis","version":3},"reference_index":35,"source":"arxiv_source","source_observed_at":"2026-08-07T15:30:36.073553Z"},"links":{"citing_paper":"/paper/2505.14910"},"observation_digest":"sha256:ed0cf0a3a0ecddc87d1b4b3790ac89bd06351d6a5fb0d0fa2998622ab16d96c9","observation_id":"e0b40519-d118-4b87-b396-95d6309f27d2","resolution":{"observed_at":"2026-08-07T15:30:37.164308Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:30:37.147087Z","title":null,"venue":null,"work_id":"7a454204-94db-49f5-a4c6-82036bf71989","year":2025},"citing_paper":{"arxiv_id":"2505.14910","last_updated":"2025-05-30T10:20:59Z","snapshot_observed_at":"2026-08-07T23:08:37.820059Z","submitted_at":"2025-05-20T21:04:10Z","title":"TCSinger 2: Customizable Multilingual Zero-shot Singing Voice Synthesis","version":3},"reference_index":36,"source":"arxiv_source","source_observed_at":"2026-08-07T15:30:36.077609Z"},"links":{"citing_paper":"/paper/2505.14910"},"observation_digest":"sha256:26cc60bc10fd810924e479c3a0ca8235859415a829a8972e1618249a8cafb572","observation_id":"2ced3b19-4de3-4b90-ab1d-c1afdf8d9a76","resolution":{"observed_at":"2026-08-07T15:30:37.150662Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:30:37.135384Z","title":null,"venue":null,"work_id":"deb53481-61c0-48cc-add2-1db6c4e806c5","year":2024},"citing_paper":{"arxiv_id":"2505.14910","last_updated":"2025-05-30T10:20:59Z","snapshot_observed_at":"2026-08-07T23:08:37.820059Z","submitted_at":"2025-05-20T21:04:10Z","title":"TCSinger 2: Customizable Multilingual Zero-shot Singing Voice Synthesis","version":3},"reference_index":37,"source":"arxiv_source","source_observed_at":"2026-08-07T15:30:36.091623Z"},"links":{"citing_paper":"/paper/2505.14910"},"observation_digest":"sha256:c958181c5cbb823edf326010f1f390dc22b7f753d060bba27b1f27214f2961af","observation_id":"1ff8e260-8ee8-461d-ad14-16ef03134356","resolution":{"observed_at":"2026-08-07T15:30:37.138542Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.00426","last_updated":"2025-05-01T09:54:12Z","snapshot_observed_at":"2026-08-07T15:57:25.964802Z","submitted_at":"2025-05-01T09:54:12Z","title":"Leveraging Pretrained Diffusion Models for Zero-Shot Part Assembly","version":1},"cited_work":{"arxiv_id":"2505.00426","doi":null,"metadata_source":"pith","pith_arxiv_id":"2505.00426","snapshot_observed_at":"2026-08-07T15:30:36.905194Z","title":"Leveraging Pretrained Diffusion Models for Zero-Shot Part Assembly","venue":"cs.CV","work_id":"bb4b4d9b-a575-40ce-8d61-cbe5f66dcac8","year":2025},"citing_paper":{"arxiv_id":"2505.14910","last_updated":"2025-05-30T10:20:59Z","snapshot_observed_at":"2026-08-07T23:08:37.820059Z","submitted_at":"2025-05-20T21:04:10Z","title":"TCSinger 2: Customizable Multilingual Zero-shot Singing Voice Synthesis","version":3},"reference_index":38,"source":"arxiv_source","source_observed_at":"2026-08-07T15:30:36.186369Z"},"links":{"cited_paper":"/paper/2505.00426","citing_paper":"/paper/2505.14910"},"observation_digest":"sha256:dd2707188c2dabb9cf28cdafe50d3e9ec7d8b1a5e8a167f4600f9e2ddc372750","observation_id":"9ee74574-3030-40aa-96f4-f3a006b9984d","resolution":{"observed_at":"2026-08-07T15:30:36.911286Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:30:37.124662Z","title":null,"venue":null,"work_id":"9244fd57-e4d5-4173-9937-8213733ea472","year":2022},"citing_paper":{"arxiv_id":"2505.14910","last_updated":"2025-05-30T10:20:59Z","snapshot_observed_at":"2026-08-07T23:08:37.820059Z","submitted_at":"2025-05-20T21:04:10Z","title":"TCSinger 2: Customizable Multilingual Zero-shot Singing Voice Synthesis","version":3},"reference_index":39,"source":"arxiv_source","source_observed_at":"2026-08-07T15:30:36.244643Z"},"links":{"citing_paper":"/paper/2505.14910"},"observation_digest":"sha256:655701f6c1560d9858baa1f794b61ae3befbb4e106bb4b613d970ce8c33aa7ef","observation_id":"10f039a1-30c0-4407-bedb-0ad6481da293","resolution":{"observed_at":"2026-08-07T15:30:37.127695Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:30:36.325078Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.14910","last_updated":"2025-05-30T10:20:59Z","snapshot_observed_at":"2026-08-07T23:08:37.820059Z","submitted_at":"2025-05-20T21:04:10Z","title":"TCSinger 2: Customizable Multilingual Zero-shot Singing Voice Synthesis","version":3},"reference_index":40,"source":"arxiv_source","source_observed_at":"2026-08-07T15:30:36.325078Z"},"links":{"citing_paper":"/paper/2505.14910"},"observation_digest":"sha256:b165a0dab993b90d63072cea4ffa67a0a2a5b7e65ed092da9cb536f71869455b","observation_id":"f83245d7-faf8-4fb7-b890-cc6a8c5be330","resolution":{"observed_at":"2026-08-07T15:30:36.325078Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:30:36.404649Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.14910","last_updated":"2025-05-30T10:20:59Z","snapshot_observed_at":"2026-08-07T23:08:37.820059Z","submitted_at":"2025-05-20T21:04:10Z","title":"TCSinger 2: Customizable Multilingual Zero-shot Singing Voice Synthesis","version":3},"reference_index":41,"source":"arxiv_source","source_observed_at":"2026-08-07T15:30:36.404649Z"},"links":{"citing_paper":"/paper/2505.14910"},"observation_digest":"sha256:9ad76a5750f7c30327dadc1c1b49bcdcedf52acb8e6e047855adb1af927c861d","observation_id":"6934e319-b4cf-4666-8995-96bdca8bd8bb","resolution":{"observed_at":"2026-08-07T15:30:36.404649Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:30:37.114741Z","title":null,"venue":null,"work_id":"d0a7e6c1-4c5c-4822-8851-38ea4495c060","year":2024},"citing_paper":{"arxiv_id":"2505.14910","last_updated":"2025-05-30T10:20:59Z","snapshot_observed_at":"2026-08-07T23:08:37.820059Z","submitted_at":"2025-05-20T21:04:10Z","title":"TCSinger 2: Customizable Multilingual Zero-shot Singing Voice Synthesis","version":3},"reference_index":42,"source":"arxiv_source","source_observed_at":"2026-08-07T15:30:36.457288Z"},"links":{"citing_paper":"/paper/2505.14910"},"observation_digest":"sha256:cabcb5e7eb56257d327bf68d8d9556a723ae824cefb02891d6bdc9b7948adab4","observation_id":"fdbee746-3cc7-42ae-aa11-a71adb9b61bc","resolution":{"observed_at":"2026-08-07T15:30:37.117739Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:30:37.101470Z","title":null,"venue":null,"work_id":"9ba04e01-207b-4a2e-b115-981c79bad752","year":2024},"citing_paper":{"arxiv_id":"2505.14910","last_updated":"2025-05-30T10:20:59Z","snapshot_observed_at":"2026-08-07T23:08:37.820059Z","submitted_at":"2025-05-20T21:04:10Z","title":"TCSinger 2: Customizable Multilingual Zero-shot Singing Voice Synthesis","version":3},"reference_index":43,"source":"arxiv_source","source_observed_at":"2026-08-07T15:30:36.516128Z"},"links":{"citing_paper":"/paper/2505.14910"},"observation_digest":"sha256:98ef0965374dae924816cfa18815a8aa248466dc41426fe071b2b28f9073e132","observation_id":"888cc960-a643-4dc8-b26b-58ba587a3344","resolution":{"observed_at":"2026-08-07T15:30:37.105987Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:30:36.565217Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.14910","last_updated":"2025-05-30T10:20:59Z","snapshot_observed_at":"2026-08-07T23:08:37.820059Z","submitted_at":"2025-05-20T21:04:10Z","title":"TCSinger 2: Customizable Multilingual Zero-shot Singing Voice Synthesis","version":3},"reference_index":44,"source":"arxiv_source","source_observed_at":"2026-08-07T15:30:36.565217Z"},"links":{"citing_paper":"/paper/2505.14910"},"observation_digest":"sha256:bbe999fdefe4456fff85947d9e11e87e7992f3d341f83db2c665e6d7e8c3b3b1","observation_id":"394e5773-1d5e-41aa-b784-6b3382f8917c","resolution":{"observed_at":"2026-08-07T15:30:36.565217Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:30:36.583447Z","title":"online\" 'onlinestring :=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.14910","last_updated":"2025-05-30T10:20:59Z","snapshot_observed_at":"2026-08-07T23:08:37.820059Z","submitted_at":"2025-05-20T21:04:10Z","title":"TCSinger 2: Customizable Multilingual Zero-shot Singing Voice Synthesis","version":3},"reference_index":45,"source":"arxiv_source","source_observed_at":"2026-08-07T15:30:36.583447Z"},"links":{"citing_paper":"/paper/2505.14910"},"observation_digest":"sha256:03b638b83955432884ed6eff6854d852487aca99e115285d2e47dcc8ba6640ae","observation_id":"578bf0ff-98e3-49ef-b00c-55fa72533ad4","resolution":{"observed_at":"2026-08-07T15:30:36.583447Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:30:36.587629Z","title":"write newline","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.14910","last_updated":"2025-05-30T10:20:59Z","snapshot_observed_at":"2026-08-07T23:08:37.820059Z","submitted_at":"2025-05-20T21:04:10Z","title":"TCSinger 2: Customizable Multilingual Zero-shot Singing Voice Synthesis","version":3},"reference_index":46,"source":"arxiv_source","source_observed_at":"2026-08-07T15:30:36.587629Z"},"links":{"citing_paper":"/paper/2505.14910"},"observation_digest":"sha256:cb178dbfd295c504cf0abd7ae20c89900beb0bd70b1087c447faec5f88782cad","observation_id":"59f29a62-52f2-41fb-914f-153ae31ebc17","resolution":{"observed_at":"2026-08-07T15:30:36.587629Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2505.14910","last_updated":"2025-05-30T10:20:59Z","latest_version":3,"primary_category":"eess.AS","snapshot_observed_at":"2026-08-07T23:08:37.820059Z","submitted_at":"2025-05-20T21:04:10Z","title":"TCSinger 2: Customizable Multilingual Zero-shot Singing Voice Synthesis"},"reference_resolution":{"displayed":46,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":43,"verified_exact":3,"verified_fuzzy":0},"total_outbound_references":46},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"thesis":"As of 10 August 2026, this Paper Citation Record lists 46 of 46 outbound references and 2 inbound Pith citation observations for arXiv:2505.14910."}