{"as_of":"2026-08-22T22:25:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:71e9a8a55ad285ff6964459a58700744d54956a0ca0bac7119b71afdc1c03144","coverage":[{"denominator":43,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":43,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-06T22:29:58.843755Z","state":"measured"},{"denominator":43,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":43,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-22T06:32:14.747728+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2506.21478/citation-record","integrity":"/paper/2506.21478/integrity","json":"/paper/2506.21478/citation-record.json","paper":"/paper/2506.21478"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2004.05150","last_updated":"2020-12-02T17:52:35Z","snapshot_observed_at":"2026-07-31T17:17:17.205582Z","submitted_at":"2020-04-10T17:54:09Z","title":"Longformer: The Long-Document Transformer","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2004.05150","snapshot_observed_at":"2026-08-06T22:29:27.752921Z","title":"Beltagy, M","venue":null,"work_id":null,"year":2004},"citing_paper":{"arxiv_id":"2506.21478","last_updated":"2025-06-26T17:07:45Z","snapshot_observed_at":"2026-08-10T02:02:49.811618Z","submitted_at":"2025-06-26T17:07:45Z","title":"SmoothSinger: A Conditional Diffusion Model for Singing Voice Synthesis with Multi-Resolution Architecture","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-06T22:29:27.752921Z"},"links":{"cited_paper":"/paper/2004.05150","citing_paper":"/paper/2506.21478"},"observation_digest":"sha256:fabae56ea65e0cae694c246fe6106e8e855d144a2d0528b674dbbe7dcd551f1b","observation_id":"2b3c8989-e854-49da-bac1-d3c219f0dbf8","resolution":{"observed_at":"2026-08-06T22:29:27.752921Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:30:00.462349Z","title":"Chandna, M","venue":null,"work_id":"9d3b39d2-e9be-42a8-8d17-2fd7ac441f41","year":2019},"citing_paper":{"arxiv_id":"2506.21478","last_updated":"2025-06-26T17:07:45Z","snapshot_observed_at":"2026-08-10T02:02:49.811618Z","submitted_at":"2025-06-26T17:07:45Z","title":"SmoothSinger: A Conditional Diffusion Model for Singing Voice Synthesis with Multi-Resolution Architecture","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-06T22:29:27.780086Z"},"links":{"citing_paper":"/paper/2506.21478"},"observation_digest":"sha256:c51c6ec1c7e0859c8fb5be51b9b8599ee37edf11a179009ba350adc520f9a0ca","observation_id":"b8c953a1-c532-4193-9250-b09919d91fac","resolution":{"observed_at":"2026-08-06T22:30:00.473936Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2106.09660","last_updated":"2021-06-19T01:47:11Z","snapshot_observed_at":"2026-08-16T18:16:19.754786Z","submitted_at":"2021-06-17T17:09:21Z","title":"WaveGrad 2: Iterative Refinement for Text-to-Speech Synthesis","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2106.09660","snapshot_observed_at":"2026-08-06T22:29:27.799528Z","title":null,"venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2506.21478","last_updated":"2025-06-26T17:07:45Z","snapshot_observed_at":"2026-08-10T02:02:49.811618Z","submitted_at":"2025-06-26T17:07:45Z","title":"SmoothSinger: A Conditional Diffusion Model for Singing Voice Synthesis with Multi-Resolution Architecture","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-06T22:29:27.799528Z"},"links":{"cited_paper":"/paper/2106.09660","citing_paper":"/paper/2506.21478"},"observation_digest":"sha256:c5008b33dccd07b9b77cd3db2ea7ecf82cb2d6332767aad123dfcfe494ea2bbd","observation_id":"87db912f-e779-4483-b3e4-4c278c4e85fd","resolution":{"observed_at":"2026-08-06T22:29:27.799528Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:30:00.430567Z","title":"Chien, H.-M","venue":null,"work_id":"4aa8b73e-7d99-4ec4-9613-92b253091a98","year":1998},"citing_paper":{"arxiv_id":"2506.21478","last_updated":"2025-06-26T17:07:45Z","snapshot_observed_at":"2026-08-10T02:02:49.811618Z","submitted_at":"2025-06-26T17:07:45Z","title":"SmoothSinger: A Conditional Diffusion Model for Singing Voice Synthesis with Multi-Resolution Architecture","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-06T22:29:27.805837Z"},"links":{"citing_paper":"/paper/2506.21478"},"observation_digest":"sha256:59ddc03f974c3dcd325818431185e8a00a3b5d152655b47c9b089ee394f5c9c0","observation_id":"1224f7fa-fc5e-41c3-af0e-8b1e750ec14c","resolution":{"observed_at":"2026-08-06T22:30:00.443769Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:29:27.821531Z","title":"Dhariwal and A","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2506.21478","last_updated":"2025-06-26T17:07:45Z","snapshot_observed_at":"2026-08-10T02:02:49.811618Z","submitted_at":"2025-06-26T17:07:45Z","title":"SmoothSinger: A Conditional Diffusion Model for Singing Voice Synthesis with Multi-Resolution Architecture","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-06T22:29:27.821531Z"},"links":{"citing_paper":"/paper/2506.21478"},"observation_digest":"sha256:211e33b1f5c3d49516776b90f6536caff747307e436ca87dc01b15d7fa19d8f2","observation_id":"388cbfd0-7a9d-486c-9e13-1b542ae0cff7","resolution":{"observed_at":"2026-08-06T22:29:27.821531Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:29:27.839942Z","title":"Goodfellow, J","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2506.21478","last_updated":"2025-06-26T17:07:45Z","snapshot_observed_at":"2026-08-10T02:02:49.811618Z","submitted_at":"2025-06-26T17:07:45Z","title":"SmoothSinger: A Conditional Diffusion Model for Singing Voice Synthesis with Multi-Resolution Architecture","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-06T22:29:27.839942Z"},"links":{"citing_paper":"/paper/2506.21478"},"observation_digest":"sha256:1466fe05f7784c5caa6fa26ee39854cb05498c4a48a81f555aeac41fc601d718","observation_id":"a1f5ca68-4fa0-427e-8bb5-bdc2ffdc1b8a","resolution":{"observed_at":"2026-08-06T22:29:27.839942Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:29:27.863893Z","title":null,"venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2506.21478","last_updated":"2025-06-26T17:07:45Z","snapshot_observed_at":"2026-08-10T02:02:49.811618Z","submitted_at":"2025-06-26T17:07:45Z","title":"SmoothSinger: A Conditional Diffusion Model for Singing Voice Synthesis with Multi-Resolution Architecture","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-06T22:29:27.863893Z"},"links":{"citing_paper":"/paper/2506.21478"},"observation_digest":"sha256:570422467d7a1795f38c455170da1bc8a03f4ccff51b9db3c673065e5c7d070c","observation_id":"d088dced-484e-41d4-82ee-a3e6333a3ced","resolution":{"observed_at":"2026-08-06T22:29:27.863893Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:29:27.883593Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.21478","last_updated":"2025-06-26T17:07:45Z","snapshot_observed_at":"2026-08-10T02:02:49.811618Z","submitted_at":"2025-06-26T17:07:45Z","title":"SmoothSinger: A Conditional Diffusion Model for Singing Voice Synthesis with Multi-Resolution Architecture","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-06T22:29:27.883593Z"},"links":{"citing_paper":"/paper/2506.21478"},"observation_digest":"sha256:55017d440ec4154e9749ff2c1d5a939149f6a3676608a455e644a53495de77e3","observation_id":"140dbe4d-9c6e-4c95-a600-5185f44206d6","resolution":{"observed_at":"2026-08-06T22:29:27.883593Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:30:00.348616Z","title":null,"venue":null,"work_id":"866e479e-23fd-4514-b342-47ecee1c9c27","year":2019},"citing_paper":{"arxiv_id":"2506.21478","last_updated":"2025-06-26T17:07:45Z","snapshot_observed_at":"2026-08-10T02:02:49.811618Z","submitted_at":"2025-06-26T17:07:45Z","title":"SmoothSinger: A Conditional Diffusion Model for Singing Voice Synthesis with Multi-Resolution Architecture","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-06T22:29:27.913585Z"},"links":{"citing_paper":"/paper/2506.21478"},"observation_digest":"sha256:9ba766597efa4637701acde768460e58358346f66ec2a801f9a680bfcc9c8c5d","observation_id":"a738d2de-94c2-4991-9542-eb6f92480836","resolution":{"observed_at":"2026-08-06T22:30:00.359931Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:30:00.319006Z","title":null,"venue":null,"work_id":"8e3a165a-9046-400f-b0c7-2c2ee09b48d6","year":2024},"citing_paper":{"arxiv_id":"2506.21478","last_updated":"2025-06-26T17:07:45Z","snapshot_observed_at":"2026-08-10T02:02:49.811618Z","submitted_at":"2025-06-26T17:07:45Z","title":"SmoothSinger: A Conditional Diffusion Model for Singing Voice Synthesis with Multi-Resolution Architecture","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-06T22:29:27.934884Z"},"links":{"citing_paper":"/paper/2506.21478"},"observation_digest":"sha256:5837e740f778f036b3bb9dca03bb859c1a6ea13139843551fa6e120eaee4aa69","observation_id":"2e9ccb86-6580-4dfb-ba9d-2e2ee2eac120","resolution":{"observed_at":"2026-08-06T22:30:00.328112Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:30:00.293610Z","title":"Huang, E","venue":null,"work_id":"3449157b-69b7-407f-8347-9baf992dc894","year":2022},"citing_paper":{"arxiv_id":"2506.21478","last_updated":"2025-06-26T17:07:45Z","snapshot_observed_at":"2026-08-10T02:02:49.811618Z","submitted_at":"2025-06-26T17:07:45Z","title":"SmoothSinger: A Conditional Diffusion Model for Singing Voice Synthesis with Multi-Resolution Architecture","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-06T22:29:27.956171Z"},"links":{"citing_paper":"/paper/2506.21478"},"observation_digest":"sha256:f3d802e8bbe79bc3d6dc7114d709e3162a25b2d83efbc493855ba3aa00391dc6","observation_id":"768e828c-ce2c-43bf-941f-f87e7b3f50d8","resolution":{"observed_at":"2026-08-06T22:30:00.302451Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2204.09934","last_updated":"2022-04-21T07:49:09Z","snapshot_observed_at":"2026-08-20T03:27:35.350267Z","submitted_at":"2022-04-21T07:49:09Z","title":"FastDiff: A Fast Conditional Diffusion Model for High-Quality Speech Synthesis","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2204.09934","snapshot_observed_at":"2026-08-06T22:29:27.975790Z","title":"Huang, M","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.21478","last_updated":"2025-06-26T17:07:45Z","snapshot_observed_at":"2026-08-10T02:02:49.811618Z","submitted_at":"2025-06-26T17:07:45Z","title":"SmoothSinger: A Conditional Diffusion Model for Singing Voice Synthesis with Multi-Resolution Architecture","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-06T22:29:27.975790Z"},"links":{"cited_paper":"/paper/2204.09934","citing_paper":"/paper/2506.21478"},"observation_digest":"sha256:b1b938e16ad16167d8c7582e535d78cac3471e2d5ed523a3e41b9b7e4ea3c329","observation_id":"2606b796-9326-4548-97b6-4bdaf6334104","resolution":{"observed_at":"2026-08-06T22:29:27.975790Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:30:00.267577Z","title":"Huang, Z","venue":null,"work_id":"55c9728b-2c49-474b-af72-5d6f0b3ea532","year":2022},"citing_paper":{"arxiv_id":"2506.21478","last_updated":"2025-06-26T17:07:45Z","snapshot_observed_at":"2026-08-10T02:02:49.811618Z","submitted_at":"2025-06-26T17:07:45Z","title":"SmoothSinger: A Conditional Diffusion Model for Singing Voice Synthesis with Multi-Resolution Architecture","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-06T22:29:27.999846Z"},"links":{"citing_paper":"/paper/2506.21478"},"observation_digest":"sha256:afa6f2ccedda6af72da3d7792d9001097a2789f53c22bdb1571286ef41d3d9c6","observation_id":"32d8731d-1843-45da-8848-83eeb55c93b7","resolution":{"observed_at":"2026-08-06T22:30:00.276172Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:30:00.237970Z","title":"Ito and L","venue":null,"work_id":"25e89995-18b5-465b-b349-0d90de77287a","year":2017},"citing_paper":{"arxiv_id":"2506.21478","last_updated":"2025-06-26T17:07:45Z","snapshot_observed_at":"2026-08-10T02:02:49.811618Z","submitted_at":"2025-06-26T17:07:45Z","title":"SmoothSinger: A Conditional Diffusion Model for Singing Voice Synthesis with Multi-Resolution Architecture","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-06T22:29:28.009515Z"},"links":{"citing_paper":"/paper/2506.21478"},"observation_digest":"sha256:9ec8059c6e1c7770ae99a961e8e30087a6b771909810af480ba39723c06ee2c6","observation_id":"f3b22ad5-5719-4e75-b424-27fd836f61ef","resolution":{"observed_at":"2026-08-06T22:30:00.249622Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:29:28.029616Z","title":"Jadoul, B","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2506.21478","last_updated":"2025-06-26T17:07:45Z","snapshot_observed_at":"2026-08-10T02:02:49.811618Z","submitted_at":"2025-06-26T17:07:45Z","title":"SmoothSinger: A Conditional Diffusion Model for Singing Voice Synthesis with Multi-Resolution Architecture","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-06T22:29:28.029616Z"},"links":{"citing_paper":"/paper/2506.21478"},"observation_digest":"sha256:fdab8a30123a13660b1b30267a05313219e8f3958e62791f3b27576e211684ef","observation_id":"db14a4f3-5af9-4c45-8a73-39a22cbc86a8","resolution":{"observed_at":"2026-08-06T22:29:28.029616Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:30:00.205524Z","title":"Karras, M","venue":null,"work_id":"0143ef05-8c9c-4ca5-9435-164588ef031a","year":2021},"citing_paper":{"arxiv_id":"2506.21478","last_updated":"2025-06-26T17:07:45Z","snapshot_observed_at":"2026-08-10T02:02:49.811618Z","submitted_at":"2025-06-26T17:07:45Z","title":"SmoothSinger: A Conditional Diffusion Model for Singing Voice Synthesis with Multi-Resolution Architecture","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-06T22:29:28.049250Z"},"links":{"citing_paper":"/paper/2506.21478"},"observation_digest":"sha256:e6e7cc927149fda03c36e98e46a804f434d69e2d185f5e9a424471f539931049","observation_id":"57ced24d-4985-46c8-8d68-59106dc004c7","resolution":{"observed_at":"2026-08-06T22:30:00.215144Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2206.11558","last_updated":"2024-06-13T14:48:58Z","snapshot_observed_at":"2026-08-18T00:22:05.604024Z","submitted_at":"2022-06-23T09:11:02Z","title":"Adversarial Multi-Task Learning for Disentangling Timbre and Pitch in Singing Voice Synthesis","version":2},"cited_work":{"arxiv_id":"2206.11558","doi":null,"metadata_source":"pith","pith_arxiv_id":"2206.11558","snapshot_observed_at":"2026-08-06T22:29:59.315412Z","title":"Adversarial Multi-Task Learning for Disentangling Timbre and Pitch in Singing Voice Synthesis","venue":"eess.AS","work_id":"8aa093ba-6010-4cf0-a95c-77c1265ae12b","year":2022},"citing_paper":{"arxiv_id":"2506.21478","last_updated":"2025-06-26T17:07:45Z","snapshot_observed_at":"2026-08-10T02:02:49.811618Z","submitted_at":"2025-06-26T17:07:45Z","title":"SmoothSinger: A Conditional Diffusion Model for Singing Voice Synthesis with Multi-Resolution Architecture","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-06T22:29:28.054865Z"},"links":{"cited_paper":"/paper/2206.11558","citing_paper":"/paper/2506.21478"},"observation_digest":"sha256:719c54b005ab2a4b565b06d86a79d05f91064368dd49b5386e2b5e928c1da2f3","observation_id":"9f509ce2-f35a-4790-a552-42505cb1d616","resolution":{"observed_at":"2026-08-06T22:29:59.344754Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:30:00.168194Z","title":null,"venue":null,"work_id":"c2c42172-f0ae-4337-8fa5-e1f23c94f37d","year":2019},"citing_paper":{"arxiv_id":"2506.21478","last_updated":"2025-06-26T17:07:45Z","snapshot_observed_at":"2026-08-10T02:02:49.811618Z","submitted_at":"2025-06-26T17:07:45Z","title":"SmoothSinger: A Conditional Diffusion Model for Singing Voice Synthesis with Multi-Resolution Architecture","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-06T22:29:28.079966Z"},"links":{"citing_paper":"/paper/2506.21478"},"observation_digest":"sha256:80e30e503c8b2052924b15f0f0f6939a99699a973d2ca8b336c4ebb57043099a","observation_id":"300cded9-7b97-4885-bef7-906ede9667ce","resolution":{"observed_at":"2026-08-06T22:30:00.180560Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:30:00.126923Z","title":null,"venue":null,"work_id":"6c8b7344-1a68-4e23-98e7-5c46adee672e","year":2020},"citing_paper":{"arxiv_id":"2506.21478","last_updated":"2025-06-26T17:07:45Z","snapshot_observed_at":"2026-08-10T02:02:49.811618Z","submitted_at":"2025-06-26T17:07:45Z","title":"SmoothSinger: A Conditional Diffusion Model for Singing Voice Synthesis with Multi-Resolution Architecture","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-06T22:29:28.095537Z"},"links":{"citing_paper":"/paper/2506.21478"},"observation_digest":"sha256:b6b48604337d7d17c11a9a9fc54f4d6b32afd15f884319693fa333f1677f1ad3","observation_id":"e70cbfbf-bcc8-493a-8891-2509177661ff","resolution":{"observed_at":"2026-08-06T22:30:00.141857Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2009.09761","last_updated":"2021-03-30T19:48:38Z","snapshot_observed_at":"2026-07-06T09:57:19.117228Z","submitted_at":"2020-09-21T11:20:38Z","title":"DiffWave: A Versatile Diffusion Model for Audio Synthesis","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2009.09761","snapshot_observed_at":"2026-08-06T22:29:28.113961Z","title":null,"venue":null,"work_id":null,"year":2009},"citing_paper":{"arxiv_id":"2506.21478","last_updated":"2025-06-26T17:07:45Z","snapshot_observed_at":"2026-08-10T02:02:49.811618Z","submitted_at":"2025-06-26T17:07:45Z","title":"SmoothSinger: A Conditional Diffusion Model for Singing Voice Synthesis with Multi-Resolution Architecture","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-06T22:29:28.113961Z"},"links":{"cited_paper":"/paper/2009.09761","citing_paper":"/paper/2506.21478"},"observation_digest":"sha256:8323d379a4a45cbb5f16fa45613ec6401d7e7dc640d662a39435cf6bfa7ab4cf","observation_id":"5bcb1bf9-bb90-4672-8a33-0ed0183bca5e","resolution":{"observed_at":"2026-08-06T22:29:28.113961Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2206.04658","last_updated":"2023-02-16T18:48:56Z","snapshot_observed_at":"2026-08-19T06:25:23.989944Z","submitted_at":"2022-06-09T17:56:10Z","title":"BigVGAN: A Universal Neural Vocoder with Large-Scale Training","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2206.04658","snapshot_observed_at":"2026-08-06T22:29:28.144770Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.21478","last_updated":"2025-06-26T17:07:45Z","snapshot_observed_at":"2026-08-10T02:02:49.811618Z","submitted_at":"2025-06-26T17:07:45Z","title":"SmoothSinger: A Conditional Diffusion Model for Singing Voice Synthesis with Multi-Resolution Architecture","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-06T22:29:28.144770Z"},"links":{"cited_paper":"/paper/2206.04658","citing_paper":"/paper/2506.21478"},"observation_digest":"sha256:428381f6bd27e70022e869dbdeed3393ce895c57ad9bea7ab63c043fd4b6ca9b","observation_id":"9270443a-18f3-402d-b2b9-64bc1ce5d6ec","resolution":{"observed_at":"2026-08-06T22:29:28.144770Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:30:00.095648Z","title":null,"venue":null,"work_id":"79ed2635-591d-47bb-bb0f-926e790df6f8","year":2022},"citing_paper":{"arxiv_id":"2506.21478","last_updated":"2025-06-26T17:07:45Z","snapshot_observed_at":"2026-08-10T02:02:49.811618Z","submitted_at":"2025-06-26T17:07:45Z","title":"SmoothSinger: A Conditional Diffusion Model for Singing Voice Synthesis with Multi-Resolution Architecture","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-06T22:29:28.166256Z"},"links":{"citing_paper":"/paper/2506.21478"},"observation_digest":"sha256:a2cf35c6008e1c74e09901371d862b9509757b4ff658fcf6f9078aa2745096b7","observation_id":"bd41f50f-6018-42e0-a233-f1b06060bb33","resolution":{"observed_at":"2026-08-06T22:30:00.103983Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:30:00.025939Z","title":null,"venue":null,"work_id":"9b5aeaa0-0a98-4a2a-a5b8-752a9d17ae9c","year":2023},"citing_paper":{"arxiv_id":"2506.21478","last_updated":"2025-06-26T17:07:45Z","snapshot_observed_at":"2026-08-10T02:02:49.811618Z","submitted_at":"2025-06-26T17:07:45Z","title":"SmoothSinger: A Conditional Diffusion Model for Singing Voice Synthesis with Multi-Resolution Architecture","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-06T22:29:28.186840Z"},"links":{"citing_paper":"/paper/2506.21478"},"observation_digest":"sha256:b4a1c52397689f29ed63a6c20365228e2699b5ac442c70c2b35be8df49c3a97e","observation_id":"50d9ddd4-e221-4495-8cdb-d3a3a98c1831","resolution":{"observed_at":"2026-08-06T22:30:00.054490Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2006.06261","last_updated":"2020-06-11T09:09:59Z","snapshot_observed_at":"2026-08-15T11:37:19.112605Z","submitted_at":"2020-06-11T09:09:59Z","title":"XiaoiceSing: A High-Quality and Integrated Singing Voice Synthesis System","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2006.06261","snapshot_observed_at":"2026-08-06T22:29:28.214431Z","title":null,"venue":null,"work_id":null,"year":2006},"citing_paper":{"arxiv_id":"2506.21478","last_updated":"2025-06-26T17:07:45Z","snapshot_observed_at":"2026-08-10T02:02:49.811618Z","submitted_at":"2025-06-26T17:07:45Z","title":"SmoothSinger: A Conditional Diffusion Model for Singing Voice Synthesis with Multi-Resolution Architecture","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-06T22:29:28.214431Z"},"links":{"cited_paper":"/paper/2006.06261","citing_paper":"/paper/2506.21478"},"observation_digest":"sha256:9b239b3581007d7e0878d8f0db05ff4f57a4bcf357b3dd59e06e8118156b48b8","observation_id":"879c9003-422b-4896-9fdc-319fdb77ce67","resolution":{"observed_at":"2026-08-06T22:29:28.214431Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:29:59.957628Z","title":"Müller, A","venue":null,"work_id":"62a44184-30c9-4124-9b71-fde2fa4bc776","year":2022},"citing_paper":{"arxiv_id":"2506.21478","last_updated":"2025-06-26T17:07:45Z","snapshot_observed_at":"2026-08-10T02:02:49.811618Z","submitted_at":"2025-06-26T17:07:45Z","title":"SmoothSinger: A Conditional Diffusion Model for Singing Voice Synthesis with Multi-Resolution Architecture","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-06T22:29:28.227547Z"},"links":{"citing_paper":"/paper/2506.21478"},"observation_digest":"sha256:376b253ab305449627ebf439de4a096af6d548b400d4d1b56ef1c0b86775a3b3","observation_id":"6a5ec65d-1a09-4f40-bcb2-7b59d55067ff","resolution":{"observed_at":"2026-08-06T22:29:59.978201Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1904.06868","last_updated":"2019-06-25T06:54:03Z","snapshot_observed_at":"2026-08-14T16:46:40.857775Z","submitted_at":"2019-04-15T06:23:44Z","title":"Singing voice synthesis based on convolutional neural networks","version":2},"cited_work":{"arxiv_id":"1904.06868","doi":null,"metadata_source":"pith","pith_arxiv_id":"1904.06868","snapshot_observed_at":"2026-08-06T22:29:59.170410Z","title":"Singing voice synthesis based on convolutional neural networks","venue":"eess.AS","work_id":"1352e3b2-c559-4c99-b29a-0836dfbaf43d","year":2019},"citing_paper":{"arxiv_id":"2506.21478","last_updated":"2025-06-26T17:07:45Z","snapshot_observed_at":"2026-08-10T02:02:49.811618Z","submitted_at":"2025-06-26T17:07:45Z","title":"SmoothSinger: A Conditional Diffusion Model for Singing Voice Synthesis with Multi-Resolution Architecture","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-06T22:29:28.261900Z"},"links":{"cited_paper":"/paper/1904.06868","citing_paper":"/paper/2506.21478"},"observation_digest":"sha256:ef61a807b54ccf4eb0b455014ae479f5b2e607739618cbbfddf964a7d7fc6399","observation_id":"2440c8b2-79b3-4232-8ab1-bcf74940eb38","resolution":{"observed_at":"2026-08-06T22:29:59.199750Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:29:59.902001Z","title":"Popov, I","venue":null,"work_id":"4d783088-b954-4ba0-9535-ed9f8550099f","year":2021},"citing_paper":{"arxiv_id":"2506.21478","last_updated":"2025-06-26T17:07:45Z","snapshot_observed_at":"2026-08-10T02:02:49.811618Z","submitted_at":"2025-06-26T17:07:45Z","title":"SmoothSinger: A Conditional Diffusion Model for Singing Voice Synthesis with Multi-Resolution Architecture","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-06T22:29:28.286079Z"},"links":{"citing_paper":"/paper/2506.21478"},"observation_digest":"sha256:a9f02d495de2dba045ca3382107053fbe966d0490cc59754920f47cc0fec54dc","observation_id":"ec0cd236-830d-4866-9b55-a729f8b29206","resolution":{"observed_at":"2026-08-06T22:29:59.932922Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:29:59.864047Z","title":"Prenger, R","venue":null,"work_id":"5ded4bf4-173d-422e-9b30-f1875b9df2a0","year":2019},"citing_paper":{"arxiv_id":"2506.21478","last_updated":"2025-06-26T17:07:45Z","snapshot_observed_at":"2026-08-10T02:02:49.811618Z","submitted_at":"2025-06-26T17:07:45Z","title":"SmoothSinger: A Conditional Diffusion Model for Singing Voice Synthesis with Multi-Resolution Architecture","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-06T22:29:28.312885Z"},"links":{"citing_paper":"/paper/2506.21478"},"observation_digest":"sha256:1581b4d637f5ce6e2ca3e28040056448e1165596ffca45f6177633ec1ff3abd0","observation_id":"0144e5b6-7abf-4902-a6dd-56d522e83c9c","resolution":{"observed_at":"2026-08-06T22:29:59.876383Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2204.06125","last_updated":"2022-04-13T01:10:33Z","snapshot_observed_at":"2026-08-15T12:50:58.405488Z","submitted_at":"2022-04-13T01:10:33Z","title":"Hierarchical Text-Conditional Image Generation with CLIP Latents","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2204.06125","snapshot_observed_at":"2026-08-06T22:29:28.332966Z","title":"Ramesh, P","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.21478","last_updated":"2025-06-26T17:07:45Z","snapshot_observed_at":"2026-08-10T02:02:49.811618Z","submitted_at":"2025-06-26T17:07:45Z","title":"SmoothSinger: A Conditional Diffusion Model for Singing Voice Synthesis with Multi-Resolution Architecture","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-06T22:29:28.332966Z"},"links":{"cited_paper":"/paper/2204.06125","citing_paper":"/paper/2506.21478"},"observation_digest":"sha256:3f4fdce970ce8b01e6132e8cd3d11064c36a22899de50ea3bdf60ef86e36a5b3","observation_id":"baf91113-26ad-4f85-a243-621970d3c292","resolution":{"observed_at":"2026-08-06T22:29:28.332966Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:29:59.808346Z","title":null,"venue":null,"work_id":"f36bb745-42e8-4f8f-bd86-1d4a1e1470e4","year":2022},"citing_paper":{"arxiv_id":"2506.21478","last_updated":"2025-06-26T17:07:45Z","snapshot_observed_at":"2026-08-10T02:02:49.811618Z","submitted_at":"2025-06-26T17:07:45Z","title":"SmoothSinger: A Conditional Diffusion Model for Singing Voice Synthesis with Multi-Resolution Architecture","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-06T22:29:28.349696Z"},"links":{"citing_paper":"/paper/2506.21478"},"observation_digest":"sha256:6fd18700659b44728513b5e803b9f005535fc200a0f16ce685a0f1c84d18850a","observation_id":"14f82d62-596e-47ff-a4bd-501839b93d9d","resolution":{"observed_at":"2026-08-06T22:29:59.836088Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2006.04558","last_updated":"2022-08-08T01:53:05Z","snapshot_observed_at":"2026-08-20T03:31:53.345681Z","submitted_at":"2020-06-08T13:05:40Z","title":"FastSpeech 2: Fast and High-Quality End-to-End Text to Speech","version":8},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2006.04558","snapshot_observed_at":"2026-08-06T22:29:28.366767Z","title":null,"venue":null,"work_id":null,"year":2006},"citing_paper":{"arxiv_id":"2506.21478","last_updated":"2025-06-26T17:07:45Z","snapshot_observed_at":"2026-08-10T02:02:49.811618Z","submitted_at":"2025-06-26T17:07:45Z","title":"SmoothSinger: A Conditional Diffusion Model for Singing Voice Synthesis with Multi-Resolution Architecture","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-06T22:29:28.366767Z"},"links":{"cited_paper":"/paper/2006.04558","citing_paper":"/paper/2506.21478"},"observation_digest":"sha256:c1fe627f6983afbbef83b87b67ccfcf7ff8cadeb17286fd97f19d3dc93636e81","observation_id":"51258cdc-1a04-47bc-b851-77e66cfb4e41","resolution":{"observed_at":"2026-08-06T22:29:28.366767Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:29:59.760385Z","title":null,"venue":null,"work_id":"cadce443-4ac9-4e06-a12b-cf5ac5a77a9c","year":1979},"citing_paper":{"arxiv_id":"2506.21478","last_updated":"2025-06-26T17:07:45Z","snapshot_observed_at":"2026-08-10T02:02:49.811618Z","submitted_at":"2025-06-26T17:07:45Z","title":"SmoothSinger: A Conditional Diffusion Model for Singing Voice Synthesis with Multi-Resolution Architecture","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-06T22:29:28.411362Z"},"links":{"citing_paper":"/paper/2506.21478"},"observation_digest":"sha256:22f92f04f4fa6fad50cfb96242cb9cf6dc10143971f6581ce20cd0c96c20081a","observation_id":"49624944-1107-4a1a-8553-5de0724a95d1","resolution":{"observed_at":"2026-08-06T22:29:59.785013Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:29:59.695402Z","title":null,"venue":null,"work_id":"bce142fd-f31e-4dc4-aafa-092e68529d01","year":2001},"citing_paper":{"arxiv_id":"2506.21478","last_updated":"2025-06-26T17:07:45Z","snapshot_observed_at":"2026-08-10T02:02:49.811618Z","submitted_at":"2025-06-26T17:07:45Z","title":"SmoothSinger: A Conditional Diffusion Model for Singing Voice Synthesis with Multi-Resolution Architecture","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-06T22:29:28.444908Z"},"links":{"citing_paper":"/paper/2506.21478"},"observation_digest":"sha256:d150aa1518d58db9483dcae9a1768125c1ff059a7b3679a392c5d57999b1e79f","observation_id":"8cc1d15f-d98d-4d11-818d-969bc6a0d826","resolution":{"observed_at":"2026-08-06T22:29:59.721273Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:29:59.634248Z","title":"Saharia, J","venue":null,"work_id":"a65e2e49-b50a-4565-b420-2b100d2d831d","year":2022},"citing_paper":{"arxiv_id":"2506.21478","last_updated":"2025-06-26T17:07:45Z","snapshot_observed_at":"2026-08-10T02:02:49.811618Z","submitted_at":"2025-06-26T17:07:45Z","title":"SmoothSinger: A Conditional Diffusion Model for Singing Voice Synthesis with Multi-Resolution Architecture","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-06T22:29:28.467372Z"},"links":{"citing_paper":"/paper/2506.21478"},"observation_digest":"sha256:9a447dc2c0680396d710f0ad9624ffc41f47a4b49acefb0dd80f901acecf1cfb","observation_id":"cc097481-44fb-461b-96a6-9b6870812009","resolution":{"observed_at":"2026-08-06T22:29:59.653582Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.21641","last_updated":"2024-10-29T01:01:18Z","snapshot_observed_at":"2026-08-16T13:05:09.424318Z","submitted_at":"2024-10-29T01:01:18Z","title":"RDSinger: Reference-based Diffusion Network for Singing Voice Synthesis","version":1},"cited_work":{"arxiv_id":"2410.21641","doi":null,"metadata_source":"pith","pith_arxiv_id":"2410.21641","snapshot_observed_at":"2026-08-06T22:29:59.061885Z","title":"RDSinger: Reference-based Diffusion Network for Singing Voice Synthesis","venue":"cs.SD","work_id":"3f6a8a86-21e6-4511-9f46-9e266a86c935","year":2024},"citing_paper":{"arxiv_id":"2506.21478","last_updated":"2025-06-26T17:07:45Z","snapshot_observed_at":"2026-08-10T02:02:49.811618Z","submitted_at":"2025-06-26T17:07:45Z","title":"SmoothSinger: A Conditional Diffusion Model for Singing Voice Synthesis with Multi-Resolution Architecture","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-06T22:29:28.484086Z"},"links":{"cited_paper":"/paper/2410.21641","citing_paper":"/paper/2506.21478"},"observation_digest":"sha256:f2db757b16878066f4de43ed2d70af503bd254e6d787b15f6334597157f5661f","observation_id":"75551b59-e661-40f9-9b48-d5ab1385562a","resolution":{"observed_at":"2026-08-06T22:29:59.087886Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:29:59.574943Z","title":null,"venue":null,"work_id":"34dae179-968f-48dd-b8b3-b4026416c7c5","year":2011},"citing_paper":{"arxiv_id":"2506.21478","last_updated":"2025-06-26T17:07:45Z","snapshot_observed_at":"2026-08-10T02:02:49.811618Z","submitted_at":"2025-06-26T17:07:45Z","title":"SmoothSinger: A Conditional Diffusion Model for Singing Voice Synthesis with Multi-Resolution Architecture","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-06T22:29:28.506584Z"},"links":{"citing_paper":"/paper/2506.21478"},"observation_digest":"sha256:d3310d8ae23f61985a3e424fba37128ca8d283b8caf490dad7c7e01dea836c03","observation_id":"93952d6d-f335-4f56-a2cb-4526fb5c709f","resolution":{"observed_at":"2026-08-06T22:29:59.599277Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1609.03499","last_updated":"2016-09-19T18:04:35Z","snapshot_observed_at":"2026-08-16T05:39:41.727705Z","submitted_at":"2016-09-12T17:29:40Z","title":"WaveNet: A Generative Model for Raw Audio","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1609.03499","snapshot_observed_at":"2026-08-06T22:29:28.529788Z","title":"Van Den Oord, S","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2506.21478","last_updated":"2025-06-26T17:07:45Z","snapshot_observed_at":"2026-08-10T02:02:49.811618Z","submitted_at":"2025-06-26T17:07:45Z","title":"SmoothSinger: A Conditional Diffusion Model for Singing Voice Synthesis with Multi-Resolution Architecture","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-06T22:29:28.529788Z"},"links":{"cited_paper":"/paper/1609.03499","citing_paper":"/paper/2506.21478"},"observation_digest":"sha256:6d1075c75ecc560322376f6980c6976e5318a57313c2b1ba17ff52199ec916f7","observation_id":"3e671ec9-5621-4f95-986f-baeb49a49ede","resolution":{"observed_at":"2026-08-06T22:29:28.529788Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2201.07429","last_updated":"2022-01-20T02:08:47Z","snapshot_observed_at":"2026-08-21T23:37:39.712418Z","submitted_at":"2022-01-19T06:12:47Z","title":"Opencpop: A High-Quality Open Source Chinese Popular Song Corpus for Singing Voice Synthesis","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2201.07429","snapshot_observed_at":"2026-08-06T22:29:58.668681Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.21478","last_updated":"2025-06-26T17:07:45Z","snapshot_observed_at":"2026-08-10T02:02:49.811618Z","submitted_at":"2025-06-26T17:07:45Z","title":"SmoothSinger: A Conditional Diffusion Model for Singing Voice Synthesis with Multi-Resolution Architecture","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-06T22:29:58.668681Z"},"links":{"cited_paper":"/paper/2201.07429","citing_paper":"/paper/2506.21478"},"observation_digest":"sha256:3f5e1ea7253c8b1f4f22f94eab595f5dbe0967b6a05f1a2ac3a0b94672965418","observation_id":"476baf62-2e92-4420-8ec4-72780cde32d3","resolution":{"observed_at":"2026-08-06T22:29:58.668681Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2006.10317","last_updated":"2020-06-18T07:20:11Z","snapshot_observed_at":"2026-08-09T23:48:54.574728Z","submitted_at":"2020-06-18T07:20:11Z","title":"Adversarially Trained Multi-Singer Sequence-To-Sequence Singing Synthesizer","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2006.10317","snapshot_observed_at":"2026-08-06T22:29:58.689483Z","title":"Wu and J","venue":null,"work_id":null,"year":2006},"citing_paper":{"arxiv_id":"2506.21478","last_updated":"2025-06-26T17:07:45Z","snapshot_observed_at":"2026-08-10T02:02:49.811618Z","submitted_at":"2025-06-26T17:07:45Z","title":"SmoothSinger: A Conditional Diffusion Model for Singing Voice Synthesis with Multi-Resolution Architecture","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-06T22:29:58.689483Z"},"links":{"cited_paper":"/paper/2006.10317","citing_paper":"/paper/2506.21478"},"observation_digest":"sha256:a460b08340a7cf48501c8cd93c9862afee88ef8c8595fe8e399f17ba3aa02d31","observation_id":"c106236e-0bff-4c85-ad23-b225aa866802","resolution":{"observed_at":"2026-08-06T22:29:58.689483Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:29:59.525544Z","title":"Zhang, A","venue":null,"work_id":"0cd8b0b5-5ecd-4c6e-99d6-dd0cf27f564e","year":2023},"citing_paper":{"arxiv_id":"2506.21478","last_updated":"2025-06-26T17:07:45Z","snapshot_observed_at":"2026-08-10T02:02:49.811618Z","submitted_at":"2025-06-26T17:07:45Z","title":"SmoothSinger: A Conditional Diffusion Model for Singing Voice Synthesis with Multi-Resolution Architecture","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-06T22:29:58.710008Z"},"links":{"citing_paper":"/paper/2506.21478"},"observation_digest":"sha256:a5147ab7350aa4a704a9a5384a33816b8c13d0f6f467698a523684fe4d8759d9","observation_id":"617ff0f0-cd93-4a12-880c-708e1cf083b9","resolution":{"observed_at":"2026-08-06T22:29:59.544824Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2211.02903","last_updated":"2022-11-05T13:35:00Z","snapshot_observed_at":"2026-08-16T16:18:24.294951Z","submitted_at":"2022-11-05T13:35:00Z","title":"VISinger 2: High-Fidelity End-to-End Singing Voice Synthesis Enhanced by Digital Signal Processing Synthesizer","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2211.02903","snapshot_observed_at":"2026-08-06T22:29:58.757941Z","title":"Zhang, H","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.21478","last_updated":"2025-06-26T17:07:45Z","snapshot_observed_at":"2026-08-10T02:02:49.811618Z","submitted_at":"2025-06-26T17:07:45Z","title":"SmoothSinger: A Conditional Diffusion Model for Singing Voice Synthesis with Multi-Resolution Architecture","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-06T22:29:58.757941Z"},"links":{"cited_paper":"/paper/2211.02903","citing_paper":"/paper/2506.21478"},"observation_digest":"sha256:2a7a90d87c7f25d76128d98722c8801a2de13965868f885d3785631a74898013","observation_id":"95ad80f0-f15c-4375-9879-0ddc38144496","resolution":{"observed_at":"2026-08-06T22:29:58.757941Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:29:59.445459Z","title":"Zhang, R","venue":null,"work_id":"35bc0dfd-59a2-436d-a549-da1ccf1f97b6","year":2024},"citing_paper":{"arxiv_id":"2506.21478","last_updated":"2025-06-26T17:07:45Z","snapshot_observed_at":"2026-08-10T02:02:49.811618Z","submitted_at":"2025-06-26T17:07:45Z","title":"SmoothSinger: A Conditional Diffusion Model for Singing Voice Synthesis with Multi-Resolution Architecture","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-06T22:29:58.811963Z"},"links":{"citing_paper":"/paper/2506.21478"},"observation_digest":"sha256:ca4a6ebd4fe90728e94950a850be1968d7acc6bbad8ce302c8d52b7a23b974f2","observation_id":"303cdbb7-360a-46b4-8e06-f32f1eea6c7b","resolution":{"observed_at":"2026-08-06T22:29:59.480755Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2409.15977","last_updated":"2025-05-30T10:11:27Z","snapshot_observed_at":"2026-08-16T13:15:54.313869Z","submitted_at":"2024-09-24T11:18:09Z","title":"TCSinger: Zero-Shot Singing Voice Synthesis with Style Transfer and Multi-Level Style Control","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.15977","snapshot_observed_at":"2026-08-06T22:29:58.843755Z","title":"Zhang, Z","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.21478","last_updated":"2025-06-26T17:07:45Z","snapshot_observed_at":"2026-08-10T02:02:49.811618Z","submitted_at":"2025-06-26T17:07:45Z","title":"SmoothSinger: A Conditional Diffusion Model for Singing Voice Synthesis with Multi-Resolution Architecture","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-06T22:29:58.843755Z"},"links":{"cited_paper":"/paper/2409.15977","citing_paper":"/paper/2506.21478"},"observation_digest":"sha256:9531a40b4ae5c10119d7382288fd2fd264134ab5ce6e28df53ccd0ebcc9060fa","observation_id":"f04aaa5e-fc54-48e0-8e4c-3ec7c9930734","resolution":{"observed_at":"2026-08-06T22:29:58.843755Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2506.21478","last_updated":"2025-06-26T17:07:45Z","latest_version":1,"primary_category":"cs.SD","snapshot_observed_at":"2026-08-10T02:02:49.811618Z","submitted_at":"2025-06-26T17:07:45Z","title":"SmoothSinger: A Conditional Diffusion Model for Singing Voice Synthesis with Multi-Resolution Architecture"},"reference_resolution":{"displayed":43,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":28,"verified_exact":3,"verified_fuzzy":12},"total_outbound_references":43},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"thesis":"As of 22 August 2026, this Paper Citation Record lists 43 of 43 outbound references and 0 inbound Pith citation observations for arXiv:2506.21478."}