{"as_of":"2026-08-10T19:36:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:4b0c291fce3ea3c13c7e5db71397b275c92d8204efc982b67ce5932a2520da48","coverage":[{"denominator":72,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":72,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-09T16:43:08.911696Z","state":"measured"},{"denominator":72,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":72,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-10T06:31:04.303077+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2502.01084/citation-record","integrity":"/paper/2502.01084/integrity","json":"/paper/2502.01084/citation-record.json","paper":"/paper/2502.01084"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T16:43:09.896787Z","title":"wav2vec 2.0: A framework for self-supervised learning of speech representations","venue":null,"work_id":"97bfa862-5aa0-4887-9527-6ce719e0cb02","year":2020},"citing_paper":{"arxiv_id":"2502.01084","last_updated":"2025-02-13T09:25:03Z","snapshot_observed_at":"2026-08-09T19:41:15.653121Z","submitted_at":"2025-02-03T05:53:59Z","title":"Continuous Autoregressive Modeling with Stochastic Monotonic Alignment for Speech Synthesis","version":2},"reference_index":1,"source":"arxiv_source","source_observed_at":"2026-08-09T16:43:08.642508Z"},"links":{"citing_paper":"/paper/2502.01084"},"observation_digest":"sha256:aae55d35bad769e0ac4c63b6af241d1c1dadca7c7b8fa205a3a7603592d9681a","observation_id":"996989fd-0ad4-471a-8883-8a02d55370d1","resolution":{"observed_at":"2026-08-09T16:43:09.900635Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2305.07243","last_updated":"2023-05-23T21:41:54Z","snapshot_observed_at":"2026-08-10T19:02:23.351550Z","submitted_at":"2023-05-12T04:19:49Z","title":"Better speech synthesis through scaling","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.07243","snapshot_observed_at":"2026-08-09T16:43:08.647563Z","title":"Better speech synthesis through scaling","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2502.01084","last_updated":"2025-02-13T09:25:03Z","snapshot_observed_at":"2026-08-09T19:41:15.653121Z","submitted_at":"2025-02-03T05:53:59Z","title":"Continuous Autoregressive Modeling with Stochastic Monotonic Alignment for Speech Synthesis","version":2},"reference_index":2,"source":"arxiv_source","source_observed_at":"2026-08-09T16:43:08.647563Z"},"links":{"cited_paper":"/paper/2305.07243","citing_paper":"/paper/2502.01084"},"observation_digest":"sha256:23a09749e805e1ccfd1706e48bfe2ec4857122a838bc06283fbfc43f4876b325","observation_id":"2c20c57d-0727-4a1e-a2f9-1923e9fcec21","resolution":{"observed_at":"2026-08-09T16:43:08.647563Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T16:43:09.885062Z","title":"Audiolm: a language modeling approach to audio generation","venue":null,"work_id":"9e7812e9-f072-4c8f-8ca6-ccf824c5b9e6","year":2023},"citing_paper":{"arxiv_id":"2502.01084","last_updated":"2025-02-13T09:25:03Z","snapshot_observed_at":"2026-08-09T19:41:15.653121Z","submitted_at":"2025-02-03T05:53:59Z","title":"Continuous Autoregressive Modeling with Stochastic Monotonic Alignment for Speech Synthesis","version":2},"reference_index":3,"source":"arxiv_source","source_observed_at":"2026-08-09T16:43:08.652180Z"},"links":{"citing_paper":"/paper/2502.01084"},"observation_digest":"sha256:f147b2985392257638f360b03dbdf0353ea19ac1301cbf72904805c2aa5e2a88","observation_id":"da4d6059-d957-4a40-b646-ed79e10e0d91","resolution":{"observed_at":"2026-08-09T16:43:09.888991Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2305.09636","last_updated":"2023-05-16T17:41:25Z","snapshot_observed_at":"2026-08-06T19:45:49.830925Z","submitted_at":"2023-05-16T17:41:25Z","title":"SoundStorm: Efficient Parallel Audio Generation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.09636","snapshot_observed_at":"2026-08-09T16:43:08.656006Z","title":"Soundstorm: Efficient parallel audio generation","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2502.01084","last_updated":"2025-02-13T09:25:03Z","snapshot_observed_at":"2026-08-09T19:41:15.653121Z","submitted_at":"2025-02-03T05:53:59Z","title":"Continuous Autoregressive Modeling with Stochastic Monotonic Alignment for Speech Synthesis","version":2},"reference_index":4,"source":"arxiv_source","source_observed_at":"2026-08-09T16:43:08.656006Z"},"links":{"cited_paper":"/paper/2305.09636","citing_paper":"/paper/2502.01084"},"observation_digest":"sha256:d6d0bb4ffe09d992f87fa239275b604c5ba6a5ff77d898e322f4a585d86c9dd5","observation_id":"4da0a028-7968-46a2-afc0-d9ba82130442","resolution":{"observed_at":"2026-08-09T16:43:08.656006Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T16:43:08.660039Z","title":"Language models are few-shot learners","venue":null,"work_id":null,"year":1901},"citing_paper":{"arxiv_id":"2502.01084","last_updated":"2025-02-13T09:25:03Z","snapshot_observed_at":"2026-08-09T19:41:15.653121Z","submitted_at":"2025-02-03T05:53:59Z","title":"Continuous Autoregressive Modeling with Stochastic Monotonic Alignment for Speech Synthesis","version":2},"reference_index":5,"source":"arxiv_source","source_observed_at":"2026-08-09T16:43:08.660039Z"},"links":{"citing_paper":"/paper/2502.01084"},"observation_digest":"sha256:c09bf4e6f604a2874be79b51e5cf2ffe535782ccdaa1f5843a12faea5ef6ab8b","observation_id":"7b55b257-0531-481b-a2a2-e35416a02f23","resolution":{"observed_at":"2026-08-09T16:43:08.660039Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.04904","last_updated":"2024-06-07T12:56:11Z","snapshot_observed_at":"2026-08-06T13:29:11.244845Z","submitted_at":"2024-06-07T12:56:11Z","title":"XTTS: a Massively Multilingual Zero-Shot Text-to-Speech Model","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.04904","snapshot_observed_at":"2026-08-09T16:43:08.663955Z","title":"o lge, G \\","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.01084","last_updated":"2025-02-13T09:25:03Z","snapshot_observed_at":"2026-08-09T19:41:15.653121Z","submitted_at":"2025-02-03T05:53:59Z","title":"Continuous Autoregressive Modeling with Stochastic Monotonic Alignment for Speech Synthesis","version":2},"reference_index":6,"source":"arxiv_source","source_observed_at":"2026-08-09T16:43:08.663955Z"},"links":{"cited_paper":"/paper/2406.04904","citing_paper":"/paper/2502.01084"},"observation_digest":"sha256:3f7ff1e5bec91cf96589602e00b1ada7e1b7f4deafd9801b43c5f5343c98b8a6","observation_id":"9a4a5a56-897e-4fa7-b9fc-06b5aa821aa5","resolution":{"observed_at":"2026-08-09T16:43:08.663955Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T16:43:09.866655Z","title":"A vector quantized approach for text to speech synthesis on real-world spontaneous speech","venue":null,"work_id":"a83c8077-7e79-46fb-8149-1c6c73d15cf5","year":2023},"citing_paper":{"arxiv_id":"2502.01084","last_updated":"2025-02-13T09:25:03Z","snapshot_observed_at":"2026-08-09T19:41:15.653121Z","submitted_at":"2025-02-03T05:53:59Z","title":"Continuous Autoregressive Modeling with Stochastic Monotonic Alignment for Speech Synthesis","version":2},"reference_index":7,"source":"arxiv_source","source_observed_at":"2026-08-09T16:43:08.668091Z"},"links":{"citing_paper":"/paper/2502.01084"},"observation_digest":"sha256:8b5f4781b9aa41385ca6bf7883fd9d0f19fa2b6ec8cf7cc5fcb35ecc2ebe0438","observation_id":"5919ee56-1eeb-4d1f-91bd-83f1f5086090","resolution":{"observed_at":"2026-08-09T16:43:09.870716Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2209.11866","last_updated":"2025-04-15T02:29:20Z","snapshot_observed_at":"2026-08-03T11:19:01.218071Z","submitted_at":"2022-09-23T21:28:59Z","title":"ControlVC: Zero-Shot Voice Conversion with Time-Varying Controls on Pitch and Speed","version":6},"cited_work":{"arxiv_id":"2209.11866","doi":null,"metadata_source":"pith","pith_arxiv_id":"2209.11866","snapshot_observed_at":"2026-08-09T16:43:09.462430Z","title":"ControlVC: Zero-Shot Voice Conversion with Time-Varying Controls on Pitch and Speed","venue":"eess.AS","work_id":"daaac400-e8f3-49c3-a18c-bf9bd1b3eaec","year":2022},"citing_paper":{"arxiv_id":"2502.01084","last_updated":"2025-02-13T09:25:03Z","snapshot_observed_at":"2026-08-09T19:41:15.653121Z","submitted_at":"2025-02-03T05:53:59Z","title":"Continuous Autoregressive Modeling with Stochastic Monotonic Alignment for Speech Synthesis","version":2},"reference_index":8,"source":"arxiv_source","source_observed_at":"2026-08-09T16:43:08.671551Z"},"links":{"cited_paper":"/paper/2209.11866","citing_paper":"/paper/2502.01084"},"observation_digest":"sha256:440f1498de0c1bd8ad0c672954434a42d3f07eed18cddee6df8632a556ae83eb","observation_id":"10b39969-f666-4c5a-b2ea-c2d769da6ada","resolution":{"observed_at":"2026-08-09T16:43:09.467295Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T16:43:09.854753Z","title":"WavLM : Large-scale self-supervised pre-training for full stack speech processing","venue":null,"work_id":"4ceac0cd-cbbd-40b6-8ef3-5e1794581fef","year":2022},"citing_paper":{"arxiv_id":"2502.01084","last_updated":"2025-02-13T09:25:03Z","snapshot_observed_at":"2026-08-09T19:41:15.653121Z","submitted_at":"2025-02-03T05:53:59Z","title":"Continuous Autoregressive Modeling with Stochastic Monotonic Alignment for Speech Synthesis","version":2},"reference_index":9,"source":"arxiv_source","source_observed_at":"2026-08-09T16:43:08.675588Z"},"links":{"citing_paper":"/paper/2502.01084"},"observation_digest":"sha256:b1b837f72027b6c0bbc5588e02cfb6cccffd29a83ed8563de6f0286d752754f4","observation_id":"a98efccd-d824-4a27-a431-609124b0805e","resolution":{"observed_at":"2026-08-09T16:43:09.858766Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1712.05382","last_updated":"2018-02-23T01:35:36Z","snapshot_observed_at":"2026-08-09T00:00:42.100207Z","submitted_at":"2017-12-14T18:29:42Z","title":"Monotonic Chunkwise Attention","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1712.05382","snapshot_observed_at":"2026-08-09T16:43:08.679399Z","title":"Monotonic chunkwise attention","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2502.01084","last_updated":"2025-02-13T09:25:03Z","snapshot_observed_at":"2026-08-09T19:41:15.653121Z","submitted_at":"2025-02-03T05:53:59Z","title":"Continuous Autoregressive Modeling with Stochastic Monotonic Alignment for Speech Synthesis","version":2},"reference_index":10,"source":"arxiv_source","source_observed_at":"2026-08-09T16:43:08.679399Z"},"links":{"cited_paper":"/paper/1712.05382","citing_paper":"/paper/2502.01084"},"observation_digest":"sha256:b87a469c72f017305263033def23d1abb0fcd8a89c75bf365fd91d22f293901e","observation_id":"64796b72-25ba-44ed-891b-acb12ae1f5d4","resolution":{"observed_at":"2026-08-09T16:43:08.679399Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.08619","last_updated":"2024-06-12T20:04:44Z","snapshot_observed_at":"2026-08-05T11:23:51.812806Z","submitted_at":"2024-06-12T20:04:44Z","title":"Self-Supervised Speech Representations are More Phonetic than Semantic","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.08619","snapshot_observed_at":"2026-08-09T16:43:08.683147Z","title":"Self-supervised speech representations are more phonetic than semantic","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.01084","last_updated":"2025-02-13T09:25:03Z","snapshot_observed_at":"2026-08-09T19:41:15.653121Z","submitted_at":"2025-02-03T05:53:59Z","title":"Continuous Autoregressive Modeling with Stochastic Monotonic Alignment for Speech Synthesis","version":2},"reference_index":11,"source":"arxiv_source","source_observed_at":"2026-08-09T16:43:08.683147Z"},"links":{"cited_paper":"/paper/2406.08619","citing_paper":"/paper/2502.01084"},"observation_digest":"sha256:bce3783f3d1fceb18dcf364f25f3e8bf17707cbea5f0896a7cab868ac20d5356","observation_id":"683d8685-7551-4494-b098-9d356f18ddc0","resolution":{"observed_at":"2026-08-09T16:43:08.683147Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T16:43:09.842402Z","title":"Unsupervised speech representation learning using wavenet autoencoders","venue":null,"work_id":"79f6b989-d923-4bc0-a7a9-3fc2fc85ae0e","year":2019},"citing_paper":{"arxiv_id":"2502.01084","last_updated":"2025-02-13T09:25:03Z","snapshot_observed_at":"2026-08-09T19:41:15.653121Z","submitted_at":"2025-02-03T05:53:59Z","title":"Continuous Autoregressive Modeling with Stochastic Monotonic Alignment for Speech Synthesis","version":2},"reference_index":12,"source":"arxiv_source","source_observed_at":"2026-08-09T16:43:08.687036Z"},"links":{"citing_paper":"/paper/2502.01084"},"observation_digest":"sha256:539441cb6bdf16a17406a1480affd533f1b69d22677c11557c2f8a4d9872632a","observation_id":"5139dc36-18d9-44d5-ba50-46c874ecb99d","resolution":{"observed_at":"2026-08-09T16:43:09.846716Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1806.05622","last_updated":"2018-06-27T01:49:17Z","snapshot_observed_at":"2026-08-08T04:36:13.309903Z","submitted_at":"2018-06-14T15:59:12Z","title":"VoxCeleb2: Deep Speaker Recognition","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1806.05622","snapshot_observed_at":"2026-08-09T16:43:08.690593Z","title":"Voxceleb2: Deep speaker recognition","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2502.01084","last_updated":"2025-02-13T09:25:03Z","snapshot_observed_at":"2026-08-09T19:41:15.653121Z","submitted_at":"2025-02-03T05:53:59Z","title":"Continuous Autoregressive Modeling with Stochastic Monotonic Alignment for Speech Synthesis","version":2},"reference_index":13,"source":"arxiv_source","source_observed_at":"2026-08-09T16:43:08.690593Z"},"links":{"cited_paper":"/paper/1806.05622","citing_paper":"/paper/2502.01084"},"observation_digest":"sha256:b008f9e76b58b49892f6b594e82530d3bc3acbc7b7faa0da495aea5bed394858","observation_id":"c92f5921-bb4d-4d35-94f6-ed3b4f674af5","resolution":{"observed_at":"2026-08-09T16:43:08.690593Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T16:43:09.830770Z","title":"Simple and controllable music generation","venue":null,"work_id":"852c8c8b-e706-48be-8d7a-0640c3c1e777","year":2024},"citing_paper":{"arxiv_id":"2502.01084","last_updated":"2025-02-13T09:25:03Z","snapshot_observed_at":"2026-08-09T19:41:15.653121Z","submitted_at":"2025-02-03T05:53:59Z","title":"Continuous Autoregressive Modeling with Stochastic Monotonic Alignment for Speech Synthesis","version":2},"reference_index":14,"source":"arxiv_source","source_observed_at":"2026-08-09T16:43:08.694045Z"},"links":{"citing_paper":"/paper/2502.01084"},"observation_digest":"sha256:ee6db3a751c8998502aa36c33a43f3ba2d3a8abfa5cc1c279051c66e53c5a358","observation_id":"ae839e87-2861-4dfb-95c4-6c5d3455ef4d","resolution":{"observed_at":"2026-08-09T16:43:09.834722Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2405.15682","last_updated":"2024-10-29T22:40:23Z","snapshot_observed_at":"2026-07-06T18:19:25.869339Z","submitted_at":"2024-05-24T16:20:46Z","title":"The Road Less Scheduled","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.15682","snapshot_observed_at":"2026-08-09T16:43:08.697680Z","title":"The road less scheduled","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.01084","last_updated":"2025-02-13T09:25:03Z","snapshot_observed_at":"2026-08-09T19:41:15.653121Z","submitted_at":"2025-02-03T05:53:59Z","title":"Continuous Autoregressive Modeling with Stochastic Monotonic Alignment for Speech Synthesis","version":2},"reference_index":15,"source":"arxiv_source","source_observed_at":"2026-08-09T16:43:08.697680Z"},"links":{"cited_paper":"/paper/2405.15682","citing_paper":"/paper/2502.01084"},"observation_digest":"sha256:f717ca6d9070718f1f9657eb7e6827d12cbebecf9a44d4fe8c2493e76298f754","observation_id":"42fdbbb7-daf1-409b-a88d-65dfee838a79","resolution":{"observed_at":"2026-08-09T16:43:08.697680Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2210.13438","last_updated":"2022-10-24T17:52:02Z","snapshot_observed_at":"2026-08-09T07:12:13.721596Z","submitted_at":"2022-10-24T17:52:02Z","title":"High Fidelity Neural Audio Compression","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2210.13438","snapshot_observed_at":"2026-08-09T16:43:08.701299Z","title":"High fidelity neural audio compression","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2502.01084","last_updated":"2025-02-13T09:25:03Z","snapshot_observed_at":"2026-08-09T19:41:15.653121Z","submitted_at":"2025-02-03T05:53:59Z","title":"Continuous Autoregressive Modeling with Stochastic Monotonic Alignment for Speech Synthesis","version":2},"reference_index":16,"source":"arxiv_source","source_observed_at":"2026-08-09T16:43:08.701299Z"},"links":{"cited_paper":"/paper/2210.13438","citing_paper":"/paper/2502.01084"},"observation_digest":"sha256:150db93775513a75d5371cebd9bcfbd6c2dbc5b42668bb8388904992e518d5bf","observation_id":"78e54ebb-0f1c-4cfa-abdc-d34a57012c50","resolution":{"observed_at":"2026-08-09T16:43:08.701299Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1810.04805","last_updated":"2019-05-24T20:37:26Z","snapshot_observed_at":"2026-07-30T09:12:38.100527Z","submitted_at":"2018-10-11T00:50:01Z","title":"BERT: Pre-training of Deep Bidirectional Transformers for Language Understanding","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1810.04805","snapshot_observed_at":"2026-08-09T16:43:08.705119Z","title":"Bert: Pre-training of deep bidirectional transformers for language understanding","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2502.01084","last_updated":"2025-02-13T09:25:03Z","snapshot_observed_at":"2026-08-09T19:41:15.653121Z","submitted_at":"2025-02-03T05:53:59Z","title":"Continuous Autoregressive Modeling with Stochastic Monotonic Alignment for Speech Synthesis","version":2},"reference_index":17,"source":"arxiv_source","source_observed_at":"2026-08-09T16:43:08.705119Z"},"links":{"cited_paper":"/paper/1810.04805","citing_paper":"/paper/2502.01084"},"observation_digest":"sha256:2c333816ea1f0612ea55ecde791343933f82fa009656096259f26a6f55f84cb3","observation_id":"bed1d918-2f40-4e9c-bc3c-40d2c9cb9140","resolution":{"observed_at":"2026-08-09T16:43:08.705119Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1611.02648","last_updated":"2017-01-13T17:53:10Z","snapshot_observed_at":"2026-08-10T08:57:34.622770Z","submitted_at":"2016-11-08T18:36:36Z","title":"Deep Unsupervised Clustering with Gaussian Mixture Variational Autoencoders","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1611.02648","snapshot_observed_at":"2026-08-09T16:43:08.709109Z","title":"Deep unsupervised clustering with gaussian mixture variational autoencoders","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2502.01084","last_updated":"2025-02-13T09:25:03Z","snapshot_observed_at":"2026-08-09T19:41:15.653121Z","submitted_at":"2025-02-03T05:53:59Z","title":"Continuous Autoregressive Modeling with Stochastic Monotonic Alignment for Speech Synthesis","version":2},"reference_index":18,"source":"arxiv_source","source_observed_at":"2026-08-09T16:43:08.709109Z"},"links":{"cited_paper":"/paper/1611.02648","citing_paper":"/paper/2502.01084"},"observation_digest":"sha256:9b9687a39ae58e5ab0809b41f554045f28b14486ee4399ec9d58a3d5a6380c01","observation_id":"145b50cf-72dd-4570-b187-3558c0682659","resolution":{"observed_at":"2026-08-09T16:43:08.709109Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T16:43:08.713005Z","title":"Taming transformers for high-resolution image synthesis","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2502.01084","last_updated":"2025-02-13T09:25:03Z","snapshot_observed_at":"2026-08-09T19:41:15.653121Z","submitted_at":"2025-02-03T05:53:59Z","title":"Continuous Autoregressive Modeling with Stochastic Monotonic Alignment for Speech Synthesis","version":2},"reference_index":19,"source":"arxiv_source","source_observed_at":"2026-08-09T16:43:08.713005Z"},"links":{"citing_paper":"/paper/2502.01084"},"observation_digest":"sha256:50379a50eb936811351026ec1c698b6751ca42ac871aeafb58cc18d81a649bad","observation_id":"80e6761d-857f-4f89-8d2c-491996350f99","resolution":{"observed_at":"2026-08-09T16:43:08.713005Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1607.05690","last_updated":"2016-07-19T18:37:00Z","snapshot_observed_at":"2026-07-06T05:04:11.741056Z","submitted_at":"2016-07-19T18:37:00Z","title":"Stochastic Backpropagation through Mixture Density Distributions","version":1},"cited_work":{"arxiv_id":"1607.05690","doi":null,"metadata_source":"pith","pith_arxiv_id":"1607.05690","snapshot_observed_at":"2026-08-09T16:43:09.357833Z","title":"Stochastic Backpropagation through Mixture Density Distributions","venue":"cs.NE","work_id":"1b14882a-9ad5-4d14-a2ed-af0c74c3b315","year":2016},"citing_paper":{"arxiv_id":"2502.01084","last_updated":"2025-02-13T09:25:03Z","snapshot_observed_at":"2026-08-09T19:41:15.653121Z","submitted_at":"2025-02-03T05:53:59Z","title":"Continuous Autoregressive Modeling with Stochastic Monotonic Alignment for Speech Synthesis","version":2},"reference_index":20,"source":"arxiv_source","source_observed_at":"2026-08-09T16:43:08.716434Z"},"links":{"cited_paper":"/paper/1607.05690","citing_paper":"/paper/2502.01084"},"observation_digest":"sha256:cc4615ec5af623d96ccffe72b3b3d269e867d2d91872d80f2128f64efef8cc4f","observation_id":"0676804b-3905-4acf-9af2-bc1561793e37","resolution":{"observed_at":"2026-08-09T16:43:09.362124Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1906.00672","last_updated":"2019-08-06T06:50:33Z","snapshot_observed_at":"2026-07-06T07:57:26.611285Z","submitted_at":"2019-06-03T09:52:19Z","title":"Robust Sequence-to-Sequence Acoustic Modeling with Stepwise Monotonic Attention for Neural TTS","version":3},"cited_work":{"arxiv_id":"1906.00672","doi":null,"metadata_source":"pith","pith_arxiv_id":"1906.00672","snapshot_observed_at":"2026-08-09T16:43:09.338522Z","title":"Robust Sequence-to-Sequence Acoustic Modeling with Stepwise Monotonic Attention for Neural TTS","venue":"cs.CL","work_id":"62054a05-45bb-42eb-9bec-12e286e4747b","year":2019},"citing_paper":{"arxiv_id":"2502.01084","last_updated":"2025-02-13T09:25:03Z","snapshot_observed_at":"2026-08-09T19:41:15.653121Z","submitted_at":"2025-02-03T05:53:59Z","title":"Continuous Autoregressive Modeling with Stochastic Monotonic Alignment for Speech Synthesis","version":2},"reference_index":21,"source":"arxiv_source","source_observed_at":"2026-08-09T16:43:08.720156Z"},"links":{"cited_paper":"/paper/1906.00672","citing_paper":"/paper/2502.01084"},"observation_digest":"sha256:28e7be6e2fa2de027d2a3710b1efb117d8dc190daf14fda48a11941acf266a12","observation_id":"07aef043-1885-4302-95ac-421c5f748845","resolution":{"observed_at":"2026-08-09T16:43:09.344609Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T16:43:09.812818Z","title":"Visqol: an objective speech quality model","venue":null,"work_id":"8d6eacc6-aa81-4892-a8c5-9da9964c9855","year":2015},"citing_paper":{"arxiv_id":"2502.01084","last_updated":"2025-02-13T09:25:03Z","snapshot_observed_at":"2026-08-09T19:41:15.653121Z","submitted_at":"2025-02-03T05:53:59Z","title":"Continuous Autoregressive Modeling with Stochastic Monotonic Alignment for Speech Synthesis","version":2},"reference_index":22,"source":"arxiv_source","source_observed_at":"2026-08-09T16:43:08.723947Z"},"links":{"citing_paper":"/paper/2502.01084"},"observation_digest":"sha256:ba40530d5c90bd0657d6185c32848d85e5ab9258e25c02562c53f55ead7dff0d","observation_id":"51194fae-1175-4cfc-9e8f-699f97b9b500","resolution":{"observed_at":"2026-08-09T16:43:09.816607Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T16:43:08.727357Z","title":"Reducing the dimensionality of data with neural networks","venue":null,"work_id":null,"year":2006},"citing_paper":{"arxiv_id":"2502.01084","last_updated":"2025-02-13T09:25:03Z","snapshot_observed_at":"2026-08-09T19:41:15.653121Z","submitted_at":"2025-02-03T05:53:59Z","title":"Continuous Autoregressive Modeling with Stochastic Monotonic Alignment for Speech Synthesis","version":2},"reference_index":23,"source":"arxiv_source","source_observed_at":"2026-08-09T16:43:08.727357Z"},"links":{"citing_paper":"/paper/2502.01084"},"observation_digest":"sha256:0799444eb51097da8bee2de6c6236c78652b96ff6ac197797b839d2b78be831b","observation_id":"64c63cf4-faab-4277-91d3-8e1179154fa6","resolution":{"observed_at":"2026-08-09T16:43:08.727357Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T16:43:09.795482Z","title":"Hubert: Self-supervised speech representation learning by masked prediction of hidden units","venue":null,"work_id":"bf8a65b8-152e-4979-ba8b-372bff2a8e24","year":2021},"citing_paper":{"arxiv_id":"2502.01084","last_updated":"2025-02-13T09:25:03Z","snapshot_observed_at":"2026-08-09T19:41:15.653121Z","submitted_at":"2025-02-03T05:53:59Z","title":"Continuous Autoregressive Modeling with Stochastic Monotonic Alignment for Speech Synthesis","version":2},"reference_index":24,"source":"arxiv_source","source_observed_at":"2026-08-09T16:43:08.730734Z"},"links":{"citing_paper":"/paper/2502.01084"},"observation_digest":"sha256:dc3c57a03c0204f35659818f2d2442da66a085268f55a1ff86c7a2e735f09171","observation_id":"044afde6-530a-473f-b1fe-04bb4432fcf4","resolution":{"observed_at":"2026-08-09T16:43:09.799283Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T16:43:09.783503Z","title":"Prodiff: Progressive fast diffusion model for high-quality text-to-speech","venue":null,"work_id":"fca9b5fa-07db-4c17-a449-304f5ee66564","year":2022},"citing_paper":{"arxiv_id":"2502.01084","last_updated":"2025-02-13T09:25:03Z","snapshot_observed_at":"2026-08-09T19:41:15.653121Z","submitted_at":"2025-02-03T05:53:59Z","title":"Continuous Autoregressive Modeling with Stochastic Monotonic Alignment for Speech Synthesis","version":2},"reference_index":25,"source":"arxiv_source","source_observed_at":"2026-08-09T16:43:08.734163Z"},"links":{"citing_paper":"/paper/2502.01084"},"observation_digest":"sha256:ecdfa95f66e02641bb61b5347328fc344976e2e2f23bea8f215c94bf7e65a3e4","observation_id":"15a21aac-fb50-487a-9384-360993f62109","resolution":{"observed_at":"2026-08-09T16:43:09.787597Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1611.01144","last_updated":"2017-08-05T22:45:19Z","snapshot_observed_at":"2026-08-01T18:34:23.156273Z","submitted_at":"2016-11-03T19:48:08Z","title":"Categorical Reparameterization with Gumbel-Softmax","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1611.01144","snapshot_observed_at":"2026-08-09T16:43:08.738045Z","title":"Categorical reparameterization with gumbel-softmax","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2502.01084","last_updated":"2025-02-13T09:25:03Z","snapshot_observed_at":"2026-08-09T19:41:15.653121Z","submitted_at":"2025-02-03T05:53:59Z","title":"Continuous Autoregressive Modeling with Stochastic Monotonic Alignment for Speech Synthesis","version":2},"reference_index":26,"source":"arxiv_source","source_observed_at":"2026-08-09T16:43:08.738045Z"},"links":{"cited_paper":"/paper/1611.01144","citing_paper":"/paper/2502.01084"},"observation_digest":"sha256:6e17a70a972ea80e889eeb6e0990c6f9c291b8278a8fbc761ba436439ff6430b","observation_id":"45b7547d-39b6-4a26-8dcc-0c14c4635439","resolution":{"observed_at":"2026-08-09T16:43:08.738045Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2104.01409","last_updated":"2021-04-03T13:53:19Z","snapshot_observed_at":"2026-08-09T08:07:41.367781Z","submitted_at":"2021-04-03T13:53:19Z","title":"Diff-TTS: A Denoising Diffusion Model for Text-to-Speech","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2104.01409","snapshot_observed_at":"2026-08-09T16:43:08.742096Z","title":"Diff-tts: A denoising diffusion model for text-to-speech","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2502.01084","last_updated":"2025-02-13T09:25:03Z","snapshot_observed_at":"2026-08-09T19:41:15.653121Z","submitted_at":"2025-02-03T05:53:59Z","title":"Continuous Autoregressive Modeling with Stochastic Monotonic Alignment for Speech Synthesis","version":2},"reference_index":27,"source":"arxiv_source","source_observed_at":"2026-08-09T16:43:08.742096Z"},"links":{"cited_paper":"/paper/2104.01409","citing_paper":"/paper/2502.01084"},"observation_digest":"sha256:a97306f3e870b196a7156f42cd22f6ba4cbf1f0a937f17ec0b201ea643a0f190","observation_id":"caa7e61c-5546-4f50-bd15-c1fdc9ccb94e","resolution":{"observed_at":"2026-08-09T16:43:08.742096Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T16:43:08.745908Z","title":"Libri-light: A benchmark for asr with limited or no supervision","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2502.01084","last_updated":"2025-02-13T09:25:03Z","snapshot_observed_at":"2026-08-09T19:41:15.653121Z","submitted_at":"2025-02-03T05:53:59Z","title":"Continuous Autoregressive Modeling with Stochastic Monotonic Alignment for Speech Synthesis","version":2},"reference_index":28,"source":"arxiv_source","source_observed_at":"2026-08-09T16:43:08.745908Z"},"links":{"citing_paper":"/paper/2502.01084"},"observation_digest":"sha256:b0c26b30a709bb12469029c69ba1220ac30308f61370f39e9869145f534fb562","observation_id":"45da75a7-23fb-4c7e-9b49-c8ce4f8aeff1","resolution":{"observed_at":"2026-08-09T16:43:08.745908Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T16:43:09.765268Z","title":"Conditional variational autoencoder with adversarial learning for end-to-end text-to-speech","venue":null,"work_id":"89b5902c-f7ae-482c-bdc0-7f5a03d114de","year":2021},"citing_paper":{"arxiv_id":"2502.01084","last_updated":"2025-02-13T09:25:03Z","snapshot_observed_at":"2026-08-09T19:41:15.653121Z","submitted_at":"2025-02-03T05:53:59Z","title":"Continuous Autoregressive Modeling with Stochastic Monotonic Alignment for Speech Synthesis","version":2},"reference_index":29,"source":"arxiv_source","source_observed_at":"2026-08-09T16:43:08.749904Z"},"links":{"citing_paper":"/paper/2502.01084"},"observation_digest":"sha256:db2db45c61f3b34c4c8f4af4bb0881a7ff9a1ef9324e32674a8a8840eb46036a","observation_id":"ce42680e-7ba0-415e-bf82-450e533ba805","resolution":{"observed_at":"2026-08-09T16:43:09.769374Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T16:43:09.753743Z","title":"Kingma and Max Welling","venue":null,"work_id":"3a3d8203-c6f8-4919-9117-cfa4181332b4","year":2014},"citing_paper":{"arxiv_id":"2502.01084","last_updated":"2025-02-13T09:25:03Z","snapshot_observed_at":"2026-08-09T19:41:15.653121Z","submitted_at":"2025-02-03T05:53:59Z","title":"Continuous Autoregressive Modeling with Stochastic Monotonic Alignment for Speech Synthesis","version":2},"reference_index":30,"source":"arxiv_source","source_observed_at":"2026-08-09T16:43:08.753289Z"},"links":{"citing_paper":"/paper/2502.01084"},"observation_digest":"sha256:9d548c3e11373b3951e0766327de4fd1ee72477030d84e63a571b809cabc3ba1","observation_id":"fffee71c-5db3-4f11-bb80-845d9355e870","resolution":{"observed_at":"2026-08-09T16:43:09.757721Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T16:43:09.741316Z","title":"Hifi-gan: Generative adversarial networks for efficient and high fidelity speech synthesis","venue":null,"work_id":"69160374-0cab-4904-b871-0fc4e8fcf572","year":2020},"citing_paper":{"arxiv_id":"2502.01084","last_updated":"2025-02-13T09:25:03Z","snapshot_observed_at":"2026-08-09T19:41:15.653121Z","submitted_at":"2025-02-03T05:53:59Z","title":"Continuous Autoregressive Modeling with Stochastic Monotonic Alignment for Speech Synthesis","version":2},"reference_index":31,"source":"arxiv_source","source_observed_at":"2026-08-09T16:43:08.756871Z"},"links":{"citing_paper":"/paper/2502.01084"},"observation_digest":"sha256:9a4e072d7379b9b1d5b448c9216fe7cebe1a05a347ff9e16e9dda31db24d1787","observation_id":"14cfdd7c-8655-4e06-9a7b-bdb201ac574c","resolution":{"observed_at":"2026-08-09T16:43:09.745077Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T16:43:09.729723Z","title":"High-fidelity audio compression with improved rvqgan","venue":null,"work_id":"1f247fee-fb1e-4395-bad0-a21b73b20d13","year":2024},"citing_paper":{"arxiv_id":"2502.01084","last_updated":"2025-02-13T09:25:03Z","snapshot_observed_at":"2026-08-09T19:41:15.653121Z","submitted_at":"2025-02-03T05:53:59Z","title":"Continuous Autoregressive Modeling with Stochastic Monotonic Alignment for Speech Synthesis","version":2},"reference_index":32,"source":"arxiv_source","source_observed_at":"2026-08-09T16:43:08.760481Z"},"links":{"citing_paper":"/paper/2502.01084"},"observation_digest":"sha256:8ca41ff8e1943798416d94319278a6789ffbae73dbadb1f8acbaad06fed460b2","observation_id":"1dd0fe29-c507-42f8-b1eb-2d084abfdc8c","resolution":{"observed_at":"2026-08-09T16:43:09.733435Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T16:43:09.719043Z","title":"Robust training of vector quantized bottleneck models","venue":null,"work_id":"21a16fbc-85ba-4196-af86-81300747bd05","year":2020},"citing_paper":{"arxiv_id":"2502.01084","last_updated":"2025-02-13T09:25:03Z","snapshot_observed_at":"2026-08-09T19:41:15.653121Z","submitted_at":"2025-02-03T05:53:59Z","title":"Continuous Autoregressive Modeling with Stochastic Monotonic Alignment for Speech Synthesis","version":2},"reference_index":33,"source":"arxiv_source","source_observed_at":"2026-08-09T16:43:08.763769Z"},"links":{"citing_paper":"/paper/2502.01084"},"observation_digest":"sha256:0aa365619045f357f2c3d087bd9c5b363cb86c506e265b925e7d6aae429b8a98","observation_id":"982da5a7-6077-45ab-9c46-f5f50fe8ca29","resolution":{"observed_at":"2026-08-09T16:43:09.722906Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2306.15687","last_updated":"2023-10-19T13:23:28Z","snapshot_observed_at":"2026-08-10T13:43:11.982910Z","submitted_at":"2023-06-23T16:23:24Z","title":"Voicebox: Text-Guided Multilingual Universal Speech Generation at Scale","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.15687","snapshot_observed_at":"2026-08-09T16:43:08.768464Z","title":"Voicebox: Text-guided multilingual universal speech generation at scale","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2502.01084","last_updated":"2025-02-13T09:25:03Z","snapshot_observed_at":"2026-08-09T19:41:15.653121Z","submitted_at":"2025-02-03T05:53:59Z","title":"Continuous Autoregressive Modeling with Stochastic Monotonic Alignment for Speech Synthesis","version":2},"reference_index":34,"source":"arxiv_source","source_observed_at":"2026-08-09T16:43:08.768464Z"},"links":{"cited_paper":"/paper/2306.15687","citing_paper":"/paper/2502.01084"},"observation_digest":"sha256:acf127345ec0cb900e578f907881d241d30a17260ffcf752be1d44a2ee3bf607","observation_id":"996e2d5b-fdd1-48d5-88b8-1a4ee0220a00","resolution":{"observed_at":"2026-08-09T16:43:08.768464Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.12454","last_updated":"2023-11-27T12:26:32Z","snapshot_observed_at":"2026-07-06T16:50:26.807430Z","submitted_at":"2023-11-21T09:07:11Z","title":"HierSpeech++: Bridging the Gap between Semantic and Acoustic Representation of Speech by Hierarchical Variational Inference for Zero-shot Speech Synthesis","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.12454","snapshot_observed_at":"2026-08-09T16:43:08.772217Z","title":"Hierspeech++: Bridging the gap between semantic and acoustic representation of speech by hierarchical variational inference for zero-shot speech synthesis","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2502.01084","last_updated":"2025-02-13T09:25:03Z","snapshot_observed_at":"2026-08-09T19:41:15.653121Z","submitted_at":"2025-02-03T05:53:59Z","title":"Continuous Autoregressive Modeling with Stochastic Monotonic Alignment for Speech Synthesis","version":2},"reference_index":35,"source":"arxiv_source","source_observed_at":"2026-08-09T16:43:08.772217Z"},"links":{"cited_paper":"/paper/2311.12454","citing_paper":"/paper/2502.01084"},"observation_digest":"sha256:a6e606c311c010d4183a1bcaa9d3597e5ac2ff1c69e2837f8b10170b8678379e","observation_id":"ceaace19-f2da-4f7a-97fc-c90eb85c1b64","resolution":{"observed_at":"2026-08-09T16:43:08.772217Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2205.15439","last_updated":"2023-11-20T04:31:13Z","snapshot_observed_at":"2026-07-06T13:15:39.751387Z","submitted_at":"2022-05-30T21:34:40Z","title":"StyleTTS: A Style-Based Generative Model for Natural and Diverse Text-to-Speech Synthesis","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2205.15439","snapshot_observed_at":"2026-08-09T16:43:08.775875Z","title":"Styletts: A style-based generative model for natural and diverse text-to-speech synthesis","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2502.01084","last_updated":"2025-02-13T09:25:03Z","snapshot_observed_at":"2026-08-09T19:41:15.653121Z","submitted_at":"2025-02-03T05:53:59Z","title":"Continuous Autoregressive Modeling with Stochastic Monotonic Alignment for Speech Synthesis","version":2},"reference_index":36,"source":"arxiv_source","source_observed_at":"2026-08-09T16:43:08.775875Z"},"links":{"cited_paper":"/paper/2205.15439","citing_paper":"/paper/2502.01084"},"observation_digest":"sha256:a53204341924eaaf40dc9ccf712d51c7c179a2b2d24ae7fb30d764916e39bf87","observation_id":"46734ece-16fc-4464-b22c-f7d03c37f3cb","resolution":{"observed_at":"2026-08-09T16:43:08.775875Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T16:43:08.779643Z","title":"Styletts 2: Towards human-level text-to-speech through style diffusion and adversarial training with large speech language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.01084","last_updated":"2025-02-13T09:25:03Z","snapshot_observed_at":"2026-08-09T19:41:15.653121Z","submitted_at":"2025-02-03T05:53:59Z","title":"Continuous Autoregressive Modeling with Stochastic Monotonic Alignment for Speech Synthesis","version":2},"reference_index":37,"source":"arxiv_source","source_observed_at":"2026-08-09T16:43:08.779643Z"},"links":{"citing_paper":"/paper/2502.01084"},"observation_digest":"sha256:1f1e4056aec9a550f0c48583131b286c504a9b110519c8b1f39d70cee8b2826c","observation_id":"a772db78-97fc-488d-8f3f-958bc6fe0134","resolution":{"observed_at":"2026-08-09T16:43:08.779643Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2203.16852","last_updated":"2022-07-01T18:20:39Z","snapshot_observed_at":"2026-08-10T13:38:23.312725Z","submitted_at":"2022-03-31T07:25:11Z","title":"JETS: Jointly Training FastSpeech2 and HiFi-GAN for End to End Text to Speech","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2203.16852","snapshot_observed_at":"2026-08-09T16:43:08.783086Z","title":"Jets: Jointly training fastspeech2 and hifi-gan for end to end text to speech","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2502.01084","last_updated":"2025-02-13T09:25:03Z","snapshot_observed_at":"2026-08-09T19:41:15.653121Z","submitted_at":"2025-02-03T05:53:59Z","title":"Continuous Autoregressive Modeling with Stochastic Monotonic Alignment for Speech Synthesis","version":2},"reference_index":38,"source":"arxiv_source","source_observed_at":"2026-08-09T16:43:08.783086Z"},"links":{"cited_paper":"/paper/2203.16852","citing_paper":"/paper/2502.01084"},"observation_digest":"sha256:6ffce387d8faa1b361f30466a79e73366bd75831b033d4c0f69fe136fd4da30d","observation_id":"2f6bd274-9071-430b-be9e-a69f1ff53512","resolution":{"observed_at":"2026-08-09T16:43:08.783086Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2201.11972","last_updated":"2022-01-28T07:41:10Z","snapshot_observed_at":"2026-08-05T09:16:36.326542Z","submitted_at":"2022-01-28T07:41:10Z","title":"DiffGAN-TTS: High-Fidelity and Efficient Text-to-Speech with Denoising Diffusion GANs","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2201.11972","snapshot_observed_at":"2026-08-09T16:43:08.786889Z","title":"Diffgan-tts: High-fidelity and efficient text-to-speech with denoising diffusion gans","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2502.01084","last_updated":"2025-02-13T09:25:03Z","snapshot_observed_at":"2026-08-09T19:41:15.653121Z","submitted_at":"2025-02-03T05:53:59Z","title":"Continuous Autoregressive Modeling with Stochastic Monotonic Alignment for Speech Synthesis","version":2},"reference_index":39,"source":"arxiv_source","source_observed_at":"2026-08-09T16:43:08.786889Z"},"links":{"cited_paper":"/paper/2201.11972","citing_paper":"/paper/2502.01084"},"observation_digest":"sha256:ce68d02518592827c779774a8d9240c241be11b3e7f5ba3a2f552097dcf90a05","observation_id":"0c3d4016-2a18-45d4-946d-7359cefedb8c","resolution":{"observed_at":"2026-08-09T16:43:08.786889Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.01912","last_updated":"2024-02-02T21:29:34Z","snapshot_observed_at":"2026-08-10T02:15:41.685360Z","submitted_at":"2024-02-02T21:29:34Z","title":"Natural language guidance of high-fidelity text-to-speech with synthetic annotations","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.01912","snapshot_observed_at":"2026-08-09T16:43:08.790672Z","title":"Natural language guidance of high-fidelity text-to-speech with synthetic annotations","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.01084","last_updated":"2025-02-13T09:25:03Z","snapshot_observed_at":"2026-08-09T19:41:15.653121Z","submitted_at":"2025-02-03T05:53:59Z","title":"Continuous Autoregressive Modeling with Stochastic Monotonic Alignment for Speech Synthesis","version":2},"reference_index":40,"source":"arxiv_source","source_observed_at":"2026-08-09T16:43:08.790672Z"},"links":{"cited_paper":"/paper/2402.01912","citing_paper":"/paper/2502.01084"},"observation_digest":"sha256:3a624cf4b149ee3df414a49c4176afdc0dff4ae0e58e45fd3e1c26a6d1e4ffaa","observation_id":"cd010cce-1125-4d87-ad1e-da6c7c2af2ce","resolution":{"observed_at":"2026-08-09T16:43:08.790672Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1511.05644","last_updated":"2016-05-25T00:17:45Z","snapshot_observed_at":"2026-08-10T09:13:56.872366Z","submitted_at":"2015-11-18T02:32:39Z","title":"Adversarial Autoencoders","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1511.05644","snapshot_observed_at":"2026-08-09T16:43:08.794667Z","title":"Adversarial autoencoders","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2502.01084","last_updated":"2025-02-13T09:25:03Z","snapshot_observed_at":"2026-08-09T19:41:15.653121Z","submitted_at":"2025-02-03T05:53:59Z","title":"Continuous Autoregressive Modeling with Stochastic Monotonic Alignment for Speech Synthesis","version":2},"reference_index":41,"source":"arxiv_source","source_observed_at":"2026-08-09T16:43:08.794667Z"},"links":{"cited_paper":"/paper/1511.05644","citing_paper":"/paper/2502.01084"},"observation_digest":"sha256:c8e5282e34e3e81f3dbf7e9ca7a9dec939bde229374a2ffeeba460691db75752","observation_id":"8215d38d-45e5-428f-88f1-99515e29df55","resolution":{"observed_at":"2026-08-09T16:43:08.794667Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.05401","last_updated":"2024-06-08T08:49:22Z","snapshot_observed_at":"2026-08-10T15:55:50.011071Z","submitted_at":"2024-06-08T08:49:22Z","title":"Should you use a probabilistic duration model in TTS? Probably! Especially for spontaneous speech","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.05401","snapshot_observed_at":"2026-08-09T16:43:08.798686Z","title":"Should you use a probabilistic duration model in tts? probably! especially for spontaneous speech","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.01084","last_updated":"2025-02-13T09:25:03Z","snapshot_observed_at":"2026-08-09T19:41:15.653121Z","submitted_at":"2025-02-03T05:53:59Z","title":"Continuous Autoregressive Modeling with Stochastic Monotonic Alignment for Speech Synthesis","version":2},"reference_index":42,"source":"arxiv_source","source_observed_at":"2026-08-09T16:43:08.798686Z"},"links":{"cited_paper":"/paper/2406.05401","citing_paper":"/paper/2502.01084"},"observation_digest":"sha256:4821ddf3a326461f0fb07e6f17b09e14200d5109513722a11a0817250f688a7f","observation_id":"674f8a57-6c60-49c6-974d-a887ccba5baa","resolution":{"observed_at":"2026-08-09T16:43:08.798686Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T16:43:09.701084Z","title":"Matcha-tts: A fast tts architecture with conditional flow matching","venue":null,"work_id":"c9d10dd9-398f-4c2f-93d0-3da9d99ebb87","year":2024},"citing_paper":{"arxiv_id":"2502.01084","last_updated":"2025-02-13T09:25:03Z","snapshot_observed_at":"2026-08-09T19:41:15.653121Z","submitted_at":"2025-02-03T05:53:59Z","title":"Continuous Autoregressive Modeling with Stochastic Monotonic Alignment for Speech Synthesis","version":2},"reference_index":43,"source":"arxiv_source","source_observed_at":"2026-08-09T16:43:08.802541Z"},"links":{"citing_paper":"/paper/2502.01084"},"observation_digest":"sha256:0cdd454c7ba317a3fc81b13de057df7f3623d8eae368f448344194ef4faeff4c","observation_id":"6975252e-218a-41d4-9a86-7e84fdf33352","resolution":{"observed_at":"2026-08-09T16:43:09.705074Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2309.15505","last_updated":"2023-10-12T07:55:05Z","snapshot_observed_at":"2026-07-06T16:24:17.829828Z","submitted_at":"2023-09-27T09:13:40Z","title":"Finite Scalar Quantization: VQ-VAE Made Simple","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.15505","snapshot_observed_at":"2026-08-09T16:43:08.805847Z","title":"Finite scalar quantization: Vq-vae made simple","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2502.01084","last_updated":"2025-02-13T09:25:03Z","snapshot_observed_at":"2026-08-09T19:41:15.653121Z","submitted_at":"2025-02-03T05:53:59Z","title":"Continuous Autoregressive Modeling with Stochastic Monotonic Alignment for Speech Synthesis","version":2},"reference_index":44,"source":"arxiv_source","source_observed_at":"2026-08-09T16:43:08.805847Z"},"links":{"cited_paper":"/paper/2309.15505","citing_paper":"/paper/2502.01084"},"observation_digest":"sha256:c7d6fb3b75202139e66378e43d13f94cd3b5d4a2d3940116b6a624a71922f4d5","observation_id":"88f18359-782a-4cf9-a878-cb14507d49a8","resolution":{"observed_at":"2026-08-09T16:43:08.805847Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1706.08612","last_updated":"2018-05-30T06:52:06Z","snapshot_observed_at":"2026-08-08T04:51:01.052037Z","submitted_at":"2017-06-26T21:42:27Z","title":"VoxCeleb: a large-scale speaker identification dataset","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1706.08612","snapshot_observed_at":"2026-08-09T16:43:08.809872Z","title":"Voxceleb: a large-scale speaker identification dataset","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2502.01084","last_updated":"2025-02-13T09:25:03Z","snapshot_observed_at":"2026-08-09T19:41:15.653121Z","submitted_at":"2025-02-03T05:53:59Z","title":"Continuous Autoregressive Modeling with Stochastic Monotonic Alignment for Speech Synthesis","version":2},"reference_index":45,"source":"arxiv_source","source_observed_at":"2026-08-09T16:43:08.809872Z"},"links":{"cited_paper":"/paper/1706.08612","citing_paper":"/paper/2502.01084"},"observation_digest":"sha256:52c9abca6994c8f35d1a8dfaa65309972fb0444899bfa9e84356d48030a96ec6","observation_id":"bbac4ca4-2011-4d0d-8c2e-0f07b4bba779","resolution":{"observed_at":"2026-08-09T16:43:08.809872Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T16:43:09.689676Z","title":"Librispeech: An ASR corpus based on public domain audio books","venue":null,"work_id":"f14854d5-3984-424b-8d99-a0befe3d05ca","year":2015},"citing_paper":{"arxiv_id":"2502.01084","last_updated":"2025-02-13T09:25:03Z","snapshot_observed_at":"2026-08-09T19:41:15.653121Z","submitted_at":"2025-02-03T05:53:59Z","title":"Continuous Autoregressive Modeling with Stochastic Monotonic Alignment for Speech Synthesis","version":2},"reference_index":46,"source":"arxiv_source","source_observed_at":"2026-08-09T16:43:08.813617Z"},"links":{"citing_paper":"/paper/2502.01084"},"observation_digest":"sha256:d389f3f6fcf1d840790a49876ff917dd228dda156790c2209f29fffc823607ed","observation_id":"c8705b49-25fa-4c1c-bb45-e288cfe5198a","resolution":{"observed_at":"2026-08-09T16:43:09.693535Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2104.00355","last_updated":"2021-07-27T14:27:27Z","snapshot_observed_at":"2026-08-09T13:24:51.366298Z","submitted_at":"2021-04-01T09:20:33Z","title":"Speech Resynthesis from Discrete Disentangled Self-Supervised Representations","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2104.00355","snapshot_observed_at":"2026-08-09T16:43:08.817148Z","title":"Speech resynthesis from discrete disentangled self-supervised representations","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2502.01084","last_updated":"2025-02-13T09:25:03Z","snapshot_observed_at":"2026-08-09T19:41:15.653121Z","submitted_at":"2025-02-03T05:53:59Z","title":"Continuous Autoregressive Modeling with Stochastic Monotonic Alignment for Speech Synthesis","version":2},"reference_index":47,"source":"arxiv_source","source_observed_at":"2026-08-09T16:43:08.817148Z"},"links":{"cited_paper":"/paper/2104.00355","citing_paper":"/paper/2502.01084"},"observation_digest":"sha256:d4b0dabacb5b1d888bd4d07bdbd1001209deef50ef2bb905933c426e64d857a0","observation_id":"dc3fa77f-3c20-498f-ba72-4a1c1b184875","resolution":{"observed_at":"2026-08-09T16:43:08.817148Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T16:43:09.677914Z","title":"Grad-tts: A diffusion probabilistic model for text-to-speech","venue":null,"work_id":"cfe7a39d-74ea-4198-8dfb-3cabff07f66d","year":2021},"citing_paper":{"arxiv_id":"2502.01084","last_updated":"2025-02-13T09:25:03Z","snapshot_observed_at":"2026-08-09T19:41:15.653121Z","submitted_at":"2025-02-03T05:53:59Z","title":"Continuous Autoregressive Modeling with Stochastic Monotonic Alignment for Speech Synthesis","version":2},"reference_index":48,"source":"arxiv_source","source_observed_at":"2026-08-09T16:43:08.820769Z"},"links":{"citing_paper":"/paper/2502.01084"},"observation_digest":"sha256:c4ee77afeb29f496d8e3d417106cd1a76dfb061571eb90dd88c97b515ae3e549","observation_id":"24a6b9c0-c32b-4f2e-8ef5-16e955fb5f9a","resolution":{"observed_at":"2026-08-09T16:43:09.682228Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T16:43:09.666241Z","title":"Autovc: Zero-shot voice style transfer with only autoencoder loss","venue":null,"work_id":"e8877fa5-286e-46ea-b8d9-86b75089df83","year":2019},"citing_paper":{"arxiv_id":"2502.01084","last_updated":"2025-02-13T09:25:03Z","snapshot_observed_at":"2026-08-09T19:41:15.653121Z","submitted_at":"2025-02-03T05:53:59Z","title":"Continuous Autoregressive Modeling with Stochastic Monotonic Alignment for Speech Synthesis","version":2},"reference_index":49,"source":"arxiv_source","source_observed_at":"2026-08-09T16:43:08.824187Z"},"links":{"citing_paper":"/paper/2502.01084"},"observation_digest":"sha256:d5b3b3103bd565bd0220ebaf44e569f55a9bfd136a1df4456dd80857f3fa1336","observation_id":"cfa424c9-5e9f-4027-a925-a560a4f0adb0","resolution":{"observed_at":"2026-08-09T16:43:09.670485Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T16:43:08.827803Z","title":"Language models are unsupervised multitask learners","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2502.01084","last_updated":"2025-02-13T09:25:03Z","snapshot_observed_at":"2026-08-09T19:41:15.653121Z","submitted_at":"2025-02-03T05:53:59Z","title":"Continuous Autoregressive Modeling with Stochastic Monotonic Alignment for Speech Synthesis","version":2},"reference_index":50,"source":"arxiv_source","source_observed_at":"2026-08-09T16:43:08.827803Z"},"links":{"citing_paper":"/paper/2502.01084"},"observation_digest":"sha256:e6d719948c068278aacfadc620f566555084e269b2a0dc15ab84def4cd670267","observation_id":"10f2d27b-c147-4bc3-aa7d-83456ddd948e","resolution":{"observed_at":"2026-08-09T16:43:08.827803Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2212.04356","last_updated":"2022-12-06T18:46:04Z","snapshot_observed_at":"2026-07-06T14:28:21.844826Z","submitted_at":"2022-12-06T18:46:04Z","title":"Robust Speech Recognition via Large-Scale Weak Supervision","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2212.04356","snapshot_observed_at":"2026-08-09T16:43:08.831448Z","title":"Robust speech recognition via large-scale weak supervision","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2502.01084","last_updated":"2025-02-13T09:25:03Z","snapshot_observed_at":"2026-08-09T19:41:15.653121Z","submitted_at":"2025-02-03T05:53:59Z","title":"Continuous Autoregressive Modeling with Stochastic Monotonic Alignment for Speech Synthesis","version":2},"reference_index":51,"source":"arxiv_source","source_observed_at":"2026-08-09T16:43:08.831448Z"},"links":{"cited_paper":"/paper/2212.04356","citing_paper":"/paper/2502.01084"},"observation_digest":"sha256:7636fe1bcb8253573d3024662597eae2146ec4c918e1d822ae7ac3dabe442616","observation_id":"e5c149c6-979a-4f34-b0d0-349eee89c42f","resolution":{"observed_at":"2026-08-09T16:43:08.831448Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T16:43:09.645074Z","title":"Online and linear-time attention by enforcing monotonic alignments","venue":null,"work_id":"aaa7590d-e657-4979-bf3a-292fc1d554f1","year":2017},"citing_paper":{"arxiv_id":"2502.01084","last_updated":"2025-02-13T09:25:03Z","snapshot_observed_at":"2026-08-09T19:41:15.653121Z","submitted_at":"2025-02-03T05:53:59Z","title":"Continuous Autoregressive Modeling with Stochastic Monotonic Alignment for Speech Synthesis","version":2},"reference_index":52,"source":"arxiv_source","source_observed_at":"2026-08-09T16:43:08.835730Z"},"links":{"citing_paper":"/paper/2502.01084"},"observation_digest":"sha256:a32ff0c50e5d88d3f3b04e140aca7403d3b658b65d1ae5a18d645db31c0b8888","observation_id":"a5b6c15f-b284-4725-b56f-4229803b937d","resolution":{"observed_at":"2026-08-09T16:43:09.649749Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T16:43:08.839506Z","title":"Zero-shot text-to-image generation","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2502.01084","last_updated":"2025-02-13T09:25:03Z","snapshot_observed_at":"2026-08-09T19:41:15.653121Z","submitted_at":"2025-02-03T05:53:59Z","title":"Continuous Autoregressive Modeling with Stochastic Monotonic Alignment for Speech Synthesis","version":2},"reference_index":53,"source":"arxiv_source","source_observed_at":"2026-08-09T16:43:08.839506Z"},"links":{"citing_paper":"/paper/2502.01084"},"observation_digest":"sha256:2ea4fcbb4d834bee4c994e1e3981fdeeae6f2627c7b756888cbf8e8911b5d90b","observation_id":"af00bcea-17c3-4890-a58c-a23e17cf1b72","resolution":{"observed_at":"2026-08-09T16:43:08.839506Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T16:43:09.625160Z","title":"Multi-task self-supervised learning for robust speech recognition","venue":null,"work_id":"152b8cd0-53a6-493c-a64d-a8b3097b1bbf","year":2020},"citing_paper":{"arxiv_id":"2502.01084","last_updated":"2025-02-13T09:25:03Z","snapshot_observed_at":"2026-08-09T19:41:15.653121Z","submitted_at":"2025-02-03T05:53:59Z","title":"Continuous Autoregressive Modeling with Stochastic Monotonic Alignment for Speech Synthesis","version":2},"reference_index":54,"source":"arxiv_source","source_observed_at":"2026-08-09T16:43:08.843091Z"},"links":{"citing_paper":"/paper/2502.01084"},"observation_digest":"sha256:317d4c1de81d90beb873f2c6adb81d9aee3ca92ce879b6f62c75c6c092cc4647","observation_id":"8554702d-e5e9-48f3-ba43-23f1330914cd","resolution":{"observed_at":"2026-08-09T16:43:09.629301Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2106.04624","last_updated":"2021-06-08T18:22:56Z","snapshot_observed_at":"2026-08-04T07:20:14.379561Z","submitted_at":"2021-06-08T18:22:56Z","title":"SpeechBrain: A General-Purpose Speech Toolkit","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2106.04624","snapshot_observed_at":"2026-08-09T16:43:08.846652Z","title":"SpeechBrain : A general-purpose speech toolkit, 2021","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2502.01084","last_updated":"2025-02-13T09:25:03Z","snapshot_observed_at":"2026-08-09T19:41:15.653121Z","submitted_at":"2025-02-03T05:53:59Z","title":"Continuous Autoregressive Modeling with Stochastic Monotonic Alignment for Speech Synthesis","version":2},"reference_index":55,"source":"arxiv_source","source_observed_at":"2026-08-09T16:43:08.846652Z"},"links":{"cited_paper":"/paper/2106.04624","citing_paper":"/paper/2502.01084"},"observation_digest":"sha256:cb92323001c6fa01ae915fdfa632aff8b7a4c6bcde07896a84df41aaa6aca704","observation_id":"95547e88-ccb3-45cb-a924-52d7e9dc8f73","resolution":{"observed_at":"2026-08-09T16:43:08.846652Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T16:43:08.850283Z","title":"Fastspeech: Fast, robust and controllable text to speech","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2502.01084","last_updated":"2025-02-13T09:25:03Z","snapshot_observed_at":"2026-08-09T19:41:15.653121Z","submitted_at":"2025-02-03T05:53:59Z","title":"Continuous Autoregressive Modeling with Stochastic Monotonic Alignment for Speech Synthesis","version":2},"reference_index":56,"source":"arxiv_source","source_observed_at":"2026-08-09T16:43:08.850283Z"},"links":{"citing_paper":"/paper/2502.01084"},"observation_digest":"sha256:392bb11897a6ff0293e059ef9877f604a3c7a4251be6244279e98d4619cc5c7e","observation_id":"1efd17cb-4407-4dad-9e1f-c1b4422746be","resolution":{"observed_at":"2026-08-09T16:43:08.850283Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2006.04558","last_updated":"2022-08-08T01:53:05Z","snapshot_observed_at":"2026-08-06T18:05:37.673476Z","submitted_at":"2020-06-08T13:05:40Z","title":"FastSpeech 2: Fast and High-Quality End-to-End Text to Speech","version":8},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2006.04558","snapshot_observed_at":"2026-08-09T16:43:08.853890Z","title":"Fastspeech 2: Fast and high-quality end-to-end text to speech","venue":null,"work_id":null,"year":2006},"citing_paper":{"arxiv_id":"2502.01084","last_updated":"2025-02-13T09:25:03Z","snapshot_observed_at":"2026-08-09T19:41:15.653121Z","submitted_at":"2025-02-03T05:53:59Z","title":"Continuous Autoregressive Modeling with Stochastic Monotonic Alignment for Speech Synthesis","version":2},"reference_index":57,"source":"arxiv_source","source_observed_at":"2026-08-09T16:43:08.853890Z"},"links":{"cited_paper":"/paper/2006.04558","citing_paper":"/paper/2502.01084"},"observation_digest":"sha256:e3847eaad56d9674e73c2cbf5723db50e31229fd3ae0c116cdef9d78847fadae","observation_id":"30595c40-9843-41ae-99a8-e0c97676db0f","resolution":{"observed_at":"2026-08-09T16:43:08.853890Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1701.05517","last_updated":"2017-01-19T17:29:06Z","snapshot_observed_at":"2026-08-09T02:47:46.527055Z","submitted_at":"2017-01-19T17:29:06Z","title":"PixelCNN++: Improving the PixelCNN with Discretized Logistic Mixture Likelihood and Other Modifications","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1701.05517","snapshot_observed_at":"2026-08-09T16:43:08.857847Z","title":"Pixelcnn++: Improving the pixelcnn with discretized logistic mixture likelihood and other modifications","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2502.01084","last_updated":"2025-02-13T09:25:03Z","snapshot_observed_at":"2026-08-09T19:41:15.653121Z","submitted_at":"2025-02-03T05:53:59Z","title":"Continuous Autoregressive Modeling with Stochastic Monotonic Alignment for Speech Synthesis","version":2},"reference_index":58,"source":"arxiv_source","source_observed_at":"2026-08-09T16:43:08.857847Z"},"links":{"cited_paper":"/paper/1701.05517","citing_paper":"/paper/2502.01084"},"observation_digest":"sha256:5efd66f209241aa0427ed99c81bbdd1c84a442d972354642fc90408eabea7bbf","observation_id":"527985ac-02ac-42d5-b1a4-e2b334c35561","resolution":{"observed_at":"2026-08-09T16:43:08.857847Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T16:43:09.604996Z","title":"Natural TTS synthesis by conditioning WaveNet on mel spectrogram predictions","venue":null,"work_id":"dbac981e-042c-4efa-bb15-092c9063dcbd","year":2018},"citing_paper":{"arxiv_id":"2502.01084","last_updated":"2025-02-13T09:25:03Z","snapshot_observed_at":"2026-08-09T19:41:15.653121Z","submitted_at":"2025-02-03T05:53:59Z","title":"Continuous Autoregressive Modeling with Stochastic Monotonic Alignment for Speech Synthesis","version":2},"reference_index":59,"source":"arxiv_source","source_observed_at":"2026-08-09T16:43:08.861735Z"},"links":{"citing_paper":"/paper/2502.01084"},"observation_digest":"sha256:8571d14938589eb07aad602d85a0d8ad4eeae11860f039ff9edef313a963ce69","observation_id":"9e23dc9b-2bd6-467a-b18c-9d3f3979ccca","resolution":{"observed_at":"2026-08-09T16:43:09.609529Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T16:43:09.593963Z","title":"Vae with a vampprior","venue":null,"work_id":"69003eec-625d-4a43-9185-d665c084dc48","year":2018},"citing_paper":{"arxiv_id":"2502.01084","last_updated":"2025-02-13T09:25:03Z","snapshot_observed_at":"2026-08-09T19:41:15.653121Z","submitted_at":"2025-02-03T05:53:59Z","title":"Continuous Autoregressive Modeling with Stochastic Monotonic Alignment for Speech Synthesis","version":2},"reference_index":60,"source":"arxiv_source","source_observed_at":"2026-08-09T16:43:08.865243Z"},"links":{"citing_paper":"/paper/2502.01084"},"observation_digest":"sha256:d74dd5924892ae61ce8fd2e6bb4b1da32c13fe73763167519cd1da0baabf86ca","observation_id":"1e86ae95-b1a8-4634-8fa5-ed966586445e","resolution":{"observed_at":"2026-08-09T16:43:09.597826Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T16:43:09.582664Z","title":"Givt: Generative infinite-vocabulary transformers","venue":null,"work_id":"3df1d82f-5382-4b86-b140-b370cc377653","year":2024},"citing_paper":{"arxiv_id":"2502.01084","last_updated":"2025-02-13T09:25:03Z","snapshot_observed_at":"2026-08-09T19:41:15.653121Z","submitted_at":"2025-02-03T05:53:59Z","title":"Continuous Autoregressive Modeling with Stochastic Monotonic Alignment for Speech Synthesis","version":2},"reference_index":61,"source":"arxiv_source","source_observed_at":"2026-08-09T16:43:08.868954Z"},"links":{"citing_paper":"/paper/2502.01084"},"observation_digest":"sha256:d1b14707f94c2b4fa5a15591f9ac1a4983bc3103285a95a0c8dd96d8d75a2359","observation_id":"71b940c0-1f75-4b68-9f1e-4b0f1d62fbba","resolution":{"observed_at":"2026-08-09T16:43:09.586523Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T16:43:09.570817Z","title":"Neural discrete representation learning","venue":null,"work_id":"a4d354e0-8b73-4f62-8732-5951d732263b","year":2017},"citing_paper":{"arxiv_id":"2502.01084","last_updated":"2025-02-13T09:25:03Z","snapshot_observed_at":"2026-08-09T19:41:15.653121Z","submitted_at":"2025-02-03T05:53:59Z","title":"Continuous Autoregressive Modeling with Stochastic Monotonic Alignment for Speech Synthesis","version":2},"reference_index":62,"source":"arxiv_source","source_observed_at":"2026-08-09T16:43:08.872477Z"},"links":{"citing_paper":"/paper/2502.01084"},"observation_digest":"sha256:7d31a779e2526126b13bffeabcbb1c778a914cbe9526a85401c320794286dc75","observation_id":"15dee1eb-a0c1-4600-9ac4-f2164726861f","resolution":{"observed_at":"2026-08-09T16:43:09.574677Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T16:43:08.875975Z","title":"Attention is all you need","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2502.01084","last_updated":"2025-02-13T09:25:03Z","snapshot_observed_at":"2026-08-09T19:41:15.653121Z","submitted_at":"2025-02-03T05:53:59Z","title":"Continuous Autoregressive Modeling with Stochastic Monotonic Alignment for Speech Synthesis","version":2},"reference_index":63,"source":"arxiv_source","source_observed_at":"2026-08-09T16:43:08.875975Z"},"links":{"citing_paper":"/paper/2502.01084"},"observation_digest":"sha256:f3004cecd5c6444086741001d76cd5deb52ad33e84cc25e1283c00b48a33a9ce","observation_id":"854a2750-16f6-4ce2-99a7-b7fef754ed88","resolution":{"observed_at":"2026-08-09T16:43:08.875975Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T16:43:08.879511Z","title":"Extracting and composing robust features with denoising autoencoders","venue":null,"work_id":null,"year":2008},"citing_paper":{"arxiv_id":"2502.01084","last_updated":"2025-02-13T09:25:03Z","snapshot_observed_at":"2026-08-09T19:41:15.653121Z","submitted_at":"2025-02-03T05:53:59Z","title":"Continuous Autoregressive Modeling with Stochastic Monotonic Alignment for Speech Synthesis","version":2},"reference_index":64,"source":"arxiv_source","source_observed_at":"2026-08-09T16:43:08.879511Z"},"links":{"citing_paper":"/paper/2502.01084"},"observation_digest":"sha256:21c6e55ceb74e3f795a690d9e4021e27a1dfacf20a2db69f748a8769d14027ab","observation_id":"7b5d92ce-8e0a-4d35-98be-214931992f8a","resolution":{"observed_at":"2026-08-09T16:43:08.879511Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2301.02111","last_updated":"2023-01-05T15:37:15Z","snapshot_observed_at":"2026-08-07T10:11:17.796562Z","submitted_at":"2023-01-05T15:37:15Z","title":"Neural Codec Language Models are Zero-Shot Text to Speech Synthesizers","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2301.02111","snapshot_observed_at":"2026-08-09T16:43:08.882979Z","title":"Neural codec language models are zero-shot text to speech synthesizers, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2502.01084","last_updated":"2025-02-13T09:25:03Z","snapshot_observed_at":"2026-08-09T19:41:15.653121Z","submitted_at":"2025-02-03T05:53:59Z","title":"Continuous Autoregressive Modeling with Stochastic Monotonic Alignment for Speech Synthesis","version":2},"reference_index":65,"source":"arxiv_source","source_observed_at":"2026-08-09T16:43:08.882979Z"},"links":{"cited_paper":"/paper/2301.02111","citing_paper":"/paper/2502.01084"},"observation_digest":"sha256:b1fa4660e1e1cca035cf1628fafc1ce16abff9a06cf021cb596d2853fbbc6b54","observation_id":"f8a9b278-1a99-4327-897c-8e491fe085be","resolution":{"observed_at":"2026-08-09T16:43:08.882979Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T16:43:09.544713Z","title":"Wespeaker: A research and production oriented speaker embedding learning toolkit","venue":null,"work_id":"2a1b5e09-d79d-4724-9412-e6ff9356d2f6","year":2023},"citing_paper":{"arxiv_id":"2502.01084","last_updated":"2025-02-13T09:25:03Z","snapshot_observed_at":"2026-08-09T19:41:15.653121Z","submitted_at":"2025-02-03T05:53:59Z","title":"Continuous Autoregressive Modeling with Stochastic Monotonic Alignment for Speech Synthesis","version":2},"reference_index":66,"source":"arxiv_source","source_observed_at":"2026-08-09T16:43:08.886878Z"},"links":{"citing_paper":"/paper/2502.01084"},"observation_digest":"sha256:36693004fbac31eb40ee1095c1d657fd8f3b66f88e438f6acb0858cfe4181b98","observation_id":"5f3c0e47-517f-4968-9acf-ece206c86d17","resolution":{"observed_at":"2026-08-09T16:43:09.548600Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1703.10135","last_updated":"2017-04-06T21:20:34Z","snapshot_observed_at":"2026-08-05T15:51:16.043022Z","submitted_at":"2017-03-29T16:55:13Z","title":"Tacotron: Towards End-to-End Speech Synthesis","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1703.10135","snapshot_observed_at":"2026-08-09T16:43:08.890594Z","title":"Tacotron: Towards end-to-end speech synthesis","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2502.01084","last_updated":"2025-02-13T09:25:03Z","snapshot_observed_at":"2026-08-09T19:41:15.653121Z","submitted_at":"2025-02-03T05:53:59Z","title":"Continuous Autoregressive Modeling with Stochastic Monotonic Alignment for Speech Synthesis","version":2},"reference_index":67,"source":"arxiv_source","source_observed_at":"2026-08-09T16:43:08.890594Z"},"links":{"cited_paper":"/paper/1703.10135","citing_paper":"/paper/2502.01084"},"observation_digest":"sha256:38b8ae0f589dd1299582e3bffdd8f7efaf15013d105f6ca0ec42c93aefacb739","observation_id":"399ba5e1-aac2-4875-8197-67492879902a","resolution":{"observed_at":"2026-08-09T16:43:08.890594Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T16:43:09.532734Z","title":"Soundstream: An end-to-end neural audio codec","venue":null,"work_id":"0683956a-8fd7-4bb9-9124-3dddbd1a28a3","year":2021},"citing_paper":{"arxiv_id":"2502.01084","last_updated":"2025-02-13T09:25:03Z","snapshot_observed_at":"2026-08-09T19:41:15.653121Z","submitted_at":"2025-02-03T05:53:59Z","title":"Continuous Autoregressive Modeling with Stochastic Monotonic Alignment for Speech Synthesis","version":2},"reference_index":68,"source":"arxiv_source","source_observed_at":"2026-08-09T16:43:08.894452Z"},"links":{"citing_paper":"/paper/2502.01084"},"observation_digest":"sha256:eb5419e6792d23cf15eb2393721ca286139cd120af9cf073517dec83593f41b8","observation_id":"68e823fd-aa63-4bdf-baef-9f1b03201468","resolution":{"observed_at":"2026-08-09T16:43:09.536680Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T16:43:08.897920Z","title":"write newline","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2502.01084","last_updated":"2025-02-13T09:25:03Z","snapshot_observed_at":"2026-08-09T19:41:15.653121Z","submitted_at":"2025-02-03T05:53:59Z","title":"Continuous Autoregressive Modeling with Stochastic Monotonic Alignment for Speech Synthesis","version":2},"reference_index":69,"source":"arxiv_source","source_observed_at":"2026-08-09T16:43:08.897920Z"},"links":{"citing_paper":"/paper/2502.01084"},"observation_digest":"sha256:cf8725a89e415e511b9c5cd762a31c78c61a7710d6e5e483a52c326304538292","observation_id":"56c7d2ab-042b-413e-8564-bb6deebe436a","resolution":{"observed_at":"2026-08-09T16:43:08.897920Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T16:43:08.903102Z","title":"@esa (Ref","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2502.01084","last_updated":"2025-02-13T09:25:03Z","snapshot_observed_at":"2026-08-09T19:41:15.653121Z","submitted_at":"2025-02-03T05:53:59Z","title":"Continuous Autoregressive Modeling with Stochastic Monotonic Alignment for Speech Synthesis","version":2},"reference_index":70,"source":"arxiv_source","source_observed_at":"2026-08-09T16:43:08.903102Z"},"links":{"citing_paper":"/paper/2502.01084"},"observation_digest":"sha256:1891f2031dd4623e5b85feaa62bfa460303287749714ae97fb9f0b65c497468e","observation_id":"79083430-95b0-4b2e-9170-49f5e7593ec0","resolution":{"observed_at":"2026-08-09T16:43:08.903102Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T16:43:08.907509Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2502.01084","last_updated":"2025-02-13T09:25:03Z","snapshot_observed_at":"2026-08-09T19:41:15.653121Z","submitted_at":"2025-02-03T05:53:59Z","title":"Continuous Autoregressive Modeling with Stochastic Monotonic Alignment for Speech Synthesis","version":2},"reference_index":71,"source":"arxiv_source","source_observed_at":"2026-08-09T16:43:08.907509Z"},"links":{"citing_paper":"/paper/2502.01084"},"observation_digest":"sha256:6af7dd16c140d90a1cedc0176df8b6da5a74d76353a46832bd2715957a5abc73","observation_id":"a613cc14-712e-429d-9e52-60008a2d4564","resolution":{"observed_at":"2026-08-09T16:43:08.907509Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T16:43:08.911696Z","title":"1.0\" encoding=","venue":null,"work_id":null,"year":2006},"citing_paper":{"arxiv_id":"2502.01084","last_updated":"2025-02-13T09:25:03Z","snapshot_observed_at":"2026-08-09T19:41:15.653121Z","submitted_at":"2025-02-03T05:53:59Z","title":"Continuous Autoregressive Modeling with Stochastic Monotonic Alignment for Speech Synthesis","version":2},"reference_index":72,"source":"arxiv_source","source_observed_at":"2026-08-09T16:43:08.911696Z"},"links":{"citing_paper":"/paper/2502.01084"},"observation_digest":"sha256:0d6ccba7afd20f60f54bc1ba44ebcc89ec5a77b788cbce26be9453e882d0cd82","observation_id":"0cf9e3f8-fc38-42de-ac12-fc96e9c01c22","resolution":{"observed_at":"2026-08-09T16:43:08.911696Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2502.01084","last_updated":"2025-02-13T09:25:03Z","latest_version":2,"primary_category":"cs.LG","snapshot_observed_at":"2026-08-09T19:41:15.653121Z","submitted_at":"2025-02-03T05:53:59Z","title":"Continuous Autoregressive Modeling with Stochastic Monotonic Alignment for Speech Synthesis"},"reference_resolution":{"displayed":72,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":43,"verified_exact":3,"verified_fuzzy":26},"total_outbound_references":72},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"thesis":"As of 10 August 2026, this Paper Citation Record lists 72 of 72 outbound references and 0 inbound Pith citation observations for arXiv:2502.01084."}