{"as_of":"2026-08-10T11:28:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:16916d58efa8257a308424fe662164fd2ce87019f07ca1014e88d47b8dea910f","coverage":[{"denominator":36,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":36,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-06T11:22:27.950994Z","state":"measured"},{"denominator":36,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":36,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-10T06:31:04.303077+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2507.22746/citation-record","integrity":"/paper/2507.22746/integrity","json":"/paper/2507.22746/citation-record.json","paper":"/paper/2507.22746"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2305.07243","last_updated":"2023-05-23T21:41:54Z","snapshot_observed_at":"2026-08-10T09:50:27.604298Z","submitted_at":"2023-05-12T04:19:49Z","title":"Better speech synthesis through scaling","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.07243","snapshot_observed_at":"2026-08-06T11:22:25.341706Z","title":"Better speech synthesis through scaling","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.22746","last_updated":"2025-08-01T03:37:42Z","snapshot_observed_at":"2026-08-10T08:00:14.336496Z","submitted_at":"2025-07-30T15:03:36Z","title":"Next Tokens Denoising for Speech Synthesis","version":2},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-06T11:22:25.341706Z"},"links":{"cited_paper":"/paper/2305.07243","citing_paper":"/paper/2507.22746"},"observation_digest":"sha256:407bdf88e93b93daa3297a651eb019a169ff4f2da36597f0489f362a8148e731","observation_id":"6229081c-1426-49c8-90a8-da36704ba759","resolution":{"observed_at":"2026-08-06T11:22:25.341706Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2210.13438","last_updated":"2022-10-24T17:52:02Z","snapshot_observed_at":"2026-08-09T07:12:13.721596Z","submitted_at":"2022-10-24T17:52:02Z","title":"High Fidelity Neural Audio Compression","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2210.13438","snapshot_observed_at":"2026-08-06T11:22:25.630747Z","title":"High fidelity neural audio compression","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.22746","last_updated":"2025-08-01T03:37:42Z","snapshot_observed_at":"2026-08-10T08:00:14.336496Z","submitted_at":"2025-07-30T15:03:36Z","title":"Next Tokens Denoising for Speech Synthesis","version":2},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-06T11:22:25.630747Z"},"links":{"cited_paper":"/paper/2210.13438","citing_paper":"/paper/2507.22746"},"observation_digest":"sha256:c6ec4079c4c702876cc687dfe8c26cb2cadc5b8c88402689e1c183014ae84387","observation_id":"3b306d4d-dbb8-43b9-b58d-7acdf6d27af1","resolution":{"observed_at":"2026-08-06T11:22:25.630747Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.02617","last_updated":"2026-04-17T21:00:45Z","snapshot_observed_at":"2026-07-30T10:05:05.279382Z","submitted_at":"2024-12-03T17:44:23Z","title":"Improving Dynamic Object Interactions in Text-to-Video Generation with AI Feedback","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.02617","snapshot_observed_at":"2026-08-06T11:22:25.922271Z","title":"Improving dynamic object interactions in text-to-video generation with ai feedback","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.22746","last_updated":"2025-08-01T03:37:42Z","snapshot_observed_at":"2026-08-10T08:00:14.336496Z","submitted_at":"2025-07-30T15:03:36Z","title":"Next Tokens Denoising for Speech Synthesis","version":2},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-06T11:22:25.922271Z"},"links":{"cited_paper":"/paper/2412.02617","citing_paper":"/paper/2507.22746"},"observation_digest":"sha256:a15221b130900068fd13cce54296d1346267ed61f19629e1f751e44b6d5a6a6e","observation_id":"4c112359-d552-43bb-9d01-693ec47a680d","resolution":{"observed_at":"2026-08-06T11:22:25.922271Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.13447","last_updated":"2025-05-19T17:59:42Z","snapshot_observed_at":"2026-08-09T12:36:49.059190Z","submitted_at":"2025-05-19T17:59:42Z","title":"Mean Flows for One-step Generative Modeling","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.13447","snapshot_observed_at":"2026-08-06T11:22:25.951018Z","title":"Mean flows for one-step generative modeling","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.22746","last_updated":"2025-08-01T03:37:42Z","snapshot_observed_at":"2026-08-10T08:00:14.336496Z","submitted_at":"2025-07-30T15:03:36Z","title":"Next Tokens Denoising for Speech Synthesis","version":2},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-06T11:22:25.951018Z"},"links":{"cited_paper":"/paper/2505.13447","citing_paper":"/paper/2507.22746"},"observation_digest":"sha256:5ceb1088b98a28e6c8a65de1fb8c4788825475b54e64f8ef442357ea5bdad3c1","observation_id":"3265b4f7-b4a9-463f-9301-ac12a400f9da","resolution":{"observed_at":"2026-08-06T11:22:25.951018Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T11:22:26.029534Z","title":"Ditar: Diffusion transformer autoregressive modeling for speech generation","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.22746","last_updated":"2025-08-01T03:37:42Z","snapshot_observed_at":"2026-08-10T08:00:14.336496Z","submitted_at":"2025-07-30T15:03:36Z","title":"Next Tokens Denoising for Speech Synthesis","version":2},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-06T11:22:26.029534Z"},"links":{"citing_paper":"/paper/2507.22746"},"observation_digest":"sha256:b04214259fb40c478c0b7bddcbec775b692bb0561f425e8d172d0a616e8d4014","observation_id":"ce0731a6-61e7-4eb0-bc97-2580a1e39188","resolution":{"observed_at":"2026-08-06T11:22:26.029534Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.03100","last_updated":"2024-04-23T08:38:03Z","snapshot_observed_at":"2026-08-07T23:22:31.422843Z","submitted_at":"2024-03-05T16:35:25Z","title":"NaturalSpeech 3: Zero-Shot Speech Synthesis with Factorized Codec and Diffusion Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.03100","snapshot_observed_at":"2026-08-06T11:22:26.095836Z","title":"Naturalspeech 3: Zero-shot speech synthesis with factorized codec and diffusion models","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.22746","last_updated":"2025-08-01T03:37:42Z","snapshot_observed_at":"2026-08-10T08:00:14.336496Z","submitted_at":"2025-07-30T15:03:36Z","title":"Next Tokens Denoising for Speech Synthesis","version":2},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-06T11:22:26.095836Z"},"links":{"cited_paper":"/paper/2403.03100","citing_paper":"/paper/2507.22746"},"observation_digest":"sha256:94587a25403d32cb9a542304eda9d828d12a132a84c6c647f2801ef2fe5b051f","observation_id":"42b581fd-1e21-41bf-b2d1-564f140f6444","resolution":{"observed_at":"2026-08-06T11:22:26.095836Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.07383","last_updated":"2024-03-04T19:15:29Z","snapshot_observed_at":"2026-08-08T09:24:37.491001Z","submitted_at":"2024-02-12T02:58:10Z","title":"Making Flow-Matching-Based Zero-Shot Text-to-Speech Laugh as You Like","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.07383","snapshot_observed_at":"2026-08-06T11:22:26.208323Z","title":"Making flow-matching-based zero-shot text-to-speech laugh as you like","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.22746","last_updated":"2025-08-01T03:37:42Z","snapshot_observed_at":"2026-08-10T08:00:14.336496Z","submitted_at":"2025-07-30T15:03:36Z","title":"Next Tokens Denoising for Speech Synthesis","version":2},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-06T11:22:26.208323Z"},"links":{"cited_paper":"/paper/2402.07383","citing_paper":"/paper/2507.22746"},"observation_digest":"sha256:ed38ad6b21be8b0509d955659176fc2163deb1e9af1121195685d5e4c271853b","observation_id":"a5fa5a1c-84dd-47af-8e12-f28339bbaec8","resolution":{"observed_at":"2026-08-06T11:22:26.208323Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T11:22:29.057928Z","title":"istftnet: Fast and lightweight mel-spectrogram vocoder incorporating inverse short-time fourier transform","venue":null,"work_id":"8bb6cd4a-3b9e-4e3b-93a9-8a15e3d0da5c","year":2022},"citing_paper":{"arxiv_id":"2507.22746","last_updated":"2025-08-01T03:37:42Z","snapshot_observed_at":"2026-08-10T08:00:14.336496Z","submitted_at":"2025-07-30T15:03:36Z","title":"Next Tokens Denoising for Speech Synthesis","version":2},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-06T11:22:26.324190Z"},"links":{"citing_paper":"/paper/2507.22746"},"observation_digest":"sha256:e5ff57a86024c4dc767e77fb99631b0dfea79d40f2110a5ded47f956c9f793f5","observation_id":"aa2df25a-9a0d-4912-8631-37d282ff4376","resolution":{"observed_at":"2026-08-06T11:22:29.105049Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2202.07477","last_updated":"2022-12-05T09:15:28Z","snapshot_observed_at":"2026-08-03T21:45:08.939710Z","submitted_at":"2022-02-14T18:59:47Z","title":"Understanding DDPM Latent Codes Through Optimal Transport","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2202.07477","snapshot_observed_at":"2026-08-06T11:22:26.402690Z","title":"Understanding ddpm latent codes through optimal transport","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.22746","last_updated":"2025-08-01T03:37:42Z","snapshot_observed_at":"2026-08-10T08:00:14.336496Z","submitted_at":"2025-07-30T15:03:36Z","title":"Next Tokens Denoising for Speech Synthesis","version":2},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-06T11:22:26.402690Z"},"links":{"cited_paper":"/paper/2202.07477","citing_paper":"/paper/2507.22746"},"observation_digest":"sha256:eb921a9f190861a56d5d5f6e1fb990f76c52268d50afa72822a5f74b10d5d961","observation_id":"16933749-f487-4e28-8067-c097a54726a6","resolution":{"observed_at":"2026-08-06T11:22:26.402690Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2309.02285","last_updated":"2023-10-12T03:05:36Z","snapshot_observed_at":"2026-08-01T15:11:32.829718Z","submitted_at":"2023-09-05T14:45:27Z","title":"PromptTTS 2: Describing and Generating Voices with Text Prompt","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.02285","snapshot_observed_at":"2026-08-06T11:22:26.482050Z","title":"Prompttts 2: Describing and generating voices with text prompt","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.22746","last_updated":"2025-08-01T03:37:42Z","snapshot_observed_at":"2026-08-10T08:00:14.336496Z","submitted_at":"2025-07-30T15:03:36Z","title":"Next Tokens Denoising for Speech Synthesis","version":2},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-06T11:22:26.482050Z"},"links":{"cited_paper":"/paper/2309.02285","citing_paper":"/paper/2507.22746"},"observation_digest":"sha256:ec152b1a50cbbb52a42c4a2a58686c85d69371e06a14026a3fc139bfdc308f8c","observation_id":"3763f71c-b841-4b96-8274-d7fe01dee4d1","resolution":{"observed_at":"2026-08-06T11:22:26.482050Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.04016","last_updated":"2024-09-06T04:06:50Z","snapshot_observed_at":"2026-08-07T06:40:10.412326Z","submitted_at":"2024-09-06T04:06:50Z","title":"Investigating Neural Audio Codecs for Speech Language Model-Based Speech Generation","version":1},"cited_work":{"arxiv_id":"2409.04016","doi":null,"metadata_source":"pith","pith_arxiv_id":"2409.04016","snapshot_observed_at":"2026-08-06T11:22:28.800955Z","title":"Investigating Neural Audio Codecs for Speech Language Model-Based Speech Generation","venue":"cs.SD","work_id":"9919d8b4-1261-427e-91e1-a360f3fcef40","year":2024},"citing_paper":{"arxiv_id":"2507.22746","last_updated":"2025-08-01T03:37:42Z","snapshot_observed_at":"2026-08-10T08:00:14.336496Z","submitted_at":"2025-07-30T15:03:36Z","title":"Next Tokens Denoising for Speech Synthesis","version":2},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-06T11:22:26.545205Z"},"links":{"cited_paper":"/paper/2409.04016","citing_paper":"/paper/2507.22746"},"observation_digest":"sha256:6ec11b606eee5a9955c94f0cb8bc982f9780985e52939bf755c1de25bbde7858","observation_id":"2d8b244c-560b-408d-a460-e5e525c30581","resolution":{"observed_at":"2026-08-06T11:22:28.855073Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2209.03003","last_updated":"2022-09-07T08:59:55Z","snapshot_observed_at":"2026-07-06T13:49:40.974495Z","submitted_at":"2022-09-07T08:59:55Z","title":"Flow Straight and Fast: Learning to Generate and Transfer Data with Rectified Flow","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2209.03003","snapshot_observed_at":"2026-08-06T11:22:26.665411Z","title":"Flow straight and fast: Learning to generate and transfer data with rectified flow","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.22746","last_updated":"2025-08-01T03:37:42Z","snapshot_observed_at":"2026-08-10T08:00:14.336496Z","submitted_at":"2025-07-30T15:03:36Z","title":"Next Tokens Denoising for Speech Synthesis","version":2},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-06T11:22:26.665411Z"},"links":{"cited_paper":"/paper/2209.03003","citing_paper":"/paper/2507.22746"},"observation_digest":"sha256:eb08698edda270a89427453a0dff19e702e69721a2fb3f43ff281242560fa730","observation_id":"1877fbd7-3822-4a5d-95c0-d4b452f46c9f","resolution":{"observed_at":"2026-08-06T11:22:26.665411Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2207.04646","last_updated":"2022-07-11T06:15:45Z","snapshot_observed_at":"2026-08-10T06:30:39.184689Z","submitted_at":"2022-07-11T06:15:45Z","title":"DelightfulTTS 2: End-to-End Speech Synthesis with Adversarial Vector-Quantized Auto-Encoders","version":1},"cited_work":{"arxiv_id":"2207.04646","doi":null,"metadata_source":"pith","pith_arxiv_id":"2207.04646","snapshot_observed_at":"2026-08-06T11:22:28.509789Z","title":"DelightfulTTS 2: End-to-End Speech Synthesis with Adversarial Vector-Quantized Auto-Encoders","venue":"cs.SD","work_id":"00bd8f91-a87f-4049-82b2-5124c035fbf5","year":2022},"citing_paper":{"arxiv_id":"2507.22746","last_updated":"2025-08-01T03:37:42Z","snapshot_observed_at":"2026-08-10T08:00:14.336496Z","submitted_at":"2025-07-30T15:03:36Z","title":"Next Tokens Denoising for Speech Synthesis","version":2},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-06T11:22:26.737905Z"},"links":{"cited_paper":"/paper/2207.04646","citing_paper":"/paper/2507.22746"},"observation_digest":"sha256:176ac878fba148210c99ea48dda6bb25bcf0a56642ba48564f6b5caf7ae60e49","observation_id":"5c6132fe-1c44-4db0-a7a9-dc422b4ccf88","resolution":{"observed_at":"2026-08-06T11:22:28.570689Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.08551","last_updated":"2025-05-27T05:07:56Z","snapshot_observed_at":"2026-08-05T05:08:56.833881Z","submitted_at":"2024-07-11T14:36:53Z","title":"Autoregressive Speech Synthesis without Vector Quantization","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.08551","snapshot_observed_at":"2026-08-06T11:22:26.796662Z","title":"Autoregressive speech synthesis without vector quantization","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.22746","last_updated":"2025-08-01T03:37:42Z","snapshot_observed_at":"2026-08-10T08:00:14.336496Z","submitted_at":"2025-07-30T15:03:36Z","title":"Next Tokens Denoising for Speech Synthesis","version":2},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-06T11:22:26.796662Z"},"links":{"cited_paper":"/paper/2407.08551","citing_paper":"/paper/2507.22746"},"observation_digest":"sha256:d8ff92eceb1a3211b08c924c279fe8fd046d8cab79908df5313714e826c63046","observation_id":"d3549354-974d-4d53-b100-5142f17f4f53","resolution":{"observed_at":"2026-08-06T11:22:26.796662Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2309.15505","last_updated":"2023-10-12T07:55:05Z","snapshot_observed_at":"2026-07-06T16:24:17.829828Z","submitted_at":"2023-09-27T09:13:40Z","title":"Finite Scalar Quantization: VQ-VAE Made Simple","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.15505","snapshot_observed_at":"2026-08-06T11:22:26.883167Z","title":"Finite scalar quantization: Vq-vae made simple","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.22746","last_updated":"2025-08-01T03:37:42Z","snapshot_observed_at":"2026-08-10T08:00:14.336496Z","submitted_at":"2025-07-30T15:03:36Z","title":"Next Tokens Denoising for Speech Synthesis","version":2},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-06T11:22:26.883167Z"},"links":{"cited_paper":"/paper/2309.15505","citing_paper":"/paper/2507.22746"},"observation_digest":"sha256:2d3908d301de2f0651f234403ceae8d41acd354a59b3b63862b3ac64c5268394","observation_id":"d4b868e7-0546-4ed3-be84-a08794a3fc41","resolution":{"observed_at":"2026-08-06T11:22:26.883167Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2411.19842","last_updated":"2024-11-29T16:58:02Z","snapshot_observed_at":"2026-08-10T00:42:50.079942Z","submitted_at":"2024-11-29T16:58:02Z","title":"Scaling Transformers for Low-Bitrate High-Quality Speech Coding","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.19842","snapshot_observed_at":"2026-08-06T11:22:26.987973Z","title":"Scaling transformers for low-bitrate high-quality speech coding","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.22746","last_updated":"2025-08-01T03:37:42Z","snapshot_observed_at":"2026-08-10T08:00:14.336496Z","submitted_at":"2025-07-30T15:03:36Z","title":"Next Tokens Denoising for Speech Synthesis","version":2},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-06T11:22:26.987973Z"},"links":{"cited_paper":"/paper/2411.19842","citing_paper":"/paper/2507.22746"},"observation_digest":"sha256:2ca02afa07f200184f82fb6c1fda6783cd7bbd6890a221a43f42607f3e83ac29","observation_id":"f01925d6-4100-4867-b4ef-5eb009bfc73c","resolution":{"observed_at":"2026-08-06T11:22:26.987973Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2301.11757","last_updated":"2023-10-23T20:47:30Z","snapshot_observed_at":"2026-07-06T14:45:19.481734Z","submitted_at":"2023-01-27T14:52:53Z","title":"Mo\\^usai: Text-to-Music Generation with Long-Context Latent Diffusion","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2301.11757","snapshot_observed_at":"2026-08-06T11:22:27.053403Z","title":"Mo \\ˆ usai: Text-to-music generation with long-context latent diffusion","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.22746","last_updated":"2025-08-01T03:37:42Z","snapshot_observed_at":"2026-08-10T08:00:14.336496Z","submitted_at":"2025-07-30T15:03:36Z","title":"Next Tokens Denoising for Speech Synthesis","version":2},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-06T11:22:27.053403Z"},"links":{"cited_paper":"/paper/2301.11757","citing_paper":"/paper/2507.22746"},"observation_digest":"sha256:ab3e535754ae46c8ba718b6d0e0f3d27b2e31e88e92ebced64e2649448151e72","observation_id":"d123e31a-3705-44d4-864b-225d16ba3970","resolution":{"observed_at":"2026-08-06T11:22:27.053403Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2304.09116","last_updated":"2023-05-30T16:09:10Z","snapshot_observed_at":"2026-08-08T00:30:28.663818Z","submitted_at":"2023-04-18T16:31:59Z","title":"NaturalSpeech 2: Latent Diffusion Models are Natural and Zero-Shot Speech and Singing Synthesizers","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2304.09116","snapshot_observed_at":"2026-08-06T11:22:27.121148Z","title":"Naturalspeech 2: Latent diffusion models are natural and zero-shot speech and singing synthesizers","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.22746","last_updated":"2025-08-01T03:37:42Z","snapshot_observed_at":"2026-08-10T08:00:14.336496Z","submitted_at":"2025-07-30T15:03:36Z","title":"Next Tokens Denoising for Speech Synthesis","version":2},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-06T11:22:27.121148Z"},"links":{"cited_paper":"/paper/2304.09116","citing_paper":"/paper/2507.22746"},"observation_digest":"sha256:542ca566d9d7bd7417f0aa7f46714907ad6e89e7113d17ced1512af8cac50078","observation_id":"faba2588-9e08-487e-b264-81415b3455e9","resolution":{"observed_at":"2026-08-06T11:22:27.121148Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.19669","last_updated":"2025-06-02T10:03:25Z","snapshot_observed_at":"2026-08-09T04:17:24.541280Z","submitted_at":"2025-05-26T08:25:01Z","title":"Zero-Shot Streaming Text to Speech Synthesis with Transducer and Auto-Regressive Modeling","version":2},"cited_work":{"arxiv_id":"2505.19669","doi":null,"metadata_source":"pith","pith_arxiv_id":"2505.19669","snapshot_observed_at":"2026-08-06T11:22:28.361623Z","title":"Zero-Shot Streaming Text to Speech Synthesis with Transducer and Auto-Regressive Modeling","venue":"cs.LG","work_id":"198e2c51-d3be-4195-8a87-b6c703fbe641","year":2025},"citing_paper":{"arxiv_id":"2507.22746","last_updated":"2025-08-01T03:37:42Z","snapshot_observed_at":"2026-08-10T08:00:14.336496Z","submitted_at":"2025-07-30T15:03:36Z","title":"Next Tokens Denoising for Speech Synthesis","version":2},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-06T11:22:27.182862Z"},"links":{"cited_paper":"/paper/2505.19669","citing_paper":"/paper/2507.22746"},"observation_digest":"sha256:56841fe5b03bd1e93ad466d6f0469d0e7299f201383c8e2f16ec91b392f4f483","observation_id":"4706dce0-0b29-472a-80c5-38080d13a8c1","resolution":{"observed_at":"2026-08-06T11:22:28.411634Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2312.11805","last_updated":"2025-05-09T21:04:06Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-12-19T02:39:27Z","title":"Gemini: A Family of Highly Capable Multimodal Models","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.11805","snapshot_observed_at":"2026-08-06T11:22:27.280963Z","title":"Gemini: a family of highly capable multimodal models","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.22746","last_updated":"2025-08-01T03:37:42Z","snapshot_observed_at":"2026-08-10T08:00:14.336496Z","submitted_at":"2025-07-30T15:03:36Z","title":"Next Tokens Denoising for Speech Synthesis","version":2},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-06T11:22:27.280963Z"},"links":{"cited_paper":"/paper/2312.11805","citing_paper":"/paper/2507.22746"},"observation_digest":"sha256:2ccfb7f4e1946a31652bf221107824b78307c765f0fe9a7017c325f6434c15c2","observation_id":"d503ec9f-d481-4f10-aab6-d5a8b36a0787","resolution":{"observed_at":"2026-08-06T11:22:27.280963Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2302.00482","last_updated":"2024-03-11T14:27:48Z","snapshot_observed_at":"2026-07-06T14:47:04.817434Z","submitted_at":"2023-02-01T14:47:17Z","title":"Improving and generalizing flow-based generative models with minibatch optimal transport","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2302.00482","snapshot_observed_at":"2026-08-06T11:22:27.357575Z","title":"Improving and generalizing flow-based generative models with minibatch optimal transport","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.22746","last_updated":"2025-08-01T03:37:42Z","snapshot_observed_at":"2026-08-10T08:00:14.336496Z","submitted_at":"2025-07-30T15:03:36Z","title":"Next Tokens Denoising for Speech Synthesis","version":2},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-06T11:22:27.357575Z"},"links":{"cited_paper":"/paper/2302.00482","citing_paper":"/paper/2507.22746"},"observation_digest":"sha256:ac2f0540e227b8642c39a482e7b38b2b25a8bf620d18b752468cd7b3072bf0e3","observation_id":"7001ad77-5a82-47ef-a1b7-01fb19ad16d9","resolution":{"observed_at":"2026-08-06T11:22:27.357575Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.11128","last_updated":"2025-09-03T01:59:58Z","snapshot_observed_at":"2026-08-07T18:14:46.399260Z","submitted_at":"2025-02-16T13:54:32Z","title":"FELLE: Autoregressive Speech Synthesis with Token-Wise Coarse-to-Fine Flow Matching","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.11128","snapshot_observed_at":"2026-08-06T11:22:27.493156Z","title":"Felle: Autoregressive speech synthesis with token-wise coarse-to-fine flow matching","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.22746","last_updated":"2025-08-01T03:37:42Z","snapshot_observed_at":"2026-08-10T08:00:14.336496Z","submitted_at":"2025-07-30T15:03:36Z","title":"Next Tokens Denoising for Speech Synthesis","version":2},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-06T11:22:27.493156Z"},"links":{"cited_paper":"/paper/2502.11128","citing_paper":"/paper/2507.22746"},"observation_digest":"sha256:11b5881ffb9799a7b0ad284411779a3d3cbd0ebc969616ef8f4e660ac858a4ee","observation_id":"efbba303-682e-4bdb-9678-fe4e6a456f05","resolution":{"observed_at":"2026-08-06T11:22:27.493156Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.10352","last_updated":"2025-08-05T15:33:39Z","snapshot_observed_at":"2026-08-07T16:05:49.660014Z","submitted_at":"2025-04-14T16:03:21Z","title":"Pseudo-Autoregressive Neural Codec Language Models for Efficient Zero-Shot Text-to-Speech Synthesis","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.10352","snapshot_observed_at":"2026-08-06T11:22:27.528989Z","title":"Pseudo-autoregressive neural codec language models for efficient zero-shot text-to-speech synthesis","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.22746","last_updated":"2025-08-01T03:37:42Z","snapshot_observed_at":"2026-08-10T08:00:14.336496Z","submitted_at":"2025-07-30T15:03:36Z","title":"Next Tokens Denoising for Speech Synthesis","version":2},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-06T11:22:27.528989Z"},"links":{"cited_paper":"/paper/2504.10352","citing_paper":"/paper/2507.22746"},"observation_digest":"sha256:70effff519c7f108409fbd74d60aac90a87ead9e9299adcf3c82b0bb31349ed2","observation_id":"b2a6f30a-9185-4d39-bc60-d608c1c65b1c","resolution":{"observed_at":"2026-08-06T11:22:27.528989Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T11:22:27.625768Z","title":"Lumos-1: On autoregressive video generation from a unified model perspective","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.22746","last_updated":"2025-08-01T03:37:42Z","snapshot_observed_at":"2026-08-10T08:00:14.336496Z","submitted_at":"2025-07-30T15:03:36Z","title":"Next Tokens Denoising for Speech Synthesis","version":2},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-06T11:22:27.625768Z"},"links":{"citing_paper":"/paper/2507.22746"},"observation_digest":"sha256:71b12ee24190b0b078cd3a4c53a1a63fdf6de1001b63ee709f321c440fae8e30","observation_id":"f3d6bb98-fc36-488c-8faf-0489bb1a1767","resolution":{"observed_at":"2026-08-06T11:22:27.625768Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.04917","last_updated":"2024-12-06T10:16:04Z","snapshot_observed_at":"2026-07-06T20:02:43.795985Z","submitted_at":"2024-12-06T10:16:04Z","title":"Continuous Speech Tokens Makes LLMs Robust Multi-Modality Learners","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.04917","snapshot_observed_at":"2026-08-06T11:22:27.693175Z","title":"Continuous speech tokens makes llms robust multi-modality learners","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.22746","last_updated":"2025-08-01T03:37:42Z","snapshot_observed_at":"2026-08-10T08:00:14.336496Z","submitted_at":"2025-07-30T15:03:36Z","title":"Next Tokens Denoising for Speech Synthesis","version":2},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-06T11:22:27.693175Z"},"links":{"cited_paper":"/paper/2412.04917","citing_paper":"/paper/2507.22746"},"observation_digest":"sha256:b4c27e941b28f13d1c73222e19cab83bae6692bda27b5c5c2d83d79d2c50433d","observation_id":"57703305-fd3c-4bd1-8837-dd90a5334c5e","resolution":{"observed_at":"2026-08-06T11:22:27.693175Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.04633","last_updated":"2024-06-07T04:34:03Z","snapshot_observed_at":"2026-08-07T20:43:34.793280Z","submitted_at":"2024-06-07T04:34:03Z","title":"Boosting Diffusion Model for Spectrogram Up-sampling in Text-to-speech: An Empirical Study","version":1},"cited_work":{"arxiv_id":"2406.04633","doi":null,"metadata_source":"pith","pith_arxiv_id":"2406.04633","snapshot_observed_at":"2026-08-06T11:22:28.061312Z","title":"Boosting Diffusion Model for Spectrogram Up-sampling in Text-to-speech: An Empirical Study","venue":"eess.AS","work_id":"c1122563-90cb-403f-9ec5-d20d37396a13","year":2024},"citing_paper":{"arxiv_id":"2507.22746","last_updated":"2025-08-01T03:37:42Z","snapshot_observed_at":"2026-08-10T08:00:14.336496Z","submitted_at":"2025-07-30T15:03:36Z","title":"Next Tokens Denoising for Speech Synthesis","version":2},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-06T11:22:27.789945Z"},"links":{"cited_paper":"/paper/2406.04633","citing_paper":"/paper/2507.22746"},"observation_digest":"sha256:d7d46e53bd163663aa4c48199ce8790b8f82f0ee77cf50d03194e501082dcd98","observation_id":"12782ae2-731c-4d75-bc15-cfd92c294d8f","resolution":{"observed_at":"2026-08-06T11:22:28.145958Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2203.17190","last_updated":"2022-07-19T19:19:47Z","snapshot_observed_at":"2026-07-06T12:55:23.720351Z","submitted_at":"2022-03-31T17:12:26Z","title":"Mixed-Phoneme BERT: Improving BERT with Mixed Phoneme and Sup-Phoneme Representations for Text to Speech","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2203.17190","snapshot_observed_at":"2026-08-06T11:22:27.883606Z","title":"Mixed-phoneme bert: Improving bert with mixed phoneme and sup-phoneme representations for text to speech","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.22746","last_updated":"2025-08-01T03:37:42Z","snapshot_observed_at":"2026-08-10T08:00:14.336496Z","submitted_at":"2025-07-30T15:03:36Z","title":"Next Tokens Denoising for Speech Synthesis","version":2},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-06T11:22:27.883606Z"},"links":{"cited_paper":"/paper/2203.17190","citing_paper":"/paper/2507.22746"},"observation_digest":"sha256:e6860349f50649adb664d18182b26a2d27359e8e87fd03f2c9680a6d9d104727","observation_id":"53ce42bb-f56c-4f05-b7e7-2ad9bf1494fd","resolution":{"observed_at":"2026-08-06T11:22:27.883606Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2303.03926","last_updated":"2023-03-07T14:31:55Z","snapshot_observed_at":"2026-08-06T04:55:08.186019Z","submitted_at":"2023-03-07T14:31:55Z","title":"Speak Foreign Languages with Your Own Voice: Cross-Lingual Neural Codec Language Modeling","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.03926","snapshot_observed_at":"2026-08-06T11:22:27.950994Z","title":"Speak foreign languages with your own voice: Cross-lingual neural codec language modeling","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.22746","last_updated":"2025-08-01T03:37:42Z","snapshot_observed_at":"2026-08-10T08:00:14.336496Z","submitted_at":"2025-07-30T15:03:36Z","title":"Next Tokens Denoising for Speech Synthesis","version":2},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-06T11:22:27.950994Z"},"links":{"cited_paper":"/paper/2303.03926","citing_paper":"/paper/2507.22746"},"observation_digest":"sha256:ae713d8e397ee7a199deca68ad51e3a9994435f93574caa6ea305049963ccc54","observation_id":"d4517a79-8173-4f65-8551-ffcd886f9f98","resolution":{"observed_at":"2026-08-06T11:22:27.950994Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2301.02111","last_updated":"2023-01-05T15:37:15Z","snapshot_observed_at":"2026-08-07T10:11:17.796562Z","submitted_at":"2023-01-05T15:37:15Z","title":"Neural Codec Language Models are Zero-Shot Text to Speech Synthesizers","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2301.02111","snapshot_observed_at":"2026-08-06T11:22:27.428195Z","title":"Neural codec language models are zero-shot text to speech synthesizers","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.22746","last_updated":"2025-08-01T03:37:42Z","snapshot_observed_at":"2026-08-10T08:00:14.336496Z","submitted_at":"2025-07-30T15:03:36Z","title":"Next Tokens Denoising for Speech Synthesis","version":2},"reference_index":2017,"source":"pdf_text","source_observed_at":"2026-08-06T11:22:27.428195Z"},"links":{"cited_paper":"/paper/2301.02111","citing_paper":"/paper/2507.22746"},"observation_digest":"sha256:4da851b32f4d1a3042d7f8a64e3b3425ce8aa46d65baefc4026d78355e50350a","observation_id":"2e844282-1ca3-4230-b734-949e062f358f","resolution":{"observed_at":"2026-08-06T11:22:27.428195Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2005.08528","last_updated":"2020-06-09T05:01:20Z","snapshot_observed_at":"2026-08-07T21:29:41.343803Z","submitted_at":"2020-05-18T08:36:12Z","title":"MoBoAligner: a Neural Alignment Model for Non-autoregressive TTS with Monotonic Boundary Search","version":2},"cited_work":{"arxiv_id":"2005.08528","doi":null,"metadata_source":"pith","pith_arxiv_id":"2005.08528","snapshot_observed_at":"2026-08-06T11:22:28.646096Z","title":"MoBoAligner: a Neural Alignment Model for Non-autoregressive TTS with Monotonic Boundary Search","venue":"eess.AS","work_id":"78059abd-b72b-4fce-a4e6-d4cd06c891a1","year":2020},"citing_paper":{"arxiv_id":"2507.22746","last_updated":"2025-08-01T03:37:42Z","snapshot_observed_at":"2026-08-10T08:00:14.336496Z","submitted_at":"2025-07-30T15:03:36Z","title":"Next Tokens Denoising for Speech Synthesis","version":2},"reference_index":2019,"source":"pdf_text","source_observed_at":"2026-08-06T11:22:26.621996Z"},"links":{"cited_paper":"/paper/2005.08528","citing_paper":"/paper/2507.22746"},"observation_digest":"sha256:aff6e95eba996b99feece2c3b8bf0cc4036b4bdb02d2b1af76f3d5675624ab9a","observation_id":"ebfe630b-423b-4645-a172-64b64bff40ab","resolution":{"observed_at":"2026-08-06T11:22:28.701598Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2103.00993","last_updated":"2021-03-01T13:28:59Z","snapshot_observed_at":"2026-08-10T07:58:40.233730Z","submitted_at":"2021-03-01T13:28:59Z","title":"AdaSpeech: Adaptive Text to Speech for Custom Voice","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2103.00993","snapshot_observed_at":"2026-08-06T11:22:25.496315Z","title":"Adaspeech: Adaptive text to speech for custom voice","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.22746","last_updated":"2025-08-01T03:37:42Z","snapshot_observed_at":"2026-08-10T08:00:14.336496Z","submitted_at":"2025-07-30T15:03:36Z","title":"Next Tokens Denoising for Speech Synthesis","version":2},"reference_index":2020,"source":"pdf_text","source_observed_at":"2026-08-06T11:22:25.496315Z"},"links":{"cited_paper":"/paper/2103.00993","citing_paper":"/paper/2507.22746"},"observation_digest":"sha256:84ef19eb3c3417cfdd3372a3fea83012e389bda0a6b489c9e33f086358a9f9ef","observation_id":"d8d21cbe-36a0-4a83-ae5c-37f0360f7ef3","resolution":{"observed_at":"2026-08-06T11:22:25.496315Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.05370","last_updated":"2024-06-17T04:39:08Z","snapshot_observed_at":"2026-08-08T07:23:06.245954Z","submitted_at":"2024-06-08T06:31:03Z","title":"VALL-E 2: Neural Codec Language Models are Human Parity Zero-Shot Text to Speech Synthesizers","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.05370","snapshot_observed_at":"2026-08-06T11:22:25.548417Z","title":"Vall-e 2: Neural codec language models are human parity zero-shot text to speech synthesizers","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.22746","last_updated":"2025-08-01T03:37:42Z","snapshot_observed_at":"2026-08-10T08:00:14.336496Z","submitted_at":"2025-07-30T15:03:36Z","title":"Next Tokens Denoising for Speech Synthesis","version":2},"reference_index":2021,"source":"pdf_text","source_observed_at":"2026-08-06T11:22:25.548417Z"},"links":{"cited_paper":"/paper/2406.05370","citing_paper":"/paper/2507.22746"},"observation_digest":"sha256:c937b22b596582271e014c0d7d9eb22720ee3e90b9fb88fd778ced753c907d02","observation_id":"0c650765-46aa-4e7f-868f-ebc596c3d331","resolution":{"observed_at":"2026-08-06T11:22:25.548417Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.18009","last_updated":"2024-09-12T17:45:37Z","snapshot_observed_at":"2026-08-04T03:12:21.293095Z","submitted_at":"2024-06-26T01:38:37Z","title":"E2 TTS: Embarrassingly Easy Fully Non-Autoregressive Zero-Shot TTS","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.18009","snapshot_observed_at":"2026-08-06T11:22:25.706245Z","title":"E2 tts: Embarrassingly easy fully non- autoregressive zero-shot tts","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.22746","last_updated":"2025-08-01T03:37:42Z","snapshot_observed_at":"2026-08-10T08:00:14.336496Z","submitted_at":"2025-07-30T15:03:36Z","title":"Next Tokens Denoising for Speech Synthesis","version":2},"reference_index":2022,"source":"pdf_text","source_observed_at":"2026-08-06T11:22:25.706245Z"},"links":{"cited_paper":"/paper/2406.18009","citing_paper":"/paper/2507.22746"},"observation_digest":"sha256:e1cd8313da09860553d418919852018e2785742c6b485452539b5dbac62cf21e","observation_id":"572e330a-4104-4d2b-b35e-f211c1787355","resolution":{"observed_at":"2026-08-06T11:22:25.706245Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T11:22:25.418317Z","title":"Language models are few-shot learners","venue":null,"work_id":null,"year":1901},"citing_paper":{"arxiv_id":"2507.22746","last_updated":"2025-08-01T03:37:42Z","snapshot_observed_at":"2026-08-10T08:00:14.336496Z","submitted_at":"2025-07-30T15:03:36Z","title":"Next Tokens Denoising for Speech Synthesis","version":2},"reference_index":2023,"source":"pdf_text","source_observed_at":"2026-08-06T11:22:25.418317Z"},"links":{"citing_paper":"/paper/2507.22746"},"observation_digest":"sha256:3b5f85893581fd9343921a7171c26c61a91054eb91e7b30ae614e43ab87f5dad","observation_id":"9e9ba83c-6772-4838-9f60-dc93aea1ba61","resolution":{"observed_at":"2026-08-06T11:22:25.418317Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.12557","last_updated":"2025-06-23T14:26:35Z","snapshot_observed_at":"2026-07-06T19:34:32.629776Z","submitted_at":"2024-10-16T13:34:40Z","title":"One Step Diffusion via Shortcut Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.12557","snapshot_observed_at":"2026-08-06T11:22:25.814243Z","title":"One step diffusion via shortcut models","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.22746","last_updated":"2025-08-01T03:37:42Z","snapshot_observed_at":"2026-08-10T08:00:14.336496Z","submitted_at":"2025-07-30T15:03:36Z","title":"Next Tokens Denoising for Speech Synthesis","version":2},"reference_index":2024,"source":"pdf_text","source_observed_at":"2026-08-06T11:22:25.814243Z"},"links":{"cited_paper":"/paper/2410.12557","citing_paper":"/paper/2507.22746"},"observation_digest":"sha256:21c8ceb85237edf7bf2d0d55cb90475b92f631813a158428c283bbf6d7e314f2","observation_id":"68f10129-0acc-4fc5-a3d2-d6a4e1b0060c","resolution":{"observed_at":"2026-08-06T11:22:25.814243Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.07855","last_updated":"2024-06-12T04:09:44Z","snapshot_observed_at":"2026-08-05T04:07:33.037081Z","submitted_at":"2024-06-12T04:09:44Z","title":"VALL-E R: Robust and Efficient Zero-Shot Text-to-Speech Synthesis via Monotonic Alignment","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.07855","snapshot_observed_at":"2026-08-06T11:22:25.974745Z","title":"Vall-e r: Robust and efficient zero-shot text-to-speech synthesis via monotonic alignment","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.22746","last_updated":"2025-08-01T03:37:42Z","snapshot_observed_at":"2026-08-10T08:00:14.336496Z","submitted_at":"2025-07-30T15:03:36Z","title":"Next Tokens Denoising for Speech Synthesis","version":2},"reference_index":2025,"source":"pdf_text","source_observed_at":"2026-08-06T11:22:25.974745Z"},"links":{"cited_paper":"/paper/2406.07855","citing_paper":"/paper/2507.22746"},"observation_digest":"sha256:41e24a623f2597dbe99f245eaba40d24d29637c813476542c9faa31e8645651d","observation_id":"0b58e0cd-015b-4b9c-a206-ecd55188d95f","resolution":{"observed_at":"2026-08-06T11:22:25.974745Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2507.22746","last_updated":"2025-08-01T03:37:42Z","latest_version":2,"primary_category":"cs.SD","snapshot_observed_at":"2026-08-10T08:00:14.336496Z","submitted_at":"2025-07-30T15:03:36Z","title":"Next Tokens Denoising for Speech Synthesis"},"reference_resolution":{"displayed":36,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":30,"verified_exact":5,"verified_fuzzy":1},"total_outbound_references":36},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"thesis":"As of 10 August 2026, this Paper Citation Record lists 36 of 36 outbound references and 0 inbound Pith citation observations for arXiv:2507.22746."}