{"as_of":"2026-08-15T06:25:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:b14739282f843d871696ab5f46fd04db307fb906ce53a04dee35c3b613975032","coverage":[{"denominator":25,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":25,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-06T11:34:09.630347Z","state":"measured"},{"denominator":26,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":26,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-14T06:32:32.682623+00:00","state":"measured"},{"denominator":1,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":1,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-06T11:34:07.882293Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"pith","source_observed_at":"2026-08-06T11:34:10.011767Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2507.22612","last_updated":"2025-08-29T06:09:29Z","snapshot_observed_at":"2026-08-14T20:29:00.417184Z","submitted_at":"2025-07-30T12:31:11Z","title":"Adaptive Duration Model for Text Speech Alignment","version":2},"cited_work":{"arxiv_id":"2507.22612","doi":null,"metadata_source":"pith","pith_arxiv_id":"2507.22612","snapshot_observed_at":"2026-08-06T11:34:10.011767Z","title":"Adaptive Duration Model for Text Speech Alignment","venue":"cs.SD","work_id":"e204af43-da6e-43bb-96a2-adb79b38452d","year":2025},"citing_paper":{"arxiv_id":"2507.22612","last_updated":"2025-08-29T06:09:29Z","snapshot_observed_at":"2026-08-14T20:29:00.417184Z","submitted_at":"2025-07-30T12:31:11Z","title":"Adaptive Duration Model for Text Speech Alignment","version":2},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-06T11:34:07.882293Z"},"links":{"cited_paper":"/paper/2507.22612","citing_paper":"/paper/2507.22612"},"observation_digest":"sha256:20742ae242595ec246d3098561aa301193da1499923fe09b4b08f9e1fb492bb3","observation_id":"e822238e-0ba3-457f-bee2-0dc2c323cba7","resolution":{"observed_at":"2026-08-06T11:34:10.121918Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2507.22612/citation-record","integrity":"/paper/2507.22612/integrity","json":"/paper/2507.22612/citation-record.json","paper":"/paper/2507.22612"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T11:34:12.353545Z","title":"A typical TTS system includes an encoder, a decoder, and an alignment mechanism linking linguistic and acoustic representations [3–6]","venue":null,"work_id":"5a8446b7-cc38-4e31-8416-8cd2f3c76154","year":null},"citing_paper":{"arxiv_id":"2507.22612","last_updated":"2025-08-29T06:09:29Z","snapshot_observed_at":"2026-08-14T20:29:00.417184Z","submitted_at":"2025-07-30T12:31:11Z","title":"Adaptive Duration Model for Text Speech Alignment","version":2},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-06T11:34:07.829227Z"},"links":{"citing_paper":"/paper/2507.22612"},"observation_digest":"sha256:ecdddf727838a72ea125d518ac9100aa8fb1ee140c017550bf74f87ea188472a","observation_id":"769360fc-7bb6-4889-b742-f172efc4899d","resolution":{"observed_at":"2026-08-06T11:34:12.419908Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2507.22612","last_updated":"2025-08-29T06:09:29Z","snapshot_observed_at":"2026-08-14T20:29:00.417184Z","submitted_at":"2025-07-30T12:31:11Z","title":"Adaptive Duration Model for Text Speech Alignment","version":2},"cited_work":{"arxiv_id":"2507.22612","doi":null,"metadata_source":"pith","pith_arxiv_id":"2507.22612","snapshot_observed_at":"2026-08-06T11:34:10.011767Z","title":"Adaptive Duration Model for Text Speech Alignment","venue":"cs.SD","work_id":"e204af43-da6e-43bb-96a2-adb79b38452d","year":2025},"citing_paper":{"arxiv_id":"2507.22612","last_updated":"2025-08-29T06:09:29Z","snapshot_observed_at":"2026-08-14T20:29:00.417184Z","submitted_at":"2025-07-30T12:31:11Z","title":"Adaptive Duration Model for Text Speech Alignment","version":2},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-06T11:34:07.882293Z"},"links":{"cited_paper":"/paper/2507.22612","citing_paper":"/paper/2507.22612"},"observation_digest":"sha256:20742ae242595ec246d3098561aa301193da1499923fe09b4b08f9e1fb492bb3","observation_id":"e822238e-0ba3-457f-bee2-0dc2c323cba7","resolution":{"observed_at":"2026-08-06T11:34:10.121918Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T11:34:12.195522Z","title":"We use Premium and Basic subsets of Wenet- Speech4TTS as our experiment dataset","venue":null,"work_id":"d866bafb-4683-43ed-95e5-4a5b1cd41e57","year":2020},"citing_paper":{"arxiv_id":"2507.22612","last_updated":"2025-08-29T06:09:29Z","snapshot_observed_at":"2026-08-14T20:29:00.417184Z","submitted_at":"2025-07-30T12:31:11Z","title":"Adaptive Duration Model for Text Speech Alignment","version":2},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-06T11:34:07.942094Z"},"links":{"citing_paper":"/paper/2507.22612"},"observation_digest":"sha256:c4a8faffdf880e9fd8c71dca31f54b371f7a9609a3fce139b7f528eed7857cfc","observation_id":"50b46a03-b979-44fc-86c3-0b452df8c76e","resolution":{"observed_at":"2026-08-06T11:34:12.271952Z","resolver_source":"raw_fallback","status":"malformed_identifier"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T11:34:12.002747Z","title":"Durformer outperforms baseline methods with respect to efficiency and accuracy","venue":null,"work_id":"305f83ef-cbfe-4fff-a0dc-c697ea2c88f2","year":null},"citing_paper":{"arxiv_id":"2507.22612","last_updated":"2025-08-29T06:09:29Z","snapshot_observed_at":"2026-08-14T20:29:00.417184Z","submitted_at":"2025-07-30T12:31:11Z","title":"Adaptive Duration Model for Text Speech Alignment","version":2},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-06T11:34:08.046867Z"},"links":{"citing_paper":"/paper/2507.22612"},"observation_digest":"sha256:2c64c3acd124935943da6d5ae86d1d295a63d2a19c8b67cbb21cbf4b34a8e048","observation_id":"458ac7de-2dbe-4a37-80c5-c02a70b6ea43","resolution":{"observed_at":"2026-08-06T11:34:12.084758Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T11:34:11.802960Z","title":"One tts align- ment to rule them all,","venue":null,"work_id":"8c0308d4-deb8-47d8-bc28-228ef6b0370e","year":2022},"citing_paper":{"arxiv_id":"2507.22612","last_updated":"2025-08-29T06:09:29Z","snapshot_observed_at":"2026-08-14T20:29:00.417184Z","submitted_at":"2025-07-30T12:31:11Z","title":"Adaptive Duration Model for Text Speech Alignment","version":2},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-06T11:34:08.114869Z"},"links":{"citing_paper":"/paper/2507.22612"},"observation_digest":"sha256:b4c97ac711de5c8c5ce3071769c4921f87d58225a64b7cc67636f664eb8449a5","observation_id":"0e2b5885-beda-4b19-8418-c051f936a75c","resolution":{"observed_at":"2026-08-06T11:34:11.898860Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.01710","last_updated":"2025-03-03T16:23:10Z","snapshot_observed_at":"2026-08-13T16:11:28.134657Z","submitted_at":"2025-03-03T16:23:10Z","title":"Spark-TTS: An Efficient LLM-Based Text-to-Speech Model with Single-Stream Decoupled Speech Tokens","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.01710","snapshot_observed_at":"2026-08-06T11:34:08.167239Z","title":"Spark-tts: An efficient llm-based text-to-speech model with single- stream decoupled speech tokens,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.22612","last_updated":"2025-08-29T06:09:29Z","snapshot_observed_at":"2026-08-14T20:29:00.417184Z","submitted_at":"2025-07-30T12:31:11Z","title":"Adaptive Duration Model for Text Speech Alignment","version":2},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-06T11:34:08.167239Z"},"links":{"cited_paper":"/paper/2503.01710","citing_paper":"/paper/2507.22612"},"observation_digest":"sha256:b6f5a409cc7b743e3e5625a9cc5c21f198209305811709e4dd21b2ed902ccf48","observation_id":"0c5d9294-2c5c-4955-820b-fd37b48e7a1b","resolution":{"observed_at":"2026-08-06T11:34:08.167239Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2005.05957","last_updated":"2020-07-16T15:10:18Z","snapshot_observed_at":"2026-08-09T18:28:37.918698Z","submitted_at":"2020-05-12T17:57:17Z","title":"Flowtron: an Autoregressive Flow-based Generative Network for Text-to-Speech Synthesis","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2005.05957","snapshot_observed_at":"2026-08-06T11:34:08.232019Z","title":"Flowtron: an autoregressive flow-based generative network for text-to-speech synthesis,","venue":null,"work_id":null,"year":2005},"citing_paper":{"arxiv_id":"2507.22612","last_updated":"2025-08-29T06:09:29Z","snapshot_observed_at":"2026-08-14T20:29:00.417184Z","submitted_at":"2025-07-30T12:31:11Z","title":"Adaptive Duration Model for Text Speech Alignment","version":2},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-06T11:34:08.232019Z"},"links":{"cited_paper":"/paper/2005.05957","citing_paper":"/paper/2507.22612"},"observation_digest":"sha256:b3e30bfac636b368f51838a58e9cf38c661bf8d92fcae4582e25f0c0072788b0","observation_id":"d5b85757-2026-4848-bdb3-4bc26b481cdf","resolution":{"observed_at":"2026-08-06T11:34:08.232019Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T11:34:11.596915Z","title":"Fastspeech: Fast, robust and controllable text to speech,","venue":null,"work_id":"7a22581c-9975-4f63-9042-cbc0142e4a0e","year":2019},"citing_paper":{"arxiv_id":"2507.22612","last_updated":"2025-08-29T06:09:29Z","snapshot_observed_at":"2026-08-14T20:29:00.417184Z","submitted_at":"2025-07-30T12:31:11Z","title":"Adaptive Duration Model for Text Speech Alignment","version":2},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-06T11:34:08.320168Z"},"links":{"citing_paper":"/paper/2507.22612"},"observation_digest":"sha256:75d764a8d8897bd7a2ffd2cc335404d076900166f599c3ed0e3abbbe767f9b48","observation_id":"1dc12977-4893-42a9-9c18-67a74ec62837","resolution":{"observed_at":"2026-08-06T11:34:11.701373Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T11:34:11.436818Z","title":"Fastpitch: Parallel text-to-speech with pitch prediction,","venue":null,"work_id":"1edd672f-a59c-4fc6-9496-db0a79e619b3","year":2021},"citing_paper":{"arxiv_id":"2507.22612","last_updated":"2025-08-29T06:09:29Z","snapshot_observed_at":"2026-08-14T20:29:00.417184Z","submitted_at":"2025-07-30T12:31:11Z","title":"Adaptive Duration Model for Text Speech Alignment","version":2},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-06T11:34:08.378954Z"},"links":{"citing_paper":"/paper/2507.22612"},"observation_digest":"sha256:77e3464825d930a94d82497d66cf6c3d5b4dfd4010ab9e9beaa8332a05f1d225","observation_id":"03f6445e-4212-4a15-8f2a-1c798a8804c9","resolution":{"observed_at":"2026-08-06T11:34:11.524555Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2006.04558","last_updated":"2022-08-08T01:53:05Z","snapshot_observed_at":"2026-08-14T02:11:04.009144Z","submitted_at":"2020-06-08T13:05:40Z","title":"FastSpeech 2: Fast and High-Quality End-to-End Text to Speech","version":8},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2006.04558","snapshot_observed_at":"2026-08-06T11:34:08.523005Z","title":"Fastspeech 2: Fast and high-quality end-to-end text to speech,","venue":null,"work_id":null,"year":2006},"citing_paper":{"arxiv_id":"2507.22612","last_updated":"2025-08-29T06:09:29Z","snapshot_observed_at":"2026-08-14T20:29:00.417184Z","submitted_at":"2025-07-30T12:31:11Z","title":"Adaptive Duration Model for Text Speech Alignment","version":2},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-06T11:34:08.523005Z"},"links":{"cited_paper":"/paper/2006.04558","citing_paper":"/paper/2507.22612"},"observation_digest":"sha256:277fe4eb82148b45382abb99e1bcc02ad6ad579006909c59950ccda225876108","observation_id":"10183caa-b808-4807-92b6-767070d9fb8e","resolution":{"observed_at":"2026-08-06T11:34:08.523005Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T11:34:11.276912Z","title":"Location-relative attention mechanisms for ro- bust long-form speech synthesis,","venue":null,"work_id":"9907aebb-f388-4ea2-ada3-d064ef929f7b","year":2020},"citing_paper":{"arxiv_id":"2507.22612","last_updated":"2025-08-29T06:09:29Z","snapshot_observed_at":"2026-08-14T20:29:00.417184Z","submitted_at":"2025-07-30T12:31:11Z","title":"Adaptive Duration Model for Text Speech Alignment","version":2},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-06T11:34:08.586589Z"},"links":{"citing_paper":"/paper/2507.22612"},"observation_digest":"sha256:0d93b6ac693e33610ff82d9166a45e47a346a62f9baba12a3e9f8e61f5fd6754","observation_id":"849ba4da-4596-46cd-8456-028e7175abd4","resolution":{"observed_at":"2026-08-06T11:34:11.359121Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.02430","last_updated":"2024-06-04T15:48:29Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-06-04T15:48:29Z","title":"Seed-TTS: A Family of High-Quality Versatile Speech Generation Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.02430","snapshot_observed_at":"2026-08-06T11:34:08.681690Z","title":"Seed-tts: A family of high-quality versatile speech generation models,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.22612","last_updated":"2025-08-29T06:09:29Z","snapshot_observed_at":"2026-08-14T20:29:00.417184Z","submitted_at":"2025-07-30T12:31:11Z","title":"Adaptive Duration Model for Text Speech Alignment","version":2},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-06T11:34:08.681690Z"},"links":{"cited_paper":"/paper/2406.02430","citing_paper":"/paper/2507.22612"},"observation_digest":"sha256:31f45935d09cd06dea805b2c3591e74b3abe3d6bdfe3b3d03c8554ca840081d1","observation_id":"368df377-e60e-4603-b996-af6b64354af5","resolution":{"observed_at":"2026-08-06T11:34:08.681690Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.03100","last_updated":"2024-04-23T08:38:03Z","snapshot_observed_at":"2026-08-13T04:02:54.961180Z","submitted_at":"2024-03-05T16:35:25Z","title":"NaturalSpeech 3: Zero-Shot Speech Synthesis with Factorized Codec and Diffusion Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.03100","snapshot_observed_at":"2026-08-06T11:34:08.767437Z","title":"Naturalspeech 3: Zero-shot speech synthesis with factorized codec and diffusion models,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.22612","last_updated":"2025-08-29T06:09:29Z","snapshot_observed_at":"2026-08-14T20:29:00.417184Z","submitted_at":"2025-07-30T12:31:11Z","title":"Adaptive Duration Model for Text Speech Alignment","version":2},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-06T11:34:08.767437Z"},"links":{"cited_paper":"/paper/2403.03100","citing_paper":"/paper/2507.22612"},"observation_digest":"sha256:3aac81e3ca6d000ae84010679f12db03573972e213ffb1701672b9f484b3a91d","observation_id":"71ddde11-7728-46f0-97c8-631b877d30c0","resolution":{"observed_at":"2026-08-06T11:34:08.767437Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T11:34:11.115054Z","title":"Non-autoregressive neural text-to-speech,","venue":null,"work_id":"1a41cab3-3633-420c-a65b-d84d54b219fd","year":2020},"citing_paper":{"arxiv_id":"2507.22612","last_updated":"2025-08-29T06:09:29Z","snapshot_observed_at":"2026-08-14T20:29:00.417184Z","submitted_at":"2025-07-30T12:31:11Z","title":"Adaptive Duration Model for Text Speech Alignment","version":2},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-06T11:34:08.866084Z"},"links":{"citing_paper":"/paper/2507.22612"},"observation_digest":"sha256:e02fe6310432dcc3081db107c00aec698730095497679a3511b7e0d18b85ab7b","observation_id":"2a3f2b53-4432-4704-bf13-5ce8b7d01f08","resolution":{"observed_at":"2026-08-06T11:34:11.191926Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T11:34:10.958730Z","title":"Durian-e 2: Duration informed attention net- work with adaptive variational autoencoder and adver- sarial learning for expressive text-to-speech synthesis,","venue":null,"work_id":"141c6378-19c5-484b-a0fe-12cc01f92b53","year":2024},"citing_paper":{"arxiv_id":"2507.22612","last_updated":"2025-08-29T06:09:29Z","snapshot_observed_at":"2026-08-14T20:29:00.417184Z","submitted_at":"2025-07-30T12:31:11Z","title":"Adaptive Duration Model for Text Speech Alignment","version":2},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-06T11:34:08.959203Z"},"links":{"citing_paper":"/paper/2507.22612"},"observation_digest":"sha256:fb45debc862a75be9597525f409cc70a0dbfe0964b612652d226b2516fc824f0","observation_id":"21c31295-447d-46b1-8bc5-31f1d935c5ab","resolution":{"observed_at":"2026-08-06T11:34:11.038847Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1911.09645","last_updated":"2020-05-15T20:46:24Z","snapshot_observed_at":"2026-08-14T00:12:48.511572Z","submitted_at":"2019-11-21T18:04:47Z","title":"Prosody Transfer in Neural Text to Speech Using Global Pitch and Loudness Features","version":2},"cited_work":{"arxiv_id":"1911.09645","doi":null,"metadata_source":"pith","pith_arxiv_id":"1911.09645","snapshot_observed_at":"2026-08-06T11:34:09.797800Z","title":"Prosody Transfer in Neural Text to Speech Using Global Pitch and Loudness Features","venue":"cs.SD","work_id":"17286b19-c789-449b-83ad-eae0bb962b72","year":2019},"citing_paper":{"arxiv_id":"2507.22612","last_updated":"2025-08-29T06:09:29Z","snapshot_observed_at":"2026-08-14T20:29:00.417184Z","submitted_at":"2025-07-30T12:31:11Z","title":"Adaptive Duration Model for Text Speech Alignment","version":2},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-06T11:34:09.044690Z"},"links":{"cited_paper":"/paper/1911.09645","citing_paper":"/paper/2507.22612"},"observation_digest":"sha256:fbe77ffaa3d576985fce88b5e7cf04798b2918a52367ffba256bcf7afab67900","observation_id":"6cbc73b0-781d-4ae4-99b2-0c2dc1b537e5","resolution":{"observed_at":"2026-08-06T11:34:09.863491Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T11:34:10.807787Z","title":"Simple-tts: End-to-end text-to-speech synthesis with latent diffusion,","venue":null,"work_id":"bc3eac48-b89a-4dcc-9b3c-16409f71e46c","year":2023},"citing_paper":{"arxiv_id":"2507.22612","last_updated":"2025-08-29T06:09:29Z","snapshot_observed_at":"2026-08-14T20:29:00.417184Z","submitted_at":"2025-07-30T12:31:11Z","title":"Adaptive Duration Model for Text Speech Alignment","version":2},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-06T11:34:09.097184Z"},"links":{"citing_paper":"/paper/2507.22612"},"observation_digest":"sha256:ea6b6798af01b0377a21bccf81a78d49561c2d584bd1879f1e0d094ff6046d80","observation_id":"10f337af-c4fa-42b6-bcc3-fe35ea5ccb08","resolution":{"observed_at":"2026-08-06T11:34:10.878139Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2301.02111","last_updated":"2023-01-05T15:37:15Z","snapshot_observed_at":"2026-08-07T10:11:17.796562Z","submitted_at":"2023-01-05T15:37:15Z","title":"Neural Codec Language Models are Zero-Shot Text to Speech Synthesizers","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2301.02111","snapshot_observed_at":"2026-08-06T11:34:09.160142Z","title":"Neural codec lan- guage models are zero-shot text to speech synthesizers,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.22612","last_updated":"2025-08-29T06:09:29Z","snapshot_observed_at":"2026-08-14T20:29:00.417184Z","submitted_at":"2025-07-30T12:31:11Z","title":"Adaptive Duration Model for Text Speech Alignment","version":2},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-06T11:34:09.160142Z"},"links":{"cited_paper":"/paper/2301.02111","citing_paper":"/paper/2507.22612"},"observation_digest":"sha256:8157c1f2118c814846a8569b9944f29336d66efc7caa4cf1830e090e5bf05b5c","observation_id":"7f2d6d4c-ffdd-4fe9-8d08-605b21eeb050","resolution":{"observed_at":"2026-08-06T11:34:09.160142Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T11:34:10.659561Z","title":"Natural tts synthesis by conditioning wavenet on mel spectrogram predictions,","venue":null,"work_id":"1a246776-6b16-4411-ba30-83266cd16ca0","year":2018},"citing_paper":{"arxiv_id":"2507.22612","last_updated":"2025-08-29T06:09:29Z","snapshot_observed_at":"2026-08-14T20:29:00.417184Z","submitted_at":"2025-07-30T12:31:11Z","title":"Adaptive Duration Model for Text Speech Alignment","version":2},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-06T11:34:09.231739Z"},"links":{"citing_paper":"/paper/2507.22612"},"observation_digest":"sha256:af576e3a38346f5d1e5a9362f11339d321e84ff75b89722e5305ae1e173cfcfc","observation_id":"06f29d60-5a31-40d7-a324-22c2f553eea3","resolution":{"observed_at":"2026-08-06T11:34:10.727750Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T11:34:10.458647Z","title":"Portaspeech: Portable and high-quality generative text-to-speech,","venue":null,"work_id":"7f5aef36-ed8f-47e9-a7d3-79078dc3890c","year":2021},"citing_paper":{"arxiv_id":"2507.22612","last_updated":"2025-08-29T06:09:29Z","snapshot_observed_at":"2026-08-14T20:29:00.417184Z","submitted_at":"2025-07-30T12:31:11Z","title":"Adaptive Duration Model for Text Speech Alignment","version":2},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-06T11:34:09.286028Z"},"links":{"citing_paper":"/paper/2507.22612"},"observation_digest":"sha256:1966c6ffe0ae5ab58fb010f94664dd0f5c5278d6ad42dbbd7b2cfe39bf664622","observation_id":"cbfaa89b-f5e3-42c5-8734-c4c308da99e2","resolution":{"observed_at":"2026-08-06T11:34:10.564583Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T11:34:10.267293Z","title":"V oicebox: Text-guided multilingual universal speech generation at scale,","venue":null,"work_id":"a841c80e-0f9d-4188-8b68-df98a981bc1a","year":2023},"citing_paper":{"arxiv_id":"2507.22612","last_updated":"2025-08-29T06:09:29Z","snapshot_observed_at":"2026-08-14T20:29:00.417184Z","submitted_at":"2025-07-30T12:31:11Z","title":"Adaptive Duration Model for Text Speech Alignment","version":2},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-06T11:34:09.356034Z"},"links":{"citing_paper":"/paper/2507.22612"},"observation_digest":"sha256:79a5d1ff6f244dd18652ec997a10139265a9c91645da413c146a809519f54ccd","observation_id":"a65be6c9-43c0-465b-a52b-8a8010999c00","resolution":{"observed_at":"2026-08-06T11:34:10.353445Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2409.00750","last_updated":"2024-10-20T14:25:49Z","snapshot_observed_at":"2026-08-12T22:53:35.238599Z","submitted_at":"2024-09-01T15:26:30Z","title":"MaskGCT: Zero-Shot Text-to-Speech with Masked Generative Codec Transformer","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.00750","snapshot_observed_at":"2026-08-06T11:34:09.403232Z","title":"Maskgct: Zero-shot text-to-speech with masked generative codec transformer,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.22612","last_updated":"2025-08-29T06:09:29Z","snapshot_observed_at":"2026-08-14T20:29:00.417184Z","submitted_at":"2025-07-30T12:31:11Z","title":"Adaptive Duration Model for Text Speech Alignment","version":2},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-06T11:34:09.403232Z"},"links":{"cited_paper":"/paper/2409.00750","citing_paper":"/paper/2507.22612"},"observation_digest":"sha256:924e776bedb70da1b1b49d483985fe0c226fa797c002b09b03e89cf8883e1eac","observation_id":"752c8ba0-a959-4247-8d1e-c3737aee4cf3","resolution":{"observed_at":"2026-08-06T11:34:09.403232Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.02328","last_updated":"2024-06-14T16:04:48Z","snapshot_observed_at":"2026-08-12T23:50:29.503225Z","submitted_at":"2024-06-04T13:58:28Z","title":"SimpleSpeech: Towards Simple and Efficient Text-to-Speech with Scalar Latent Transformer Diffusion Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.02328","snapshot_observed_at":"2026-08-06T11:34:09.476364Z","title":"Sim- plespeech: Towards simple and efficient text-to-speech with scalar latent transformer diffusion models,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.22612","last_updated":"2025-08-29T06:09:29Z","snapshot_observed_at":"2026-08-14T20:29:00.417184Z","submitted_at":"2025-07-30T12:31:11Z","title":"Adaptive Duration Model for Text Speech Alignment","version":2},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-06T11:34:09.476364Z"},"links":{"cited_paper":"/paper/2406.02328","citing_paper":"/paper/2507.22612"},"observation_digest":"sha256:801cc2b1a9db3c06e0924c57130822472e4ce5953f20dc91f80066a7cce4e24e","observation_id":"9cb08e55-b39c-4f59-ab51-4d28892893d5","resolution":{"observed_at":"2026-08-06T11:34:09.476364Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.06885","last_updated":"2025-05-20T15:53:10Z","snapshot_observed_at":"2026-08-01T23:52:25.071174Z","submitted_at":"2024-10-09T13:46:34Z","title":"F5-TTS: A Fairytaler that Fakes Fluent and Faithful Speech with Flow Matching","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.06885","snapshot_observed_at":"2026-08-06T11:34:09.568289Z","title":"F5- tts: A fairytaler that fakes fluent and faithful speech with flow matching,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.22612","last_updated":"2025-08-29T06:09:29Z","snapshot_observed_at":"2026-08-14T20:29:00.417184Z","submitted_at":"2025-07-30T12:31:11Z","title":"Adaptive Duration Model for Text Speech Alignment","version":2},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-06T11:34:09.568289Z"},"links":{"cited_paper":"/paper/2410.06885","citing_paper":"/paper/2507.22612"},"observation_digest":"sha256:6a8b246014bd695f1a27a1748f8b6318a8223b4754495173cc50568130da845e","observation_id":"56b91bcd-6dbd-4bf0-b070-a152a73ffcc4","resolution":{"observed_at":"2026-08-06T11:34:09.568289Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.05763","last_updated":"2024-06-19T04:52:56Z","snapshot_observed_at":"2026-08-12T23:47:01.101483Z","submitted_at":"2024-06-09T12:32:42Z","title":"WenetSpeech4TTS: A 12,800-hour Mandarin TTS Corpus for Large Speech Generation Model Benchmark","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.05763","snapshot_observed_at":"2026-08-06T11:34:09.630347Z","title":"Wenetspeech4tts: A 12,800-hour mandarin tts corpus for large speech generation model benchmark,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.22612","last_updated":"2025-08-29T06:09:29Z","snapshot_observed_at":"2026-08-14T20:29:00.417184Z","submitted_at":"2025-07-30T12:31:11Z","title":"Adaptive Duration Model for Text Speech Alignment","version":2},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-06T11:34:09.630347Z"},"links":{"cited_paper":"/paper/2406.05763","citing_paper":"/paper/2507.22612"},"observation_digest":"sha256:fc801b0467afa2cf2f45386431018e24cc9a87555d92297348cdf7d91544871d","observation_id":"f5a86135-f78e-4daf-8f2e-11ed8cd36458","resolution":{"observed_at":"2026-08-06T11:34:09.630347Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2507.22612","last_updated":"2025-08-29T06:09:29Z","latest_version":2,"primary_category":"cs.SD","snapshot_observed_at":"2026-08-14T20:29:00.417184Z","submitted_at":"2025-07-30T12:31:11Z","title":"Adaptive Duration Model for Text Speech Alignment"},"reference_resolution":{"displayed":25,"state_counts":{"malformed_identifier":1,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":10,"verified_exact":2,"verified_fuzzy":12},"total_outbound_references":25},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"thesis":"As of 15 August 2026, this Paper Citation Record lists 25 of 25 outbound references and 1 inbound Pith citation observation for arXiv:2507.22612."}