{"as_of":"2026-08-10T06:53:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:fe8263d7504861649b3de22c507d8980b99b625cac6dbc794afd082d7e97ea7b","coverage":[{"denominator":40,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":40,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-06T15:14:31.528872Z","state":"measured"},{"denominator":40,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":40,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-10T06:31:04.303077+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2507.16875/citation-record","integrity":"/paper/2507.16875/integrity","json":"/paper/2507.16875/citation-record.json","paper":"/paper/2507.16875"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:14:28.851711Z","title":"online\" 'onlinestring :=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.16875","last_updated":"2025-07-22T09:38:30Z","snapshot_observed_at":"2026-08-07T22:00:26.714703Z","submitted_at":"2025-07-22T09:38:30Z","title":"Technical report: Impact of Duration Prediction on Speaker-specific TTS for Indian Languages","version":1},"reference_index":1,"source":"arxiv_source","source_observed_at":"2026-08-06T15:14:28.851711Z"},"links":{"citing_paper":"/paper/2507.16875"},"observation_digest":"sha256:986d40c0fadcbe723708531d630901f85c3ef468112d6b415ae83121188b4d7d","observation_id":"3486352c-35ec-4299-8248-c85b2028d082","resolution":{"observed_at":"2026-08-06T15:14:28.851711Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:14:28.900880Z","title":"write newline","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.16875","last_updated":"2025-07-22T09:38:30Z","snapshot_observed_at":"2026-08-07T22:00:26.714703Z","submitted_at":"2025-07-22T09:38:30Z","title":"Technical report: Impact of Duration Prediction on Speaker-specific TTS for Indian Languages","version":1},"reference_index":2,"source":"arxiv_source","source_observed_at":"2026-08-06T15:14:28.900880Z"},"links":{"citing_paper":"/paper/2507.16875"},"observation_digest":"sha256:8d38a49065283b0c462428fcbfe69d939b415339aaea04467c76fa565838942d","observation_id":"c217d86d-aaa0-4943-97ef-8421acdeac8c","resolution":{"observed_at":"2026-08-06T15:14:28.900880Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:14:33.733303Z","title":null,"venue":null,"work_id":"bc7bc1ab-5bf4-4036-9c2f-088995f911f5","year":2025},"citing_paper":{"arxiv_id":"2507.16875","last_updated":"2025-07-22T09:38:30Z","snapshot_observed_at":"2026-08-07T22:00:26.714703Z","submitted_at":"2025-07-22T09:38:30Z","title":"Technical report: Impact of Duration Prediction on Speaker-specific TTS for Indian Languages","version":1},"reference_index":3,"source":"arxiv_source","source_observed_at":"2026-08-06T15:14:28.949257Z"},"links":{"citing_paper":"/paper/2507.16875"},"observation_digest":"sha256:abcd1af27fd7317adce3da619277296b36361b560f41a89c618e4422866409ca","observation_id":"65c8152b-ec59-4a19-b156-ee8ccc09051e","resolution":{"observed_at":"2026-08-06T15:14:33.801529Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:14:33.650793Z","title":null,"venue":null,"work_id":"3b944243-14a2-40e4-8f85-79f38cce33f9","year":2024},"citing_paper":{"arxiv_id":"2507.16875","last_updated":"2025-07-22T09:38:30Z","snapshot_observed_at":"2026-08-07T22:00:26.714703Z","submitted_at":"2025-07-22T09:38:30Z","title":"Technical report: Impact of Duration Prediction on Speaker-specific TTS for Indian Languages","version":1},"reference_index":4,"source":"arxiv_source","source_observed_at":"2026-08-06T15:14:29.046283Z"},"links":{"citing_paper":"/paper/2507.16875"},"observation_digest":"sha256:2656a148c3619b2f031c7aa1da6e58e3e1257f50175719e0a05d9509bd2d2f1a","observation_id":"6744d350-15ac-4e12-9b94-6d6a1ea08ffc","resolution":{"observed_at":"2026-08-06T15:14:33.695220Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1912.06670","last_updated":"2020-03-05T20:37:08Z","snapshot_observed_at":"2026-08-05T11:17:11.092255Z","submitted_at":"2019-12-13T19:22:44Z","title":"Common Voice: A Massively-Multilingual Speech Corpus","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1912.06670","snapshot_observed_at":"2026-08-06T15:14:29.110045Z","title":"Tyers, and Gregor Weber","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2507.16875","last_updated":"2025-07-22T09:38:30Z","snapshot_observed_at":"2026-08-07T22:00:26.714703Z","submitted_at":"2025-07-22T09:38:30Z","title":"Technical report: Impact of Duration Prediction on Speaker-specific TTS for Indian Languages","version":1},"reference_index":5,"source":"arxiv_source","source_observed_at":"2026-08-06T15:14:29.110045Z"},"links":{"cited_paper":"/paper/1912.06670","citing_paper":"/paper/2507.16875"},"observation_digest":"sha256:ea5474cb4dc2f24a912bdf85248a76d7c4efa0eef937be35a40bf9bdbb7af49d","observation_id":"a231c882-4e11-4c31-b255-050eb910fe15","resolution":{"observed_at":"2026-08-06T15:14:29.110045Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:14:33.525856Z","title":null,"venue":null,"work_id":"223065cf-d956-4320-93c5-9622d6b6df20","year":2023},"citing_paper":{"arxiv_id":"2507.16875","last_updated":"2025-07-22T09:38:30Z","snapshot_observed_at":"2026-08-07T22:00:26.714703Z","submitted_at":"2025-07-22T09:38:30Z","title":"Technical report: Impact of Duration Prediction on Speaker-specific TTS for Indian Languages","version":1},"reference_index":6,"source":"arxiv_source","source_observed_at":"2026-08-06T15:14:29.154651Z"},"links":{"citing_paper":"/paper/2507.16875"},"observation_digest":"sha256:342daddf2c78246c648fbeee4fab5946c435e4d0e6281b26f7fff8055b9716bb","observation_id":"418719bb-0509-40e0-a452-0067eec1d065","resolution":{"observed_at":"2026-08-06T15:14:33.578220Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2305.15386","last_updated":"2023-08-02T13:29:31Z","snapshot_observed_at":"2026-07-06T15:32:49.322000Z","submitted_at":"2023-05-24T17:46:03Z","title":"Vistaar: Diverse Benchmarks and Training Sets for Indian Language ASR","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.15386","snapshot_observed_at":"2026-08-06T15:14:29.185047Z","title":"Khapra, and Pratyush Kumar","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.16875","last_updated":"2025-07-22T09:38:30Z","snapshot_observed_at":"2026-08-07T22:00:26.714703Z","submitted_at":"2025-07-22T09:38:30Z","title":"Technical report: Impact of Duration Prediction on Speaker-specific TTS for Indian Languages","version":1},"reference_index":7,"source":"arxiv_source","source_observed_at":"2026-08-06T15:14:29.185047Z"},"links":{"cited_paper":"/paper/2305.15386","citing_paper":"/paper/2507.16875"},"observation_digest":"sha256:f5a0ec8d3905ff9d6256ad334cfc1455b50e2934c20136030f9f1cb11b4d4255","observation_id":"59d85089-f29c-4588-a8eb-4446db136635","resolution":{"observed_at":"2026-08-06T15:14:29.185047Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:14:29.258511Z","title":null,"venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2507.16875","last_updated":"2025-07-22T09:38:30Z","snapshot_observed_at":"2026-08-07T22:00:26.714703Z","submitted_at":"2025-07-22T09:38:30Z","title":"Technical report: Impact of Duration Prediction on Speaker-specific TTS for Indian Languages","version":1},"reference_index":8,"source":"arxiv_source","source_observed_at":"2026-08-06T15:14:29.258511Z"},"links":{"citing_paper":"/paper/2507.16875"},"observation_digest":"sha256:505a5baee4249cb65693a7048b8832172ed9f55dd6531e0ac4868e44fa7a3f1c","observation_id":"75463a93-7eba-4e22-b544-9d749f5c31e6","resolution":{"observed_at":"2026-08-06T15:14:29.258511Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2205.12446","last_updated":"2022-05-25T02:29:03Z","snapshot_observed_at":"2026-07-06T13:13:37.143547Z","submitted_at":"2022-05-25T02:29:03Z","title":"FLEURS: Few-shot Learning Evaluation of Universal Representations of Speech","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2205.12446","snapshot_observed_at":"2026-08-06T15:14:29.325515Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2507.16875","last_updated":"2025-07-22T09:38:30Z","snapshot_observed_at":"2026-08-07T22:00:26.714703Z","submitted_at":"2025-07-22T09:38:30Z","title":"Technical report: Impact of Duration Prediction on Speaker-specific TTS for Indian Languages","version":1},"reference_index":9,"source":"arxiv_source","source_observed_at":"2026-08-06T15:14:29.325515Z"},"links":{"cited_paper":"/paper/2205.12446","citing_paper":"/paper/2507.16875"},"observation_digest":"sha256:381e70ab9ded678b3e07a0b7b96cbe76e993261211bfa9be73a4710799631e84","observation_id":"3c674f5f-94d6-4e13-8644-be859c9f748b","resolution":{"observed_at":"2026-08-06T15:14:29.325515Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:14:29.369006Z","title":null,"venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2507.16875","last_updated":"2025-07-22T09:38:30Z","snapshot_observed_at":"2026-08-07T22:00:26.714703Z","submitted_at":"2025-07-22T09:38:30Z","title":"Technical report: Impact of Duration Prediction on Speaker-specific TTS for Indian Languages","version":1},"reference_index":10,"source":"arxiv_source","source_observed_at":"2026-08-06T15:14:29.369006Z"},"links":{"citing_paper":"/paper/2507.16875"},"observation_digest":"sha256:bba9d6b3a8dfbe4559fc5c81d88da9c444a05c3e6a7454fc9653fc8ccc568542","observation_id":"d63cf14c-b70d-4c1c-80b0-ed050c653bac","resolution":{"observed_at":"2026-08-06T15:14:29.369006Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.21437/interspeech.2021-1339","metadata_source":"openalex","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T05:30:23.456663Z","title":null,"venue":null,"work_id":"2329df02-479c-488a-9843-1e0b05b4a672","year":2021},"citing_paper":{"arxiv_id":"2507.16875","last_updated":"2025-07-22T09:38:30Z","snapshot_observed_at":"2026-08-07T22:00:26.714703Z","submitted_at":"2025-07-22T09:38:30Z","title":"Technical report: Impact of Duration Prediction on Speaker-specific TTS for Indian Languages","version":1},"reference_index":11,"source":"arxiv_source","source_observed_at":"2026-08-06T15:14:29.480961Z"},"links":{"citing_paper":"/paper/2507.16875"},"observation_digest":"sha256:86309b49c219193bf91ec9c92f0b68a686689d4582ba09e36d4029c52f59ea57","observation_id":"62b2027e-4be7-47a2-b16c-ca045da36cbf","resolution":{"observed_at":"2026-08-06T15:14:31.755373Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2208.11761","last_updated":"2022-12-15T07:32:25Z","snapshot_observed_at":"2026-08-07T16:01:10.164392Z","submitted_at":"2022-08-24T20:14:52Z","title":"IndicSUPERB: A Speech Processing Universal Performance Benchmark for Indian languages","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2208.11761","snapshot_observed_at":"2026-08-06T15:14:29.537980Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2507.16875","last_updated":"2025-07-22T09:38:30Z","snapshot_observed_at":"2026-08-07T22:00:26.714703Z","submitted_at":"2025-07-22T09:38:30Z","title":"Technical report: Impact of Duration Prediction on Speaker-specific TTS for Indian Languages","version":1},"reference_index":12,"source":"arxiv_source","source_observed_at":"2026-08-06T15:14:29.537980Z"},"links":{"cited_paper":"/paper/2208.11761","citing_paper":"/paper/2507.16875"},"observation_digest":"sha256:c53a08022fc6075742712ba6d31bdca4aa84dafd4d5b246a2fa7b7e0a6e69735","observation_id":"b0ed9496-8a61-447e-b9f5-c4f6fab4dd73","resolution":{"observed_at":"2026-08-06T15:14:29.537980Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.01926","last_updated":"2024-03-04T10:42:08Z","snapshot_observed_at":"2026-07-06T17:39:07.926765Z","submitted_at":"2024-03-04T10:42:08Z","title":"IndicVoices: Towards building an Inclusive Multilingual Speech Dataset for Indian Languages","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.01926","snapshot_observed_at":"2026-08-06T15:14:29.703143Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.16875","last_updated":"2025-07-22T09:38:30Z","snapshot_observed_at":"2026-08-07T22:00:26.714703Z","submitted_at":"2025-07-22T09:38:30Z","title":"Technical report: Impact of Duration Prediction on Speaker-specific TTS for Indian Languages","version":1},"reference_index":13,"source":"arxiv_source","source_observed_at":"2026-08-06T15:14:29.703143Z"},"links":{"cited_paper":"/paper/2403.01926","citing_paper":"/paper/2507.16875"},"observation_digest":"sha256:8d473e5411c9402e76eaaf1050bc34c2b3542fa947d1de65c889f112b72eb75b","observation_id":"5691cadf-4806-4b99-af9b-ee7b6b662e7a","resolution":{"observed_at":"2026-08-06T15:14:29.703143Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2005.11129","last_updated":"2020-10-23T01:53:58Z","snapshot_observed_at":"2026-08-09T11:53:42.244015Z","submitted_at":"2020-05-22T12:06:46Z","title":"Glow-TTS: A Generative Flow for Text-to-Speech via Monotonic Alignment Search","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2005.11129","snapshot_observed_at":"2026-08-06T15:14:29.752321Z","title":null,"venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2507.16875","last_updated":"2025-07-22T09:38:30Z","snapshot_observed_at":"2026-08-07T22:00:26.714703Z","submitted_at":"2025-07-22T09:38:30Z","title":"Technical report: Impact of Duration Prediction on Speaker-specific TTS for Indian Languages","version":1},"reference_index":14,"source":"arxiv_source","source_observed_at":"2026-08-06T15:14:29.752321Z"},"links":{"cited_paper":"/paper/2005.11129","citing_paper":"/paper/2507.16875"},"observation_digest":"sha256:96f40d55a387946e2863774463e6ec08cef0fbb16f14253626cea17a95d78487","observation_id":"ea993c09-867e-4142-971d-c66408588c40","resolution":{"observed_at":"2026-08-06T15:14:29.752321Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2106.06103","last_updated":"2021-06-11T01:07:12Z","snapshot_observed_at":"2026-08-02T17:41:21.677381Z","submitted_at":"2021-06-11T01:07:12Z","title":"Conditional Variational Autoencoder with Adversarial Learning for End-to-End Text-to-Speech","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2106.06103","snapshot_observed_at":"2026-08-06T15:14:29.789462Z","title":null,"venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2507.16875","last_updated":"2025-07-22T09:38:30Z","snapshot_observed_at":"2026-08-07T22:00:26.714703Z","submitted_at":"2025-07-22T09:38:30Z","title":"Technical report: Impact of Duration Prediction on Speaker-specific TTS for Indian Languages","version":1},"reference_index":15,"source":"arxiv_source","source_observed_at":"2026-08-06T15:14:29.789462Z"},"links":{"cited_paper":"/paper/2106.06103","citing_paper":"/paper/2507.16875"},"observation_digest":"sha256:9d47574d26b2a0915567f8d0c90d9be61d9b1735e9d1f942bb7573bef77c0ce1","observation_id":"d5ce8eca-58e1-46c1-92ab-e59d5d3f4173","resolution":{"observed_at":"2026-08-06T15:14:29.789462Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:14:33.428772Z","title":"Shih, Rohan Badlani, Joao Felipe Santos, Evelina Bakhturina, Mikyas T","venue":null,"work_id":"a61d4d54-7f2c-4752-b509-bb64f2bfdd6f","year":2023},"citing_paper":{"arxiv_id":"2507.16875","last_updated":"2025-07-22T09:38:30Z","snapshot_observed_at":"2026-08-07T22:00:26.714703Z","submitted_at":"2025-07-22T09:38:30Z","title":"Technical report: Impact of Duration Prediction on Speaker-specific TTS for Indian Languages","version":1},"reference_index":16,"source":"arxiv_source","source_observed_at":"2026-08-06T15:14:29.857641Z"},"links":{"citing_paper":"/paper/2507.16875"},"observation_digest":"sha256:f4f2cb805e5708c2de5599ad5be8888035c5515fa1693a74262b042cad0c1de4","observation_id":"507cb6a4-b091-439e-94ca-747d269f103a","resolution":{"observed_at":"2026-08-06T15:14:33.473985Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2010.05646","last_updated":"2020-10-23T09:12:04Z","snapshot_observed_at":"2026-07-06T10:03:33.857220Z","submitted_at":"2020-10-12T12:33:43Z","title":"HiFi-GAN: Generative Adversarial Networks for Efficient and High Fidelity Speech Synthesis","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2010.05646","snapshot_observed_at":"2026-08-06T15:14:29.951696Z","title":null,"venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2507.16875","last_updated":"2025-07-22T09:38:30Z","snapshot_observed_at":"2026-08-07T22:00:26.714703Z","submitted_at":"2025-07-22T09:38:30Z","title":"Technical report: Impact of Duration Prediction on Speaker-specific TTS for Indian Languages","version":1},"reference_index":17,"source":"arxiv_source","source_observed_at":"2026-08-06T15:14:29.951696Z"},"links":{"cited_paper":"/paper/2010.05646","citing_paper":"/paper/2507.16875"},"observation_digest":"sha256:e6c5b7390863ddb967d214b51925087b0b99d5b68a5f364aa275d5a4f84496fd","observation_id":"724417c4-7bab-481d-90ce-930880d48b18","resolution":{"observed_at":"2026-08-06T15:14:29.951696Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2211.09536","last_updated":"2023-02-17T08:09:02Z","snapshot_observed_at":"2026-07-06T14:19:47.424778Z","submitted_at":"2022-11-17T13:59:34Z","title":"Towards Building Text-To-Speech Systems for the Next Billion Users","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2211.09536","snapshot_observed_at":"2026-08-06T15:14:30.026285Z","title":"Khapra, and Karthik Nandakumar","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.16875","last_updated":"2025-07-22T09:38:30Z","snapshot_observed_at":"2026-08-07T22:00:26.714703Z","submitted_at":"2025-07-22T09:38:30Z","title":"Technical report: Impact of Duration Prediction on Speaker-specific TTS for Indian Languages","version":1},"reference_index":18,"source":"arxiv_source","source_observed_at":"2026-08-06T15:14:30.026285Z"},"links":{"cited_paper":"/paper/2211.09536","citing_paper":"/paper/2507.16875"},"observation_digest":"sha256:1ecf9dba1af91dda81288f52723929cc5c22c194142008a3b942161efb6ace9e","observation_id":"2a268d05-5e41-4234-8418-029e20a4b169","resolution":{"observed_at":"2026-08-06T15:14:30.026285Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2306.15687","last_updated":"2023-10-19T13:23:28Z","snapshot_observed_at":"2026-07-06T15:47:26.532273Z","submitted_at":"2023-06-23T16:23:24Z","title":"Voicebox: Text-Guided Multilingual Universal Speech Generation at Scale","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.15687","snapshot_observed_at":"2026-08-06T15:14:30.133816Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.16875","last_updated":"2025-07-22T09:38:30Z","snapshot_observed_at":"2026-08-07T22:00:26.714703Z","submitted_at":"2025-07-22T09:38:30Z","title":"Technical report: Impact of Duration Prediction on Speaker-specific TTS for Indian Languages","version":1},"reference_index":19,"source":"arxiv_source","source_observed_at":"2026-08-06T15:14:30.133816Z"},"links":{"cited_paper":"/paper/2306.15687","citing_paper":"/paper/2507.16875"},"observation_digest":"sha256:2e1345b84973529b3848137820a892e755abd14ac910eb1447fb377bca4816c7","observation_id":"ead94f66-2b8d-4b78-928d-1d85dd3b77a5","resolution":{"observed_at":"2026-08-06T15:14:30.133816Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2210.02747","last_updated":"2023-02-08T15:46:05Z","snapshot_observed_at":"2026-08-02T18:24:58.914589Z","submitted_at":"2022-10-06T08:32:20Z","title":"Flow Matching for Generative Modeling","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2210.02747","snapshot_observed_at":"2026-08-06T15:14:30.216423Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.16875","last_updated":"2025-07-22T09:38:30Z","snapshot_observed_at":"2026-08-07T22:00:26.714703Z","submitted_at":"2025-07-22T09:38:30Z","title":"Technical report: Impact of Duration Prediction on Speaker-specific TTS for Indian Languages","version":1},"reference_index":20,"source":"arxiv_source","source_observed_at":"2026-08-06T15:14:30.216423Z"},"links":{"cited_paper":"/paper/2210.02747","citing_paper":"/paper/2507.16875"},"observation_digest":"sha256:5422ea9d1b951de80f642925edb246e467d75fee183e1e3a8c6b9c118f9709d7","observation_id":"718d8ba3-b7d5-4f66-9602-9376b60effcc","resolution":{"observed_at":"2026-08-06T15:14:30.216423Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:14:33.296152Z","title":null,"venue":null,"work_id":"b072a490-5eca-47b9-ad76-2f221698067c","year":2020},"citing_paper":{"arxiv_id":"2507.16875","last_updated":"2025-07-22T09:38:30Z","snapshot_observed_at":"2026-08-07T22:00:26.714703Z","submitted_at":"2025-07-22T09:38:30Z","title":"Technical report: Impact of Duration Prediction on Speaker-specific TTS for Indian Languages","version":1},"reference_index":21,"source":"arxiv_source","source_observed_at":"2026-08-06T15:14:30.258751Z"},"links":{"citing_paper":"/paper/2507.16875"},"observation_digest":"sha256:dd6e1045509b5e76be223eaa588487e5f6ff0f7a0674a7b3220d4ed5123f9e03","observation_id":"9e9212a2-a1db-4b53-89d0-f1b3761ba85f","resolution":{"observed_at":"2026-08-06T15:14:33.361801Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2012.03500","last_updated":"2020-12-07T07:46:46Z","snapshot_observed_at":"2026-07-06T10:21:17.333971Z","submitted_at":"2020-12-07T07:46:46Z","title":"EfficientTTS: An Efficient and High-Quality Text-to-Speech Architecture","version":1},"cited_work":{"arxiv_id":"2012.03500","doi":null,"metadata_source":"pith","pith_arxiv_id":"2012.03500","snapshot_observed_at":"2026-08-06T15:14:32.401201Z","title":"EfficientTTS: An Efficient and High-Quality Text-to-Speech Architecture","venue":"eess.AS","work_id":"ceb33664-6129-4573-8c60-bf2ea5c9cf57","year":2020},"citing_paper":{"arxiv_id":"2507.16875","last_updated":"2025-07-22T09:38:30Z","snapshot_observed_at":"2026-08-07T22:00:26.714703Z","submitted_at":"2025-07-22T09:38:30Z","title":"Technical report: Impact of Duration Prediction on Speaker-specific TTS for Indian Languages","version":1},"reference_index":22,"source":"arxiv_source","source_observed_at":"2026-08-06T15:14:30.316970Z"},"links":{"cited_paper":"/paper/2012.03500","citing_paper":"/paper/2507.16875"},"observation_digest":"sha256:3a3c95707d2406760e9563a0e8cf0161c48586bf6077ee5aa47fe592db93e50c","observation_id":"bf8952db-b67f-493f-a3db-2b79f90a01d6","resolution":{"observed_at":"2026-08-06T15:14:32.518024Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:14:33.131236Z","title":null,"venue":null,"work_id":"12b85b52-1f11-48b0-87ae-342d6edeb6e0","year":2020},"citing_paper":{"arxiv_id":"2507.16875","last_updated":"2025-07-22T09:38:30Z","snapshot_observed_at":"2026-08-07T22:00:26.714703Z","submitted_at":"2025-07-22T09:38:30Z","title":"Technical report: Impact of Duration Prediction on Speaker-specific TTS for Indian Languages","version":1},"reference_index":23,"source":"arxiv_source","source_observed_at":"2026-08-06T15:14:30.418669Z"},"links":{"citing_paper":"/paper/2507.16875"},"observation_digest":"sha256:3fa9f553815746b72bba8bbe847bb3e5bf14455106b6b2fff5db947a2b11a858","observation_id":"1b685550-945e-4d48-9d63-02d92c9de4bc","resolution":{"observed_at":"2026-08-06T15:14:33.192578Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.14654","last_updated":"2023-10-24T06:03:14Z","snapshot_observed_at":"2026-07-06T16:36:59.440643Z","submitted_at":"2023-10-23T07:50:10Z","title":"SPRING-INX: A Multilingual Indian Language Speech Corpus by SPRING Lab, IIT Madras","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.14654","snapshot_observed_at":"2026-08-06T15:14:30.445886Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.16875","last_updated":"2025-07-22T09:38:30Z","snapshot_observed_at":"2026-08-07T22:00:26.714703Z","submitted_at":"2025-07-22T09:38:30Z","title":"Technical report: Impact of Duration Prediction on Speaker-specific TTS for Indian Languages","version":1},"reference_index":24,"source":"arxiv_source","source_observed_at":"2026-08-06T15:14:30.445886Z"},"links":{"cited_paper":"/paper/2310.14654","citing_paper":"/paper/2507.16875"},"observation_digest":"sha256:35ce01d7a69c8d9d46d7f133bf4edd4609f7abd0adc07cc919a067e40c0299db","observation_id":"fa5599c9-21d1-484b-8623-55f5ca3074a4","resolution":{"observed_at":"2026-08-06T15:14:30.445886Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2006.04558","last_updated":"2022-08-08T01:53:05Z","snapshot_observed_at":"2026-08-06T18:05:37.673476Z","submitted_at":"2020-06-08T13:05:40Z","title":"FastSpeech 2: Fast and High-Quality End-to-End Text to Speech","version":8},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2006.04558","snapshot_observed_at":"2026-08-06T15:14:30.485844Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2507.16875","last_updated":"2025-07-22T09:38:30Z","snapshot_observed_at":"2026-08-07T22:00:26.714703Z","submitted_at":"2025-07-22T09:38:30Z","title":"Technical report: Impact of Duration Prediction on Speaker-specific TTS for Indian Languages","version":1},"reference_index":25,"source":"arxiv_source","source_observed_at":"2026-08-06T15:14:30.485844Z"},"links":{"cited_paper":"/paper/2006.04558","citing_paper":"/paper/2507.16875"},"observation_digest":"sha256:0e599b60bc6ad94eef1dad23a3904c792bf00e3db8b6550d194640a5ba541a03","observation_id":"dbec8d13-d99a-4ef8-bbec-77b4844aaab6","resolution":{"observed_at":"2026-08-06T15:14:30.485844Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1905.09263","last_updated":"2019-11-20T09:37:22Z","snapshot_observed_at":"2026-08-07T08:05:20.018613Z","submitted_at":"2019-05-22T17:50:21Z","title":"FastSpeech: Fast, Robust and Controllable Text to Speech","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1905.09263","snapshot_observed_at":"2026-08-06T15:14:30.581398Z","title":null,"venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2507.16875","last_updated":"2025-07-22T09:38:30Z","snapshot_observed_at":"2026-08-07T22:00:26.714703Z","submitted_at":"2025-07-22T09:38:30Z","title":"Technical report: Impact of Duration Prediction on Speaker-specific TTS for Indian Languages","version":1},"reference_index":26,"source":"arxiv_source","source_observed_at":"2026-08-06T15:14:30.581398Z"},"links":{"cited_paper":"/paper/1905.09263","citing_paper":"/paper/2507.16875"},"observation_digest":"sha256:690c2f1560b8577e0d8a13af56b594e9e6ca8034b1fc157ba46decd25fd1af5b","observation_id":"58d67193-7f70-4504-84d4-09c56b858988","resolution":{"observed_at":"2026-08-06T15:14:30.581398Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1505.04597","last_updated":"2015-05-18T11:28:37Z","snapshot_observed_at":"2026-08-06T11:05:16.105361Z","submitted_at":"2015-05-18T11:28:37Z","title":"U-Net: Convolutional Networks for Biomedical Image Segmentation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1505.04597","snapshot_observed_at":"2026-08-06T15:14:30.713340Z","title":null,"venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2507.16875","last_updated":"2025-07-22T09:38:30Z","snapshot_observed_at":"2026-08-07T22:00:26.714703Z","submitted_at":"2025-07-22T09:38:30Z","title":"Technical report: Impact of Duration Prediction on Speaker-specific TTS for Indian Languages","version":1},"reference_index":27,"source":"arxiv_source","source_observed_at":"2026-08-06T15:14:30.713340Z"},"links":{"cited_paper":"/paper/1505.04597","citing_paper":"/paper/2507.16875"},"observation_digest":"sha256:5f138c4bb7d7d92e856cf2b5432ebeeb07d2ba12fdd26e199ae5244051c49de4","observation_id":"86b0fe1b-611a-4c98-a7a8-505b0962d4ee","resolution":{"observed_at":"2026-08-06T15:14:30.713340Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.05356","last_updated":"2024-10-07T05:29:01Z","snapshot_observed_at":"2026-08-04T09:16:47.088267Z","submitted_at":"2024-09-09T06:28:47Z","title":"IndicVoices-R: Unlocking a Massive Multilingual Multi-speaker Speech Corpus for Scaling Indian TTS","version":2},"cited_work":{"arxiv_id":"2409.05356","doi":null,"metadata_source":"pith","pith_arxiv_id":"2409.05356","snapshot_observed_at":"2026-08-06T15:14:32.068359Z","title":"IndicVoices-R: Unlocking a Massive Multilingual Multi-speaker Speech Corpus for Scaling Indian TTS","venue":"cs.CL","work_id":"dbce4188-78bb-4511-bb9a-864f7b0ee880","year":2024},"citing_paper":{"arxiv_id":"2507.16875","last_updated":"2025-07-22T09:38:30Z","snapshot_observed_at":"2026-08-07T22:00:26.714703Z","submitted_at":"2025-07-22T09:38:30Z","title":"Technical report: Impact of Duration Prediction on Speaker-specific TTS for Indian Languages","version":1},"reference_index":28,"source":"arxiv_source","source_observed_at":"2026-08-06T15:14:30.761558Z"},"links":{"cited_paper":"/paper/2409.05356","citing_paper":"/paper/2507.16875"},"observation_digest":"sha256:4fe2487b4d384e21a132536639064ec47780758edb47e06da1ae5e75b172e463","observation_id":"26448455-0f63-47d1-9b08-1c9949650b2f","resolution":{"observed_at":"2026-08-06T15:14:32.221966Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:14:30.799973Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.16875","last_updated":"2025-07-22T09:38:30Z","snapshot_observed_at":"2026-08-07T22:00:26.714703Z","submitted_at":"2025-07-22T09:38:30Z","title":"Technical report: Impact of Duration Prediction on Speaker-specific TTS for Indian Languages","version":1},"reference_index":29,"source":"arxiv_source","source_observed_at":"2026-08-06T15:14:30.799973Z"},"links":{"citing_paper":"/paper/2507.16875"},"observation_digest":"sha256:04f12c3ef38ea209f1dce4b89052f55131174b7e87044fff778cc2e76c6ac61a","observation_id":"017f1592-d3c9-4c8c-af18-073a264abff0","resolution":{"observed_at":"2026-08-06T15:14:30.799973Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2010.04301","last_updated":"2021-05-11T04:12:14Z","snapshot_observed_at":"2026-08-06T20:00:38.096518Z","submitted_at":"2020-10-08T23:41:39Z","title":"Non-Attentive Tacotron: Robust and Controllable Neural TTS Synthesis Including Unsupervised Duration Modeling","version":4},"cited_work":{"arxiv_id":"2010.04301","doi":null,"metadata_source":"pith","pith_arxiv_id":"2010.04301","snapshot_observed_at":"2026-08-06T15:14:31.871791Z","title":"Non-Attentive Tacotron: Robust and Controllable Neural TTS Synthesis Including Unsupervised Duration Modeling","venue":"cs.SD","work_id":"63150e68-7c2a-49f2-88b2-004f80dd9693","year":2020},"citing_paper":{"arxiv_id":"2507.16875","last_updated":"2025-07-22T09:38:30Z","snapshot_observed_at":"2026-08-07T22:00:26.714703Z","submitted_at":"2025-07-22T09:38:30Z","title":"Technical report: Impact of Duration Prediction on Speaker-specific TTS for Indian Languages","version":1},"reference_index":30,"source":"arxiv_source","source_observed_at":"2026-08-06T15:14:30.879930Z"},"links":{"cited_paper":"/paper/2010.04301","citing_paper":"/paper/2507.16875"},"observation_digest":"sha256:c68e652df3eeede81f54442c6143e8de227c528db9293a3743113d20280b06c9","observation_id":"c55ea404-b1f0-4317-824e-a2302233b547","resolution":{"observed_at":"2026-08-06T15:14:31.926697Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1712.05884","last_updated":"2018-02-16T01:28:23Z","snapshot_observed_at":"2026-07-06T06:14:40.571088Z","submitted_at":"2017-12-16T00:51:40Z","title":"Natural TTS Synthesis by Conditioning WaveNet on Mel Spectrogram Predictions","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1712.05884","snapshot_observed_at":"2026-08-06T15:14:30.947024Z","title":"Weiss, Mike Schuster, Navdeep Jaitly, Zongheng Yang, Zhifeng Chen, Yu Zhang, Yuxuan Wang, RJ Skerry-Ryan, Rif A","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2507.16875","last_updated":"2025-07-22T09:38:30Z","snapshot_observed_at":"2026-08-07T22:00:26.714703Z","submitted_at":"2025-07-22T09:38:30Z","title":"Technical report: Impact of Duration Prediction on Speaker-specific TTS for Indian Languages","version":1},"reference_index":31,"source":"arxiv_source","source_observed_at":"2026-08-06T15:14:30.947024Z"},"links":{"cited_paper":"/paper/1712.05884","citing_paper":"/paper/2507.16875"},"observation_digest":"sha256:0a12a342a2358ea51d7914ede35e4037402715119b92eec28447b4e2cb6e2533","observation_id":"3eee1f02-b148-45ec-823e-ce31c42c0ba5","resolution":{"observed_at":"2026-08-06T15:14:30.947024Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:14:32.911640Z","title":"Shih, Rafael Valle, Rohan Badlani, Adrian Lancucki, Wei Ping, and Bryan Catanzaro","venue":null,"work_id":"72ca9a22-44d9-4235-b01e-1348d2cd687f","year":2021},"citing_paper":{"arxiv_id":"2507.16875","last_updated":"2025-07-22T09:38:30Z","snapshot_observed_at":"2026-08-07T22:00:26.714703Z","submitted_at":"2025-07-22T09:38:30Z","title":"Technical report: Impact of Duration Prediction on Speaker-specific TTS for Indian Languages","version":1},"reference_index":32,"source":"arxiv_source","source_observed_at":"2026-08-06T15:14:31.001141Z"},"links":{"citing_paper":"/paper/2507.16875"},"observation_digest":"sha256:2f9af9349eb6019cb5011e2d171486e5932922e4d14da19c141e6236605b3abf","observation_id":"07d178d3-7e4d-4005-ab9c-6371c1de726a","resolution":{"observed_at":"2026-08-06T15:14:32.995561Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2104.09864","last_updated":"2023-11-08T13:36:32Z","snapshot_observed_at":"2026-07-06T11:01:58.137141Z","submitted_at":"2021-04-20T09:54:06Z","title":"RoFormer: Enhanced Transformer with Rotary Position Embedding","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2104.09864","snapshot_observed_at":"2026-08-06T15:14:31.084431Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.16875","last_updated":"2025-07-22T09:38:30Z","snapshot_observed_at":"2026-08-07T22:00:26.714703Z","submitted_at":"2025-07-22T09:38:30Z","title":"Technical report: Impact of Duration Prediction on Speaker-specific TTS for Indian Languages","version":1},"reference_index":33,"source":"arxiv_source","source_observed_at":"2026-08-06T15:14:31.084431Z"},"links":{"cited_paper":"/paper/2104.09864","citing_paper":"/paper/2507.16875"},"observation_digest":"sha256:00010083a083f00a90b07a16f89ed08140dd1f92dbfe774a7c0cb136d08f7b98","observation_id":"c6d4ee7c-67c7-4b0c-a61a-e255d614d34d","resolution":{"observed_at":"2026-08-06T15:14:31.084431Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2205.04421","last_updated":"2022-05-10T15:25:20Z","snapshot_observed_at":"2026-07-06T13:08:11.000809Z","submitted_at":"2022-05-09T16:57:35Z","title":"NaturalSpeech: End-to-End Text to Speech Synthesis with Human-Level Quality","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2205.04421","snapshot_observed_at":"2026-08-06T15:14:31.231631Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2507.16875","last_updated":"2025-07-22T09:38:30Z","snapshot_observed_at":"2026-08-07T22:00:26.714703Z","submitted_at":"2025-07-22T09:38:30Z","title":"Technical report: Impact of Duration Prediction on Speaker-specific TTS for Indian Languages","version":1},"reference_index":34,"source":"arxiv_source","source_observed_at":"2026-08-06T15:14:31.231631Z"},"links":{"cited_paper":"/paper/2205.04421","citing_paper":"/paper/2507.16875"},"observation_digest":"sha256:0b7a711b15f5364937350edfa64c4760b0395bce1bdca796107ec07a8ae8309e","observation_id":"9159994c-8716-48fc-88c7-28012bea8ee2","resolution":{"observed_at":"2026-08-06T15:14:31.231631Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:14:32.682036Z","title":null,"venue":null,"work_id":"da5cc12b-717e-46f9-b7c4-ff85e240eb7d","year":2025},"citing_paper":{"arxiv_id":"2507.16875","last_updated":"2025-07-22T09:38:30Z","snapshot_observed_at":"2026-08-07T22:00:26.714703Z","submitted_at":"2025-07-22T09:38:30Z","title":"Technical report: Impact of Duration Prediction on Speaker-specific TTS for Indian Languages","version":1},"reference_index":35,"source":"arxiv_source","source_observed_at":"2026-08-06T15:14:31.284147Z"},"links":{"citing_paper":"/paper/2507.16875"},"observation_digest":"sha256:4ec6b17522a5c8f6c2e2198f103a0165fbb61efdc39806fbed147e10f2a28670","observation_id":"8206b7f7-ae58-4a33-8f73-0f73277eff22","resolution":{"observed_at":"2026-08-06T15:14:32.772004Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1609.03499","last_updated":"2016-09-19T18:04:35Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2016-09-12T17:29:40Z","title":"WaveNet: A Generative Model for Raw Audio","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1609.03499","snapshot_observed_at":"2026-08-06T15:14:31.321308Z","title":null,"venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2507.16875","last_updated":"2025-07-22T09:38:30Z","snapshot_observed_at":"2026-08-07T22:00:26.714703Z","submitted_at":"2025-07-22T09:38:30Z","title":"Technical report: Impact of Duration Prediction on Speaker-specific TTS for Indian Languages","version":1},"reference_index":36,"source":"arxiv_source","source_observed_at":"2026-08-06T15:14:31.321308Z"},"links":{"cited_paper":"/paper/1609.03499","citing_paper":"/paper/2507.16875"},"observation_digest":"sha256:719b6500cc29a3ed496a8c8a2f55053c2ee43555daa8200cde86f60fde63cb92","observation_id":"830c4312-e079-43fb-9f64-424885b3efe7","resolution":{"observed_at":"2026-08-06T15:14:31.321308Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1706.03762","last_updated":"2023-08-02T00:41:18Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2017-06-12T17:57:34Z","title":"Attention Is All You Need","version":7},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1706.03762","snapshot_observed_at":"2026-08-06T15:14:31.387276Z","title":"Gomez, Lukasz Kaiser, and Illia Polosukhin","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.16875","last_updated":"2025-07-22T09:38:30Z","snapshot_observed_at":"2026-08-07T22:00:26.714703Z","submitted_at":"2025-07-22T09:38:30Z","title":"Technical report: Impact of Duration Prediction on Speaker-specific TTS for Indian Languages","version":1},"reference_index":37,"source":"arxiv_source","source_observed_at":"2026-08-06T15:14:31.387276Z"},"links":{"cited_paper":"/paper/1706.03762","citing_paper":"/paper/2507.16875"},"observation_digest":"sha256:dbb7fd2661683022137dd641253bb2ea3738db02fb216895db61773b2f09026d","observation_id":"30737b08-bc54-40b5-94e2-c69128a91585","resolution":{"observed_at":"2026-08-06T15:14:31.387276Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2301.02111","last_updated":"2023-01-05T15:37:15Z","snapshot_observed_at":"2026-08-07T10:11:17.796562Z","submitted_at":"2023-01-05T15:37:15Z","title":"Neural Codec Language Models are Zero-Shot Text to Speech Synthesizers","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2301.02111","snapshot_observed_at":"2026-08-06T15:14:31.452735Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.16875","last_updated":"2025-07-22T09:38:30Z","snapshot_observed_at":"2026-08-07T22:00:26.714703Z","submitted_at":"2025-07-22T09:38:30Z","title":"Technical report: Impact of Duration Prediction on Speaker-specific TTS for Indian Languages","version":1},"reference_index":38,"source":"arxiv_source","source_observed_at":"2026-08-06T15:14:31.452735Z"},"links":{"cited_paper":"/paper/2301.02111","citing_paper":"/paper/2507.16875"},"observation_digest":"sha256:c0926f01f74f1067ae45db75505b64eb5a49c093ce231e84fde9fe682ca7847d","observation_id":"f0760b92-4652-409b-8b16-d7a37068a120","resolution":{"observed_at":"2026-08-06T15:14:31.452735Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1803.09017","last_updated":"2018-03-23T23:56:49Z","snapshot_observed_at":"2026-07-06T06:29:57.506159Z","submitted_at":"2018-03-23T23:56:49Z","title":"Style Tokens: Unsupervised Style Modeling, Control and Transfer in End-to-End Speech Synthesis","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1803.09017","snapshot_observed_at":"2026-08-06T15:14:31.491408Z","title":null,"venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2507.16875","last_updated":"2025-07-22T09:38:30Z","snapshot_observed_at":"2026-08-07T22:00:26.714703Z","submitted_at":"2025-07-22T09:38:30Z","title":"Technical report: Impact of Duration Prediction on Speaker-specific TTS for Indian Languages","version":1},"reference_index":39,"source":"arxiv_source","source_observed_at":"2026-08-06T15:14:31.491408Z"},"links":{"cited_paper":"/paper/1803.09017","citing_paper":"/paper/2507.16875"},"observation_digest":"sha256:9d5ac505deb7efc59e49121b762b9d91865858ae35ff21b99924f46d6778c8c4","observation_id":"b439e1d8-a09d-4530-82b3-6062dc1a6caf","resolution":{"observed_at":"2026-08-06T15:14:31.491408Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1910.07467","last_updated":"2019-10-16T16:44:22Z","snapshot_observed_at":"2026-08-08T08:22:25.110228Z","submitted_at":"2019-10-16T16:44:22Z","title":"Root Mean Square Layer Normalization","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1910.07467","snapshot_observed_at":"2026-08-06T15:14:31.528872Z","title":null,"venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2507.16875","last_updated":"2025-07-22T09:38:30Z","snapshot_observed_at":"2026-08-07T22:00:26.714703Z","submitted_at":"2025-07-22T09:38:30Z","title":"Technical report: Impact of Duration Prediction on Speaker-specific TTS for Indian Languages","version":1},"reference_index":40,"source":"arxiv_source","source_observed_at":"2026-08-06T15:14:31.528872Z"},"links":{"cited_paper":"/paper/1910.07467","citing_paper":"/paper/2507.16875"},"observation_digest":"sha256:8b2ddf68bfe0276005abedad081f34efca3cd1c8a5917b5fd84d4dd718652655","observation_id":"c0d9e11f-ccaa-4d7e-a440-31147ca3c488","resolution":{"observed_at":"2026-08-06T15:14:31.528872Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2507.16875","last_updated":"2025-07-22T09:38:30Z","latest_version":1,"primary_category":"eess.AS","snapshot_observed_at":"2026-08-07T22:00:26.714703Z","submitted_at":"2025-07-22T09:38:30Z","title":"Technical report: Impact of Duration Prediction on Speaker-specific TTS for Indian Languages"},"reference_resolution":{"displayed":40,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":34,"verified_exact":4,"verified_fuzzy":2},"total_outbound_references":40},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"thesis":"As of 10 August 2026, this Paper Citation Record lists 40 of 40 outbound references and 0 inbound Pith citation observations for arXiv:2507.16875."}