{"as_of":"2026-08-10T15:58:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:07bdeaafd01b4cf2c529cb9ed1cf588e4965a2a18ee18eff82f1695a8e55286e","coverage":[{"denominator":28,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":28,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T14:32:43.738977Z","state":"measured"},{"denominator":29,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":29,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-10T06:31:04.303077+00:00","state":"measured"},{"denominator":1,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":1,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T14:32:41.840891Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"pith","source_observed_at":"2026-08-07T14:32:44.018538Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2505.18609","last_updated":"2025-05-27T14:19:23Z","snapshot_observed_at":"2026-08-08T01:17:21.397743Z","submitted_at":"2025-05-24T09:16:14Z","title":"RASMALAI: Resources for Adaptive Speech Modeling in Indian Languages with Accents and Intonations","version":2},"cited_work":{"arxiv_id":"2505.18609","doi":null,"metadata_source":"pith","pith_arxiv_id":"2505.18609","snapshot_observed_at":"2026-08-07T14:32:44.018538Z","title":"RASMALAI: Resources for Adaptive Speech Modeling in Indian Languages with Accents and Intonations","venue":"cs.CL","work_id":"225f7edd-ec0b-4329-b783-3e24dea38c62","year":2025},"citing_paper":{"arxiv_id":"2505.18609","last_updated":"2025-05-27T14:19:23Z","snapshot_observed_at":"2026-08-08T01:17:21.397743Z","submitted_at":"2025-05-24T09:16:14Z","title":"RASMALAI: Resources for Adaptive Speech Modeling in Indian Languages with Accents and Intonations","version":2},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-07T14:32:41.840891Z"},"links":{"cited_paper":"/paper/2505.18609","citing_paper":"/paper/2505.18609"},"observation_digest":"sha256:07ca3dd578fb3103e146844b97d75aefe2040100470194fd938a7e9d116dc354","observation_id":"8cf1aa0e-162e-457e-83ea-1ca45bf64861","resolution":{"observed_at":"2026-08-07T14:32:44.121993Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2505.18609/citation-record","integrity":"/paper/2505.18609/integrity","json":"/paper/2505.18609/citation-record.json","paper":"/paper/2505.18609"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2505.18609","last_updated":"2025-05-27T14:19:23Z","snapshot_observed_at":"2026-08-08T01:17:21.397743Z","submitted_at":"2025-05-24T09:16:14Z","title":"RASMALAI: Resources for Adaptive Speech Modeling in Indian Languages with Accents and Intonations","version":2},"cited_work":{"arxiv_id":"2505.18609","doi":null,"metadata_source":"pith","pith_arxiv_id":"2505.18609","snapshot_observed_at":"2026-08-07T14:32:44.018538Z","title":"RASMALAI: Resources for Adaptive Speech Modeling in Indian Languages with Accents and Intonations","venue":"cs.CL","work_id":"225f7edd-ec0b-4329-b783-3e24dea38c62","year":2025},"citing_paper":{"arxiv_id":"2505.18609","last_updated":"2025-05-27T14:19:23Z","snapshot_observed_at":"2026-08-08T01:17:21.397743Z","submitted_at":"2025-05-24T09:16:14Z","title":"RASMALAI: Resources for Adaptive Speech Modeling in Indian Languages with Accents and Intonations","version":2},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-07T14:32:41.840891Z"},"links":{"cited_paper":"/paper/2505.18609","citing_paper":"/paper/2505.18609"},"observation_digest":"sha256:07ca3dd578fb3103e146844b97d75aefe2040100470194fd938a7e9d116dc354","observation_id":"8cf1aa0e-162e-457e-83ea-1ca45bf64861","resolution":{"observed_at":"2026-08-07T14:32:44.121993Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:32:47.447302Z","title":null,"venue":null,"work_id":"201cac7b-14e9-4070-822b-35069f8ebca6","year":null},"citing_paper":{"arxiv_id":"2505.18609","last_updated":"2025-05-27T14:19:23Z","snapshot_observed_at":"2026-08-08T01:17:21.397743Z","submitted_at":"2025-05-24T09:16:14Z","title":"RASMALAI: Resources for Adaptive Speech Modeling in Indian Languages with Accents and Intonations","version":2},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-07T14:32:41.888236Z"},"links":{"citing_paper":"/paper/2505.18609"},"observation_digest":"sha256:76dd1fbd6255c0ea7bb71a066956810588c65033835cba5c914785340cd2e215","observation_id":"4d513c77-1664-450e-a09f-0da9ccbafac8","resolution":{"observed_at":"2026-08-07T14:32:47.504408Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:32:47.340257Z","title":null,"venue":null,"work_id":"801c41a1-f32b-4129-a371-e4d1f21911cf","year":null},"citing_paper":{"arxiv_id":"2505.18609","last_updated":"2025-05-27T14:19:23Z","snapshot_observed_at":"2026-08-08T01:17:21.397743Z","submitted_at":"2025-05-24T09:16:14Z","title":"RASMALAI: Resources for Adaptive Speech Modeling in Indian Languages with Accents and Intonations","version":2},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-07T14:32:41.979105Z"},"links":{"citing_paper":"/paper/2505.18609"},"observation_digest":"sha256:54626fe76f40449e3c44620bf8a6f5c0ee8df7f9e8be95241d3fdc7efcfb30c2","observation_id":"d87950c6-67d8-4636-9532-3dfebc8ab665","resolution":{"observed_at":"2026-08-07T14:32:47.371914Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:32:47.262746Z","title":null,"venue":null,"work_id":"f13a5da6-e0e1-4ce1-a262-28f671557724","year":null},"citing_paper":{"arxiv_id":"2505.18609","last_updated":"2025-05-27T14:19:23Z","snapshot_observed_at":"2026-08-08T01:17:21.397743Z","submitted_at":"2025-05-24T09:16:14Z","title":"RASMALAI: Resources for Adaptive Speech Modeling in Indian Languages with Accents and Intonations","version":2},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-07T14:32:42.069675Z"},"links":{"citing_paper":"/paper/2505.18609"},"observation_digest":"sha256:f05651ad7a74efb3b2ad8a6c81a2e1d0ebd497f7f280d5f53985455f467eeb99","observation_id":"35e84f5c-3cad-4641-b061-87c4f3a15576","resolution":{"observed_at":"2026-08-07T14:32:47.297529Z","resolver_source":"raw_fallback","status":"malformed_identifier"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:32:47.069543Z","title":"However, most efforts are limited to English [5, 7], and cover only a narrow set of attributes with restricted domain diversity","venue":null,"work_id":"dd85360f-e59b-48ed-a50b-f821b349663b","year":null},"citing_paper":{"arxiv_id":"2505.18609","last_updated":"2025-05-27T14:19:23Z","snapshot_observed_at":"2026-08-08T01:17:21.397743Z","submitted_at":"2025-05-24T09:16:14Z","title":"RASMALAI: Resources for Adaptive Speech Modeling in Indian Languages with Accents and Intonations","version":2},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-07T14:32:42.124552Z"},"links":{"citing_paper":"/paper/2505.18609"},"observation_digest":"sha256:4de8de079b4ea68dfe1a9fb19b0b67bd13ee877d2b91d68288a64845780017fa","observation_id":"880fc2da-fb20-43d1-a144-09077396b9d0","resolution":{"observed_at":"2026-08-07T14:32:47.186295Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:32:46.828811Z","title":"Using this dataset, we train INDIC PARLER TTS, the first multilingual text- prompted TTS system for Indic languages","venue":null,"work_id":"9af6fb68-d758-4772-a0fc-2cec0662ce75","year":null},"citing_paper":{"arxiv_id":"2505.18609","last_updated":"2025-05-27T14:19:23Z","snapshot_observed_at":"2026-08-08T01:17:21.397743Z","submitted_at":"2025-05-24T09:16:14Z","title":"RASMALAI: Resources for Adaptive Speech Modeling in Indian Languages with Accents and Intonations","version":2},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-07T14:32:42.151621Z"},"links":{"citing_paper":"/paper/2505.18609"},"observation_digest":"sha256:4b74fd1d478ac0730363b5d5c0d4505d078ec2ccf5900d6595a9a99941f3b329","observation_id":"581551b6-64d2-45ba-af5e-6d3079369fe7","resolution":{"observed_at":"2026-08-07T14:32:46.943469Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:32:42.196374Z","title":"V oicecraft: Zero-shot speech editing and text-to-speech in the wild,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.18609","last_updated":"2025-05-27T14:19:23Z","snapshot_observed_at":"2026-08-08T01:17:21.397743Z","submitted_at":"2025-05-24T09:16:14Z","title":"RASMALAI: Resources for Adaptive Speech Modeling in Indian Languages with Accents and Intonations","version":2},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-07T14:32:42.196374Z"},"links":{"citing_paper":"/paper/2505.18609"},"observation_digest":"sha256:fc80e6f88133140a8c8223faa93cbef5e7c8bfcb9ba586c120dafa87bfc7e8a8","observation_id":"6e503723-8332-4277-bf76-fb14c28dde2c","resolution":{"observed_at":"2026-08-07T14:32:42.196374Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:32:46.609630Z","title":"StyleTTS 2: Towards human-level text-to-speech through style diffusion and adversarial training with large speech language models,","venue":null,"work_id":"15c5e2ed-97ce-4f73-a4f8-52d5a313f99c","year":2023},"citing_paper":{"arxiv_id":"2505.18609","last_updated":"2025-05-27T14:19:23Z","snapshot_observed_at":"2026-08-08T01:17:21.397743Z","submitted_at":"2025-05-24T09:16:14Z","title":"RASMALAI: Resources for Adaptive Speech Modeling in Indian Languages with Accents and Intonations","version":2},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-07T14:32:42.269178Z"},"links":{"citing_paper":"/paper/2505.18609"},"observation_digest":"sha256:cf757ddd8f39d72462d0b5c255f896382d55d3524a07d2ccffd242750025f035","observation_id":"5415cfa3-a33a-492d-83fa-e8be6c55953d","resolution":{"observed_at":"2026-08-07T14:32:46.730365Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:32:46.424681Z","title":"Naturalspeech 3: Zero-shot speech synthesis with factorized codec and diffusion models,","venue":null,"work_id":"8ccd1902-226d-4628-9f65-4c0dd8878110","year":2024},"citing_paper":{"arxiv_id":"2505.18609","last_updated":"2025-05-27T14:19:23Z","snapshot_observed_at":"2026-08-08T01:17:21.397743Z","submitted_at":"2025-05-24T09:16:14Z","title":"RASMALAI: Resources for Adaptive Speech Modeling in Indian Languages with Accents and Intonations","version":2},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-07T14:32:42.365994Z"},"links":{"citing_paper":"/paper/2505.18609"},"observation_digest":"sha256:abb0f70ed5fbacaf49d21069316f2e3fbb99a59da93d427b9212bfee2687816a","observation_id":"2ed43d88-b79f-43cc-a08f-d8f58686a9ce","resolution":{"observed_at":"2026-08-07T14:32:46.513070Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.18009","last_updated":"2024-09-12T17:45:37Z","snapshot_observed_at":"2026-08-04T03:12:21.293095Z","submitted_at":"2024-06-26T01:38:37Z","title":"E2 TTS: Embarrassingly Easy Fully Non-Autoregressive Zero-Shot TTS","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.18009","snapshot_observed_at":"2026-08-07T14:32:42.436102Z","title":"E2 TTS: embarrassingly easy fully non-autoregressive zero-shot TTS,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.18609","last_updated":"2025-05-27T14:19:23Z","snapshot_observed_at":"2026-08-08T01:17:21.397743Z","submitted_at":"2025-05-24T09:16:14Z","title":"RASMALAI: Resources for Adaptive Speech Modeling in Indian Languages with Accents and Intonations","version":2},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-07T14:32:42.436102Z"},"links":{"cited_paper":"/paper/2406.18009","citing_paper":"/paper/2505.18609"},"observation_digest":"sha256:6c4963992ab7b066a0f6310dc96055552757c8ed1d9e47f8fdb1f3b8c65c282f","observation_id":"459caa60-3a6d-49c9-8acb-b7b8450965e5","resolution":{"observed_at":"2026-08-07T14:32:42.436102Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:32:46.225337Z","title":"PromptTTS 2: Describing and generating voices with text prompt,","venue":null,"work_id":"ddd72712-bcd2-4aea-a33c-6e2289d95b4b","year":2024},"citing_paper":{"arxiv_id":"2505.18609","last_updated":"2025-05-27T14:19:23Z","snapshot_observed_at":"2026-08-08T01:17:21.397743Z","submitted_at":"2025-05-24T09:16:14Z","title":"RASMALAI: Resources for Adaptive Speech Modeling in Indian Languages with Accents and Intonations","version":2},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-07T14:32:42.557744Z"},"links":{"citing_paper":"/paper/2505.18609"},"observation_digest":"sha256:8e75b1d4f309e1df89efa8c363662d9872a3890b954b234e01c21f2ba0b0b1e4","observation_id":"3d060bf0-7f2c-472f-af45-4a81fc4d3757","resolution":{"observed_at":"2026-08-07T14:32:46.320095Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2312.15821","last_updated":"2023-12-25T22:24:49Z","snapshot_observed_at":"2026-08-05T03:40:24.447729Z","submitted_at":"2023-12-25T22:24:49Z","title":"Audiobox: Unified Audio Generation with Natural Language Prompts","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.15821","snapshot_observed_at":"2026-08-07T14:32:42.653144Z","title":"Audiobox: Unified audio generation with natural language prompts,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.18609","last_updated":"2025-05-27T14:19:23Z","snapshot_observed_at":"2026-08-08T01:17:21.397743Z","submitted_at":"2025-05-24T09:16:14Z","title":"RASMALAI: Resources for Adaptive Speech Modeling in Indian Languages with Accents and Intonations","version":2},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-07T14:32:42.653144Z"},"links":{"cited_paper":"/paper/2312.15821","citing_paper":"/paper/2505.18609"},"observation_digest":"sha256:e8b47510e721da8210cee9d7637a34cfb32f943384ed6365af7e3f60c22cb189","observation_id":"9ae32be0-7d26-4b9d-b5f7-32d78822003b","resolution":{"observed_at":"2026-08-07T14:32:42.653144Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:32:46.003230Z","title":"Libritts-p: A corpus with speaking style and speaker identity prompts for text-to-speech and style captioning,","venue":null,"work_id":"1b5d8678-5f9f-4ea3-9e05-b4820b748960","year":2024},"citing_paper":{"arxiv_id":"2505.18609","last_updated":"2025-05-27T14:19:23Z","snapshot_observed_at":"2026-08-08T01:17:21.397743Z","submitted_at":"2025-05-24T09:16:14Z","title":"RASMALAI: Resources for Adaptive Speech Modeling in Indian Languages with Accents and Intonations","version":2},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-07T14:32:42.750303Z"},"links":{"citing_paper":"/paper/2505.18609"},"observation_digest":"sha256:9155f52c22c82aeb8d392d164306c204b66c46e7dd28abbdc2950deeeded74bc","observation_id":"551856cb-24ca-4b93-a61a-240aff2c7b0b","resolution":{"observed_at":"2026-08-07T14:32:46.101700Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.01912","last_updated":"2024-02-02T21:29:34Z","snapshot_observed_at":"2026-08-10T02:15:41.685360Z","submitted_at":"2024-02-02T21:29:34Z","title":"Natural language guidance of high-fidelity text-to-speech with synthetic annotations","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.01912","snapshot_observed_at":"2026-08-07T14:32:42.812459Z","title":"Natural language guidance of high- fidelity text-to-speech with synthetic annotations,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.18609","last_updated":"2025-05-27T14:19:23Z","snapshot_observed_at":"2026-08-08T01:17:21.397743Z","submitted_at":"2025-05-24T09:16:14Z","title":"RASMALAI: Resources for Adaptive Speech Modeling in Indian Languages with Accents and Intonations","version":2},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-07T14:32:42.812459Z"},"links":{"cited_paper":"/paper/2402.01912","citing_paper":"/paper/2505.18609"},"observation_digest":"sha256:05c023a9967bfa1d1bc9c2367ec871704a227c6acd01208be09609cff26410df","observation_id":"db7c9d04-f6fa-4db1-9bc1-def38a7a896a","resolution":{"observed_at":"2026-08-07T14:32:42.812459Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:32:45.884870Z","title":"Mega-TTS 2: Boosting prompting mechanisms for zero-shot speech synthesis,","venue":null,"work_id":"f0f889e9-684b-45ab-9fab-d70ee4893509","year":2024},"citing_paper":{"arxiv_id":"2505.18609","last_updated":"2025-05-27T14:19:23Z","snapshot_observed_at":"2026-08-08T01:17:21.397743Z","submitted_at":"2025-05-24T09:16:14Z","title":"RASMALAI: Resources for Adaptive Speech Modeling in Indian Languages with Accents and Intonations","version":2},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-07T14:32:42.841571Z"},"links":{"citing_paper":"/paper/2505.18609"},"observation_digest":"sha256:b24cb523f3d81b9a123fcc37f59ce48b38de7bcd84ec74e372c99fea218b2fd5","observation_id":"05020229-e774-44e2-a699-1ea51650d1b8","resolution":{"observed_at":"2026-08-07T14:32:45.942318Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:32:45.759318Z","title":"Re- sources for indian languages,","venue":null,"work_id":"b87a8d28-fc6d-4948-823f-d6902f3eb179","year":2016},"citing_paper":{"arxiv_id":"2505.18609","last_updated":"2025-05-27T14:19:23Z","snapshot_observed_at":"2026-08-08T01:17:21.397743Z","submitted_at":"2025-05-24T09:16:14Z","title":"RASMALAI: Resources for Adaptive Speech Modeling in Indian Languages with Accents and Intonations","version":2},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-07T14:32:42.878386Z"},"links":{"citing_paper":"/paper/2505.18609"},"observation_digest":"sha256:b9dcc8594275021f0d517242d041843c409d73290d39527fa871f6becfca4f1e","observation_id":"1d72f021-2d4d-421d-a12a-81283a79ab4e","resolution":{"observed_at":"2026-08-07T14:32:45.808175Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:32:45.642697Z","title":"Rasa: Building expressive speech synthesis systems for indian languages in low-resource settings,","venue":null,"work_id":"f989ce18-f352-4943-ae04-49daba9ae9c7","year":2024},"citing_paper":{"arxiv_id":"2505.18609","last_updated":"2025-05-27T14:19:23Z","snapshot_observed_at":"2026-08-08T01:17:21.397743Z","submitted_at":"2025-05-24T09:16:14Z","title":"RASMALAI: Resources for Adaptive Speech Modeling in Indian Languages with Accents and Intonations","version":2},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-07T14:32:42.926006Z"},"links":{"citing_paper":"/paper/2505.18609"},"observation_digest":"sha256:830e5a2fd5397d25b0875215234e15e03071e8774767adf7c80ee92f65a4368c","observation_id":"a137d4d7-eb59-4c57-a223-b439803a657c","resolution":{"observed_at":"2026-08-07T14:32:45.697316Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:32:42.991403Z","title":"Limmits’24: Multi- speaker, multi-lingual indic tts with voice cloning,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.18609","last_updated":"2025-05-27T14:19:23Z","snapshot_observed_at":"2026-08-08T01:17:21.397743Z","submitted_at":"2025-05-24T09:16:14Z","title":"RASMALAI: Resources for Adaptive Speech Modeling in Indian Languages with Accents and Intonations","version":2},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-07T14:32:42.991403Z"},"links":{"citing_paper":"/paper/2505.18609"},"observation_digest":"sha256:49d62f2612377e098fd3475f5a0fbda5ae946aa2e32f44053a507ce9c8002c25","observation_id":"3d7e376e-7d3b-4d9a-8931-012e9d37a9b5","resolution":{"observed_at":"2026-08-07T14:32:42.991403Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:32:45.438706Z","title":"Indicvoices-r: Unlocking a massive multilingual multi-speaker speech corpus for scaling indian TTS,","venue":null,"work_id":"4ad77606-602c-47d4-a7c4-81fb4d5228ce","year":2024},"citing_paper":{"arxiv_id":"2505.18609","last_updated":"2025-05-27T14:19:23Z","snapshot_observed_at":"2026-08-08T01:17:21.397743Z","submitted_at":"2025-05-24T09:16:14Z","title":"RASMALAI: Resources for Adaptive Speech Modeling in Indian Languages with Accents and Intonations","version":2},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-07T14:32:43.063641Z"},"links":{"citing_paper":"/paper/2505.18609"},"observation_digest":"sha256:0a63f310271f12e573265b78e1faa705e7cb9a2b2ff1ae7c7a0fb77614781818","observation_id":"84eef546-850b-47ed-b85d-69a24e54e825","resolution":{"observed_at":"2026-08-07T14:32:45.540559Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2301.12258","last_updated":"2024-08-12T03:23:09Z","snapshot_observed_at":"2026-08-01T14:42:12.372500Z","submitted_at":"2023-01-28T17:30:47Z","title":"Cross-domain Neural Pitch and Periodicity Estimation","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2301.12258","snapshot_observed_at":"2026-08-07T14:32:43.093298Z","title":"Cross- domain neural pitch and periodicity estimation,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.18609","last_updated":"2025-05-27T14:19:23Z","snapshot_observed_at":"2026-08-08T01:17:21.397743Z","submitted_at":"2025-05-24T09:16:14Z","title":"RASMALAI: Resources for Adaptive Speech Modeling in Indian Languages with Accents and Intonations","version":2},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-07T14:32:43.093298Z"},"links":{"cited_paper":"/paper/2301.12258","citing_paper":"/paper/2505.18609"},"observation_digest":"sha256:ba7869aa6eaa431bdbb0e2bc14e47323348b702be6906aa2e4e59b40b677a475","observation_id":"06a716c9-d672-48dc-8a97-264152d79bba","resolution":{"observed_at":"2026-08-07T14:32:43.093298Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:32:43.134581Z","title":"Brouhaha: multi-task training for voice activity detection, speech-to-noise ratio, and C50 room acoustics estimation,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.18609","last_updated":"2025-05-27T14:19:23Z","snapshot_observed_at":"2026-08-08T01:17:21.397743Z","submitted_at":"2025-05-24T09:16:14Z","title":"RASMALAI: Resources for Adaptive Speech Modeling in Indian Languages with Accents and Intonations","version":2},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-07T14:32:43.134581Z"},"links":{"citing_paper":"/paper/2505.18609"},"observation_digest":"sha256:a61d00f8365d9399e87a8f039b39dfa9f980cea972c426d9ffbea9bdb4af2f62","observation_id":"c0bfc116-4aee-4d78-8832-859f818c9ebb","resolution":{"observed_at":"2026-08-07T14:32:43.134581Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:32:43.208912Z","title":"pyannote.audio: neural building blocks for speaker diarization,","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2505.18609","last_updated":"2025-05-27T14:19:23Z","snapshot_observed_at":"2026-08-08T01:17:21.397743Z","submitted_at":"2025-05-24T09:16:14Z","title":"RASMALAI: Resources for Adaptive Speech Modeling in Indian Languages with Accents and Intonations","version":2},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-07T14:32:43.208912Z"},"links":{"citing_paper":"/paper/2505.18609"},"observation_digest":"sha256:bb73ca42d1379564737cd0a61b263401b2248003603e4c1e4f1635001f401552","observation_id":"8488055b-fe1b-435a-b860-47a55840a15e","resolution":{"observed_at":"2026-08-07T14:32:43.208912Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:32:45.206303Z","title":"Indictrans2: Towards high-quality and accessible machine translation models for all 22 scheduled indian languages,","venue":null,"work_id":"aa875d1a-2a5d-4995-9173-1c763b29615c","year":2023},"citing_paper":{"arxiv_id":"2505.18609","last_updated":"2025-05-27T14:19:23Z","snapshot_observed_at":"2026-08-08T01:17:21.397743Z","submitted_at":"2025-05-24T09:16:14Z","title":"RASMALAI: Resources for Adaptive Speech Modeling in Indian Languages with Accents and Intonations","version":2},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-07T14:32:43.310125Z"},"links":{"citing_paper":"/paper/2505.18609"},"observation_digest":"sha256:26a732ef851ed396b3d673f7cec9b9673d5a7b2a4fd2d08de6653d780457c135","observation_id":"188c9e34-da3b-45f1-964e-7f825d5fb928","resolution":{"observed_at":"2026-08-07T14:32:45.331712Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:32:44.916075Z","title":"IndicVoices: Towards building an inclusive multilingual speech dataset for Indian languages,","venue":null,"work_id":"ffa731c3-6b9c-4992-ba12-a0ebd5ed7811","year":2024},"citing_paper":{"arxiv_id":"2505.18609","last_updated":"2025-05-27T14:19:23Z","snapshot_observed_at":"2026-08-08T01:17:21.397743Z","submitted_at":"2025-05-24T09:16:14Z","title":"RASMALAI: Resources for Adaptive Speech Modeling in Indian Languages with Accents and Intonations","version":2},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-07T14:32:43.399540Z"},"links":{"citing_paper":"/paper/2505.18609"},"observation_digest":"sha256:050523c9416ff7261ec206e71ce22fdab7c5f7484f4a174809f8fffb5e8e07b4","observation_id":"236232e1-dcd2-4e97-850d-bfaa69ca8a8f","resolution":{"observed_at":"2026-08-07T14:32:45.043699Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:32:44.673145Z","title":"Globe: A high-quality english corpus with global accents for zero-shot speaker adaptive text-to- speech,","venue":null,"work_id":"77cdaf14-d31d-411a-8759-283ccba5122d","year":2024},"citing_paper":{"arxiv_id":"2505.18609","last_updated":"2025-05-27T14:19:23Z","snapshot_observed_at":"2026-08-08T01:17:21.397743Z","submitted_at":"2025-05-24T09:16:14Z","title":"RASMALAI: Resources for Adaptive Speech Modeling in Indian Languages with Accents and Intonations","version":2},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-07T14:32:43.480464Z"},"links":{"citing_paper":"/paper/2505.18609"},"observation_digest":"sha256:e2c2f910836ae06e99297717c37575c5262923cd00011a122658597d88b4a570","observation_id":"0729c809-fe5e-42c7-bf75-a98738a33e85","resolution":{"observed_at":"2026-08-07T14:32:44.766182Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:32:44.466479Z","title":"An empirical comparison of vocabulary expansion and initialization approaches for language models,","venue":null,"work_id":"40f4e86d-45fb-4782-8f1e-605a57016b44","year":2024},"citing_paper":{"arxiv_id":"2505.18609","last_updated":"2025-05-27T14:19:23Z","snapshot_observed_at":"2026-08-08T01:17:21.397743Z","submitted_at":"2025-05-24T09:16:14Z","title":"RASMALAI: Resources for Adaptive Speech Modeling in Indian Languages with Accents and Intonations","version":2},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-07T14:32:43.578891Z"},"links":{"citing_paper":"/paper/2505.18609"},"observation_digest":"sha256:cc4d1b5bdac4011831d220b27f5c64e2b1b738949453c14bf567cd60ae062a0c","observation_id":"a1eb8a19-3fe1-43fe-b4fb-1d0686ac1a56","resolution":{"observed_at":"2026-08-07T14:32:44.553870Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:32:43.666981Z","title":"Stateful conformer with cache-based inference for streaming automatic speech recognition,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.18609","last_updated":"2025-05-27T14:19:23Z","snapshot_observed_at":"2026-08-08T01:17:21.397743Z","submitted_at":"2025-05-24T09:16:14Z","title":"RASMALAI: Resources for Adaptive Speech Modeling in Indian Languages with Accents and Intonations","version":2},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-07T14:32:43.666981Z"},"links":{"citing_paper":"/paper/2505.18609"},"observation_digest":"sha256:4804f3655591d90838a2d96ecc97984af904a79f8d011ff1b2d5d7afb316b636","observation_id":"07cb4ff0-cd1f-4dbe-be03-abae14336a83","resolution":{"observed_at":"2026-08-07T14:32:43.666981Z","resolver_source":null,"status":"malformed_identifier"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:32:44.221280Z","title":"Speech quality assessment through mos using non-matching references,","venue":null,"work_id":"72751c31-009a-45f3-be5d-4bf6bd348440","year":2022},"citing_paper":{"arxiv_id":"2505.18609","last_updated":"2025-05-27T14:19:23Z","snapshot_observed_at":"2026-08-08T01:17:21.397743Z","submitted_at":"2025-05-24T09:16:14Z","title":"RASMALAI: Resources for Adaptive Speech Modeling in Indian Languages with Accents and Intonations","version":2},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-07T14:32:43.738977Z"},"links":{"citing_paper":"/paper/2505.18609"},"observation_digest":"sha256:243fb0385d4bf2c5a99624bcf0cc15d808bbe73d546bd25374024ee04a2b70d2","observation_id":"6da1a7e8-9c5f-40ae-b117-c117ffbb2e34","resolution":{"observed_at":"2026-08-07T14:32:44.336435Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2505.18609","last_updated":"2025-05-27T14:19:23Z","latest_version":2,"primary_category":"cs.CL","snapshot_observed_at":"2026-08-08T01:17:21.397743Z","submitted_at":"2025-05-24T09:16:14Z","title":"RASMALAI: Resources for Adaptive Speech Modeling in Indian Languages with Accents and Intonations"},"reference_resolution":{"displayed":28,"state_counts":{"malformed_identifier":2,"metadata_mismatch":1,"parse_uncertain":0,"unresolved":10,"verified_exact":0,"verified_fuzzy":15},"total_outbound_references":28},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"thesis":"As of 10 August 2026, this Paper Citation Record lists 28 of 28 outbound references and 1 inbound Pith citation observation for arXiv:2505.18609."}