{"as_of":"2026-08-09T18:49:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:722ded1e847a8e02596ccb997d7d56717807498f6ce79423b3d513c897f37c28","coverage":[{"denominator":49,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":49,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T10:45:15.786786Z","state":"measured"},{"denominator":50,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":50,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-09T06:31:02.800959+00:00","state":"measured"},{"denominator":1,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":1,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T10:45:15.390168Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"pith","source_observed_at":"2026-08-07T10:45:15.943522Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2506.04527","last_updated":"2025-06-05T00:24:00Z","snapshot_observed_at":"2026-08-07T10:37:41.693621Z","submitted_at":"2025-06-05T00:24:00Z","title":"Grapheme-Coherent Phonemic and Prosodic Annotation of Speech by Implicit and Explicit Grapheme Conditioning","version":1},"cited_work":{"arxiv_id":"2506.04527","doi":null,"metadata_source":"pith","pith_arxiv_id":"2506.04527","snapshot_observed_at":"2026-08-07T10:45:15.943522Z","title":"Grapheme-Coherent Phonemic and Prosodic Annotation of Speech by Implicit and Explicit Grapheme Conditioning","venue":"cs.SD","work_id":"9ea1e1a2-6160-40cd-a1bf-1ca7b0347076","year":2025},"citing_paper":{"arxiv_id":"2506.04527","last_updated":"2025-06-05T00:24:00Z","snapshot_observed_at":"2026-08-07T10:37:41.693621Z","submitted_at":"2025-06-05T00:24:00Z","title":"Grapheme-Coherent Phonemic and Prosodic Annotation of Speech by Implicit and Explicit Grapheme Conditioning","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-07T10:45:15.390168Z"},"links":{"cited_paper":"/paper/2506.04527","citing_paper":"/paper/2506.04527"},"observation_digest":"sha256:4f503af51bc66d480f33bb6d673c59e6e30d27d1921571c5e71130e475230b31","observation_id":"3828ef2d-8103-4827-9723-0e4ff294770b","resolution":{"observed_at":"2026-08-07T10:45:15.953103Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2506.04527/citation-record","integrity":"/paper/2506.04527/integrity","json":"/paper/2506.04527/citation-record.json","paper":"/paper/2506.04527"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:45:16.962205Z","title":"For training high-quality and diverse-styled TTS models, a large amount of text-speech paired data is re- quired [4, 5]","venue":null,"work_id":"3e74e6eb-3de8-497d-b060-1e0cc29c4211","year":null},"citing_paper":{"arxiv_id":"2506.04527","last_updated":"2025-06-05T00:24:00Z","snapshot_observed_at":"2026-08-07T10:37:41.693621Z","submitted_at":"2025-06-05T00:24:00Z","title":"Grapheme-Coherent Phonemic and Prosodic Annotation of Speech by Implicit and Explicit Grapheme Conditioning","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-07T10:45:15.376258Z"},"links":{"citing_paper":"/paper/2506.04527"},"observation_digest":"sha256:11276ceae340db7e0bcea7e0d8872db4739e96893f82a3241e7a021ab37165ae","observation_id":"8d183f01-308a-4a4d-b3a1-f50a73b0244b","resolution":{"observed_at":"2026-08-07T10:45:16.968584Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.04527","last_updated":"2025-06-05T00:24:00Z","snapshot_observed_at":"2026-08-07T10:37:41.693621Z","submitted_at":"2025-06-05T00:24:00Z","title":"Grapheme-Coherent Phonemic and Prosodic Annotation of Speech by Implicit and Explicit Grapheme Conditioning","version":1},"cited_work":{"arxiv_id":"2506.04527","doi":null,"metadata_source":"pith","pith_arxiv_id":"2506.04527","snapshot_observed_at":"2026-08-07T10:45:15.943522Z","title":"Grapheme-Coherent Phonemic and Prosodic Annotation of Speech by Implicit and Explicit Grapheme Conditioning","venue":"cs.SD","work_id":"9ea1e1a2-6160-40cd-a1bf-1ca7b0347076","year":2025},"citing_paper":{"arxiv_id":"2506.04527","last_updated":"2025-06-05T00:24:00Z","snapshot_observed_at":"2026-08-07T10:37:41.693621Z","submitted_at":"2025-06-05T00:24:00Z","title":"Grapheme-Coherent Phonemic and Prosodic Annotation of Speech by Implicit and Explicit Grapheme Conditioning","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-07T10:45:15.390168Z"},"links":{"cited_paper":"/paper/2506.04527","citing_paper":"/paper/2506.04527"},"observation_digest":"sha256:4f503af51bc66d480f33bb6d673c59e6e30d27d1921571c5e71130e475230b31","observation_id":"3828ef2d-8103-4827-9723-0e4ff294770b","resolution":{"observed_at":"2026-08-07T10:45:15.953103Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:45:16.942299Z","title":"<blank>","venue":null,"work_id":"336f19a6-be23-489e-a8c6-cce5702acc9c","year":null},"citing_paper":{"arxiv_id":"2506.04527","last_updated":"2025-06-05T00:24:00Z","snapshot_observed_at":"2026-08-07T10:37:41.693621Z","submitted_at":"2025-06-05T00:24:00Z","title":"Grapheme-Coherent Phonemic and Prosodic Annotation of Speech by Implicit and Explicit Grapheme Conditioning","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-07T10:45:15.397152Z"},"links":{"citing_paper":"/paper/2506.04527"},"observation_digest":"sha256:99651f16c50e8d7424af99cfc9e13d0047681fd57547492b6b2b1ff154ff8690","observation_id":"d83c57ff-e9c2-4051-a2b8-5ffde5a2fcff","resolution":{"observed_at":"2026-08-07T10:45:16.947649Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:45:16.922393Z","title":"Evaluation of proposed annotation model 4.1.1","venue":null,"work_id":"38e1333b-c89a-4e18-a05d-823eb64615d5","year":null},"citing_paper":{"arxiv_id":"2506.04527","last_updated":"2025-06-05T00:24:00Z","snapshot_observed_at":"2026-08-07T10:37:41.693621Z","submitted_at":"2025-06-05T00:24:00Z","title":"Grapheme-Coherent Phonemic and Prosodic Annotation of Speech by Implicit and Explicit Grapheme Conditioning","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-07T10:45:15.408097Z"},"links":{"citing_paper":"/paper/2506.04527"},"observation_digest":"sha256:c1f290c14b139f8db611f69ac01a4d9e9cd57f284694b7aff1e1e11bbfcba5e7","observation_id":"283541ee-6f26-4a93-adb5-f166d39e8b93","resolution":{"observed_at":"2026-08-07T10:45:16.928154Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:45:16.898298Z","title":"Specifically, we utilized the basic5000 subset along with its manually annotated TTS labels1","venue":null,"work_id":"527149c3-33f4-484c-9e2a-10c0c4b4dffe","year":null},"citing_paper":{"arxiv_id":"2506.04527","last_updated":"2025-06-05T00:24:00Z","snapshot_observed_at":"2026-08-07T10:37:41.693621Z","submitted_at":"2025-06-05T00:24:00Z","title":"Grapheme-Coherent Phonemic and Prosodic Annotation of Speech by Implicit and Explicit Grapheme Conditioning","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-07T10:45:15.416347Z"},"links":{"citing_paper":"/paper/2506.04527"},"observation_digest":"sha256:d93e1c947f5845026adda819f589ddb97ee162311d668f298bd44b2470ed0683","observation_id":"dd5fb3c8-6404-4130-b3ef-a50ee30c9db0","resolution":{"observed_at":"2026-08-07T10:45:16.903592Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:45:16.877459Z","title":"”, (2) Accent change from low to high “[","venue":null,"work_id":"d512852b-fc07-4a46-8022-ce06a9d90bf2","year":null},"citing_paper":{"arxiv_id":"2506.04527","last_updated":"2025-06-05T00:24:00Z","snapshot_observed_at":"2026-08-07T10:37:41.693621Z","submitted_at":"2025-06-05T00:24:00Z","title":"Grapheme-Coherent Phonemic and Prosodic Annotation of Speech by Implicit and Explicit Grapheme Conditioning","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-07T10:45:15.422376Z"},"links":{"citing_paper":"/paper/2506.04527"},"observation_digest":"sha256:c1b0d8898e934b78c64d3b114f62fdd32090116196eed968b8a58a6336065384","observation_id":"88bb5455-04e4-464a-b6ce-7b7f26498546","resolution":{"observed_at":"2026-08-07T10:45:16.884422Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:45:16.858145Z","title":"Applying this method to downstream tasks be- yond textual accent estimation is a challenge for future work","venue":null,"work_id":"c02e258d-148c-48b9-b6a7-29987faa75d6","year":null},"citing_paper":{"arxiv_id":"2506.04527","last_updated":"2025-06-05T00:24:00Z","snapshot_observed_at":"2026-08-07T10:37:41.693621Z","submitted_at":"2025-06-05T00:24:00Z","title":"Grapheme-Coherent Phonemic and Prosodic Annotation of Speech by Implicit and Explicit Grapheme Conditioning","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-07T10:45:15.428341Z"},"links":{"citing_paper":"/paper/2506.04527"},"observation_digest":"sha256:85f0c385b5c343eb20a285147bb213332dc3feef695b30534056f839c93777d4","observation_id":"8a7ac17f-3c7a-49fd-b1c8-b4a1f7ba2937","resolution":{"observed_at":"2026-08-07T10:45:16.865438Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:45:16.837097Z","title":"Tacotron: Towards end-to-end speech synthesis,","venue":null,"work_id":"03b4d096-f09d-4101-b759-9dd05912b472","year":2017},"citing_paper":{"arxiv_id":"2506.04527","last_updated":"2025-06-05T00:24:00Z","snapshot_observed_at":"2026-08-07T10:37:41.693621Z","submitted_at":"2025-06-05T00:24:00Z","title":"Grapheme-Coherent Phonemic and Prosodic Annotation of Speech by Implicit and Explicit Grapheme Conditioning","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-07T10:45:15.436595Z"},"links":{"citing_paper":"/paper/2506.04527"},"observation_digest":"sha256:c54d94cad818cceddf94049a4de8f1fe8d41ab265bae091a4b8f7d752e6c361a","observation_id":"471f62fb-b9d2-4ecb-8445-85cff0353220","resolution":{"observed_at":"2026-08-07T10:45:16.843284Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:45:16.813407Z","title":"Fastspeech 2: Fast and high-quality end-to-end text to speech,","venue":null,"work_id":"ffaf3157-0855-4160-82b5-adeedf13b04e","year":2021},"citing_paper":{"arxiv_id":"2506.04527","last_updated":"2025-06-05T00:24:00Z","snapshot_observed_at":"2026-08-07T10:37:41.693621Z","submitted_at":"2025-06-05T00:24:00Z","title":"Grapheme-Coherent Phonemic and Prosodic Annotation of Speech by Implicit and Explicit Grapheme Conditioning","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-07T10:45:15.444523Z"},"links":{"citing_paper":"/paper/2506.04527"},"observation_digest":"sha256:a2cdf6b1fdad6892233ddfa74c72e506e0d20a3fd16391d5ffe63ddab5755f34","observation_id":"0d18b20c-8ab5-4230-87dd-921714906ef3","resolution":{"observed_at":"2026-08-07T10:45:16.820773Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:45:16.794101Z","title":"Conditional variational autoencoder with adversarial learning for end-to-end text-to-speech,","venue":null,"work_id":"757b737d-2ae2-422d-906a-af0a769bcf11","year":2021},"citing_paper":{"arxiv_id":"2506.04527","last_updated":"2025-06-05T00:24:00Z","snapshot_observed_at":"2026-08-07T10:37:41.693621Z","submitted_at":"2025-06-05T00:24:00Z","title":"Grapheme-Coherent Phonemic and Prosodic Annotation of Speech by Implicit and Explicit Grapheme Conditioning","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-07T10:45:15.455133Z"},"links":{"citing_paper":"/paper/2506.04527"},"observation_digest":"sha256:4d9d27411b0ff253e719765c41f23f221801737151e48994e66f4073564796a5","observation_id":"76c0dd0c-e7cd-4f32-8924-f033a51a921c","resolution":{"observed_at":"2026-08-07T10:45:16.800603Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:45:16.775012Z","title":"Naturalspeech 2: Latent diffusion models are natural and zero-shot speech and singing synthesiz- ers,","venue":null,"work_id":"a4cd82a9-49ee-4c02-a637-68a2c4f365f0","year":2024},"citing_paper":{"arxiv_id":"2506.04527","last_updated":"2025-06-05T00:24:00Z","snapshot_observed_at":"2026-08-07T10:37:41.693621Z","submitted_at":"2025-06-05T00:24:00Z","title":"Grapheme-Coherent Phonemic and Prosodic Annotation of Speech by Implicit and Explicit Grapheme Conditioning","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-07T10:45:15.461525Z"},"links":{"citing_paper":"/paper/2506.04527"},"observation_digest":"sha256:584595439212579f14a21103544b500a630a2e197b53c6f46824565f7947105c","observation_id":"30c4032d-9850-4d5d-b62e-ae3728234cc1","resolution":{"observed_at":"2026-08-07T10:45:16.780616Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2306.03509","last_updated":"2023-06-06T08:54:49Z","snapshot_observed_at":"2026-07-06T15:39:06.851333Z","submitted_at":"2023-06-06T08:54:49Z","title":"Mega-TTS: Zero-Shot Text-to-Speech at Scale with Intrinsic Inductive Bias","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.03509","snapshot_observed_at":"2026-08-07T10:45:15.469169Z","title":"Mega-tts: Zero-shot text-to- speech at scale with intrinsic inductive bias,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.04527","last_updated":"2025-06-05T00:24:00Z","snapshot_observed_at":"2026-08-07T10:37:41.693621Z","submitted_at":"2025-06-05T00:24:00Z","title":"Grapheme-Coherent Phonemic and Prosodic Annotation of Speech by Implicit and Explicit Grapheme Conditioning","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-07T10:45:15.469169Z"},"links":{"cited_paper":"/paper/2306.03509","citing_paper":"/paper/2506.04527"},"observation_digest":"sha256:bb04e457163f180b71463001767547f4fc83ccd21da70611857448143d2fac73","observation_id":"b78bc22a-fcd7-4a2c-84c2-66b3954ae4d2","resolution":{"observed_at":"2026-08-07T10:45:15.469169Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:45:16.755251Z","title":"V oicebox: Text-guided multilin- gual universal speech generation at scale,","venue":null,"work_id":"f8ff8018-84c8-4711-8cdd-fabfdaa40a64","year":2023},"citing_paper":{"arxiv_id":"2506.04527","last_updated":"2025-06-05T00:24:00Z","snapshot_observed_at":"2026-08-07T10:37:41.693621Z","submitted_at":"2025-06-05T00:24:00Z","title":"Grapheme-Coherent Phonemic and Prosodic Annotation of Speech by Implicit and Explicit Grapheme Conditioning","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-07T10:45:15.479055Z"},"links":{"citing_paper":"/paper/2506.04527"},"observation_digest":"sha256:21b4a99e8e6379c1206c682987d4050ecf230c3c59fd19c520311ca847183715","observation_id":"f942b0ff-5a44-45d4-8b9d-f6c1fa025cb7","resolution":{"observed_at":"2026-08-07T10:45:16.760835Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:45:16.735300Z","title":"Listening while speaking: Speech chain by deep learning,","venue":null,"work_id":"ae9943cc-d0b6-4be7-97e1-ebc85e306ea6","year":2017},"citing_paper":{"arxiv_id":"2506.04527","last_updated":"2025-06-05T00:24:00Z","snapshot_observed_at":"2026-08-07T10:37:41.693621Z","submitted_at":"2025-06-05T00:24:00Z","title":"Grapheme-Coherent Phonemic and Prosodic Annotation of Speech by Implicit and Explicit Grapheme Conditioning","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-07T10:45:15.515750Z"},"links":{"citing_paper":"/paper/2506.04527"},"observation_digest":"sha256:4731f9858ea96006dea40ca5f3a49e71c99a7fe33a8b67dac3925cb7d0f706e6","observation_id":"bc11e927-d6f0-4d57-8504-d2201b043660","resolution":{"observed_at":"2026-08-07T10:45:16.741415Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:45:16.714790Z","title":"Almost unsupervised text to speech and automatic speech recognition,","venue":null,"work_id":"98feba44-adf3-4322-a3f6-6381a24a7007","year":2019},"citing_paper":{"arxiv_id":"2506.04527","last_updated":"2025-06-05T00:24:00Z","snapshot_observed_at":"2026-08-07T10:37:41.693621Z","submitted_at":"2025-06-05T00:24:00Z","title":"Grapheme-Coherent Phonemic and Prosodic Annotation of Speech by Implicit and Explicit Grapheme Conditioning","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-07T10:45:15.522695Z"},"links":{"citing_paper":"/paper/2506.04527"},"observation_digest":"sha256:43b0489edabc9a60e7530ce04951ffd061ba316199e34c5f6868a64923148047","observation_id":"868b8ddd-ff18-4177-8dfd-146abb81dbe7","resolution":{"observed_at":"2026-08-07T10:45:16.720787Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:45:16.695361Z","title":"Prosodic features con- trol by symbols as input of sequence-to-sequence acoustic mod- eling for neural TTS,","venue":null,"work_id":"5357f408-dd6d-4cd2-a944-ed38caa4def6","year":2021},"citing_paper":{"arxiv_id":"2506.04527","last_updated":"2025-06-05T00:24:00Z","snapshot_observed_at":"2026-08-07T10:37:41.693621Z","submitted_at":"2025-06-05T00:24:00Z","title":"Grapheme-Coherent Phonemic and Prosodic Annotation of Speech by Implicit and Explicit Grapheme Conditioning","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-07T10:45:15.530970Z"},"links":{"citing_paper":"/paper/2506.04527"},"observation_digest":"sha256:55c42ac0271649fbdb32cec62c04900b109841de734e7cd258be8436fc71459e","observation_id":"f8a5af9e-90d8-4ad9-a796-5392a21170be","resolution":{"observed_at":"2026-08-07T10:45:16.701489Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:45:16.672427Z","title":"Investigation of enhanced tacotron text-to-speech synthesis systems with self- attention for pitch accent language,","venue":null,"work_id":"21989e11-8323-48e5-941f-785298b1dba7","year":2019},"citing_paper":{"arxiv_id":"2506.04527","last_updated":"2025-06-05T00:24:00Z","snapshot_observed_at":"2026-08-07T10:37:41.693621Z","submitted_at":"2025-06-05T00:24:00Z","title":"Grapheme-Coherent Phonemic and Prosodic Annotation of Speech by Implicit and Explicit Grapheme Conditioning","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-07T10:45:15.536055Z"},"links":{"citing_paper":"/paper/2506.04527"},"observation_digest":"sha256:e3295b278b6d4239fb4ca652b403e37cf4a714c72d5e8730ac16e67a957bb25e","observation_id":"ef53aded-23e9-4299-9d45-52066e46cc17","resolution":{"observed_at":"2026-08-07T10:45:16.678475Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:45:16.638982Z","title":"A unified sequence-to-sequence front-end model for mandarin text-to-speech synthesis,","venue":null,"work_id":"9b0ef646-eed3-4f3b-82ff-6239b234c97b","year":2020},"citing_paper":{"arxiv_id":"2506.04527","last_updated":"2025-06-05T00:24:00Z","snapshot_observed_at":"2026-08-07T10:37:41.693621Z","submitted_at":"2025-06-05T00:24:00Z","title":"Grapheme-Coherent Phonemic and Prosodic Annotation of Speech by Implicit and Explicit Grapheme Conditioning","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-07T10:45:15.543348Z"},"links":{"citing_paper":"/paper/2506.04527"},"observation_digest":"sha256:e7c33b5b323e46edba4a54d415db4a870bf08b45cf803fe5f16c7d1961afc134","observation_id":"c08a13df-5cfb-450e-9d4b-c0447b39af09","resolution":{"observed_at":"2026-08-07T10:45:16.646962Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:45:16.613351Z","title":"A unified accent esti- mation method based on multi-task learning for Japanese text-to- speech,","venue":null,"work_id":"f842f163-a9a2-49ea-97d1-64bd2ce5874c","year":2022},"citing_paper":{"arxiv_id":"2506.04527","last_updated":"2025-06-05T00:24:00Z","snapshot_observed_at":"2026-08-07T10:37:41.693621Z","submitted_at":"2025-06-05T00:24:00Z","title":"Grapheme-Coherent Phonemic and Prosodic Annotation of Speech by Implicit and Explicit Grapheme Conditioning","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-07T10:45:15.549588Z"},"links":{"citing_paper":"/paper/2506.04527"},"observation_digest":"sha256:612d289f0df1f5c010c1326f5e8c7b560727926cc73c2adfcb5ba4cbd2f60005","observation_id":"9435527f-a9d1-4d16-9010-aa869e1c7848","resolution":{"observed_at":"2026-08-07T10:45:16.619564Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:45:16.591191Z","title":"Polyphone disambigua- tion and accent prediction using pre-trained language models in Japanese TTS front-end,","venue":null,"work_id":"59f61576-a25f-4199-9920-533d8c2b41ca","year":2022},"citing_paper":{"arxiv_id":"2506.04527","last_updated":"2025-06-05T00:24:00Z","snapshot_observed_at":"2026-08-07T10:37:41.693621Z","submitted_at":"2025-06-05T00:24:00Z","title":"Grapheme-Coherent Phonemic and Prosodic Annotation of Speech by Implicit and Explicit Grapheme Conditioning","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-07T10:45:15.555619Z"},"links":{"citing_paper":"/paper/2506.04527"},"observation_digest":"sha256:6bdeaaa5143336242e31ddd68d7f6732230f9868fe784e0a6f6ffeedf08c7cf0","observation_id":"a50ed950-a929-4c7e-93a5-db966a4ba857","resolution":{"observed_at":"2026-08-07T10:45:16.599984Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:45:16.564277Z","title":"Enhancing Japanese text-to-speech ac- curacy with a novel combination Transformer-BERT-based G2P: Integrating pronunciation dictionaries and accent sandhi,","venue":null,"work_id":"1d8d3e0f-86e4-4cea-a40b-b3055ba0fcb0","year":2024},"citing_paper":{"arxiv_id":"2506.04527","last_updated":"2025-06-05T00:24:00Z","snapshot_observed_at":"2026-08-07T10:37:41.693621Z","submitted_at":"2025-06-05T00:24:00Z","title":"Grapheme-Coherent Phonemic and Prosodic Annotation of Speech by Implicit and Explicit Grapheme Conditioning","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-07T10:45:15.565465Z"},"links":{"citing_paper":"/paper/2506.04527"},"observation_digest":"sha256:d3e3f5827e90199fe719444680a28d2df4e95028afc4a577a1a475ef29ef9ba0","observation_id":"f3392d7b-db93-4477-98bf-158eef3a6723","resolution":{"observed_at":"2026-08-07T10:45:16.570769Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:45:16.539399Z","title":"Audio- conditioned phonemic and prosodic annotation for building text- to-speech models from unlabeled speech data,","venue":null,"work_id":"9ea27be3-8410-4f4c-8719-388949fca027","year":2024},"citing_paper":{"arxiv_id":"2506.04527","last_updated":"2025-06-05T00:24:00Z","snapshot_observed_at":"2026-08-07T10:37:41.693621Z","submitted_at":"2025-06-05T00:24:00Z","title":"Grapheme-Coherent Phonemic and Prosodic Annotation of Speech by Implicit and Explicit Grapheme Conditioning","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-07T10:45:15.572435Z"},"links":{"citing_paper":"/paper/2506.04527"},"observation_digest":"sha256:b6d680681e3ca1eb9236d7746d0b627f592814a4936a9ce773b482fbf02b1d66","observation_id":"f552c249-4b3b-47c8-8c9d-4d3c2c4c0196","resolution":{"observed_at":"2026-08-07T10:45:16.544361Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:45:16.510447Z","title":"Robust speech recognition via large-scale weak supervision,","venue":null,"work_id":"50e0ac55-5cb9-4ae8-8c79-be9f8ed892ed","year":2023},"citing_paper":{"arxiv_id":"2506.04527","last_updated":"2025-06-05T00:24:00Z","snapshot_observed_at":"2026-08-07T10:37:41.693621Z","submitted_at":"2025-06-05T00:24:00Z","title":"Grapheme-Coherent Phonemic and Prosodic Annotation of Speech by Implicit and Explicit Grapheme Conditioning","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-07T10:45:15.577753Z"},"links":{"citing_paper":"/paper/2506.04527"},"observation_digest":"sha256:4d4309c2a348028aab035a2198ae8f4aebf3bf04554a7865c89bda77ebad530c","observation_id":"d1ed3e51-589b-422a-9cc4-5904314ad472","resolution":{"observed_at":"2026-08-07T10:45:16.517621Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:45:16.487041Z","title":"Reazonspeech: A free and massive corpus for Japanese asr,","venue":null,"work_id":"5ee7db20-1733-4c68-b0bf-98d2cf757a50","year":2023},"citing_paper":{"arxiv_id":"2506.04527","last_updated":"2025-06-05T00:24:00Z","snapshot_observed_at":"2026-08-07T10:37:41.693621Z","submitted_at":"2025-06-05T00:24:00Z","title":"Grapheme-Coherent Phonemic and Prosodic Annotation of Speech by Implicit and Explicit Grapheme Conditioning","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-07T10:45:15.583381Z"},"links":{"citing_paper":"/paper/2506.04527"},"observation_digest":"sha256:e4a8c5b38fb83251204608a8d431aefd83c7545eafda381c0ad3128c365432ad","observation_id":"c724ebc8-0b5b-4c22-b3c5-84e02602b416","resolution":{"observed_at":"2026-08-07T10:45:16.493668Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:45:16.463964Z","title":"YODAS: Youtube-oriented dataset for audio and speech,","venue":null,"work_id":"081170a8-3b02-4471-af2d-45f8fdf70448","year":2023},"citing_paper":{"arxiv_id":"2506.04527","last_updated":"2025-06-05T00:24:00Z","snapshot_observed_at":"2026-08-07T10:37:41.693621Z","submitted_at":"2025-06-05T00:24:00Z","title":"Grapheme-Coherent Phonemic and Prosodic Annotation of Speech by Implicit and Explicit Grapheme Conditioning","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-07T10:45:15.591574Z"},"links":{"citing_paper":"/paper/2506.04527"},"observation_digest":"sha256:45a567df47a0a4865cee9d04e304088692305529a9c74bd38d50222962545610","observation_id":"6e54d56c-00de-446f-88a5-9df6dee64ba7","resolution":{"observed_at":"2026-08-07T10:45:16.471599Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:45:16.431631Z","title":"OWSM-CTC: An open encoder-only speech foundation model for speech recog- nition, translation, and language identification,","venue":null,"work_id":"5b26289a-e4f2-41f1-8897-679f17ce6faf","year":2024},"citing_paper":{"arxiv_id":"2506.04527","last_updated":"2025-06-05T00:24:00Z","snapshot_observed_at":"2026-08-07T10:37:41.693621Z","submitted_at":"2025-06-05T00:24:00Z","title":"Grapheme-Coherent Phonemic and Prosodic Annotation of Speech by Implicit and Explicit Grapheme Conditioning","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-07T10:45:15.598323Z"},"links":{"citing_paper":"/paper/2506.04527"},"observation_digest":"sha256:cabbd0bcb0d6730b620561ccf0e1238e19afea790833f5e68766f1f9a5505f9c","observation_id":"3f41bf25-c650-4f98-9b8a-8920bdf1e30a","resolution":{"observed_at":"2026-08-07T10:45:16.440054Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1810.04805","last_updated":"2019-05-24T20:37:26Z","snapshot_observed_at":"2026-07-30T09:12:38.100527Z","submitted_at":"2018-10-11T00:50:01Z","title":"BERT: Pre-training of Deep Bidirectional Transformers for Language Understanding","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1810.04805","snapshot_observed_at":"2026-08-07T10:45:15.603784Z","title":"BERT: pre- training of deep bidirectional transformers for language under- standing,","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2506.04527","last_updated":"2025-06-05T00:24:00Z","snapshot_observed_at":"2026-08-07T10:37:41.693621Z","submitted_at":"2025-06-05T00:24:00Z","title":"Grapheme-Coherent Phonemic and Prosodic Annotation of Speech by Implicit and Explicit Grapheme Conditioning","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-07T10:45:15.603784Z"},"links":{"cited_paper":"/paper/1810.04805","citing_paper":"/paper/2506.04527"},"observation_digest":"sha256:e4ec22edaf32eabfbf8d450cd130b70534b6c4904b69fa040b1d1cb5d5cd84d1","observation_id":"19463acd-44b6-48c9-86c0-122a72c50bce","resolution":{"observed_at":"2026-08-07T10:45:15.603784Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1910.01108","last_updated":"2020-03-01T02:57:50Z","snapshot_observed_at":"2026-08-07T19:07:36.327251Z","submitted_at":"2019-10-02T17:56:28Z","title":"DistilBERT, a distilled version of BERT: smaller, faster, cheaper and lighter","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1910.01108","snapshot_observed_at":"2026-08-07T10:45:15.616398Z","title":"DistilBERT, a distilled version of BERT: smaller, faster, cheaper and lighter,","venue":null,"work_id":null,"year":1910},"citing_paper":{"arxiv_id":"2506.04527","last_updated":"2025-06-05T00:24:00Z","snapshot_observed_at":"2026-08-07T10:37:41.693621Z","submitted_at":"2025-06-05T00:24:00Z","title":"Grapheme-Coherent Phonemic and Prosodic Annotation of Speech by Implicit and Explicit Grapheme Conditioning","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-07T10:45:15.616398Z"},"links":{"cited_paper":"/paper/1910.01108","citing_paper":"/paper/2506.04527"},"observation_digest":"sha256:45d19a5950956cb91621bf7e7020990f4926df63e5bfcfd9c240e122e8055ab9","observation_id":"5d8ac709-023a-4726-bbaa-09be72f8e728","resolution":{"observed_at":"2026-08-07T10:45:15.616398Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:45:16.404360Z","title":"PnG BERT: Augmented BERT on phonemes and graphemes for neural TTS,","venue":null,"work_id":"7f43059b-41bd-4e7e-b333-7e74b3fe7e3e","year":2021},"citing_paper":{"arxiv_id":"2506.04527","last_updated":"2025-06-05T00:24:00Z","snapshot_observed_at":"2026-08-07T10:37:41.693621Z","submitted_at":"2025-06-05T00:24:00Z","title":"Grapheme-Coherent Phonemic and Prosodic Annotation of Speech by Implicit and Explicit Grapheme Conditioning","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-07T10:45:15.626660Z"},"links":{"citing_paper":"/paper/2506.04527"},"observation_digest":"sha256:68ddd5eed0a68589de7629cb1d2f7bf5bb863e0431b5a84cbbce666d9f67d9b8","observation_id":"17825b3e-71ae-4e4a-a71a-3f083d27a2c4","resolution":{"observed_at":"2026-08-07T10:45:16.411517Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:45:16.379502Z","title":"Phoneme-level BERT for enhanced prosody of text-to-speech with grapheme pre- dictions,","venue":null,"work_id":"51d6694d-9ee1-49d4-a737-73567f917b43","year":2023},"citing_paper":{"arxiv_id":"2506.04527","last_updated":"2025-06-05T00:24:00Z","snapshot_observed_at":"2026-08-07T10:37:41.693621Z","submitted_at":"2025-06-05T00:24:00Z","title":"Grapheme-Coherent Phonemic and Prosodic Annotation of Speech by Implicit and Explicit Grapheme Conditioning","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-07T10:45:15.633625Z"},"links":{"citing_paper":"/paper/2506.04527"},"observation_digest":"sha256:3f1e46759bb77a4432e797a9f135c646980dff40790fb7bfb6f5fe5037128a99","observation_id":"4fb61dce-a47f-449a-bdf0-d4cc80b894ab","resolution":{"observed_at":"2026-08-07T10:45:16.385283Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:45:16.360898Z","title":"Miipher: A robust speech restoration model integrating self-supervised speech and text rep- resentations,","venue":null,"work_id":"94f6db0f-376c-4202-b443-5b2c4ba99aae","year":2023},"citing_paper":{"arxiv_id":"2506.04527","last_updated":"2025-06-05T00:24:00Z","snapshot_observed_at":"2026-08-07T10:37:41.693621Z","submitted_at":"2025-06-05T00:24:00Z","title":"Grapheme-Coherent Phonemic and Prosodic Annotation of Speech by Implicit and Explicit Grapheme Conditioning","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-07T10:45:15.648375Z"},"links":{"citing_paper":"/paper/2506.04527"},"observation_digest":"sha256:e10cacc743897f73309a7848fc4c24a4b45df52575ec30e6439778e96a01115a","observation_id":"2ce861f4-1eea-4496-9484-b587b5dc1434","resolution":{"observed_at":"2026-08-07T10:45:16.366480Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:45:16.341108Z","title":"Japanese text-to-speech syn- thesis system: Open JTalk,","venue":null,"work_id":"91bc2c6b-a75d-421f-a1ae-ba67bc11c358","year":2010},"citing_paper":{"arxiv_id":"2506.04527","last_updated":"2025-06-05T00:24:00Z","snapshot_observed_at":"2026-08-07T10:37:41.693621Z","submitted_at":"2025-06-05T00:24:00Z","title":"Grapheme-Coherent Phonemic and Prosodic Annotation of Speech by Implicit and Explicit Grapheme Conditioning","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-07T10:45:15.656518Z"},"links":{"citing_paper":"/paper/2506.04527"},"observation_digest":"sha256:c38a1766740bcca5bf3f71a0dea38fb26008386775ed6e05656bbd319f544b17","observation_id":"31d5dd8b-a730-4d18-9463-76b826057f19","resolution":{"observed_at":"2026-08-07T10:45:16.346905Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:45:16.316797Z","title":"Release of pre-trained mod- els for the Japanese language,","venue":null,"work_id":"c9bdc888-df0c-446d-8f15-caa9bf6e2366","year":2024},"citing_paper":{"arxiv_id":"2506.04527","last_updated":"2025-06-05T00:24:00Z","snapshot_observed_at":"2026-08-07T10:37:41.693621Z","submitted_at":"2025-06-05T00:24:00Z","title":"Grapheme-Coherent Phonemic and Prosodic Annotation of Speech by Implicit and Explicit Grapheme Conditioning","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-07T10:45:15.665499Z"},"links":{"citing_paper":"/paper/2506.04527"},"observation_digest":"sha256:e683e704e1098e0d02e978e1a7ba584f1ab841e8c058b93e82c1bf11749f199d","observation_id":"732fba98-843d-4fa3-a9c3-04c6d9d80334","resolution":{"observed_at":"2026-08-07T10:45:16.327855Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:45:16.299741Z","title":"Joint ctc-attention based end- to-end speech recognition using multi-task learning,","venue":null,"work_id":"2eb590d8-2014-45d8-92f2-f7da7a36980d","year":2017},"citing_paper":{"arxiv_id":"2506.04527","last_updated":"2025-06-05T00:24:00Z","snapshot_observed_at":"2026-08-07T10:37:41.693621Z","submitted_at":"2025-06-05T00:24:00Z","title":"Grapheme-Coherent Phonemic and Prosodic Annotation of Speech by Implicit and Explicit Grapheme Conditioning","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-07T10:45:15.671693Z"},"links":{"citing_paper":"/paper/2506.04527"},"observation_digest":"sha256:435ceaba4084e0ddf2dd31dd760af04ab14b149debc3f3a85ab4470b17f10803","observation_id":"583a47e6-ec4b-4d60-9037-fd4384f561c0","resolution":{"observed_at":"2026-08-07T10:45:16.304977Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:45:16.278103Z","title":"Relaxing the conditional indepen- dence assumption of ctc-based asr by conditioning on interme- diate predictions,","venue":null,"work_id":"4e3a2acc-5e02-40ef-89f5-053d447ffa74","year":2021},"citing_paper":{"arxiv_id":"2506.04527","last_updated":"2025-06-05T00:24:00Z","snapshot_observed_at":"2026-08-07T10:37:41.693621Z","submitted_at":"2025-06-05T00:24:00Z","title":"Grapheme-Coherent Phonemic and Prosodic Annotation of Speech by Implicit and Explicit Grapheme Conditioning","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-07T10:45:15.678701Z"},"links":{"citing_paper":"/paper/2506.04527"},"observation_digest":"sha256:417ab16741e4f0e53756e8f95e6d067c2838193bf9b720b880fe46c2db518d39","observation_id":"43022c1b-e346-4bc8-8cde-d01027fbcd08","resolution":{"observed_at":"2026-08-07T10:45:16.285924Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:45:16.250728Z","title":"BERT meets CTC: New formulation of end-to-end speech recognition with pre-trained masked language model,","venue":null,"work_id":"b5169634-8a88-4c3b-b05e-9d799af6de35","year":2022},"citing_paper":{"arxiv_id":"2506.04527","last_updated":"2025-06-05T00:24:00Z","snapshot_observed_at":"2026-08-07T10:37:41.693621Z","submitted_at":"2025-06-05T00:24:00Z","title":"Grapheme-Coherent Phonemic and Prosodic Annotation of Speech by Implicit and Explicit Grapheme Conditioning","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-07T10:45:15.686812Z"},"links":{"citing_paper":"/paper/2506.04527"},"observation_digest":"sha256:b45556192eee4c659e9f51c9de3d40186986347a56234fafe8cfe53bb45c4de6","observation_id":"47071f34-7d6e-493e-900b-270466e0f06d","resolution":{"observed_at":"2026-08-07T10:45:16.256179Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:45:16.229418Z","title":"Improving speech recognition error prediction for modern and off-the-shelf speech recognizers,","venue":null,"work_id":"2eee9dd9-c476-4c72-854e-600077e70158","year":2019},"citing_paper":{"arxiv_id":"2506.04527","last_updated":"2025-06-05T00:24:00Z","snapshot_observed_at":"2026-08-07T10:37:41.693621Z","submitted_at":"2025-06-05T00:24:00Z","title":"Grapheme-Coherent Phonemic and Prosodic Annotation of Speech by Implicit and Explicit Grapheme Conditioning","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-07T10:45:15.692902Z"},"links":{"citing_paper":"/paper/2506.04527"},"observation_digest":"sha256:fc22de0d08180ca8d95c6e606019cb40c69d4b2d308daf014fa50fc94be20b1c","observation_id":"fc735343-fa35-4e9a-a7d3-262905b81062","resolution":{"observed_at":"2026-08-07T10:45:16.236603Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:45:16.208311Z","title":"The theory of dynamic programming,","venue":null,"work_id":"7310223b-65a3-4de2-a475-6ba582012d4d","year":1954},"citing_paper":{"arxiv_id":"2506.04527","last_updated":"2025-06-05T00:24:00Z","snapshot_observed_at":"2026-08-07T10:37:41.693621Z","submitted_at":"2025-06-05T00:24:00Z","title":"Grapheme-Coherent Phonemic and Prosodic Annotation of Speech by Implicit and Explicit Grapheme Conditioning","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-07T10:45:15.698387Z"},"links":{"citing_paper":"/paper/2506.04527"},"observation_digest":"sha256:da98a620f2cc013ef07fc7de85931367fa9aa32aac682e107eb16efd764aa0f1","observation_id":"b26f4c93-ca02-47c9-bb40-7bb3d732ce36","resolution":{"observed_at":"2026-08-07T10:45:16.216220Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:45:16.190338Z","title":"JSUT and JVS: Free Japanese voice corpora for accelerating speech synthesis re- search,","venue":null,"work_id":"010bdf5f-58d5-40a3-b5a3-abf72ec3db2f","year":2020},"citing_paper":{"arxiv_id":"2506.04527","last_updated":"2025-06-05T00:24:00Z","snapshot_observed_at":"2026-08-07T10:37:41.693621Z","submitted_at":"2025-06-05T00:24:00Z","title":"Grapheme-Coherent Phonemic and Prosodic Annotation of Speech by Implicit and Explicit Grapheme Conditioning","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-07T10:45:15.704647Z"},"links":{"citing_paper":"/paper/2506.04527"},"observation_digest":"sha256:4d2e6440e7ce1ff786a4b834579904b3c33e87a5dd326072443d61f759d8a9b3","observation_id":"cbda27c5-89e2-45a0-8e39-e82525343f51","resolution":{"observed_at":"2026-08-07T10:45:16.195859Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:45:16.167572Z","title":"Applying conditional random fields to Japanese morphological analysis,","venue":null,"work_id":"fa258283-0452-4e54-9654-220cb06a698e","year":2004},"citing_paper":{"arxiv_id":"2506.04527","last_updated":"2025-06-05T00:24:00Z","snapshot_observed_at":"2026-08-07T10:37:41.693621Z","submitted_at":"2025-06-05T00:24:00Z","title":"Grapheme-Coherent Phonemic and Prosodic Annotation of Speech by Implicit and Explicit Grapheme Conditioning","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-07T10:45:15.711298Z"},"links":{"citing_paper":"/paper/2506.04527"},"observation_digest":"sha256:c2c9f25a6d125726860cb12480442ed6d48f30a74a9beccfc9cf75b9096b7d5c","observation_id":"2059ae9e-9677-44c5-8b28-8d2c822ac4c3","resolution":{"observed_at":"2026-08-07T10:45:16.176497Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:45:16.145484Z","title":"A proper approach to Japanese morphological analysis: Dictionary, model, and eval- uation","venue":null,"work_id":"2cba477e-d0ed-4aa6-b11a-0800b104738b","year":2008},"citing_paper":{"arxiv_id":"2506.04527","last_updated":"2025-06-05T00:24:00Z","snapshot_observed_at":"2026-08-07T10:37:41.693621Z","submitted_at":"2025-06-05T00:24:00Z","title":"Grapheme-Coherent Phonemic and Prosodic Annotation of Speech by Implicit and Explicit Grapheme Conditioning","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-07T10:45:15.717972Z"},"links":{"citing_paper":"/paper/2506.04527"},"observation_digest":"sha256:0454217b6823112b0b511cd5db2721ef28c331dbcacef4fd3ebfc56cb824ad92","observation_id":"5822a7ae-f875-4f4f-8bca-30cb0505e99b","resolution":{"observed_at":"2026-08-07T10:45:16.151737Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:45:16.123807Z","title":"Period VITS: Varia- tional inference with explicit pitch modeling for end-to-end emo- tional speech synthesis,","venue":null,"work_id":"6f5b8025-8620-4de6-b341-e4749855f1e9","year":2023},"citing_paper":{"arxiv_id":"2506.04527","last_updated":"2025-06-05T00:24:00Z","snapshot_observed_at":"2026-08-07T10:37:41.693621Z","submitted_at":"2025-06-05T00:24:00Z","title":"Grapheme-Coherent Phonemic and Prosodic Annotation of Speech by Implicit and Explicit Grapheme Conditioning","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-07T10:45:15.723592Z"},"links":{"citing_paper":"/paper/2506.04527"},"observation_digest":"sha256:d070a429570209660a66606975fcb80f79d1c35b68877fc0eec02940a172cea7","observation_id":"eaa20038-d109-494e-84f1-59dd387d048a","resolution":{"observed_at":"2026-08-07T10:45:16.129554Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:45:16.105064Z","title":"DEMAND: A col- lection of multi-channel recordings of acoustic noise in diverse environments,","venue":null,"work_id":"6e37598f-a5c7-4c0f-a770-24e9cc90036b","year":2013},"citing_paper":{"arxiv_id":"2506.04527","last_updated":"2025-06-05T00:24:00Z","snapshot_observed_at":"2026-08-07T10:37:41.693621Z","submitted_at":"2025-06-05T00:24:00Z","title":"Grapheme-Coherent Phonemic and Prosodic Annotation of Speech by Implicit and Explicit Grapheme Conditioning","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-07T10:45:15.731270Z"},"links":{"citing_paper":"/paper/2506.04527"},"observation_digest":"sha256:45886dd471f75fc526b06873315082894abb605032ed405ed125e615e6cc18c5","observation_id":"dd86049e-a605-499f-986c-042b9a825cad","resolution":{"observed_at":"2026-08-07T10:45:16.111311Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:45:16.082550Z","title":"The ACE challenge—corpus description and performance evaluation,","venue":null,"work_id":"a5656d08-d772-4dee-b09f-23a7a640daac","year":2015},"citing_paper":{"arxiv_id":"2506.04527","last_updated":"2025-06-05T00:24:00Z","snapshot_observed_at":"2026-08-07T10:37:41.693621Z","submitted_at":"2025-06-05T00:24:00Z","title":"Grapheme-Coherent Phonemic and Prosodic Annotation of Speech by Implicit and Explicit Grapheme Conditioning","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-07T10:45:15.740563Z"},"links":{"citing_paper":"/paper/2506.04527"},"observation_digest":"sha256:68dcae4bb36c8b8c40c42a823c8b56a0c9ed7d480fbd8d395bb017989e585fe9","observation_id":"1a35e2c5-68bb-42df-8bc1-73b3a4f86434","resolution":{"observed_at":"2026-08-07T10:45:16.088377Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:45:16.063874Z","title":"End-to-end ASR to jointly predict transcriptions and linguistic annotations,","venue":null,"work_id":"bb3cfa4f-179b-47ac-ad34-c896b8f16f1e","year":2021},"citing_paper":{"arxiv_id":"2506.04527","last_updated":"2025-06-05T00:24:00Z","snapshot_observed_at":"2026-08-07T10:37:41.693621Z","submitted_at":"2025-06-05T00:24:00Z","title":"Grapheme-Coherent Phonemic and Prosodic Annotation of Speech by Implicit and Explicit Grapheme Conditioning","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-07T10:45:15.750147Z"},"links":{"citing_paper":"/paper/2506.04527"},"observation_digest":"sha256:66b9bd58efe02fbb8c47954c54d9e5cb9cdc2abecebe0a7bffab7ac4830bd505","observation_id":"296c0a6e-4eca-4d0f-9891-b8969d28c888","resolution":{"observed_at":"2026-08-07T10:45:16.069677Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:45:16.044607Z","title":"Building competitive direct acoustics-to-word models for english conversa- tional speech recognition,","venue":null,"work_id":"2e60936c-623b-4802-9302-c640b012f988","year":2018},"citing_paper":{"arxiv_id":"2506.04527","last_updated":"2025-06-05T00:24:00Z","snapshot_observed_at":"2026-08-07T10:37:41.693621Z","submitted_at":"2025-06-05T00:24:00Z","title":"Grapheme-Coherent Phonemic and Prosodic Annotation of Speech by Implicit and Explicit Grapheme Conditioning","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-07T10:45:15.760108Z"},"links":{"citing_paper":"/paper/2506.04527"},"observation_digest":"sha256:b7b273b561eebe33362efe847d35487ad1b350d223355e6448bb9e1bf645f8f2","observation_id":"2aaf2e9b-4a5f-415d-b22c-84b3264f98ac","resolution":{"observed_at":"2026-08-07T10:45:16.051902Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:45:16.019900Z","title":"Joint speech recognition and speaker diarization via sequence transduction,","venue":null,"work_id":"f1717bf6-48d5-4ed9-a620-ed1f4f97184c","year":2019},"citing_paper":{"arxiv_id":"2506.04527","last_updated":"2025-06-05T00:24:00Z","snapshot_observed_at":"2026-08-07T10:37:41.693621Z","submitted_at":"2025-06-05T00:24:00Z","title":"Grapheme-Coherent Phonemic and Prosodic Annotation of Speech by Implicit and Explicit Grapheme Conditioning","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-07T10:45:15.769922Z"},"links":{"citing_paper":"/paper/2506.04527"},"observation_digest":"sha256:141538fe2a36dc2ed30ecd63d8bf3275dabb23e61e96d5f9c30bd1c478c4e6de","observation_id":"f0633d88-a512-411c-8e16-5b87fe41b9e0","resolution":{"observed_at":"2026-08-07T10:45:16.028606Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:45:15.999312Z","title":"Uncon- strained many-to-many alignment for automatic pronunciation an- notation,","venue":null,"work_id":"73502719-395e-4737-aef3-460a1b8da71e","year":2011},"citing_paper":{"arxiv_id":"2506.04527","last_updated":"2025-06-05T00:24:00Z","snapshot_observed_at":"2026-08-07T10:37:41.693621Z","submitted_at":"2025-06-05T00:24:00Z","title":"Grapheme-Coherent Phonemic and Prosodic Annotation of Speech by Implicit and Explicit Grapheme Conditioning","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-07T10:45:15.777135Z"},"links":{"citing_paper":"/paper/2506.04527"},"observation_digest":"sha256:a4b01a3efe734eb1c1a7eec6d50176bed0677d34d51307f5de59a3ba4ff9190a","observation_id":"1f62b35d-1388-466c-87de-fbdaad28620a","resolution":{"observed_at":"2026-08-07T10:45:16.004563Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:45:15.972648Z","title":"Evaluation of many-to-many alignment algorithm by auto- matic pronunciation annotation using web text mining,","venue":null,"work_id":"7b51a225-84c7-428d-a633-2367f0b00910","year":2012},"citing_paper":{"arxiv_id":"2506.04527","last_updated":"2025-06-05T00:24:00Z","snapshot_observed_at":"2026-08-07T10:37:41.693621Z","submitted_at":"2025-06-05T00:24:00Z","title":"Grapheme-Coherent Phonemic and Prosodic Annotation of Speech by Implicit and Explicit Grapheme Conditioning","version":1},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-07T10:45:15.786786Z"},"links":{"citing_paper":"/paper/2506.04527"},"observation_digest":"sha256:cf9de38ee9d24a5e3cfca6a6020ecc48ca7fcf56fc5da5b8218041d1736671ac","observation_id":"800a57a2-ed89-4474-9bb9-d7ba9a01ac0e","resolution":{"observed_at":"2026-08-07T10:45:15.982204Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2506.04527","last_updated":"2025-06-05T00:24:00Z","latest_version":1,"primary_category":"cs.SD","snapshot_observed_at":"2026-08-07T10:37:41.693621Z","submitted_at":"2025-06-05T00:24:00Z","title":"Grapheme-Coherent Phonemic and Prosodic Annotation of Speech by Implicit and Explicit Grapheme Conditioning"},"reference_resolution":{"displayed":49,"state_counts":{"malformed_identifier":0,"metadata_mismatch":1,"parse_uncertain":0,"unresolved":3,"verified_exact":0,"verified_fuzzy":45},"total_outbound_references":49},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"thesis":"As of 9 August 2026, this Paper Citation Record lists 49 of 49 outbound references and 1 inbound Pith citation observation for arXiv:2506.04527."}