{"as_of":"2026-08-10T05:38:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:05df55a7ddb8e65f95e667b5455181f9ae86bc40ddced7e8de179a11059a2a11","coverage":[{"denominator":31,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":31,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T05:33:53.920089Z","state":"measured"},{"denominator":32,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":32,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-09T06:31:02.800959+00:00","state":"measured"},{"denominator":1,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":1,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T05:33:50.951862Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"pith","source_observed_at":"2026-08-07T05:33:54.309530Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2506.07646","last_updated":"2025-06-09T11:10:24Z","snapshot_observed_at":"2026-08-08T06:01:14.865364Z","submitted_at":"2025-06-09T11:10:24Z","title":"Transcript-Prompted Whisper with Dictionary-Enhanced Decoding for Japanese Speech Annotation","version":1},"cited_work":{"arxiv_id":"2506.07646","doi":null,"metadata_source":"pith","pith_arxiv_id":"2506.07646","snapshot_observed_at":"2026-08-07T05:33:54.309530Z","title":"Transcript-Prompted Whisper with Dictionary-Enhanced Decoding for Japanese Speech Annotation","venue":"cs.CL","work_id":"c8dfe6f6-03c6-4ecd-9305-0fb024302b40","year":2025},"citing_paper":{"arxiv_id":"2506.07646","last_updated":"2025-06-09T11:10:24Z","snapshot_observed_at":"2026-08-08T06:01:14.865364Z","submitted_at":"2025-06-09T11:10:24Z","title":"Transcript-Prompted Whisper with Dictionary-Enhanced Decoding for Japanese Speech Annotation","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-07T05:33:50.951862Z"},"links":{"cited_paper":"/paper/2506.07646","citing_paper":"/paper/2506.07646"},"observation_digest":"sha256:ae3627e1ee71d32ef2d7a654a6ebc64411dd7c48a601811a87e3ffbf9496cc21","observation_id":"00e469c6-d85e-457b-8842-2a142c8aa630","resolution":{"observed_at":"2026-08-07T05:33:54.429992Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2506.07646/citation-record","integrity":"/paper/2506.07646/integrity","json":"/paper/2506.07646/citation-record.json","paper":"/paper/2506.07646"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:33:55.930807Z","title":null,"venue":null,"work_id":"a2457361-f0a4-4323-887a-8adabc6e3fee","year":null},"citing_paper":{"arxiv_id":"2506.07646","last_updated":"2025-06-09T11:10:24Z","snapshot_observed_at":"2026-08-08T06:01:14.865364Z","submitted_at":"2025-06-09T11:10:24Z","title":"Transcript-Prompted Whisper with Dictionary-Enhanced Decoding for Japanese Speech Annotation","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-07T05:33:50.665721Z"},"links":{"citing_paper":"/paper/2506.07646"},"observation_digest":"sha256:31a8d9a5e0ec4f4997b50a361061233d1f24b84d500651d44d4ace3dba0ba7e2","observation_id":"253b81c9-f476-4391-b006-ed4cf90f5099","resolution":{"observed_at":"2026-08-07T05:33:55.935572Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.07646","last_updated":"2025-06-09T11:10:24Z","snapshot_observed_at":"2026-08-08T06:01:14.865364Z","submitted_at":"2025-06-09T11:10:24Z","title":"Transcript-Prompted Whisper with Dictionary-Enhanced Decoding for Japanese Speech Annotation","version":1},"cited_work":{"arxiv_id":"2506.07646","doi":null,"metadata_source":"pith","pith_arxiv_id":"2506.07646","snapshot_observed_at":"2026-08-07T05:33:54.309530Z","title":"Transcript-Prompted Whisper with Dictionary-Enhanced Decoding for Japanese Speech Annotation","venue":"cs.CL","work_id":"c8dfe6f6-03c6-4ecd-9305-0fb024302b40","year":2025},"citing_paper":{"arxiv_id":"2506.07646","last_updated":"2025-06-09T11:10:24Z","snapshot_observed_at":"2026-08-08T06:01:14.865364Z","submitted_at":"2025-06-09T11:10:24Z","title":"Transcript-Prompted Whisper with Dictionary-Enhanced Decoding for Japanese Speech Annotation","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-07T05:33:50.951862Z"},"links":{"cited_paper":"/paper/2506.07646","citing_paper":"/paper/2506.07646"},"observation_digest":"sha256:ae3627e1ee71d32ef2d7a654a6ebc64411dd7c48a601811a87e3ffbf9496cc21","observation_id":"00e469c6-d85e-457b-8842-2a142c8aa630","resolution":{"observed_at":"2026-08-07T05:33:54.429992Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:33:55.899440Z","title":"#”. For each accent phrase, we divide it into graphemes and TTS labels using the delimiter “|","venue":null,"work_id":"c587abba-16a6-4524-881c-f335f2b37146","year":null},"citing_paper":{"arxiv_id":"2506.07646","last_updated":"2025-06-09T11:10:24Z","snapshot_observed_at":"2026-08-08T06:01:14.865364Z","submitted_at":"2025-06-09T11:10:24Z","title":"Transcript-Prompted Whisper with Dictionary-Enhanced Decoding for Japanese Speech Annotation","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-07T05:33:51.079231Z"},"links":{"citing_paper":"/paper/2506.07646"},"observation_digest":"sha256:6158be3adbf3a9c236c3f89c0ebeab280b90b006e7d3e4b0a60c59fe6ed2b688","observation_id":"91318715-bb77-4e99-b88e-79028646b3a3","resolution":{"observed_at":"2026-08-07T05:33:55.904062Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:33:55.883886Z","title":"ブィ ” and “ビ","venue":null,"work_id":"3cdce73e-20aa-4d0b-ab08-2d6c4225e93e","year":null},"citing_paper":{"arxiv_id":"2506.07646","last_updated":"2025-06-09T11:10:24Z","snapshot_observed_at":"2026-08-08T06:01:14.865364Z","submitted_at":"2025-06-09T11:10:24Z","title":"Transcript-Prompted Whisper with Dictionary-Enhanced Decoding for Japanese Speech Annotation","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-07T05:33:51.150189Z"},"links":{"citing_paper":"/paper/2506.07646"},"observation_digest":"sha256:9357ff8bba5704e90cae12a9ce3105de6565a298c6ecd10590422741756fb4f3","observation_id":"63f3318d-2eeb-4add-bb3c-dd0d4fbbe38b","resolution":{"observed_at":"2026-08-07T05:33:55.888413Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:33:55.868845Z","title":"To address the phonemic labeling issue associated with Kanji characters, we adopt a decoding strategy that incorporates dic- tionary prior knowledge","venue":null,"work_id":"f90bc56b-33a4-44f7-bb70-44c61d2bfe6a","year":null},"citing_paper":{"arxiv_id":"2506.07646","last_updated":"2025-06-09T11:10:24Z","snapshot_observed_at":"2026-08-08T06:01:14.865364Z","submitted_at":"2025-06-09T11:10:24Z","title":"Transcript-Prompted Whisper with Dictionary-Enhanced Decoding for Japanese Speech Annotation","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-07T05:33:51.305047Z"},"links":{"citing_paper":"/paper/2506.07646"},"observation_digest":"sha256:f2605b27fc7f0dbac4544bed1d7573dde8f4c053f36972089c74496051e80f94","observation_id":"87001ae8-3a89-4560-8df0-9357527be1b2","resolution":{"observed_at":"2026-08-07T05:33:55.873672Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:33:55.821899Z","title":"A unified front-end framework for english text-to-speech syn- thesis,","venue":null,"work_id":"48b62c2f-c17c-49b5-a6d1-c479eb56447d","year":2024},"citing_paper":{"arxiv_id":"2506.07646","last_updated":"2025-06-09T11:10:24Z","snapshot_observed_at":"2026-08-08T06:01:14.865364Z","submitted_at":"2025-06-09T11:10:24Z","title":"Transcript-Prompted Whisper with Dictionary-Enhanced Decoding for Japanese Speech Annotation","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-07T05:33:52.012099Z"},"links":{"citing_paper":"/paper/2506.07646"},"observation_digest":"sha256:2dbfa7282c261f5d9c36e24cfdec5ff1c6b08e8e25b6bd4b605ec4597c13e931","observation_id":"53b808c4-7044-48ae-b726-aa238163ed11","resolution":{"observed_at":"2026-08-07T05:33:55.826823Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.18009","last_updated":"2024-09-12T17:45:37Z","snapshot_observed_at":"2026-08-04T03:12:21.293095Z","submitted_at":"2024-06-26T01:38:37Z","title":"E2 TTS: Embarrassingly Easy Fully Non-Autoregressive Zero-Shot TTS","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.18009","snapshot_observed_at":"2026-08-07T05:33:51.376309Z","title":"E2 tts: Embarrass- ingly easy fully non-autoregressive zero-shot tts,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.07646","last_updated":"2025-06-09T11:10:24Z","snapshot_observed_at":"2026-08-08T06:01:14.865364Z","submitted_at":"2025-06-09T11:10:24Z","title":"Transcript-Prompted Whisper with Dictionary-Enhanced Decoding for Japanese Speech Annotation","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-07T05:33:51.376309Z"},"links":{"cited_paper":"/paper/2406.18009","citing_paper":"/paper/2506.07646"},"observation_digest":"sha256:caca2b00a818714ffcb7daeea3d16ed29d30515da6c813fdc7c8facff0a600a4","observation_id":"76430cf7-6798-4e45-8f26-f2dd8121b684","resolution":{"observed_at":"2026-08-07T05:33:51.376309Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.05407","last_updated":"2024-07-09T07:42:51Z","snapshot_observed_at":"2026-07-06T18:42:34.958119Z","submitted_at":"2024-07-07T15:16:19Z","title":"CosyVoice: A Scalable Multilingual Zero-shot Text-to-speech Synthesizer based on Supervised Semantic Tokens","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.05407","snapshot_observed_at":"2026-08-07T05:33:51.501351Z","title":"Cosyvoice: A scalable multi- lingual zero-shot text-to-speech synthesizer based on supervised semantic tokens,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.07646","last_updated":"2025-06-09T11:10:24Z","snapshot_observed_at":"2026-08-08T06:01:14.865364Z","submitted_at":"2025-06-09T11:10:24Z","title":"Transcript-Prompted Whisper with Dictionary-Enhanced Decoding for Japanese Speech Annotation","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-07T05:33:51.501351Z"},"links":{"cited_paper":"/paper/2407.05407","citing_paper":"/paper/2506.07646"},"observation_digest":"sha256:b249d288f9c8a58691c967073f17d58349be2e4d575d055e96df5ce924c5de05","observation_id":"18ec3f15-32de-44f4-b89d-3f97b8fafb02","resolution":{"observed_at":"2026-08-07T05:33:51.501351Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2411.01156","last_updated":"2024-11-09T05:58:10Z","snapshot_observed_at":"2026-08-10T00:08:15.031162Z","submitted_at":"2024-11-02T07:04:02Z","title":"Fish-Speech: Leveraging Large Language Models for Advanced Multilingual Text-to-Speech Synthesis","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.01156","snapshot_observed_at":"2026-08-07T05:33:51.609621Z","title":"Fish-speech: Leveraging large language models for advanced multilingual text-to-speech synthesis,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.07646","last_updated":"2025-06-09T11:10:24Z","snapshot_observed_at":"2026-08-08T06:01:14.865364Z","submitted_at":"2025-06-09T11:10:24Z","title":"Transcript-Prompted Whisper with Dictionary-Enhanced Decoding for Japanese Speech Annotation","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-07T05:33:51.609621Z"},"links":{"cited_paper":"/paper/2411.01156","citing_paper":"/paper/2506.07646"},"observation_digest":"sha256:962c8b53bb89395606a5c31ec171729b392f2e3ad23797ed1d5d49e2698d0170","observation_id":"47f8a2ca-2413-402c-a719-cf2fe2236001","resolution":{"observed_at":"2026-08-07T05:33:51.609621Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:33:55.853663Z","title":"Impacts of input linguistic feature representation on japanese end-to-end speech synthesis,","venue":null,"work_id":"9b6ce750-c0c0-4367-b0bb-ff377ecd115e","year":2019},"citing_paper":{"arxiv_id":"2506.07646","last_updated":"2025-06-09T11:10:24Z","snapshot_observed_at":"2026-08-08T06:01:14.865364Z","submitted_at":"2025-06-09T11:10:24Z","title":"Transcript-Prompted Whisper with Dictionary-Enhanced Decoding for Japanese Speech Annotation","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-07T05:33:51.773644Z"},"links":{"citing_paper":"/paper/2506.07646"},"observation_digest":"sha256:51773520b5fc98b1474966917bd90e1236f3a164ca595328a1a6dfdd376cc532","observation_id":"43a7426a-5dad-4650-b1bc-20c9987a7f33","resolution":{"observed_at":"2026-08-07T05:33:55.858321Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:33:55.914185Z","title":"However, these methods either only focus on prosody annotation or rely on complicated pipelines","venue":null,"work_id":"3b32e0b4-0de9-4c19-8b5e-17fa9adbb992","year":null},"citing_paper":{"arxiv_id":"2506.07646","last_updated":"2025-06-09T11:10:24Z","snapshot_observed_at":"2026-08-08T06:01:14.865364Z","submitted_at":"2025-06-09T11:10:24Z","title":"Transcript-Prompted Whisper with Dictionary-Enhanced Decoding for Japanese Speech Annotation","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-07T05:33:50.787955Z"},"links":{"citing_paper":"/paper/2506.07646"},"observation_digest":"sha256:3e2a9737ce7b4de5fc2e2423e2a37050055d241b833ac7ece96ea2e21c457dc6","observation_id":"438178da-5627-4800-a118-739148fca03a","resolution":{"observed_at":"2026-08-07T05:33:55.920447Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:33:55.837378Z","title":"Prosodic features con- trol by symbols as input of sequence-to-sequence acoustic mod- eling for neural tts,","venue":null,"work_id":"aaebef28-8c65-4682-bfdd-8655c1bbc9ec","year":2021},"citing_paper":{"arxiv_id":"2506.07646","last_updated":"2025-06-09T11:10:24Z","snapshot_observed_at":"2026-08-08T06:01:14.865364Z","submitted_at":"2025-06-09T11:10:24Z","title":"Transcript-Prompted Whisper with Dictionary-Enhanced Decoding for Japanese Speech Annotation","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-07T05:33:51.860333Z"},"links":{"citing_paper":"/paper/2506.07646"},"observation_digest":"sha256:3c59daa5d3e6fac58b75e584c218ad829298bf3597ef49c8fcdd4cca66d50b4a","observation_id":"8996299f-79b6-4f74-9010-1b9ae9acf37d","resolution":{"observed_at":"2026-08-07T05:33:55.842192Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2012.15404","last_updated":"2020-12-31T02:34:57Z","snapshot_observed_at":"2026-08-08T04:55:45.060984Z","submitted_at":"2020-12-31T02:34:57Z","title":"Unified Mandarin TTS Front-end Based on Distilled BERT Model","version":1},"cited_work":{"arxiv_id":"2012.15404","doi":null,"metadata_source":"pith","pith_arxiv_id":"2012.15404","snapshot_observed_at":"2026-08-07T05:33:54.077724Z","title":"Unified Mandarin TTS Front-end Based on Distilled BERT Model","venue":"cs.SD","work_id":"c9b2deb4-0971-4d0f-93f2-3697f14c3935","year":2020},"citing_paper":{"arxiv_id":"2506.07646","last_updated":"2025-06-09T11:10:24Z","snapshot_observed_at":"2026-08-08T06:01:14.865364Z","submitted_at":"2025-06-09T11:10:24Z","title":"Transcript-Prompted Whisper with Dictionary-Enhanced Decoding for Japanese Speech Annotation","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-07T05:33:52.158651Z"},"links":{"cited_paper":"/paper/2012.15404","citing_paper":"/paper/2506.07646"},"observation_digest":"sha256:1eb7e41f44934eb2aa8af1d4e712b250c7486d55fdc34051e86e82b363e3555f","observation_id":"c45148ba-cc31-46e1-856a-3b8fe0aaa918","resolution":{"observed_at":"2026-08-07T05:33:54.148718Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:33:55.804948Z","title":"A unified accent esti- mation method based on multi-task learning for japanese text-to- speech,","venue":null,"work_id":"5ede56cb-0ed9-4674-a82d-d5c5cc1a2fc2","year":2022},"citing_paper":{"arxiv_id":"2506.07646","last_updated":"2025-06-09T11:10:24Z","snapshot_observed_at":"2026-08-08T06:01:14.865364Z","submitted_at":"2025-06-09T11:10:24Z","title":"Transcript-Prompted Whisper with Dictionary-Enhanced Decoding for Japanese Speech Annotation","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-07T05:33:52.271932Z"},"links":{"citing_paper":"/paper/2506.07646"},"observation_digest":"sha256:30fb02630c00590de4e3e3ea5b535316b92d3577d5d6ddf21726c5b57ea17c47","observation_id":"2c70ab7f-6038-41df-857c-cc1e8240032b","resolution":{"observed_at":"2026-08-07T05:33:55.810439Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:33:55.784992Z","title":"End-to-end asr to jointly predict transcriptions and linguistic annotations,","venue":null,"work_id":"82126846-4ef9-4f4d-a964-21a1fafa9b52","year":2021},"citing_paper":{"arxiv_id":"2506.07646","last_updated":"2025-06-09T11:10:24Z","snapshot_observed_at":"2026-08-08T06:01:14.865364Z","submitted_at":"2025-06-09T11:10:24Z","title":"Transcript-Prompted Whisper with Dictionary-Enhanced Decoding for Japanese Speech Annotation","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-07T05:33:52.423236Z"},"links":{"citing_paper":"/paper/2506.07646"},"observation_digest":"sha256:7f2022f7d7efa311f272874883b67afcd73f2e6e17c16b0484f71c0e0cc8a1d3","observation_id":"6ad4b55a-7782-415b-a446-d0522e5e5863","resolution":{"observed_at":"2026-08-07T05:33:55.789595Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:33:55.769270Z","title":"Audio- conditioned phonemic and prosodic annotation for building text- to-speech models from unlabeled speech data,","venue":null,"work_id":"f394f5e5-84cc-493b-87a0-f8230b2055f0","year":2024},"citing_paper":{"arxiv_id":"2506.07646","last_updated":"2025-06-09T11:10:24Z","snapshot_observed_at":"2026-08-08T06:01:14.865364Z","submitted_at":"2025-06-09T11:10:24Z","title":"Transcript-Prompted Whisper with Dictionary-Enhanced Decoding for Japanese Speech Annotation","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-07T05:33:52.580553Z"},"links":{"citing_paper":"/paper/2506.07646"},"observation_digest":"sha256:abd296a8b7c777c82778eeba0208ad72cba3b021446e3d20ab1301d0004838f0","observation_id":"f8e3027f-d9ef-43ec-8bcd-d5f057c689de","resolution":{"observed_at":"2026-08-07T05:33:55.773913Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:33:55.753570Z","title":"Automatic prosody annotation with pre-trained text- speech model,","venue":null,"work_id":"1723ae5f-52c2-4bfc-9943-9717ef87f86c","year":2022},"citing_paper":{"arxiv_id":"2506.07646","last_updated":"2025-06-09T11:10:24Z","snapshot_observed_at":"2026-08-08T06:01:14.865364Z","submitted_at":"2025-06-09T11:10:24Z","title":"Transcript-Prompted Whisper with Dictionary-Enhanced Decoding for Japanese Speech Annotation","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-07T05:33:52.644857Z"},"links":{"citing_paper":"/paper/2506.07646"},"observation_digest":"sha256:b75d153a8092803a2e46915cc3c4973112c2c39532f5246442033cf317be4278","observation_id":"bdc8a950-e117-4484-9467-848140de031a","resolution":{"observed_at":"2026-08-07T05:33:55.757896Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:33:55.737798Z","title":"G2pa: G2p with aligned audio for mandarin chinese,","venue":null,"work_id":"83dc6ca4-b0e0-49f1-a54f-3306910f6de2","year":2024},"citing_paper":{"arxiv_id":"2506.07646","last_updated":"2025-06-09T11:10:24Z","snapshot_observed_at":"2026-08-08T06:01:14.865364Z","submitted_at":"2025-06-09T11:10:24Z","title":"Transcript-Prompted Whisper with Dictionary-Enhanced Decoding for Japanese Speech Annotation","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-07T05:33:52.791420Z"},"links":{"citing_paper":"/paper/2506.07646"},"observation_digest":"sha256:ae177e7360aebee6f55d664afd31acb2c3d99831716b2da8853ccc9b6904ef99","observation_id":"baab77ce-9c1e-4174-ab31-64838d04a974","resolution":{"observed_at":"2026-08-07T05:33:55.742904Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:33:52.884523Z","title":"Robust speech recognition via large-scale weak supervision,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.07646","last_updated":"2025-06-09T11:10:24Z","snapshot_observed_at":"2026-08-08T06:01:14.865364Z","submitted_at":"2025-06-09T11:10:24Z","title":"Transcript-Prompted Whisper with Dictionary-Enhanced Decoding for Japanese Speech Annotation","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-07T05:33:52.884523Z"},"links":{"citing_paper":"/paper/2506.07646"},"observation_digest":"sha256:a75ac15260e992eb204025be28a97b37059d9502b246c24a1f45f9c6580f6451","observation_id":"477f577b-d313-459d-96ab-a70ded181cc7","resolution":{"observed_at":"2026-08-07T05:33:52.884523Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:33:53.032764Z","title":"Attention is all you need,","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2506.07646","last_updated":"2025-06-09T11:10:24Z","snapshot_observed_at":"2026-08-08T06:01:14.865364Z","submitted_at":"2025-06-09T11:10:24Z","title":"Transcript-Prompted Whisper with Dictionary-Enhanced Decoding for Japanese Speech Annotation","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-07T05:33:53.032764Z"},"links":{"citing_paper":"/paper/2506.07646"},"observation_digest":"sha256:5085d76c680d110455f80d8a3a5fab753063b01e2bc7b9889708c7fdde2c551a","observation_id":"0b7841fa-cec0-4104-b24d-fb822222db2a","resolution":{"observed_at":"2026-08-07T05:33:53.032764Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:33:53.186970Z","title":"Zero-shot domain-sensitive speech recognition with prompt- conditioning fine-tuning,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.07646","last_updated":"2025-06-09T11:10:24Z","snapshot_observed_at":"2026-08-08T06:01:14.865364Z","submitted_at":"2025-06-09T11:10:24Z","title":"Transcript-Prompted Whisper with Dictionary-Enhanced Decoding for Japanese Speech Annotation","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-07T05:33:53.186970Z"},"links":{"citing_paper":"/paper/2506.07646"},"observation_digest":"sha256:f76a05dd1f5590f15c31418d112c37cb371ec7035d227e2406863cf13d972652","observation_id":"dd6e10cc-7013-4121-9300-c5939c1ff6bb","resolution":{"observed_at":"2026-08-07T05:33:53.186970Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:33:55.634454Z","title":"Prompt tuning for speech recognition on unknown spoken name entities,","venue":null,"work_id":"17a36829-49bc-4ac3-906d-b56972727114","year":2024},"citing_paper":{"arxiv_id":"2506.07646","last_updated":"2025-06-09T11:10:24Z","snapshot_observed_at":"2026-08-08T06:01:14.865364Z","submitted_at":"2025-06-09T11:10:24Z","title":"Transcript-Prompted Whisper with Dictionary-Enhanced Decoding for Japanese Speech Annotation","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-07T05:33:53.263260Z"},"links":{"citing_paper":"/paper/2506.07646"},"observation_digest":"sha256:0cf431884db00d28c5cbb2be8739267312fabaefb8b3722b90c7fde34445d622","observation_id":"40855888-ffb2-4ddb-a055-da5ee2067c56","resolution":{"observed_at":"2026-08-07T05:33:55.682039Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:33:55.407919Z","title":"Extending whisper with prompt tuning to target-speaker asr,","venue":null,"work_id":"0c8ece5c-70b1-4fbf-bc42-dd34394dfa31","year":2024},"citing_paper":{"arxiv_id":"2506.07646","last_updated":"2025-06-09T11:10:24Z","snapshot_observed_at":"2026-08-08T06:01:14.865364Z","submitted_at":"2025-06-09T11:10:24Z","title":"Transcript-Prompted Whisper with Dictionary-Enhanced Decoding for Japanese Speech Annotation","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-07T05:33:53.339967Z"},"links":{"citing_paper":"/paper/2506.07646"},"observation_digest":"sha256:741a70af46036b4af5862d818bffd3807911d14040aa81e1325b3a72f65b154b","observation_id":"ae99b0b4-7761-4ff9-aea2-0db55d4b7418","resolution":{"observed_at":"2026-08-07T05:33:55.526591Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:33:55.172882Z","title":"Perceiver-prompt: Flexible speaker adaptation in whisper for chinese disordered speech recognition,","venue":null,"work_id":"e31e42ea-7936-4f8e-bc8e-6f5b87084763","year":2024},"citing_paper":{"arxiv_id":"2506.07646","last_updated":"2025-06-09T11:10:24Z","snapshot_observed_at":"2026-08-08T06:01:14.865364Z","submitted_at":"2025-06-09T11:10:24Z","title":"Transcript-Prompted Whisper with Dictionary-Enhanced Decoding for Japanese Speech Annotation","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-07T05:33:53.388327Z"},"links":{"citing_paper":"/paper/2506.07646"},"observation_digest":"sha256:17e26818577c285381e4fe5dc65abf7838e182488e942d5badb86369d73c9212","observation_id":"c330a1a8-3056-4d41-9b4c-cca0e7c68aa3","resolution":{"observed_at":"2026-08-07T05:33:55.281778Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:33:54.929808Z","title":"Applying conditional random fields to japanese morphological analysis,","venue":null,"work_id":"7fd77acc-3fe1-49da-a6e9-19805cbbafed","year":2004},"citing_paper":{"arxiv_id":"2506.07646","last_updated":"2025-06-09T11:10:24Z","snapshot_observed_at":"2026-08-08T06:01:14.865364Z","submitted_at":"2025-06-09T11:10:24Z","title":"Transcript-Prompted Whisper with Dictionary-Enhanced Decoding for Japanese Speech Annotation","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-07T05:33:53.454542Z"},"links":{"citing_paper":"/paper/2506.07646"},"observation_digest":"sha256:97de105cffa6edaa903f42b125d43332a5e6a26039aada147a91593ded2adbf8","observation_id":"712e21e5-a28a-429e-bfd1-d6ab197e3da3","resolution":{"observed_at":"2026-08-07T05:33:55.025620Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:33:54.679778Z","title":"A proper approach to japanese morphological analysis: Dictionary, model, and eval- uation","venue":null,"work_id":"4bd32b56-3e3f-485f-8721-b94314eaab31","year":2008},"citing_paper":{"arxiv_id":"2506.07646","last_updated":"2025-06-09T11:10:24Z","snapshot_observed_at":"2026-08-08T06:01:14.865364Z","submitted_at":"2025-06-09T11:10:24Z","title":"Transcript-Prompted Whisper with Dictionary-Enhanced Decoding for Japanese Speech Annotation","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-07T05:33:53.563402Z"},"links":{"citing_paper":"/paper/2506.07646"},"observation_digest":"sha256:abaa600a601700bcec5ac6b1d5ae214aed05279ac5a0b1bc0050886509d04930","observation_id":"d758b06d-870d-4a4e-bd7e-c93fb762fde8","resolution":{"observed_at":"2026-08-07T05:33:54.789301Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1711.00354","last_updated":"2017-10-28T05:28:01Z","snapshot_observed_at":"2026-08-07T12:14:00.547338Z","submitted_at":"2017-10-28T05:28:01Z","title":"JSUT corpus: free large-scale Japanese speech corpus for end-to-end speech synthesis","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1711.00354","snapshot_observed_at":"2026-08-07T05:33:53.645210Z","title":"Jsut corpus: free large-scale japanese speech corpus for end-to-end speech synthe- sis,","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2506.07646","last_updated":"2025-06-09T11:10:24Z","snapshot_observed_at":"2026-08-08T06:01:14.865364Z","submitted_at":"2025-06-09T11:10:24Z","title":"Transcript-Prompted Whisper with Dictionary-Enhanced Decoding for Japanese Speech Annotation","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-07T05:33:53.645210Z"},"links":{"cited_paper":"/paper/1711.00354","citing_paper":"/paper/2506.07646"},"observation_digest":"sha256:6d9c42e0dc82ff5ae3aedfc01e5abd47529be38880e417ca6971313d1fe48739","observation_id":"b87c52ac-3c7c-42f0-b555-bede0aadabf0","resolution":{"observed_at":"2026-08-07T05:33:53.645210Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2303.08774","last_updated":"2024-03-04T06:01:33Z","snapshot_observed_at":"2026-08-07T07:30:12.213965Z","submitted_at":"2023-03-15T17:15:04Z","title":"GPT-4 Technical Report","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.08774","snapshot_observed_at":"2026-08-07T05:33:53.733085Z","title":"Gpt-4 technical report,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.07646","last_updated":"2025-06-09T11:10:24Z","snapshot_observed_at":"2026-08-08T06:01:14.865364Z","submitted_at":"2025-06-09T11:10:24Z","title":"Transcript-Prompted Whisper with Dictionary-Enhanced Decoding for Japanese Speech Annotation","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-07T05:33:53.733085Z"},"links":{"cited_paper":"/paper/2303.08774","citing_paper":"/paper/2506.07646"},"observation_digest":"sha256:a642155fdb24f161f2e05819a902793b6209764cf36c8c05cd14791c6c879eea","observation_id":"f22a6537-8921-4163-b814-8d3cd93b2ad9","resolution":{"observed_at":"2026-08-07T05:33:53.733085Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1908.06248","last_updated":"2019-08-17T06:04:46Z","snapshot_observed_at":"2026-08-10T04:14:03.409069Z","submitted_at":"2019-08-17T06:04:46Z","title":"JVS corpus: free Japanese multi-speaker voice corpus","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1908.06248","snapshot_observed_at":"2026-08-07T05:33:53.799236Z","title":"Jvs corpus: free japanese multi-speaker voice cor- pus,","venue":null,"work_id":null,"year":1908},"citing_paper":{"arxiv_id":"2506.07646","last_updated":"2025-06-09T11:10:24Z","snapshot_observed_at":"2026-08-08T06:01:14.865364Z","submitted_at":"2025-06-09T11:10:24Z","title":"Transcript-Prompted Whisper with Dictionary-Enhanced Decoding for Japanese Speech Annotation","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-07T05:33:53.799236Z"},"links":{"cited_paper":"/paper/1908.06248","citing_paper":"/paper/2506.07646"},"observation_digest":"sha256:def3e7ee0b4922003c24c1a44ba730690b4bd7a5360b33257ff6092927777e71","observation_id":"66ba85f3-dd33-48a6-a3a2-306299ae381d","resolution":{"observed_at":"2026-08-07T05:33:53.799236Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:33:54.524771Z","title":"Transformers: State-of-the-art natural language processing,","venue":null,"work_id":"611a0889-9e69-414b-a743-f894bfbacf5f","year":2020},"citing_paper":{"arxiv_id":"2506.07646","last_updated":"2025-06-09T11:10:24Z","snapshot_observed_at":"2026-08-08T06:01:14.865364Z","submitted_at":"2025-06-09T11:10:24Z","title":"Transcript-Prompted Whisper with Dictionary-Enhanced Decoding for Japanese Speech Annotation","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-07T05:33:53.849183Z"},"links":{"citing_paper":"/paper/2506.07646"},"observation_digest":"sha256:6d895ff306a03692e5fe1131bc1c07ce45f57c1d5ebff99048737cbae300a6ce","observation_id":"f6e6ce3c-1240-4e25-b3ea-bdf2c7fbe2dd","resolution":{"observed_at":"2026-08-07T05:33:54.580616Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:33:53.920089Z","title":"Conditional variational autoencoder with adversarial learning for end-to-end text-to-speech,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2506.07646","last_updated":"2025-06-09T11:10:24Z","snapshot_observed_at":"2026-08-08T06:01:14.865364Z","submitted_at":"2025-06-09T11:10:24Z","title":"Transcript-Prompted Whisper with Dictionary-Enhanced Decoding for Japanese Speech Annotation","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-07T05:33:53.920089Z"},"links":{"citing_paper":"/paper/2506.07646"},"observation_digest":"sha256:daa095dc0e566f9b9ace2ece526422fe54ebb20a82964cac7394e0bc2950a926","observation_id":"96ed9fe9-0f09-466c-bbc4-47643c0ea502","resolution":{"observed_at":"2026-08-07T05:33:53.920089Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2506.07646","last_updated":"2025-06-09T11:10:24Z","latest_version":1,"primary_category":"cs.CL","snapshot_observed_at":"2026-08-08T06:01:14.865364Z","submitted_at":"2025-06-09T11:10:24Z","title":"Transcript-Prompted Whisper with Dictionary-Enhanced Decoding for Japanese Speech Annotation"},"reference_resolution":{"displayed":31,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":11,"verified_exact":2,"verified_fuzzy":18},"total_outbound_references":31},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"thesis":"As of 10 August 2026, this Paper Citation Record lists 31 of 31 outbound references and 1 inbound Pith citation observation for arXiv:2506.07646."}