{"as_of":"2026-08-10T05:14:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:f11f9cdc38c16db843d9ca87c40ced764349902a270ec3e934b5a620608b6b56","coverage":[{"denominator":42,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":42,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T12:00:12.519114Z","state":"measured"},{"denominator":43,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":43,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-09T06:31:02.800959+00:00","state":"measured"},{"denominator":1,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":1,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T12:00:09.374265Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"pith","source_observed_at":"2026-08-07T12:00:13.204804Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2506.00832","last_updated":"2025-06-01T04:33:37Z","snapshot_observed_at":"2026-08-10T00:43:35.197447Z","submitted_at":"2025-06-01T04:33:37Z","title":"Counterfactual Activation Editing for Post-hoc Prosody and Mispronunciation Correction in TTS Models","version":1},"cited_work":{"arxiv_id":"2506.00832","doi":null,"metadata_source":"pith","pith_arxiv_id":"2506.00832","snapshot_observed_at":"2026-08-07T12:00:13.204804Z","title":"Counterfactual Activation Editing for Post-hoc Prosody and Mispronunciation Correction in TTS Models","venue":"cs.SD","work_id":"e258a77b-e2a7-426e-be61-706a56afe366","year":2025},"citing_paper":{"arxiv_id":"2506.00832","last_updated":"2025-06-01T04:33:37Z","snapshot_observed_at":"2026-08-10T00:43:35.197447Z","submitted_at":"2025-06-01T04:33:37Z","title":"Counterfactual Activation Editing for Post-hoc Prosody and Mispronunciation Correction in TTS Models","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-07T12:00:09.374265Z"},"links":{"cited_paper":"/paper/2506.00832","citing_paper":"/paper/2506.00832"},"observation_digest":"sha256:4c990c06bfedc4a5bb75f9f1838ba65d4374cef7ee729f312a9cf461ff0fd94b","observation_id":"5638f2c9-2732-4a60-a3ac-02461578072a","resolution":{"observed_at":"2026-08-07T12:00:13.248560Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2506.00832/citation-record","integrity":"/paper/2506.00832/integrity","json":"/paper/2506.00832/citation-record.json","paper":"/paper/2506.00832"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:00:18.200691Z","title":"What would the internal representation look like if the model aimed for a higher pitch rather than the current, lower one?","venue":null,"work_id":"0dade551-acb3-4043-939f-b9229163d288","year":null},"citing_paper":{"arxiv_id":"2506.00832","last_updated":"2025-06-01T04:33:37Z","snapshot_observed_at":"2026-08-10T00:43:35.197447Z","submitted_at":"2025-06-01T04:33:37Z","title":"Counterfactual Activation Editing for Post-hoc Prosody and Mispronunciation Correction in TTS Models","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-07T12:00:09.318584Z"},"links":{"citing_paper":"/paper/2506.00832"},"observation_digest":"sha256:b650e7be866d27743011c3f0c9c957e31f281076138b46f089e7b344004a0cdf","observation_id":"02f6f1f8-c1ca-42de-870b-2c079d7d87b2","resolution":{"observed_at":"2026-08-07T12:00:18.318653Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.00832","last_updated":"2025-06-01T04:33:37Z","snapshot_observed_at":"2026-08-10T00:43:35.197447Z","submitted_at":"2025-06-01T04:33:37Z","title":"Counterfactual Activation Editing for Post-hoc Prosody and Mispronunciation Correction in TTS Models","version":1},"cited_work":{"arxiv_id":"2506.00832","doi":null,"metadata_source":"pith","pith_arxiv_id":"2506.00832","snapshot_observed_at":"2026-08-07T12:00:13.204804Z","title":"Counterfactual Activation Editing for Post-hoc Prosody and Mispronunciation Correction in TTS Models","venue":"cs.SD","work_id":"e258a77b-e2a7-426e-be61-706a56afe366","year":2025},"citing_paper":{"arxiv_id":"2506.00832","last_updated":"2025-06-01T04:33:37Z","snapshot_observed_at":"2026-08-10T00:43:35.197447Z","submitted_at":"2025-06-01T04:33:37Z","title":"Counterfactual Activation Editing for Post-hoc Prosody and Mispronunciation Correction in TTS Models","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-07T12:00:09.374265Z"},"links":{"cited_paper":"/paper/2506.00832","citing_paper":"/paper/2506.00832"},"observation_digest":"sha256:4c990c06bfedc4a5bb75f9f1838ba65d4374cef7ee729f312a9cf461ff0fd94b","observation_id":"5638f2c9-2732-4a60-a3ac-02461578072a","resolution":{"observed_at":"2026-08-07T12:00:13.248560Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:00:17.997083Z","title":"What would the internal representation look like if the synthesized speech had a higher pitch rather than a lower pitch?","venue":null,"work_id":"cdac0d01-ed0f-4539-9d28-b4f15d36b351","year":null},"citing_paper":{"arxiv_id":"2506.00832","last_updated":"2025-06-01T04:33:37Z","snapshot_observed_at":"2026-08-10T00:43:35.197447Z","submitted_at":"2025-06-01T04:33:37Z","title":"Counterfactual Activation Editing for Post-hoc Prosody and Mispronunciation Correction in TTS Models","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-07T12:00:09.480496Z"},"links":{"citing_paper":"/paper/2506.00832"},"observation_digest":"sha256:3715522182b77f7281f37a05bd9cafe5d2d4c33cfbd7bc1e32c9c1174b876372","observation_id":"7241112a-e882-4420-8835-0c7fb9c7aefb","resolution":{"observed_at":"2026-08-07T12:00:18.062228Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:00:17.822193Z","title":null,"venue":null,"work_id":"946d2c1d-ea44-46ee-ab45-11dd1b09eda5","year":null},"citing_paper":{"arxiv_id":"2506.00832","last_updated":"2025-06-01T04:33:37Z","snapshot_observed_at":"2026-08-10T00:43:35.197447Z","submitted_at":"2025-06-01T04:33:37Z","title":"Counterfactual Activation Editing for Post-hoc Prosody and Mispronunciation Correction in TTS Models","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-07T12:00:09.563895Z"},"links":{"citing_paper":"/paper/2506.00832"},"observation_digest":"sha256:346cc12b8c6d77f80a711224fe8888246a5faf418d7f3855eea4e8245d28e4d2","observation_id":"3590fff4-d059-4644-a4e7-015aed35fa08","resolution":{"observed_at":"2026-08-07T12:00:17.902086Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:00:17.666576Z","title":"In planning its data processing techniques","venue":null,"work_id":"a8fd4919-665e-471b-a98a-f1a64ef2ec0a","year":null},"citing_paper":{"arxiv_id":"2506.00832","last_updated":"2025-06-01T04:33:37Z","snapshot_observed_at":"2026-08-10T00:43:35.197447Z","submitted_at":"2025-06-01T04:33:37Z","title":"Counterfactual Activation Editing for Post-hoc Prosody and Mispronunciation Correction in TTS Models","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-07T12:00:09.654733Z"},"links":{"citing_paper":"/paper/2506.00832"},"observation_digest":"sha256:911f06a9b2b83a07635b31f32c02ca7e9554b424aa0624aaa73117111416e86a","observation_id":"37349320-eb49-4298-81b1-7a3994aa0f7b","resolution":{"observed_at":"2026-08-07T12:00:17.722710Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:00:17.578773Z","title":null,"venue":null,"work_id":"ccf373f9-3aa9-4f6d-8408-5852da422cf8","year":null},"citing_paper":{"arxiv_id":"2506.00832","last_updated":"2025-06-01T04:33:37Z","snapshot_observed_at":"2026-08-10T00:43:35.197447Z","submitted_at":"2025-06-01T04:33:37Z","title":"Counterfactual Activation Editing for Post-hoc Prosody and Mispronunciation Correction in TTS Models","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-07T12:00:09.732784Z"},"links":{"citing_paper":"/paper/2506.00832"},"observation_digest":"sha256:fad28098a04c19a638ba17b402c5690e3228b98c20b8b0b87e495c7d6fdc561b","observation_id":"44d11211-003e-41f0-8d42-4ce76193197d","resolution":{"observed_at":"2026-08-07T12:00:17.633955Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:00:17.359758Z","title":"2022-0-00984, Devel- opment of Artificial Intelligence Technology for Personalized Plug-and-Play Explanation and Verification of Explanation; No","venue":null,"work_id":"60103c2d-5eef-4262-890e-5454aba2a584","year":2019},"citing_paper":{"arxiv_id":"2506.00832","last_updated":"2025-06-01T04:33:37Z","snapshot_observed_at":"2026-08-10T00:43:35.197447Z","submitted_at":"2025-06-01T04:33:37Z","title":"Counterfactual Activation Editing for Post-hoc Prosody and Mispronunciation Correction in TTS Models","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-07T12:00:09.840699Z"},"links":{"citing_paper":"/paper/2506.00832"},"observation_digest":"sha256:473f66a11028e8edce1a935638adb1da28bd35150e65a687c685e327f67ac9c8","observation_id":"1003b833-5259-4b16-bc68-dfe11d55928d","resolution":{"observed_at":"2026-08-07T12:00:17.417830Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1703.10135","last_updated":"2017-04-06T21:20:34Z","snapshot_observed_at":"2026-08-05T15:51:16.043022Z","submitted_at":"2017-03-29T16:55:13Z","title":"Tacotron: Towards End-to-End Speech Synthesis","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1703.10135","snapshot_observed_at":"2026-08-07T12:00:09.959311Z","title":"Tacotron: Towards end-to-end speech synthesis,","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2506.00832","last_updated":"2025-06-01T04:33:37Z","snapshot_observed_at":"2026-08-10T00:43:35.197447Z","submitted_at":"2025-06-01T04:33:37Z","title":"Counterfactual Activation Editing for Post-hoc Prosody and Mispronunciation Correction in TTS Models","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-07T12:00:09.959311Z"},"links":{"cited_paper":"/paper/1703.10135","citing_paper":"/paper/2506.00832"},"observation_digest":"sha256:fa29c8f485a4868b37f7e5ce8e9a08d7771e4d803c2a4df9fc4b9f16863c6566","observation_id":"2b339be2-3a3e-42ca-a3fb-9dd0a901e141","resolution":{"observed_at":"2026-08-07T12:00:09.959311Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:00:17.169870Z","title":"Natural tts synthesis by conditioning wavenet on mel spectrogram predic- tions,","venue":null,"work_id":"2515e8df-3189-4c9f-ae49-a658b45e04b5","year":2018},"citing_paper":{"arxiv_id":"2506.00832","last_updated":"2025-06-01T04:33:37Z","snapshot_observed_at":"2026-08-10T00:43:35.197447Z","submitted_at":"2025-06-01T04:33:37Z","title":"Counterfactual Activation Editing for Post-hoc Prosody and Mispronunciation Correction in TTS Models","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-07T12:00:10.014611Z"},"links":{"citing_paper":"/paper/2506.00832"},"observation_digest":"sha256:5d15e03e00b4f1aeb0fed743aa736a3b916443c3cfbb32bd8e68f4138e0d44b4","observation_id":"d7419863-81a5-4109-a059-61c5e407d01b","resolution":{"observed_at":"2026-08-07T12:00:17.294685Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:00:17.019667Z","title":"Neural speech synthe- sis with transformer network,","venue":null,"work_id":"02a7032a-c545-4e86-9d4a-9a1e88dd422e","year":2019},"citing_paper":{"arxiv_id":"2506.00832","last_updated":"2025-06-01T04:33:37Z","snapshot_observed_at":"2026-08-10T00:43:35.197447Z","submitted_at":"2025-06-01T04:33:37Z","title":"Counterfactual Activation Editing for Post-hoc Prosody and Mispronunciation Correction in TTS Models","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-07T12:00:10.124986Z"},"links":{"citing_paper":"/paper/2506.00832"},"observation_digest":"sha256:7a3012c8bbfbd1b0e08f14f8d1bc7b14a5e3e856310c6ae800135b1040ab0ac2","observation_id":"24f6eeb6-59af-4911-b21b-dd9f13ab3f56","resolution":{"observed_at":"2026-08-07T12:00:17.049983Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:00:10.220550Z","title":"Fastspeech: Fast, robust and controllable text to speech,","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2506.00832","last_updated":"2025-06-01T04:33:37Z","snapshot_observed_at":"2026-08-10T00:43:35.197447Z","submitted_at":"2025-06-01T04:33:37Z","title":"Counterfactual Activation Editing for Post-hoc Prosody and Mispronunciation Correction in TTS Models","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-07T12:00:10.220550Z"},"links":{"citing_paper":"/paper/2506.00832"},"observation_digest":"sha256:7b6e0d9c9fd942eff3f1c23e0de81c585d2f6edc42e3c97d0bac54eb563244b7","observation_id":"508dffc0-9d53-459f-ba21-77ad334033e4","resolution":{"observed_at":"2026-08-07T12:00:10.220550Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2006.04558","last_updated":"2022-08-08T01:53:05Z","snapshot_observed_at":"2026-08-06T18:05:37.673476Z","submitted_at":"2020-06-08T13:05:40Z","title":"FastSpeech 2: Fast and High-Quality End-to-End Text to Speech","version":8},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2006.04558","snapshot_observed_at":"2026-08-07T12:00:10.317617Z","title":"Fastspeech 2: Fast and high-quality end-to-end text to speech,","venue":null,"work_id":null,"year":2006},"citing_paper":{"arxiv_id":"2506.00832","last_updated":"2025-06-01T04:33:37Z","snapshot_observed_at":"2026-08-10T00:43:35.197447Z","submitted_at":"2025-06-01T04:33:37Z","title":"Counterfactual Activation Editing for Post-hoc Prosody and Mispronunciation Correction in TTS Models","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-07T12:00:10.317617Z"},"links":{"cited_paper":"/paper/2006.04558","citing_paper":"/paper/2506.00832"},"observation_digest":"sha256:ace0bb5c744092556a3aaeb5a588ccad3d4f76d9f3dc49b251cfb0f07b199b34","observation_id":"fc3de9b6-9a65-4842-a3ef-4433dcddfc69","resolution":{"observed_at":"2026-08-07T12:00:10.317617Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1609.03499","last_updated":"2016-09-19T18:04:35Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2016-09-12T17:29:40Z","title":"WaveNet: A Generative Model for Raw Audio","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1609.03499","snapshot_observed_at":"2026-08-07T12:00:10.368822Z","title":"Wavenet: A generative model for raw audio,","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2506.00832","last_updated":"2025-06-01T04:33:37Z","snapshot_observed_at":"2026-08-10T00:43:35.197447Z","submitted_at":"2025-06-01T04:33:37Z","title":"Counterfactual Activation Editing for Post-hoc Prosody and Mispronunciation Correction in TTS Models","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-07T12:00:10.368822Z"},"links":{"cited_paper":"/paper/1609.03499","citing_paper":"/paper/2506.00832"},"observation_digest":"sha256:b3d3e36734a7067af53f8ba97c52662fcffb15d82374ab00803a90fe697e0621","observation_id":"c8bfe558-57ec-4f69-82b4-b383d3bf917b","resolution":{"observed_at":"2026-08-07T12:00:10.368822Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:00:16.814788Z","title":"Waveglow: A flow-based generative network for speech synthesis,","venue":null,"work_id":"b530d237-cfb2-4a44-aa28-b1a27e1e006a","year":2019},"citing_paper":{"arxiv_id":"2506.00832","last_updated":"2025-06-01T04:33:37Z","snapshot_observed_at":"2026-08-10T00:43:35.197447Z","submitted_at":"2025-06-01T04:33:37Z","title":"Counterfactual Activation Editing for Post-hoc Prosody and Mispronunciation Correction in TTS Models","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-07T12:00:10.424096Z"},"links":{"citing_paper":"/paper/2506.00832"},"observation_digest":"sha256:dd8a8711af1ddb2dea0e007eba1aa81a9b5228d4bb82d4cf3601dcd35d5fdce8","observation_id":"a44eca22-eeaf-46c1-9a54-1f7da6dacf01","resolution":{"observed_at":"2026-08-07T12:00:16.909764Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:00:16.558180Z","title":"Mel- gan: Generative adversarial networks for conditional waveform synthesis,","venue":null,"work_id":"822eb98c-4a64-4828-a365-ffac5df6f291","year":2019},"citing_paper":{"arxiv_id":"2506.00832","last_updated":"2025-06-01T04:33:37Z","snapshot_observed_at":"2026-08-10T00:43:35.197447Z","submitted_at":"2025-06-01T04:33:37Z","title":"Counterfactual Activation Editing for Post-hoc Prosody and Mispronunciation Correction in TTS Models","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-07T12:00:10.536694Z"},"links":{"citing_paper":"/paper/2506.00832"},"observation_digest":"sha256:0587de76a66787a91f3cc370a1f44adaed7bf5d66efc6162dc536712ec0412b1","observation_id":"3bff5da7-4ba2-473e-86e7-8a80941dfa07","resolution":{"observed_at":"2026-08-07T12:00:16.716059Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:00:16.316740Z","title":"Hifi-gan: Generative adversarial net- works for efficient and high fidelity speech synthesis,","venue":null,"work_id":"21e59b44-7e9e-4678-af6e-8660261111c4","year":2020},"citing_paper":{"arxiv_id":"2506.00832","last_updated":"2025-06-01T04:33:37Z","snapshot_observed_at":"2026-08-10T00:43:35.197447Z","submitted_at":"2025-06-01T04:33:37Z","title":"Counterfactual Activation Editing for Post-hoc Prosody and Mispronunciation Correction in TTS Models","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-07T12:00:10.614594Z"},"links":{"citing_paper":"/paper/2506.00832"},"observation_digest":"sha256:20fe33f7a1def6dff85eedc447a5ab145624e80d69b138dc5b6d8ccc191e03f4","observation_id":"4337127c-beb1-442c-8cd1-27d4b13c3992","resolution":{"observed_at":"2026-08-07T12:00:16.447390Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:00:10.682549Z","title":"Style tokens: Un- supervised style modeling, control and transfer in end-to-end speech synthesis,","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2506.00832","last_updated":"2025-06-01T04:33:37Z","snapshot_observed_at":"2026-08-10T00:43:35.197447Z","submitted_at":"2025-06-01T04:33:37Z","title":"Counterfactual Activation Editing for Post-hoc Prosody and Mispronunciation Correction in TTS Models","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-07T12:00:10.682549Z"},"links":{"citing_paper":"/paper/2506.00832"},"observation_digest":"sha256:13e8e98c46040c61e21658342611bc358316ab171155eedfc477529674f71496","observation_id":"cb462432-b81c-4d94-a303-910b17317d71","resolution":{"observed_at":"2026-08-07T12:00:10.682549Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:00:10.754568Z","title":"To- wards end-to-end prosody transfer for expressive speech synthesis with tacotron,","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2506.00832","last_updated":"2025-06-01T04:33:37Z","snapshot_observed_at":"2026-08-10T00:43:35.197447Z","submitted_at":"2025-06-01T04:33:37Z","title":"Counterfactual Activation Editing for Post-hoc Prosody and Mispronunciation Correction in TTS Models","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-07T12:00:10.754568Z"},"links":{"citing_paper":"/paper/2506.00832"},"observation_digest":"sha256:84dfda775ef11258a44deda53f9a8b35720b12ce2fe1f1ede115570301bc4f36","observation_id":"3b54d476-2d76-49c6-aa5d-b571d2f94059","resolution":{"observed_at":"2026-08-07T12:00:10.754568Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1810.07217","last_updated":"2018-12-27T06:50:41Z","snapshot_observed_at":"2026-07-06T07:08:41.080825Z","submitted_at":"2018-10-16T18:20:02Z","title":"Hierarchical Generative Modeling for Controllable Speech Synthesis","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1810.07217","snapshot_observed_at":"2026-08-07T12:00:10.808080Z","title":"Hierarchical genera- tive modeling for controllable speech synthesis,","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2506.00832","last_updated":"2025-06-01T04:33:37Z","snapshot_observed_at":"2026-08-10T00:43:35.197447Z","submitted_at":"2025-06-01T04:33:37Z","title":"Counterfactual Activation Editing for Post-hoc Prosody and Mispronunciation Correction in TTS Models","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-07T12:00:10.808080Z"},"links":{"cited_paper":"/paper/1810.07217","citing_paper":"/paper/2506.00832"},"observation_digest":"sha256:dddc4a71bf24eee50ec3e2211b0094cdbe3b772ccfedd89d3aa37ea3ed92a5dd","observation_id":"0fd643ee-44fa-46ab-a53d-8e9ccab5cb3a","resolution":{"observed_at":"2026-08-07T12:00:10.808080Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:00:15.259681Z","title":"Prosody under con- trol: Controlling prosody in text-to-speech synthesis by adjust- ments in latent reference space,","venue":null,"work_id":"817df643-97aa-48ce-863f-0dfb99eb4d14","year":2023},"citing_paper":{"arxiv_id":"2506.00832","last_updated":"2025-06-01T04:33:37Z","snapshot_observed_at":"2026-08-10T00:43:35.197447Z","submitted_at":"2025-06-01T04:33:37Z","title":"Counterfactual Activation Editing for Post-hoc Prosody and Mispronunciation Correction in TTS Models","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-07T12:00:10.916035Z"},"links":{"citing_paper":"/paper/2506.00832"},"observation_digest":"sha256:3aae01caf649760034eda794a5daaa515e7116d10f9fb56db453260cadf6addd","observation_id":"004539f0-2355-42fe-9072-d05e53e7391b","resolution":{"observed_at":"2026-08-07T12:00:15.506225Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2106.08352","last_updated":"2021-06-15T18:03:48Z","snapshot_observed_at":"2026-08-09T00:39:30.813729Z","submitted_at":"2021-06-15T18:03:48Z","title":"Ctrl-P: Temporal Control of Prosodic Variation for Speech Synthesis","version":1},"cited_work":{"arxiv_id":"2106.08352","doi":null,"metadata_source":"pith","pith_arxiv_id":"2106.08352","snapshot_observed_at":"2026-08-07T12:00:12.957717Z","title":"Ctrl-P: Temporal Control of Prosodic Variation for Speech Synthesis","venue":"eess.AS","work_id":"31ddd0f1-0127-4cbb-a76c-9485e81a6b0b","year":2021},"citing_paper":{"arxiv_id":"2506.00832","last_updated":"2025-06-01T04:33:37Z","snapshot_observed_at":"2026-08-10T00:43:35.197447Z","submitted_at":"2025-06-01T04:33:37Z","title":"Counterfactual Activation Editing for Post-hoc Prosody and Mispronunciation Correction in TTS Models","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-07T12:00:11.005095Z"},"links":{"cited_paper":"/paper/2106.08352","citing_paper":"/paper/2506.00832"},"observation_digest":"sha256:2879c2aad038d377bd832227e0da7a5ccd32eac265825828419d754f6967952d","observation_id":"86511840-7bf2-40cd-b188-343e069a30e6","resolution":{"observed_at":"2026-08-07T12:00:13.054479Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:00:14.948693Z","title":"Hierarchical prosody modeling and control in non-autoregressive parallel neural tts,","venue":null,"work_id":"28485cb2-3049-4c00-ae8f-45aa79f175de","year":2022},"citing_paper":{"arxiv_id":"2506.00832","last_updated":"2025-06-01T04:33:37Z","snapshot_observed_at":"2026-08-10T00:43:35.197447Z","submitted_at":"2025-06-01T04:33:37Z","title":"Counterfactual Activation Editing for Post-hoc Prosody and Mispronunciation Correction in TTS Models","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-07T12:00:11.095853Z"},"links":{"citing_paper":"/paper/2506.00832"},"observation_digest":"sha256:3165ee1b7c18fc91b20a28d8bb1c99f3c08851e924776df776c25f3c059a1a8d","observation_id":"f3586622-df59-4260-90dd-f93722557864","resolution":{"observed_at":"2026-08-07T12:00:15.025126Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:00:14.780724Z","title":"Analysis of pronunciation learning in end-to-end speech synthesis","venue":null,"work_id":"d0eca43a-9316-4ceb-88e2-c4092935c90f","year":2019},"citing_paper":{"arxiv_id":"2506.00832","last_updated":"2025-06-01T04:33:37Z","snapshot_observed_at":"2026-08-10T00:43:35.197447Z","submitted_at":"2025-06-01T04:33:37Z","title":"Counterfactual Activation Editing for Post-hoc Prosody and Mispronunciation Correction in TTS Models","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-07T12:00:11.170821Z"},"links":{"citing_paper":"/paper/2506.00832"},"observation_digest":"sha256:d12e3f26ebb4e02eab4debc724793e7eae75ca4146a34fbdfdd95d532da42d9f","observation_id":"1d4052e0-cd1c-4850-990a-bdb2b00d5acb","resolution":{"observed_at":"2026-08-07T12:00:14.866577Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:00:14.563530Z","title":"Expressive prosody for unit- selection speech synthesis","venue":null,"work_id":"21b671c6-6292-46c4-9485-3f7300bc51f1","year":2006},"citing_paper":{"arxiv_id":"2506.00832","last_updated":"2025-06-01T04:33:37Z","snapshot_observed_at":"2026-08-10T00:43:35.197447Z","submitted_at":"2025-06-01T04:33:37Z","title":"Counterfactual Activation Editing for Post-hoc Prosody and Mispronunciation Correction in TTS Models","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-07T12:00:11.217114Z"},"links":{"citing_paper":"/paper/2506.00832"},"observation_digest":"sha256:37ef3e22b8e3e861734a1cebed6c85c1d9c91214ae7d6ab16afb0b4abf72bb59","observation_id":"a4613d82-41a0-40cc-ab7b-439523ce1418","resolution":{"observed_at":"2026-08-07T12:00:14.657076Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.08846","last_updated":"2023-10-13T04:13:26Z","snapshot_observed_at":"2026-07-06T16:32:19.417168Z","submitted_at":"2023-10-13T04:13:26Z","title":"Speaking rate attention-based duration prediction for speed control TTS","version":1},"cited_work":{"arxiv_id":"2310.08846","doi":null,"metadata_source":"pith","pith_arxiv_id":"2310.08846","snapshot_observed_at":"2026-08-07T12:00:12.782356Z","title":"Speaking rate attention-based duration prediction for speed control TTS","venue":"eess.AS","work_id":"711d7c11-9e30-4fed-ba44-8c6d8e300f07","year":2023},"citing_paper":{"arxiv_id":"2506.00832","last_updated":"2025-06-01T04:33:37Z","snapshot_observed_at":"2026-08-10T00:43:35.197447Z","submitted_at":"2025-06-01T04:33:37Z","title":"Counterfactual Activation Editing for Post-hoc Prosody and Mispronunciation Correction in TTS Models","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-07T12:00:11.312003Z"},"links":{"cited_paper":"/paper/2310.08846","citing_paper":"/paper/2506.00832"},"observation_digest":"sha256:57739051eba0e54f78d01475e90d3bfe39093c79b96cff0797188cea7807bf2d","observation_id":"68cf2e50-5554-4ae8-9655-447e62ecce8d","resolution":{"observed_at":"2026-08-07T12:00:12.835344Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:00:14.365616Z","title":"Speaking rate control of end-to-end tts models by direct manipulation of the encoder’s out- put embeddings,","venue":null,"work_id":"6a46985c-569c-4514-a682-c11edfeef099","year":2022},"citing_paper":{"arxiv_id":"2506.00832","last_updated":"2025-06-01T04:33:37Z","snapshot_observed_at":"2026-08-10T00:43:35.197447Z","submitted_at":"2025-06-01T04:33:37Z","title":"Counterfactual Activation Editing for Post-hoc Prosody and Mispronunciation Correction in TTS Models","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-07T12:00:11.374501Z"},"links":{"citing_paper":"/paper/2506.00832"},"observation_digest":"sha256:725ce96725e8bc31a6a77173c53735f2609ea20e541f29ab21e4e2d0f272871c","observation_id":"445b59ed-41b1-4406-9923-d6d1812161ea","resolution":{"observed_at":"2026-08-07T12:00:14.461220Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2012.15404","last_updated":"2020-12-31T02:34:57Z","snapshot_observed_at":"2026-08-08T04:55:45.060984Z","submitted_at":"2020-12-31T02:34:57Z","title":"Unified Mandarin TTS Front-end Based on Distilled BERT Model","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2012.15404","snapshot_observed_at":"2026-08-07T12:00:11.440776Z","title":"Unified mandarin tts front-end based on distilled bert model,","venue":null,"work_id":null,"year":2012},"citing_paper":{"arxiv_id":"2506.00832","last_updated":"2025-06-01T04:33:37Z","snapshot_observed_at":"2026-08-10T00:43:35.197447Z","submitted_at":"2025-06-01T04:33:37Z","title":"Counterfactual Activation Editing for Post-hoc Prosody and Mispronunciation Correction in TTS Models","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-07T12:00:11.440776Z"},"links":{"cited_paper":"/paper/2012.15404","citing_paper":"/paper/2506.00832"},"observation_digest":"sha256:b475e55fcda3f4f543d4318267590dfb4de8c3375b779e21ac43a2e246530871","observation_id":"0b83458a-f700-4ac0-ad80-36057ab40fb3","resolution":{"observed_at":"2026-08-07T12:00:11.440776Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:00:14.188844Z","title":"Speech audio corrector: using speech from non-target speakers for one- off correction of mispronunciations in grapheme-input text-to- speech,","venue":null,"work_id":"385fa46b-c0f1-4794-a729-2970e68e8f53","year":2022},"citing_paper":{"arxiv_id":"2506.00832","last_updated":"2025-06-01T04:33:37Z","snapshot_observed_at":"2026-08-10T00:43:35.197447Z","submitted_at":"2025-06-01T04:33:37Z","title":"Counterfactual Activation Editing for Post-hoc Prosody and Mispronunciation Correction in TTS Models","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-07T12:00:11.517200Z"},"links":{"citing_paper":"/paper/2506.00832"},"observation_digest":"sha256:eae6ffa55e9098f93211898bc99efc2214166ccdc6e8ae2cf6a4b89948757f03","observation_id":"d1e7c6ee-5379-450d-b595-528859d2db11","resolution":{"observed_at":"2026-08-07T12:00:14.256621Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:00:14.076295Z","title":"Exact prosody cloning in zero- shot multispeaker text-to-speech,","venue":null,"work_id":"3481b3f6-3ea6-49b1-ac08-7fe2f1d7f601","year":2023},"citing_paper":{"arxiv_id":"2506.00832","last_updated":"2025-06-01T04:33:37Z","snapshot_observed_at":"2026-08-10T00:43:35.197447Z","submitted_at":"2025-06-01T04:33:37Z","title":"Counterfactual Activation Editing for Post-hoc Prosody and Mispronunciation Correction in TTS Models","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-07T12:00:11.587352Z"},"links":{"citing_paper":"/paper/2506.00832"},"observation_digest":"sha256:5acb67bfe1edc14736c866ecfd6f7fbca64daa1a086fae747609aa92893db7d1","observation_id":"e376def8-8962-4098-8b46-8ebfe1c77cba","resolution":{"observed_at":"2026-08-07T12:00:14.115182Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:00:11.667468Z","title":"Hubert: Self-supervised speech rep- resentation learning by masked prediction of hidden units,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2506.00832","last_updated":"2025-06-01T04:33:37Z","snapshot_observed_at":"2026-08-10T00:43:35.197447Z","submitted_at":"2025-06-01T04:33:37Z","title":"Counterfactual Activation Editing for Post-hoc Prosody and Mispronunciation Correction in TTS Models","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-07T12:00:11.667468Z"},"links":{"citing_paper":"/paper/2506.00832"},"observation_digest":"sha256:5ba19accd994613e2ab8a46b5c00246165876ef2e04c373830db4aa9bd87e6cc","observation_id":"f68dbea8-097f-45fe-9527-0df732a749dd","resolution":{"observed_at":"2026-08-07T12:00:11.667468Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2206.12489","last_updated":"2022-06-24T20:55:46Z","snapshot_observed_at":"2026-08-09T19:10:44.978157Z","submitted_at":"2022-06-24T20:55:46Z","title":"Predicting within and across language phoneme recognition performance of self-supervised learning speech pre-trained models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2206.12489","snapshot_observed_at":"2026-08-07T12:00:11.722250Z","title":"Predicting within and across language phoneme recognition performance of self- supervised learning speech pre-trained models,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.00832","last_updated":"2025-06-01T04:33:37Z","snapshot_observed_at":"2026-08-10T00:43:35.197447Z","submitted_at":"2025-06-01T04:33:37Z","title":"Counterfactual Activation Editing for Post-hoc Prosody and Mispronunciation Correction in TTS Models","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-07T12:00:11.722250Z"},"links":{"cited_paper":"/paper/2206.12489","citing_paper":"/paper/2506.00832"},"observation_digest":"sha256:eb9471323a758574ff064c586e3b1c97aad1c874a72e0cc8ce1b915eac805092","observation_id":"5d2ce58f-ac88-44b7-bbdd-7403a9ea9228","resolution":{"observed_at":"2026-08-07T12:00:11.722250Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1704.03471","last_updated":"2018-10-22T14:27:40Z","snapshot_observed_at":"2026-07-06T05:37:27.385512Z","submitted_at":"2017-04-11T18:01:07Z","title":"What do Neural Machine Translation Models Learn about Morphology?","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1704.03471","snapshot_observed_at":"2026-08-07T12:00:11.782293Z","title":"What do neural machine translation models learn about morphology?","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2506.00832","last_updated":"2025-06-01T04:33:37Z","snapshot_observed_at":"2026-08-10T00:43:35.197447Z","submitted_at":"2025-06-01T04:33:37Z","title":"Counterfactual Activation Editing for Post-hoc Prosody and Mispronunciation Correction in TTS Models","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-07T12:00:11.782293Z"},"links":{"cited_paper":"/paper/1704.03471","citing_paper":"/paper/2506.00832"},"observation_digest":"sha256:ff5c9dc1a6561674783c059c257fa33f03e05d274c6f1e6b2174d6508cd6018b","observation_id":"b1e1493a-f485-411c-97f1-fc0529edeae0","resolution":{"observed_at":"2026-08-07T12:00:11.782293Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:00:13.945231Z","title":"What is one grain of sand in the desert? analyzing individual neu- rons in deep nlp models,","venue":null,"work_id":"a2298314-4b92-4b80-9a6a-fc7a3632d098","year":2019},"citing_paper":{"arxiv_id":"2506.00832","last_updated":"2025-06-01T04:33:37Z","snapshot_observed_at":"2026-08-10T00:43:35.197447Z","submitted_at":"2025-06-01T04:33:37Z","title":"Counterfactual Activation Editing for Post-hoc Prosody and Mispronunciation Correction in TTS Models","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-07T12:00:11.876789Z"},"links":{"citing_paper":"/paper/2506.00832"},"observation_digest":"sha256:82da8f9785cc234f686c0bebe3d8ff4c89f07f8d3d2b27aa5e9707d4a472cff1","observation_id":"4b48f0f9-6544-478c-b1d1-0d2c492e11bc","resolution":{"observed_at":"2026-08-07T12:00:14.001445Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1907.09615","last_updated":"2019-07-22T22:35:51Z","snapshot_observed_at":"2026-08-02T12:52:51.834393Z","submitted_at":"2019-07-22T22:35:51Z","title":"Towards Realistic Individual Recourse and Actionable Explanations in Black-Box Decision Making Systems","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1907.09615","snapshot_observed_at":"2026-08-07T12:00:11.931116Z","title":"Towards realistic individual recourse and actionable explana- tions in black-box decision making systems,","venue":null,"work_id":null,"year":1907},"citing_paper":{"arxiv_id":"2506.00832","last_updated":"2025-06-01T04:33:37Z","snapshot_observed_at":"2026-08-10T00:43:35.197447Z","submitted_at":"2025-06-01T04:33:37Z","title":"Counterfactual Activation Editing for Post-hoc Prosody and Mispronunciation Correction in TTS Models","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-07T12:00:11.931116Z"},"links":{"cited_paper":"/paper/1907.09615","citing_paper":"/paper/2506.00832"},"observation_digest":"sha256:b01f351becca264bc700a13ad5e3e16e7a7c51285df63d20f644ba124885ec24","observation_id":"7e3f52dc-1e90-4081-86ad-cb68208c4814","resolution":{"observed_at":"2026-08-07T12:00:11.931116Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:00:13.795718Z","title":"Diffeomorphic counterfactuals with generative models,","venue":null,"work_id":"70f70584-7f3a-497e-b049-9eef477e8bca","year":2023},"citing_paper":{"arxiv_id":"2506.00832","last_updated":"2025-06-01T04:33:37Z","snapshot_observed_at":"2026-08-10T00:43:35.197447Z","submitted_at":"2025-06-01T04:33:37Z","title":"Counterfactual Activation Editing for Post-hoc Prosody and Mispronunciation Correction in TTS Models","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-07T12:00:12.023797Z"},"links":{"citing_paper":"/paper/2506.00832"},"observation_digest":"sha256:6946ce89f9f6b5e9ba93b8d7e32f84c7aac99da30e283785afa6292cbceb828b","observation_id":"1952a89f-b8e6-4015-b9a0-e0f5dc6cdf65","resolution":{"observed_at":"2026-08-07T12:00:13.854760Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:00:13.664023Z","title":"beta-vae: Learning basic visual concepts with a constrained variational framework,","venue":null,"work_id":"0f60df19-e0c9-44f4-bf4b-a159c16c9731","year":2016},"citing_paper":{"arxiv_id":"2506.00832","last_updated":"2025-06-01T04:33:37Z","snapshot_observed_at":"2026-08-10T00:43:35.197447Z","submitted_at":"2025-06-01T04:33:37Z","title":"Counterfactual Activation Editing for Post-hoc Prosody and Mispronunciation Correction in TTS Models","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-07T12:00:12.065057Z"},"links":{"citing_paper":"/paper/2506.00832"},"observation_digest":"sha256:1f9591fa2e8a505b81ebe2954e38f584eb73424171e2613fd9b151ba6ce8f275","observation_id":"1db4c802-4710-465f-bea5-b579d3e189c3","resolution":{"observed_at":"2026-08-07T12:00:13.742857Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:00:13.528383Z","title":"Neural discrete represen- tation learning,","venue":null,"work_id":"37a3f5d0-bf96-4397-b0f9-22ca492701c3","year":2017},"citing_paper":{"arxiv_id":"2506.00832","last_updated":"2025-06-01T04:33:37Z","snapshot_observed_at":"2026-08-10T00:43:35.197447Z","submitted_at":"2025-06-01T04:33:37Z","title":"Counterfactual Activation Editing for Post-hoc Prosody and Mispronunciation Correction in TTS Models","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-07T12:00:12.131190Z"},"links":{"citing_paper":"/paper/2506.00832"},"observation_digest":"sha256:9dcd3ffc64b5b46585780e42ce85960b43b19d5d47726707795d28bcf276c533","observation_id":"fd3bb7e5-c28d-4611-ad1d-542c4bbf2e2f","resolution":{"observed_at":"2026-08-07T12:00:13.586825Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:00:12.209634Z","title":"The lj speech dataset,","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2506.00832","last_updated":"2025-06-01T04:33:37Z","snapshot_observed_at":"2026-08-10T00:43:35.197447Z","submitted_at":"2025-06-01T04:33:37Z","title":"Counterfactual Activation Editing for Post-hoc Prosody and Mispronunciation Correction in TTS Models","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-07T12:00:12.209634Z"},"links":{"citing_paper":"/paper/2506.00832"},"observation_digest":"sha256:6d12aaa34891ac108a71961b810ed09bef31aba4198ef9116979ea1d2f861074","observation_id":"861b9cab-a2b4-4017-8617-33324a2c61ab","resolution":{"observed_at":"2026-08-07T12:00:12.209634Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1809.11096","last_updated":"2019-02-25T21:32:06Z","snapshot_observed_at":"2026-07-06T07:04:57.275371Z","submitted_at":"2018-09-28T15:38:49Z","title":"Large Scale GAN Training for High Fidelity Natural Image Synthesis","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1809.11096","snapshot_observed_at":"2026-08-07T12:00:12.264666Z","title":"Large scale gan train- ing for high fidelity natural image synthesis,","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2506.00832","last_updated":"2025-06-01T04:33:37Z","snapshot_observed_at":"2026-08-10T00:43:35.197447Z","submitted_at":"2025-06-01T04:33:37Z","title":"Counterfactual Activation Editing for Post-hoc Prosody and Mispronunciation Correction in TTS Models","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-07T12:00:12.264666Z"},"links":{"cited_paper":"/paper/1809.11096","citing_paper":"/paper/2506.00832"},"observation_digest":"sha256:680afc3f78b47da9113495cbf4c6985b8c22933b94c8162bf46ea9ec38090858","observation_id":"f8e062e2-2d29-4f38-bb32-edd9b8a6d929","resolution":{"observed_at":"2026-08-07T12:00:12.264666Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:00:12.370607Z","title":"Robust speech recognition via large-scale weak su- pervision,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.00832","last_updated":"2025-06-01T04:33:37Z","snapshot_observed_at":"2026-08-10T00:43:35.197447Z","submitted_at":"2025-06-01T04:33:37Z","title":"Counterfactual Activation Editing for Post-hoc Prosody and Mispronunciation Correction in TTS Models","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-07T12:00:12.370607Z"},"links":{"citing_paper":"/paper/2506.00832"},"observation_digest":"sha256:95291d864639d4c14b6e0fc9c57b1e71755e9d29bec8544c90ecb69017e3bbf2","observation_id":"c22909a4-cdd4-41c5-a5c2-13d369506f8e","resolution":{"observed_at":"2026-08-07T12:00:12.370607Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:00:12.455556Z","title":"Language models are unsupervised multitask learners,","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2506.00832","last_updated":"2025-06-01T04:33:37Z","snapshot_observed_at":"2026-08-10T00:43:35.197447Z","submitted_at":"2025-06-01T04:33:37Z","title":"Counterfactual Activation Editing for Post-hoc Prosody and Mispronunciation Correction in TTS Models","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-07T12:00:12.455556Z"},"links":{"citing_paper":"/paper/2506.00832"},"observation_digest":"sha256:899d5522d01f2f07d135730e79d1b18b4ae2c98dbc90dfcd6f111303233cd438","observation_id":"a972daaa-7f52-4136-8cb9-cfa7279a8627","resolution":{"observed_at":"2026-08-07T12:00:12.455556Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:00:13.323891Z","title":"Speech quality assessment,","venue":null,"work_id":"16603543-a432-401c-ae7e-a50d96478208","year":2011},"citing_paper":{"arxiv_id":"2506.00832","last_updated":"2025-06-01T04:33:37Z","snapshot_observed_at":"2026-08-10T00:43:35.197447Z","submitted_at":"2025-06-01T04:33:37Z","title":"Counterfactual Activation Editing for Post-hoc Prosody and Mispronunciation Correction in TTS Models","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-07T12:00:12.519114Z"},"links":{"citing_paper":"/paper/2506.00832"},"observation_digest":"sha256:705f1fce39fa55f1bf41a710130e4d28ad694c605c1701a2956bfce9fcf90149","observation_id":"3363bde7-799e-4e73-8c61-0ef606ae6fa3","resolution":{"observed_at":"2026-08-07T12:00:13.409116Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2506.00832","last_updated":"2025-06-01T04:33:37Z","latest_version":1,"primary_category":"cs.SD","snapshot_observed_at":"2026-08-10T00:43:35.197447Z","submitted_at":"2025-06-01T04:33:37Z","title":"Counterfactual Activation Editing for Post-hoc Prosody and Mispronunciation Correction in TTS Models"},"reference_resolution":{"displayed":42,"state_counts":{"malformed_identifier":0,"metadata_mismatch":1,"parse_uncertain":0,"unresolved":18,"verified_exact":2,"verified_fuzzy":21},"total_outbound_references":42},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"thesis":"As of 10 August 2026, this Paper Citation Record lists 42 of 42 outbound references and 1 inbound Pith citation observation for arXiv:2506.00832."}