{"as_of":"2026-08-10T12:09:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:80f39afa0055634aed04041c37c19b1ab8946470b225d3dbd6b7d168d6ea9563","coverage":[{"denominator":60,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":60,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-06T21:11:40.541402Z","state":"measured"},{"denominator":61,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":61,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-10T06:31:04.303077+00:00","state":"measured"},{"denominator":1,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":1,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-06T21:11:26.568638Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"pith","source_observed_at":"2026-08-06T21:11:40.627696Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2507.00808","last_updated":"2025-07-02T05:42:47Z","snapshot_observed_at":"2026-08-08T00:25:18.890247Z","submitted_at":"2025-07-01T14:40:51Z","title":"Multi-interaction TTS toward professional recording reproduction","version":2},"cited_work":{"arxiv_id":"2507.00808","doi":null,"metadata_source":"pith","pith_arxiv_id":"2507.00808","snapshot_observed_at":"2026-08-06T21:11:40.627696Z","title":"Multi-interaction TTS toward professional recording reproduction","venue":"cs.SD","work_id":"862b98b9-88e9-44a0-9971-145b947b7f0b","year":2025},"citing_paper":{"arxiv_id":"2507.00808","last_updated":"2025-07-02T05:42:47Z","snapshot_observed_at":"2026-08-08T00:25:18.890247Z","submitted_at":"2025-07-01T14:40:51Z","title":"Multi-interaction TTS toward professional recording reproduction","version":2},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-06T21:11:26.568638Z"},"links":{"cited_paper":"/paper/2507.00808","citing_paper":"/paper/2507.00808"},"observation_digest":"sha256:e1248b1f90cde9393037386814eb74625e16282e952acf2b5d20f7e5578a56ba","observation_id":"f5356663-a23d-46d0-be41-e81f4b445693","resolution":{"observed_at":"2026-08-06T21:11:40.632803Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2507.00808/citation-record","integrity":"/paper/2507.00808/integrity","json":"/paper/2507.00808/citation-record.json","paper":"/paper/2507.00808"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2507.00808","last_updated":"2025-07-02T05:42:47Z","snapshot_observed_at":"2026-08-08T00:25:18.890247Z","submitted_at":"2025-07-01T14:40:51Z","title":"Multi-interaction TTS toward professional recording reproduction","version":2},"cited_work":{"arxiv_id":"2507.00808","doi":null,"metadata_source":"pith","pith_arxiv_id":"2507.00808","snapshot_observed_at":"2026-08-06T21:11:40.627696Z","title":"Multi-interaction TTS toward professional recording reproduction","venue":"cs.SD","work_id":"862b98b9-88e9-44a0-9971-145b947b7f0b","year":2025},"citing_paper":{"arxiv_id":"2507.00808","last_updated":"2025-07-02T05:42:47Z","snapshot_observed_at":"2026-08-08T00:25:18.890247Z","submitted_at":"2025-07-01T14:40:51Z","title":"Multi-interaction TTS toward professional recording reproduction","version":2},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-06T21:11:26.568638Z"},"links":{"cited_paper":"/paper/2507.00808","citing_paper":"/paper/2507.00808"},"observation_digest":"sha256:e1248b1f90cde9393037386814eb74625e16282e952acf2b5d20f7e5578a56ba","observation_id":"f5356663-a23d-46d0-be41-e81f4b445693","resolution":{"observed_at":"2026-08-06T21:11:40.632803Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:11:41.239930Z","title":"During the recording of this dataset, a di- rector iteratively gave acting directions, and the voice actor then reflected the given directions","venue":null,"work_id":"b42fb6d9-c10f-4a52-ba8b-f3046cf0f7a3","year":null},"citing_paper":{"arxiv_id":"2507.00808","last_updated":"2025-07-02T05:42:47Z","snapshot_observed_at":"2026-08-08T00:25:18.890247Z","submitted_at":"2025-07-01T14:40:51Z","title":"Multi-interaction TTS toward professional recording reproduction","version":2},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-06T21:11:26.576860Z"},"links":{"citing_paper":"/paper/2507.00808"},"observation_digest":"sha256:44e80895f8ce9a369f5f44331387dd6d28568c8c6ce45cddb8bd5a79c14bed98","observation_id":"c49bf936-37ec-4847-a415-fd790f86d472","resolution":{"observed_at":"2026-08-06T21:11:41.243995Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:11:41.227809Z","title":"Speak more brightly,","venue":null,"work_id":"27c0494d-73d1-4021-9919-0cd48c521d71","year":null},"citing_paper":{"arxiv_id":"2507.00808","last_updated":"2025-07-02T05:42:47Z","snapshot_observed_at":"2026-08-08T00:25:18.890247Z","submitted_at":"2025-07-01T14:40:51Z","title":"Multi-interaction TTS toward professional recording reproduction","version":2},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-06T21:11:26.591023Z"},"links":{"citing_paper":"/paper/2507.00808"},"observation_digest":"sha256:5cae3e9fe8c1d51864e5b2903410a28b165d110e6b428b5399618aa20478edb6","observation_id":"e1c22324-83e5-42e7-bef6-bbd725d26ea2","resolution":{"observed_at":"2026-08-06T21:11:41.232486Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:11:41.217413Z","title":"In- sert a silent-pause after this word,","venue":null,"work_id":"35977ba9-fe6e-475b-b9d8-d006f62881df","year":null},"citing_paper":{"arxiv_id":"2507.00808","last_updated":"2025-07-02T05:42:47Z","snapshot_observed_at":"2026-08-08T00:25:18.890247Z","submitted_at":"2025-07-01T14:40:51Z","title":"Multi-interaction TTS toward professional recording reproduction","version":2},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-06T21:11:26.605668Z"},"links":{"citing_paper":"/paper/2507.00808"},"observation_digest":"sha256:a6304d0c62366de06e625c8c92cee46b870fcd6c83b2432a261fa320ae2f4653","observation_id":"7d97edb3-756a-490f-b9ba-e537f8a8edae","resolution":{"observed_at":"2026-08-06T21:11:41.220883Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:11:41.205290Z","title":"Follow my example","venue":null,"work_id":"e0309806-41a9-4478-9601-8224bab79296","year":null},"citing_paper":{"arxiv_id":"2507.00808","last_updated":"2025-07-02T05:42:47Z","snapshot_observed_at":"2026-08-08T00:25:18.890247Z","submitted_at":"2025-07-01T14:40:51Z","title":"Multi-interaction TTS toward professional recording reproduction","version":2},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-06T21:11:26.623467Z"},"links":{"citing_paper":"/paper/2507.00808"},"observation_digest":"sha256:3b421b6df461acf035a190e3665940f8936a9e5de069962945528061d69f0891","observation_id":"e59eaec2-69c1-42b3-8cb5-86b257961fb5","resolution":{"observed_at":"2026-08-06T21:11:41.209689Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:11:41.190861Z","title":"The Guideline for TTS Speaking Style Classification","venue":null,"work_id":"45ca8209-54b1-4f99-a1cf-4af0a3fac4ea","year":null},"citing_paper":{"arxiv_id":"2507.00808","last_updated":"2025-07-02T05:42:47Z","snapshot_observed_at":"2026-08-08T00:25:18.890247Z","submitted_at":"2025-07-01T14:40:51Z","title":"Multi-interaction TTS toward professional recording reproduction","version":2},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-06T21:11:26.642547Z"},"links":{"citing_paper":"/paper/2507.00808"},"observation_digest":"sha256:2ec25ff30b6239dd4c43be711922a730764580c4911f1cd008389ae847c46fe9","observation_id":"0bc539be-d5a5-48d3-9873-1a8d7fd58242","resolution":{"observed_at":"2026-08-06T21:11:41.195100Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:11:41.178410Z","title":"Dataset We used three Japanese 22 kHz datasets: interactive, non- interactive, and large in-house datasets","venue":null,"work_id":"9f82e59f-a1b5-4388-8941-8d2d08986193","year":null},"citing_paper":{"arxiv_id":"2507.00808","last_updated":"2025-07-02T05:42:47Z","snapshot_observed_at":"2026-08-08T00:25:18.890247Z","submitted_at":"2025-07-01T14:40:51Z","title":"Multi-interaction TTS toward professional recording reproduction","version":2},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-06T21:11:26.663023Z"},"links":{"citing_paper":"/paper/2507.00808"},"observation_digest":"sha256:d685564ff6dbca47c283442f08d5dd69748cbeb0e58e976912b11e4d814c3d9e","observation_id":"589bc8ec-64dd-45fb-b977-05653a3c6f3c","resolution":{"observed_at":"2026-08-06T21:11:41.182706Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:11:41.167040Z","title":null,"venue":null,"work_id":"1dddc731-e5ac-463b-bf08-88de2b34ff48","year":null},"citing_paper":{"arxiv_id":"2507.00808","last_updated":"2025-07-02T05:42:47Z","snapshot_observed_at":"2026-08-08T00:25:18.890247Z","submitted_at":"2025-07-01T14:40:51Z","title":"Multi-interaction TTS toward professional recording reproduction","version":2},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-06T21:11:26.683475Z"},"links":{"citing_paper":"/paper/2507.00808"},"observation_digest":"sha256:f53ac827917062c7567a5baa6015a4162b5b9c201a067c2aae899f43527f65df","observation_id":"2255d797-b963-460e-befe-03f7b0d40e36","resolution":{"observed_at":"2026-08-06T21:11:41.170322Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:11:41.154783Z","title":null,"venue":null,"work_id":"59f7be4a-1247-4556-a490-898b525d2bac","year":null},"citing_paper":{"arxiv_id":"2507.00808","last_updated":"2025-07-02T05:42:47Z","snapshot_observed_at":"2026-08-08T00:25:18.890247Z","submitted_at":"2025-07-01T14:40:51Z","title":"Multi-interaction TTS toward professional recording reproduction","version":2},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-06T21:11:26.694379Z"},"links":{"citing_paper":"/paper/2507.00808"},"observation_digest":"sha256:c870772ec557566c7910ade4961a284c54c660a4801dfb53a41249abd133272c","observation_id":"53851e5c-e299-44a8-bb96-0a63fe1a2e24","resolution":{"observed_at":"2026-08-06T21:11:41.159357Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:11:41.144447Z","title":"The loss function and learning rate were the same as in the previous step","venue":null,"work_id":"1099232e-90e0-4d1d-af1e-26f77a5ddcfe","year":null},"citing_paper":{"arxiv_id":"2507.00808","last_updated":"2025-07-02T05:42:47Z","snapshot_observed_at":"2026-08-08T00:25:18.890247Z","submitted_at":"2025-07-01T14:40:51Z","title":"Multi-interaction TTS toward professional recording reproduction","version":2},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-06T21:11:26.703922Z"},"links":{"citing_paper":"/paper/2507.00808"},"observation_digest":"sha256:e1e0f23bdc9928a75e61ab032b85267b311324d3c708333f02c6491341a4af68","observation_id":"98649d8d-f586-442b-a582-b690c2f38fc5","resolution":{"observed_at":"2026-08-06T21:11:41.148255Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:11:41.133637Z","title":"The training step was 10K steps with AdamW optimizer [41] with 4K warm-up steps","venue":null,"work_id":"c5047e62-5a8c-48e7-a71c-c4af6eacaf80","year":null},"citing_paper":{"arxiv_id":"2507.00808","last_updated":"2025-07-02T05:42:47Z","snapshot_observed_at":"2026-08-08T00:25:18.890247Z","submitted_at":"2025-07-01T14:40:51Z","title":"Multi-interaction TTS toward professional recording reproduction","version":2},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-06T21:11:26.715018Z"},"links":{"citing_paper":"/paper/2507.00808"},"observation_digest":"sha256:56dd1baf3e20d6267e166f36c837b2d854864087cf9c797979ef4ae9743a9355","observation_id":"84dc560a-abc9-4044-bb90-bc8db27c61d3","resolution":{"observed_at":"2026-08-06T21:11:41.137813Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:11:41.122190Z","title":"Overall alignment only","venue":null,"work_id":"67317ba5-0d15-4aba-9c5e-86e120a092cf","year":null},"citing_paper":{"arxiv_id":"2507.00808","last_updated":"2025-07-02T05:42:47Z","snapshot_observed_at":"2026-08-08T00:25:18.890247Z","submitted_at":"2025-07-01T14:40:51Z","title":"Multi-interaction TTS toward professional recording reproduction","version":2},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-06T21:11:26.725122Z"},"links":{"citing_paper":"/paper/2507.00808"},"observation_digest":"sha256:9234d4b444392ff8f14082ed500e7b1faf5220d1dbe5a81733fd2257b2d66909","observation_id":"62883a09-b4af-4998-81d9-34b4d500cd6f","resolution":{"observed_at":"2026-08-06T21:11:41.125676Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:11:41.111658Z","title":"at the beginning","venue":null,"work_id":"795f2f73-8139-43b7-bf59-e9bb48f434c3","year":null},"citing_paper":{"arxiv_id":"2507.00808","last_updated":"2025-07-02T05:42:47Z","snapshot_observed_at":"2026-08-08T00:25:18.890247Z","submitted_at":"2025-07-01T14:40:51Z","title":"Multi-interaction TTS toward professional recording reproduction","version":2},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-06T21:11:26.736074Z"},"links":{"citing_paper":"/paper/2507.00808"},"observation_digest":"sha256:4d6de88aa73a8e0f4c234ca8f463d8c80e46705779409fe3661d57d5536ce91b","observation_id":"30701ae4-0d7b-4e3d-bc99-85fcfd78448c","resolution":{"observed_at":"2026-08-06T21:11:41.115057Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:11:41.100822Z","title":"Subjective evaluations demonstrated that our proposed method achieved iterative style refinement that matched the user’s di- rections to some extent","venue":null,"work_id":"a036ce55-d590-48ed-8748-09ef9b9ebea8","year":null},"citing_paper":{"arxiv_id":"2507.00808","last_updated":"2025-07-02T05:42:47Z","snapshot_observed_at":"2026-08-08T00:25:18.890247Z","submitted_at":"2025-07-01T14:40:51Z","title":"Multi-interaction TTS toward professional recording reproduction","version":2},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-06T21:11:26.749700Z"},"links":{"citing_paper":"/paper/2507.00808"},"observation_digest":"sha256:ffef190ac530000e2d892634963815386119eeeff515e6b3f6a9eec20bcb7250","observation_id":"11d0c593-3556-437e-8097-2fccaec969bf","resolution":{"observed_at":"2026-08-06T21:11:41.104855Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:11:41.087896Z","title":"The relevance of trial-and-error: Can trial-and- error be a sufficient learning method in technical problem-solving- contexts?","venue":null,"work_id":"fe137a7c-a878-461e-882c-ebbb528d62bf","year":2021},"citing_paper":{"arxiv_id":"2507.00808","last_updated":"2025-07-02T05:42:47Z","snapshot_observed_at":"2026-08-08T00:25:18.890247Z","submitted_at":"2025-07-01T14:40:51Z","title":"Multi-interaction TTS toward professional recording reproduction","version":2},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-06T21:11:26.754699Z"},"links":{"citing_paper":"/paper/2507.00808"},"observation_digest":"sha256:466fd22dba18a0cbbe90f62a9ce14fed61875810663ec387b9cab2d2d0ce623a","observation_id":"163bc918-16bc-40fe-a3db-a4eac5a8a983","resolution":{"observed_at":"2026-08-06T21:11:41.092369Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:11:41.075725Z","title":"From da Vinci’s flying machines to a theory of the creative process,","venue":null,"work_id":"fe79dc77-9882-4ec5-b3a7-b7aa6fb0fedb","year":2021},"citing_paper":{"arxiv_id":"2507.00808","last_updated":"2025-07-02T05:42:47Z","snapshot_observed_at":"2026-08-08T00:25:18.890247Z","submitted_at":"2025-07-01T14:40:51Z","title":"Multi-interaction TTS toward professional recording reproduction","version":2},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-06T21:11:26.762988Z"},"links":{"citing_paper":"/paper/2507.00808"},"observation_digest":"sha256:f8ac146e837c34aa776f54196b2caef6e5e24a3394a134ac3349287d8e4cc77d","observation_id":"d8bf1404-3233-4bf1-9700-f8452d280a5c","resolution":{"observed_at":"2026-08-06T21:11:41.079650Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:11:41.063465Z","title":"What are the stages of the creative process? What visual art students are saying","venue":null,"work_id":"575eb29d-7d15-4dab-b20f-8e6715b7f3ca","year":2018},"citing_paper":{"arxiv_id":"2507.00808","last_updated":"2025-07-02T05:42:47Z","snapshot_observed_at":"2026-08-08T00:25:18.890247Z","submitted_at":"2025-07-01T14:40:51Z","title":"Multi-interaction TTS toward professional recording reproduction","version":2},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-06T21:11:26.806058Z"},"links":{"citing_paper":"/paper/2507.00808"},"observation_digest":"sha256:9e0839f2435e7bb5434ade2bc8bb98e3d90266b2edae777919cd7733c167a930","observation_id":"1f4e05c7-a4fa-4026-a76d-176b02ac7acf","resolution":{"observed_at":"2026-08-06T21:11:41.067214Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:11:41.051582Z","title":"From page to stage: The director’s interpretation and picturization of a script,","venue":null,"work_id":"2ef9e609-8023-4f62-b4a3-e142452343cf","year":2023},"citing_paper":{"arxiv_id":"2507.00808","last_updated":"2025-07-02T05:42:47Z","snapshot_observed_at":"2026-08-08T00:25:18.890247Z","submitted_at":"2025-07-01T14:40:51Z","title":"Multi-interaction TTS toward professional recording reproduction","version":2},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-06T21:11:26.863549Z"},"links":{"citing_paper":"/paper/2507.00808"},"observation_digest":"sha256:caf5b2e4558776e366837ce277e081f62b319e76fd46e7acb7b8d4f496559a16","observation_id":"af7aab1a-6d09-4f31-87d0-ce2ac2493414","resolution":{"observed_at":"2026-08-06T21:11:41.056318Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:11:41.039057Z","title":"Showing and telling—How directors combine embodied demonstrations and verbal descrip- tions to instruct in theater rehearsals,","venue":null,"work_id":"1ac06ca7-4a21-4ea9-894e-e56967e3469a","year":2023},"citing_paper":{"arxiv_id":"2507.00808","last_updated":"2025-07-02T05:42:47Z","snapshot_observed_at":"2026-08-08T00:25:18.890247Z","submitted_at":"2025-07-01T14:40:51Z","title":"Multi-interaction TTS toward professional recording reproduction","version":2},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-06T21:11:26.952999Z"},"links":{"citing_paper":"/paper/2507.00808"},"observation_digest":"sha256:e83fe6680b2b94cf8dc3085392d4305a225a8ab1f588dc62f590b126b24098ce","observation_id":"e678791d-f81a-4aac-9e6b-68544a57c169","resolution":{"observed_at":"2026-08-06T21:11:41.043331Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2204.06125","last_updated":"2022-04-13T01:10:33Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-04-13T01:10:33Z","title":"Hierarchical Text-Conditional Image Generation with CLIP Latents","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2204.06125","snapshot_observed_at":"2026-08-06T21:11:27.044864Z","title":"Hi- erarchical text-conditional image generation with CLIP latents,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2507.00808","last_updated":"2025-07-02T05:42:47Z","snapshot_observed_at":"2026-08-08T00:25:18.890247Z","submitted_at":"2025-07-01T14:40:51Z","title":"Multi-interaction TTS toward professional recording reproduction","version":2},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-06T21:11:27.044864Z"},"links":{"cited_paper":"/paper/2204.06125","citing_paper":"/paper/2507.00808"},"observation_digest":"sha256:9f5a0ce5c1dc0a0edc1837046ef878ba18dbc3e5cf07c61927a351a64bd98275","observation_id":"6cf3832f-cff7-4458-a084-a642fbc34abb","resolution":{"observed_at":"2026-08-06T21:11:27.044864Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:11:41.027161Z","title":"High-resolution image synthesis with latent diffusion models,","venue":null,"work_id":"96cc5b7b-4473-4934-9a9d-afcf221f479e","year":2022},"citing_paper":{"arxiv_id":"2507.00808","last_updated":"2025-07-02T05:42:47Z","snapshot_observed_at":"2026-08-08T00:25:18.890247Z","submitted_at":"2025-07-01T14:40:51Z","title":"Multi-interaction TTS toward professional recording reproduction","version":2},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-06T21:11:27.144346Z"},"links":{"citing_paper":"/paper/2507.00808"},"observation_digest":"sha256:7127d1cec7634c42324d05ae9be023a1c561591eee9e7d0c9e97aa1675b66103","observation_id":"e58288b0-a4b1-4f92-a2ef-a146ededeeb0","resolution":{"observed_at":"2026-08-06T21:11:41.030672Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:11:41.015294Z","title":"Photorealistic text-to- image diffusion models with deep language understanding,","venue":null,"work_id":"a452c608-1d36-43d1-8256-b5eaad270c13","year":2022},"citing_paper":{"arxiv_id":"2507.00808","last_updated":"2025-07-02T05:42:47Z","snapshot_observed_at":"2026-08-08T00:25:18.890247Z","submitted_at":"2025-07-01T14:40:51Z","title":"Multi-interaction TTS toward professional recording reproduction","version":2},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-06T21:11:27.271811Z"},"links":{"citing_paper":"/paper/2507.00808"},"observation_digest":"sha256:74b53e4642cf9de8e674b2afff7260624f7f99816fd26b3f8c2cf50b09220289","observation_id":"aae4d33f-0de3-41cc-b023-a8f231788bf9","resolution":{"observed_at":"2026-08-06T21:11:41.019811Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2108.07732","last_updated":"2021-08-16T03:57:30Z","snapshot_observed_at":"2026-08-02T19:23:53.535075Z","submitted_at":"2021-08-16T03:57:30Z","title":"Program Synthesis with Large Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2108.07732","snapshot_observed_at":"2026-08-06T21:11:27.358467Z","title":"Program synthesis with large language models,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2507.00808","last_updated":"2025-07-02T05:42:47Z","snapshot_observed_at":"2026-08-08T00:25:18.890247Z","submitted_at":"2025-07-01T14:40:51Z","title":"Multi-interaction TTS toward professional recording reproduction","version":2},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-06T21:11:27.358467Z"},"links":{"cited_paper":"/paper/2108.07732","citing_paper":"/paper/2507.00808"},"observation_digest":"sha256:bee101a5915da645d493017f977d51a42accc0c1cec950a0628b8d5f36d0e20f","observation_id":"0a6f5387-cb32-4563-8ea8-44b89c4a90a1","resolution":{"observed_at":"2026-08-06T21:11:27.358467Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:11:41.001958Z","title":"CodeGen: An open large language model for code with multi-turn program synthesis,","venue":null,"work_id":"b03b743c-6c9c-47c7-97bd-958f5c2c6c9c","year":2023},"citing_paper":{"arxiv_id":"2507.00808","last_updated":"2025-07-02T05:42:47Z","snapshot_observed_at":"2026-08-08T00:25:18.890247Z","submitted_at":"2025-07-01T14:40:51Z","title":"Multi-interaction TTS toward professional recording reproduction","version":2},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-06T21:11:27.459503Z"},"links":{"citing_paper":"/paper/2507.00808"},"observation_digest":"sha256:48e1e3b7efebee539d81ec24b4b30c1383b8f54563adec79cae639a23c50b902","observation_id":"5ddfe0d6-1d71-498e-b9b0-ef9c9ae37a37","resolution":{"observed_at":"2026-08-06T21:11:41.006962Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:11:40.987966Z","title":"Training language models to follow instruc- tions with human feedback,","venue":null,"work_id":"f73d885a-7df1-48b2-9f5f-7a84d001a695","year":2022},"citing_paper":{"arxiv_id":"2507.00808","last_updated":"2025-07-02T05:42:47Z","snapshot_observed_at":"2026-08-08T00:25:18.890247Z","submitted_at":"2025-07-01T14:40:51Z","title":"Multi-interaction TTS toward professional recording reproduction","version":2},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-06T21:11:40.323645Z"},"links":{"citing_paper":"/paper/2507.00808"},"observation_digest":"sha256:8cb11beb7f95530ec1a0223df5388073195d7325d0e0a25e3b95d144c090bc5d","observation_id":"d212c621-fc9d-4f65-a863-63aa3f829877","resolution":{"observed_at":"2026-08-06T21:11:40.993049Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:11:40.976118Z","title":"PaLM: Scaling language modeling with path- ways,","venue":null,"work_id":"9d1a6163-9e7d-4320-90c7-b7b4b62ed975","year":2023},"citing_paper":{"arxiv_id":"2507.00808","last_updated":"2025-07-02T05:42:47Z","snapshot_observed_at":"2026-08-08T00:25:18.890247Z","submitted_at":"2025-07-01T14:40:51Z","title":"Multi-interaction TTS toward professional recording reproduction","version":2},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-06T21:11:40.341138Z"},"links":{"citing_paper":"/paper/2507.00808"},"observation_digest":"sha256:4282db5eda2e265aace8bb270697adc0eb3ce91c861d2e17625bb1ae3afa2be2","observation_id":"75703a4b-a7e8-464c-a830-477c1c0ca0e4","resolution":{"observed_at":"2026-08-06T21:11:40.980148Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2106.15561","last_updated":"2021-07-23T12:32:52Z","snapshot_observed_at":"2026-08-08T12:28:23.489422Z","submitted_at":"2021-06-29T16:50:51Z","title":"A Survey on Neural Speech Synthesis","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2106.15561","snapshot_observed_at":"2026-08-06T21:11:40.364754Z","title":"A survey on neural speech synthesis,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2507.00808","last_updated":"2025-07-02T05:42:47Z","snapshot_observed_at":"2026-08-08T00:25:18.890247Z","submitted_at":"2025-07-01T14:40:51Z","title":"Multi-interaction TTS toward professional recording reproduction","version":2},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-06T21:11:40.364754Z"},"links":{"cited_paper":"/paper/2106.15561","citing_paper":"/paper/2507.00808"},"observation_digest":"sha256:3beacd9c2b89a5b8743ca8b1733f7354c78287049d92d3c3f22ea15e09f7b3d6","observation_id":"8b928b82-e0bb-41eb-b8de-269c3720e067","resolution":{"observed_at":"2026-08-06T21:11:40.364754Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:11:40.391082Z","title":"A review of deep learning techniques for speech processing,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.00808","last_updated":"2025-07-02T05:42:47Z","snapshot_observed_at":"2026-08-08T00:25:18.890247Z","submitted_at":"2025-07-01T14:40:51Z","title":"Multi-interaction TTS toward professional recording reproduction","version":2},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-06T21:11:40.391082Z"},"links":{"citing_paper":"/paper/2507.00808"},"observation_digest":"sha256:95c2d53d6ad82101537edca3a8d1b32767d7e7d76c01b39c81fcad10b0abe74b","observation_id":"229a5f78-d42d-43a9-9874-757d67685f5d","resolution":{"observed_at":"2026-08-06T21:11:40.391082Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:11:40.956891Z","title":"Model archi- tectures to extrapolate emotional expressions in DNN-based text- to-speech,","venue":null,"work_id":"63a44829-6434-4ab4-ac02-02d1059e1c4d","year":2021},"citing_paper":{"arxiv_id":"2507.00808","last_updated":"2025-07-02T05:42:47Z","snapshot_observed_at":"2026-08-08T00:25:18.890247Z","submitted_at":"2025-07-01T14:40:51Z","title":"Multi-interaction TTS toward professional recording reproduction","version":2},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-06T21:11:40.408756Z"},"links":{"citing_paper":"/paper/2507.00808"},"observation_digest":"sha256:07e4d342410300b3828f5f12aa21555cdda2e034e7af46e2544350b62d76e5a3","observation_id":"4b376339-a22d-4f5a-b305-0dcea196f62a","resolution":{"observed_at":"2026-08-06T21:11:40.961913Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:11:40.944842Z","title":"V oice puppetry: Exploring dramatic performance to develop speech synthesis,","venue":null,"work_id":"285692e3-4a7d-474d-b7a0-d533ff9c3707","year":2019},"citing_paper":{"arxiv_id":"2507.00808","last_updated":"2025-07-02T05:42:47Z","snapshot_observed_at":"2026-08-08T00:25:18.890247Z","submitted_at":"2025-07-01T14:40:51Z","title":"Multi-interaction TTS toward professional recording reproduction","version":2},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-06T21:11:40.417111Z"},"links":{"citing_paper":"/paper/2507.00808"},"observation_digest":"sha256:a5cab473c3d52b156cc1a1ee9baf164ed4b19fd19174c3d472b2d4fcf18e5de7","observation_id":"4da98607-1c1e-42f2-a736-10a0cfe4ae89","resolution":{"observed_at":"2026-08-06T21:11:40.948640Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:11:40.932780Z","title":"V oice puppetry with FastPitch,","venue":null,"work_id":"afec0ef1-df3c-489b-a4a1-ea2229c2e4b0","year":2022},"citing_paper":{"arxiv_id":"2507.00808","last_updated":"2025-07-02T05:42:47Z","snapshot_observed_at":"2026-08-08T00:25:18.890247Z","submitted_at":"2025-07-01T14:40:51Z","title":"Multi-interaction TTS toward professional recording reproduction","version":2},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-06T21:11:40.420350Z"},"links":{"citing_paper":"/paper/2507.00808"},"observation_digest":"sha256:d097eb82fc7d8769bf704e20d6823876ffed4e5f1f707e1b2328949bebaa97e4","observation_id":"d7d8a15b-bdbf-4a10-ad7b-6e9bb3c7339a","resolution":{"observed_at":"2026-08-06T21:11:40.936595Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:11:40.921259Z","title":"Style Tokens: Unsu- pervised style modeling, control and transfer in end-to-end speech synthesis,","venue":null,"work_id":"d25c697f-58b1-4996-84fe-5150cf884c40","year":2018},"citing_paper":{"arxiv_id":"2507.00808","last_updated":"2025-07-02T05:42:47Z","snapshot_observed_at":"2026-08-08T00:25:18.890247Z","submitted_at":"2025-07-01T14:40:51Z","title":"Multi-interaction TTS toward professional recording reproduction","version":2},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-06T21:11:40.423738Z"},"links":{"citing_paper":"/paper/2507.00808"},"observation_digest":"sha256:4d0cc06cfcea6a3ba05cc485aefffb08e5da3f30353db8677de9881c20972d6e","observation_id":"6a885f33-c101-4bd3-8e7c-a2a3de59c71d","resolution":{"observed_at":"2026-08-06T21:11:40.925522Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:11:40.910750Z","title":"Robust and fine-grained prosody control of end-to-end speech synthesis,","venue":null,"work_id":"bec02749-8281-4b11-bb48-1e12d25823b1","year":2019},"citing_paper":{"arxiv_id":"2507.00808","last_updated":"2025-07-02T05:42:47Z","snapshot_observed_at":"2026-08-08T00:25:18.890247Z","submitted_at":"2025-07-01T14:40:51Z","title":"Multi-interaction TTS toward professional recording reproduction","version":2},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-06T21:11:40.437462Z"},"links":{"citing_paper":"/paper/2507.00808"},"observation_digest":"sha256:c1489f125c3854d15a237c9e8658f9cc27ba4a2e7053355697b1fa9d1ca8d015","observation_id":"0858633e-7ff2-4f3a-909d-9a0cb74122cd","resolution":{"observed_at":"2026-08-06T21:11:40.914140Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:11:40.899309Z","title":"Fine- grained robust prosody transfer for single-speaker neural text-to- speech,","venue":null,"work_id":"e81084d2-8a79-4086-a148-3f00780d235b","year":2019},"citing_paper":{"arxiv_id":"2507.00808","last_updated":"2025-07-02T05:42:47Z","snapshot_observed_at":"2026-08-08T00:25:18.890247Z","submitted_at":"2025-07-01T14:40:51Z","title":"Multi-interaction TTS toward professional recording reproduction","version":2},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-06T21:11:40.442586Z"},"links":{"citing_paper":"/paper/2507.00808"},"observation_digest":"sha256:bafa87d20029341068910a122301768739fe0ee548eac1c6c8aef41bedbd707c","observation_id":"82dd43d4-0a36-4e58-8ede-1133e2d234d4","resolution":{"observed_at":"2026-08-06T21:11:40.903959Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:11:40.888845Z","title":"Daft- Exprt: Cross-speaker prosody transfer on any text for expressive speech synthesis,","venue":null,"work_id":"be74fe22-ac5d-4664-be86-e0aa79f2a2c2","year":2022},"citing_paper":{"arxiv_id":"2507.00808","last_updated":"2025-07-02T05:42:47Z","snapshot_observed_at":"2026-08-08T00:25:18.890247Z","submitted_at":"2025-07-01T14:40:51Z","title":"Multi-interaction TTS toward professional recording reproduction","version":2},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-06T21:11:40.448323Z"},"links":{"citing_paper":"/paper/2507.00808"},"observation_digest":"sha256:37c307bdc697e645f33fbfad36b28a07d4b97875c6623c63535fd47466637fe0","observation_id":"92a808f0-8fd2-4add-a03d-b91a9555accb","resolution":{"observed_at":"2026-08-06T21:11:40.892893Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:11:40.877898Z","title":"PromptTTS: Controllable text-to-speech with text descriptions,","venue":null,"work_id":"2e345c65-1eb0-4e7f-89c9-c405fcb69970","year":2023},"citing_paper":{"arxiv_id":"2507.00808","last_updated":"2025-07-02T05:42:47Z","snapshot_observed_at":"2026-08-08T00:25:18.890247Z","submitted_at":"2025-07-01T14:40:51Z","title":"Multi-interaction TTS toward professional recording reproduction","version":2},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-06T21:11:40.452192Z"},"links":{"citing_paper":"/paper/2507.00808"},"observation_digest":"sha256:70892111a8f203fad01240db706b2aac65110277284b550bbdfad3a51306c085","observation_id":"3e7cf286-77db-4070-8541-5dba1a3fde25","resolution":{"observed_at":"2026-08-06T21:11:40.882082Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.01912","last_updated":"2024-02-02T21:29:34Z","snapshot_observed_at":"2026-08-10T02:15:41.685360Z","submitted_at":"2024-02-02T21:29:34Z","title":"Natural language guidance of high-fidelity text-to-speech with synthetic annotations","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.01912","snapshot_observed_at":"2026-08-06T21:11:40.456914Z","title":"Natural language guidance of high- fidelity text-to-speech with synthetic annotations,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.00808","last_updated":"2025-07-02T05:42:47Z","snapshot_observed_at":"2026-08-08T00:25:18.890247Z","submitted_at":"2025-07-01T14:40:51Z","title":"Multi-interaction TTS toward professional recording reproduction","version":2},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-06T21:11:40.456914Z"},"links":{"cited_paper":"/paper/2402.01912","citing_paper":"/paper/2507.00808"},"observation_digest":"sha256:1f64547d89ca4ded83d2dab46476b39bdadca2ff83c18d7bf0484b9979c061ca","observation_id":"5c2cf6a8-f131-4464-984c-ec5e78ae53f9","resolution":{"observed_at":"2026-08-06T21:11:40.456914Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:11:40.867477Z","title":"VoiceCraft: Zero-shot speech editing and text-to-speech in the wild,","venue":null,"work_id":"d3af184e-68ad-4c22-bff8-c9abcebcf5f4","year":2024},"citing_paper":{"arxiv_id":"2507.00808","last_updated":"2025-07-02T05:42:47Z","snapshot_observed_at":"2026-08-08T00:25:18.890247Z","submitted_at":"2025-07-01T14:40:51Z","title":"Multi-interaction TTS toward professional recording reproduction","version":2},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-06T21:11:40.460077Z"},"links":{"citing_paper":"/paper/2507.00808"},"observation_digest":"sha256:197a0af1964db4a1a9503ee91d2cbcb04883fa793d52ee3bfb0dec2a35279125","observation_id":"8e89fee7-5269-4fea-9a9c-9fcabc87d058","resolution":{"observed_at":"2026-08-06T21:11:40.870810Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:11:40.854823Z","title":"V oice at- tribute editing with text prompt,","venue":null,"work_id":"191ee721-ab7e-484a-be38-d756704a3eec","year":2025},"citing_paper":{"arxiv_id":"2507.00808","last_updated":"2025-07-02T05:42:47Z","snapshot_observed_at":"2026-08-08T00:25:18.890247Z","submitted_at":"2025-07-01T14:40:51Z","title":"Multi-interaction TTS toward professional recording reproduction","version":2},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-06T21:11:40.463626Z"},"links":{"citing_paper":"/paper/2507.00808"},"observation_digest":"sha256:8c467cb206c8470a3def5f6f1e85fef972a8e9644b19686b4381ea6afb5b7e00","observation_id":"ee147f85-f3dc-4ce7-ab12-bd22785346eb","resolution":{"observed_at":"2026-08-06T21:11:40.859744Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:11:40.844147Z","title":"The guidelines for TTS speaking style classifi- cation (IT-4012),","venue":null,"work_id":"39408c7d-4b33-4121-86a3-4231d58c60ca","year":2021},"citing_paper":{"arxiv_id":"2507.00808","last_updated":"2025-07-02T05:42:47Z","snapshot_observed_at":"2026-08-08T00:25:18.890247Z","submitted_at":"2025-07-01T14:40:51Z","title":"Multi-interaction TTS toward professional recording reproduction","version":2},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-06T21:11:40.466780Z"},"links":{"citing_paper":"/paper/2507.00808"},"observation_digest":"sha256:a1ce412da234cfbb469bcdbabd46c68ad2da32cfd673c7e376710c0be3395622","observation_id":"c3f6fd9f-63d3-4cb1-8b9f-21642b264989","resolution":{"observed_at":"2026-08-06T21:11:40.848015Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:11:40.831979Z","title":"Zero-shot text-to-speech synthesis conditioned using self- supervised speech representation model,","venue":null,"work_id":"d68c0ab6-2706-4cc6-88f6-19d83de24194","year":2023},"citing_paper":{"arxiv_id":"2507.00808","last_updated":"2025-07-02T05:42:47Z","snapshot_observed_at":"2026-08-08T00:25:18.890247Z","submitted_at":"2025-07-01T14:40:51Z","title":"Multi-interaction TTS toward professional recording reproduction","version":2},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-06T21:11:40.470345Z"},"links":{"citing_paper":"/paper/2507.00808"},"observation_digest":"sha256:36133160399d5a40a41b3b645714a445b111d8f5b85718284268b1d06b6f455d","observation_id":"1c9e30ab-a281-45c9-baed-3c15a4a6478a","resolution":{"observed_at":"2026-08-06T21:11:40.836114Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:11:40.820214Z","title":"Why does self-supervised learning for speech recognition benefit speaker recognition?","venue":null,"work_id":"2f2da908-424a-4f74-8a1a-a407ee223806","year":2022},"citing_paper":{"arxiv_id":"2507.00808","last_updated":"2025-07-02T05:42:47Z","snapshot_observed_at":"2026-08-08T00:25:18.890247Z","submitted_at":"2025-07-01T14:40:51Z","title":"Multi-interaction TTS toward professional recording reproduction","version":2},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-06T21:11:40.474432Z"},"links":{"citing_paper":"/paper/2507.00808"},"observation_digest":"sha256:e5d95afa114274c6bd100fd7c1d48dc12b237506777ddbf60edeb7ebdae7f26b","observation_id":"edd0a729-303e-49e2-817c-e4fd0189a9cc","resolution":{"observed_at":"2026-08-06T21:11:40.824285Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:11:40.808240Z","title":"Feed-forward networks with atten- tion can solve some long-term memory problems,","venue":null,"work_id":"7472c2e9-c51c-4472-ae62-8ed6a697c19d","year":2016},"citing_paper":{"arxiv_id":"2507.00808","last_updated":"2025-07-02T05:42:47Z","snapshot_observed_at":"2026-08-08T00:25:18.890247Z","submitted_at":"2025-07-01T14:40:51Z","title":"Multi-interaction TTS toward professional recording reproduction","version":2},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-06T21:11:40.478099Z"},"links":{"citing_paper":"/paper/2507.00808"},"observation_digest":"sha256:6c9d966162efe2a925dcba992c9df12677b54260beb740ca620f34c2d2ba1794","observation_id":"90c31184-97b6-4947-8cf3-5ad8aea0dadf","resolution":{"observed_at":"2026-08-06T21:11:40.812387Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:11:40.795331Z","title":"FiLM: Visual reasoning with a general conditioning layer,","venue":null,"work_id":"39dcb26e-7e41-46bc-811f-cf5715e1d454","year":2018},"citing_paper":{"arxiv_id":"2507.00808","last_updated":"2025-07-02T05:42:47Z","snapshot_observed_at":"2026-08-08T00:25:18.890247Z","submitted_at":"2025-07-01T14:40:51Z","title":"Multi-interaction TTS toward professional recording reproduction","version":2},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-06T21:11:40.481854Z"},"links":{"citing_paper":"/paper/2507.00808"},"observation_digest":"sha256:96636a67dcc1e6c4d8c769b2f3f4981d3fc415cad35c79145fea82358a494d21","observation_id":"3f58c8c9-6a46-4d3d-8bef-7e44cc592c25","resolution":{"observed_at":"2026-08-06T21:11:40.799080Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:11:40.782621Z","title":"Learning alignment for multimodal emotion recognition from speech,","venue":null,"work_id":"b727fa2c-e20f-4b98-b9d5-6e096190db16","year":2019},"citing_paper":{"arxiv_id":"2507.00808","last_updated":"2025-07-02T05:42:47Z","snapshot_observed_at":"2026-08-08T00:25:18.890247Z","submitted_at":"2025-07-01T14:40:51Z","title":"Multi-interaction TTS toward professional recording reproduction","version":2},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-06T21:11:40.485594Z"},"links":{"citing_paper":"/paper/2507.00808"},"observation_digest":"sha256:a52d5b1b59030baf551a045e64175a3f46d89444e3b855957d4fda01e87755c2","observation_id":"a142c6f3-6c21-4885-9782-5769efddf13f","resolution":{"observed_at":"2026-08-06T21:11:40.786499Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:11:40.769292Z","title":"Multimodal cross- and self-attention network for speech emotion recognition,","venue":null,"work_id":"02368237-d04a-4e72-8379-6a3e342e1713","year":2021},"citing_paper":{"arxiv_id":"2507.00808","last_updated":"2025-07-02T05:42:47Z","snapshot_observed_at":"2026-08-08T00:25:18.890247Z","submitted_at":"2025-07-01T14:40:51Z","title":"Multi-interaction TTS toward professional recording reproduction","version":2},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-06T21:11:40.489331Z"},"links":{"citing_paper":"/paper/2507.00808"},"observation_digest":"sha256:3adea97286b9e6d6d31ba624ff5ac695bef109c87675244cf9454d9a048e2cb5","observation_id":"6f8acf10-56df-4593-9a55-93ff0820cb56","resolution":{"observed_at":"2026-08-06T21:11:40.774085Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:11:40.757424Z","title":"Hello GPT-4o,","venue":null,"work_id":"1c51ae04-a296-418b-a635-28f298a9f198","year":2024},"citing_paper":{"arxiv_id":"2507.00808","last_updated":"2025-07-02T05:42:47Z","snapshot_observed_at":"2026-08-08T00:25:18.890247Z","submitted_at":"2025-07-01T14:40:51Z","title":"Multi-interaction TTS toward professional recording reproduction","version":2},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-06T21:11:40.492151Z"},"links":{"citing_paper":"/paper/2507.00808"},"observation_digest":"sha256:20c868d811f3033d1d6bcbff48ef3109bbf332deabb00448abc6bee4f2f25ba3","observation_id":"30949dc0-96c0-4ef4-b9ea-9bc9b9e9bf48","resolution":{"observed_at":"2026-08-06T21:11:40.761622Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:11:40.746902Z","title":"Rephrasing the web: A recipe for compute and data-efficient lan- guage modeling,","venue":null,"work_id":"c858fd71-d2d7-49b3-a8ba-835aeef95bc4","year":2024},"citing_paper":{"arxiv_id":"2507.00808","last_updated":"2025-07-02T05:42:47Z","snapshot_observed_at":"2026-08-08T00:25:18.890247Z","submitted_at":"2025-07-01T14:40:51Z","title":"Multi-interaction TTS toward professional recording reproduction","version":2},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-06T21:11:40.498128Z"},"links":{"citing_paper":"/paper/2507.00808"},"observation_digest":"sha256:4bed59fe7f575f7859e53c5245279231687a386e9b51334bb4a96d3bee1b8423","observation_id":"2356dee1-9d92-443f-97df-de095f883371","resolution":{"observed_at":"2026-08-06T21:11:40.750736Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:11:40.736781Z","title":"FastSpeech 2: Fast and high-quality end-to-end text to speech,","venue":null,"work_id":"d0253091-937a-41f7-aa06-ae67f4299b0b","year":2020},"citing_paper":{"arxiv_id":"2507.00808","last_updated":"2025-07-02T05:42:47Z","snapshot_observed_at":"2026-08-08T00:25:18.890247Z","submitted_at":"2025-07-01T14:40:51Z","title":"Multi-interaction TTS toward professional recording reproduction","version":2},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-06T21:11:40.502456Z"},"links":{"citing_paper":"/paper/2507.00808"},"observation_digest":"sha256:d5e2edf7058d5a581428873e2682ccfb234594a4e15c3f0cf51b5883f0f17289","observation_id":"04d3e439-1ad4-410d-a1c7-fdd0af902c2f","resolution":{"observed_at":"2026-08-06T21:11:40.740424Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:11:40.726559Z","title":"In- vestigating on incorporating pretrained and learnable speaker rep- resentations for multi-speaker multi-style text-to-speech,","venue":null,"work_id":"d5d87f8c-0ada-4822-9bc1-feb651a9b44d","year":2021},"citing_paper":{"arxiv_id":"2507.00808","last_updated":"2025-07-02T05:42:47Z","snapshot_observed_at":"2026-08-08T00:25:18.890247Z","submitted_at":"2025-07-01T14:40:51Z","title":"Multi-interaction TTS toward professional recording reproduction","version":2},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-06T21:11:40.505360Z"},"links":{"citing_paper":"/paper/2507.00808"},"observation_digest":"sha256:f550c8f2f27b1bb27576ed18b3690fb24899923d1ab632886a67c3738dc429ed","observation_id":"24aeb924-e40f-458f-ac95-331827345ec7","resolution":{"observed_at":"2026-08-06T21:11:40.729800Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:11:40.508676Z","title":"HiFi-GAN: Generative adversarial networks for efficient and high fidelity speech synthesis,","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2507.00808","last_updated":"2025-07-02T05:42:47Z","snapshot_observed_at":"2026-08-08T00:25:18.890247Z","submitted_at":"2025-07-01T14:40:51Z","title":"Multi-interaction TTS toward professional recording reproduction","version":2},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-06T21:11:40.508676Z"},"links":{"citing_paper":"/paper/2507.00808"},"observation_digest":"sha256:c5f5812ed1184eff793575d489e9ef5ba3486ba4e430f1b8e9e7fd3c4302456c","observation_id":"0bc8d84b-6de6-49fa-9a4b-4c6bfcf054b6","resolution":{"observed_at":"2026-08-06T21:11:40.508676Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.17493","last_updated":"2024-04-14T05:20:10Z","snapshot_observed_at":"2026-08-05T16:03:40.517679Z","submitted_at":"2023-05-27T15:10:41Z","title":"The Curse of Recursion: Training on Generated Data Makes Models Forget","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.17493","snapshot_observed_at":"2026-08-06T21:11:40.512618Z","title":"The curse of recursion: Training on generated data makes models forget,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.00808","last_updated":"2025-07-02T05:42:47Z","snapshot_observed_at":"2026-08-08T00:25:18.890247Z","submitted_at":"2025-07-01T14:40:51Z","title":"Multi-interaction TTS toward professional recording reproduction","version":2},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-06T21:11:40.512618Z"},"links":{"cited_paper":"/paper/2305.17493","citing_paper":"/paper/2507.00808"},"observation_digest":"sha256:ee661f85b46d95b82e39126e271492542a8f06647a0c7f603d8f8958ce5d5cbd","observation_id":"3dc66171-3503-43ed-a7c8-4a85e6d20c9b","resolution":{"observed_at":"2026-08-06T21:11:40.512618Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:11:40.709603Z","title":"Multi-speaker modeling for DNN- based speech synthesis incorporating generative adversarial net- works,","venue":null,"work_id":"b437d13f-cb74-401f-a54a-a3a185918bec","year":2019},"citing_paper":{"arxiv_id":"2507.00808","last_updated":"2025-07-02T05:42:47Z","snapshot_observed_at":"2026-08-08T00:25:18.890247Z","submitted_at":"2025-07-01T14:40:51Z","title":"Multi-interaction TTS toward professional recording reproduction","version":2},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-06T21:11:40.515996Z"},"links":{"citing_paper":"/paper/2507.00808"},"observation_digest":"sha256:a07d39ce5a3911d15490cfac293a70efc1a311b6e2c057cc116d70cdca48b478","observation_id":"2e60fafe-82e7-4392-80da-a62b9d224e36","resolution":{"observed_at":"2026-08-06T21:11:40.713292Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:11:40.700032Z","title":"Variational discriminator bottleneck: Improving imitation learn- ing, inverse RL, and GANs by constraining information flow,","venue":null,"work_id":"5d0a516e-6584-4ebd-93c6-9e286d9ad630","year":2019},"citing_paper":{"arxiv_id":"2507.00808","last_updated":"2025-07-02T05:42:47Z","snapshot_observed_at":"2026-08-08T00:25:18.890247Z","submitted_at":"2025-07-01T14:40:51Z","title":"Multi-interaction TTS toward professional recording reproduction","version":2},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-08-06T21:11:40.519705Z"},"links":{"citing_paper":"/paper/2507.00808"},"observation_digest":"sha256:5515d1e05cf7502e50d26c2f5195ca3c3797038eba88cc5fd83880954b9248aa","observation_id":"ac610f13-f5c7-4140-b63a-55e47da9bec4","resolution":{"observed_at":"2026-08-06T21:11:40.703451Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:11:40.523505Z","title":"Decoupled weight decay regulariza- tion,","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2507.00808","last_updated":"2025-07-02T05:42:47Z","snapshot_observed_at":"2026-08-08T00:25:18.890247Z","submitted_at":"2025-07-01T14:40:51Z","title":"Multi-interaction TTS toward professional recording reproduction","version":2},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-08-06T21:11:40.523505Z"},"links":{"citing_paper":"/paper/2507.00808"},"observation_digest":"sha256:7a6849f06d12efc8595fc51a880e58000cc59c895eaa2b5d8e932ea3518a6109","observation_id":"ddfa18e2-47f7-4b0b-8e0b-9cbe15bdf6c9","resolution":{"observed_at":"2026-08-06T21:11:40.523505Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:11:40.681163Z","title":"Expressive text-to-speech synthesis using text chat dataset with speaking style information,","venue":null,"work_id":"3bee1736-7847-412e-9134-ef182987ed2d","year":2023},"citing_paper":{"arxiv_id":"2507.00808","last_updated":"2025-07-02T05:42:47Z","snapshot_observed_at":"2026-08-08T00:25:18.890247Z","submitted_at":"2025-07-01T14:40:51Z","title":"Multi-interaction TTS toward professional recording reproduction","version":2},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-08-06T21:11:40.526777Z"},"links":{"citing_paper":"/paper/2507.00808"},"observation_digest":"sha256:3519b38c9e7a7acbe1ab1f3b22c3119f06c06ab6bfba51b72c338c98761f05b1","observation_id":"03f70cff-87dd-4cf0-8dfb-4b54da726799","resolution":{"observed_at":"2026-08-06T21:11:40.685250Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:11:40.670202Z","title":"NaturalSpeech 3: Zero-shot speech synthesis with factorized codec and diffusion models,","venue":null,"work_id":"25f99a9d-6599-4a10-957c-8958c71939fd","year":2024},"citing_paper":{"arxiv_id":"2507.00808","last_updated":"2025-07-02T05:42:47Z","snapshot_observed_at":"2026-08-08T00:25:18.890247Z","submitted_at":"2025-07-01T14:40:51Z","title":"Multi-interaction TTS toward professional recording reproduction","version":2},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-08-06T21:11:40.530589Z"},"links":{"citing_paper":"/paper/2507.00808"},"observation_digest":"sha256:113422f7d7da982ce7fa1c33b49478b3f8069624c9e273bdd7cc6df40f50554b","observation_id":"79df0849-aaf6-4be3-923c-1d70f86d183f","resolution":{"observed_at":"2026-08-06T21:11:40.673622Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:11:40.660111Z","title":"Neural codec language models are zero-shot text to speech synthesizers,","venue":null,"work_id":"b3b6c1c8-ca6b-4044-9803-9f59d75a1e28","year":2025},"citing_paper":{"arxiv_id":"2507.00808","last_updated":"2025-07-02T05:42:47Z","snapshot_observed_at":"2026-08-08T00:25:18.890247Z","submitted_at":"2025-07-01T14:40:51Z","title":"Multi-interaction TTS toward professional recording reproduction","version":2},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-08-06T21:11:40.534096Z"},"links":{"citing_paper":"/paper/2507.00808"},"observation_digest":"sha256:0f6122535567e8c9367dce2a544b34be44a29b514ff4180a4d8505cb19ba7c46","observation_id":"55c5343b-e23d-4e33-94bd-556f25af4981","resolution":{"observed_at":"2026-08-06T21:11:40.663664Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:11:40.649364Z","title":"FETV: A benchmark for fine-grained evaluation of open-domain text-to-video generation,","venue":null,"work_id":"a878becd-4842-4c98-ba47-1cb6a80e8987","year":2023},"citing_paper":{"arxiv_id":"2507.00808","last_updated":"2025-07-02T05:42:47Z","snapshot_observed_at":"2026-08-08T00:25:18.890247Z","submitted_at":"2025-07-01T14:40:51Z","title":"Multi-interaction TTS toward professional recording reproduction","version":2},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-08-06T21:11:40.537401Z"},"links":{"citing_paper":"/paper/2507.00808"},"observation_digest":"sha256:ca9f1278705a337141a6c7b9b52f045015cde986e033702b48c1b22a0654c49d","observation_id":"448d23c8-497b-4cee-9f0c-fb3ba3d0a156","resolution":{"observed_at":"2026-08-06T21:11:40.652925Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:11:40.639771Z","title":"Toward verifiable and repro- ducible human evaluation for text-to-image generation,","venue":null,"work_id":"c703e984-606b-45c5-a6f8-525925a1a7f3","year":2023},"citing_paper":{"arxiv_id":"2507.00808","last_updated":"2025-07-02T05:42:47Z","snapshot_observed_at":"2026-08-08T00:25:18.890247Z","submitted_at":"2025-07-01T14:40:51Z","title":"Multi-interaction TTS toward professional recording reproduction","version":2},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-08-06T21:11:40.541402Z"},"links":{"citing_paper":"/paper/2507.00808"},"observation_digest":"sha256:e9e71ccdba4460fa441a698add022fdd077349c98628fe833c0af94d7d882d6c","observation_id":"27e012b0-5b8d-47a2-a991-ebdd4448ff7e","resolution":{"observed_at":"2026-08-06T21:11:40.643029Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2507.00808","last_updated":"2025-07-02T05:42:47Z","latest_version":2,"primary_category":"cs.SD","snapshot_observed_at":"2026-08-08T00:25:18.890247Z","submitted_at":"2025-07-01T14:40:51Z","title":"Multi-interaction TTS toward professional recording reproduction"},"reference_resolution":{"displayed":60,"state_counts":{"malformed_identifier":0,"metadata_mismatch":1,"parse_uncertain":0,"unresolved":10,"verified_exact":0,"verified_fuzzy":49},"total_outbound_references":60},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"thesis":"As of 10 August 2026, this Paper Citation Record lists 60 of 60 outbound references and 1 inbound Pith citation observation for arXiv:2507.00808."}