{"as_of":"2026-08-10T04:00:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:49d45b50b4aa885c369b2936e138e692d78c8c3d7f92b3497ba3f48b37678a58","coverage":[{"denominator":16,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":16,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T04:45:19.307090Z","state":"measured"},{"denominator":17,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":17,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-09T06:31:02.800959+00:00","state":"measured"},{"denominator":1,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":1,"source":"paper_references, paper_reference_links","source_observed_at":"2026-06-28T21:12:19.893944Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-07-01T20:26:12.658368Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2506.09874","last_updated":"2025-07-10T19:47:47Z","snapshot_observed_at":"2026-08-07T16:56:30.600491Z","submitted_at":"2025-06-11T15:43:08Z","title":"UmbraTTS: Adapting Text-to-Speech to Environmental Contexts with Flow Matching","version":2},"cited_work":{"arxiv_id":"2506.09874","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2506.09874","snapshot_observed_at":"2026-07-01T20:26:12.658368Z","title":null,"venue":null,"work_id":"a3f4e54b-149f-4af7-b2ac-3c5a273a3e42","year":2025},"citing_paper":{"arxiv_id":"2605.30965","last_updated":"2026-05-29T07:58:54Z","snapshot_observed_at":"2026-08-02T19:54:21.945716Z","submitted_at":"2026-05-29T07:58:54Z","title":"ImmersiveTTS: Environment-Aware Text-to-Speech with Multimodal Diffusion Transformer and Domain-Specific Representation Alignment","version":1},"reference_index":18,"source":"arxiv_source","source_observed_at":"2026-06-28T21:12:19.893944Z"},"links":{"cited_paper":"/paper/2506.09874","citing_paper":"/paper/2605.30965"},"observation_digest":"sha256:7663d3944d6f4f0dac228eef5c04c805b2bc35f0e7f850e94090b317546f3374","observation_id":"48b72c44-7294-484b-9ac6-93694d3d2945","resolution":{"observed_at":"2026-07-01T20:26:12.661007Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2506.09874/citation-record","integrity":"/paper/2506.09874/integrity","json":"/paper/2506.09874/citation-record.json","paper":"/paper/2506.09874"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2312.15821","last_updated":"2023-12-25T22:24:49Z","snapshot_observed_at":"2026-08-05T03:40:24.447729Z","submitted_at":"2023-12-25T22:24:49Z","title":"Audiobox: Unified Audio Generation with Natural Language Prompts","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.15821","snapshot_observed_at":"2026-08-07T04:45:19.234441Z","title":"Vyas, A., Shi, B., Le, M., Tjandra, A., Wu, Y .-C., Guo, B., Zhang, J., Zhang, X., Adkins, R., Ngan, W., et al","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.09874","last_updated":"2025-07-10T19:47:47Z","snapshot_observed_at":"2026-08-07T16:56:30.600491Z","submitted_at":"2025-06-11T15:43:08Z","title":"UmbraTTS: Adapting Text-to-Speech to Environmental Contexts with Flow Matching","version":2},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-07T04:45:19.234441Z"},"links":{"cited_paper":"/paper/2312.15821","citing_paper":"/paper/2506.09874"},"observation_digest":"sha256:7adcbdcf0a7e004abb97c238f8679d8682811e2af2d3d25278fef3e83040a488","observation_id":"78962cc4-95b9-4726-bf81-1735024ca5ba","resolution":{"observed_at":"2026-08-07T04:45:19.234441Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1812.08466","last_updated":"2019-01-17T16:12:43Z","snapshot_observed_at":"2026-08-08T16:07:44.435146Z","submitted_at":"2018-12-20T10:28:00Z","title":"Fr\\'echet Audio Distance: A Metric for Evaluating Music Enhancement Algorithms","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1812.08466","snapshot_observed_at":"2026-08-07T04:45:18.687085Z","title":"Fr \\’echet audio distance: A metric for evaluat- ing music enhancement algorithms","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.09874","last_updated":"2025-07-10T19:47:47Z","snapshot_observed_at":"2026-08-07T16:56:30.600491Z","submitted_at":"2025-06-11T15:43:08Z","title":"UmbraTTS: Adapting Text-to-Speech to Environmental Contexts with Flow Matching","version":2},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-07T04:45:18.687085Z"},"links":{"cited_paper":"/paper/1812.08466","citing_paper":"/paper/2506.09874"},"observation_digest":"sha256:3297676ff8da7689bc4c80fa818d36005533a9156b44b7a7af0b75307f692077","observation_id":"41accd41-1833-4715-b628-8871c45e6645","resolution":{"observed_at":"2026-08-07T04:45:18.687085Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2209.15352","last_updated":"2023-03-05T09:14:16Z","snapshot_observed_at":"2026-08-07T16:54:38.689558Z","submitted_at":"2022-09-30T10:17:05Z","title":"AudioGen: Textually Guided Audio Generation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2209.15352","snapshot_observed_at":"2026-08-07T04:45:18.835009Z","title":"Audio- gen: Textually guided audio generation","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.09874","last_updated":"2025-07-10T19:47:47Z","snapshot_observed_at":"2026-08-07T16:56:30.600491Z","submitted_at":"2025-06-11T15:43:08Z","title":"UmbraTTS: Adapting Text-to-Speech to Environmental Contexts with Flow Matching","version":2},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-07T04:45:18.835009Z"},"links":{"cited_paper":"/paper/2209.15352","citing_paper":"/paper/2506.09874"},"observation_digest":"sha256:19bc987ba9a60190a4326c516dde860dc4193c25bbf44ffe489b09bfb505e432","observation_id":"dd1ab871-4070-40d1-bc54-9ce02b7be156","resolution":{"observed_at":"2026-08-07T04:45:18.835009Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2210.02747","last_updated":"2023-02-08T15:46:05Z","snapshot_observed_at":"2026-08-02T18:24:58.914589Z","submitted_at":"2022-10-06T08:32:20Z","title":"Flow Matching for Generative Modeling","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2210.02747","snapshot_observed_at":"2026-08-07T04:45:18.891032Z","title":"D., Phan, H., and Benetos, E","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.09874","last_updated":"2025-07-10T19:47:47Z","snapshot_observed_at":"2026-08-07T16:56:30.600491Z","submitted_at":"2025-06-11T15:43:08Z","title":"UmbraTTS: Adapting Text-to-Speech to Environmental Contexts with Flow Matching","version":2},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-07T04:45:18.891032Z"},"links":{"cited_paper":"/paper/2210.02747","citing_paper":"/paper/2506.09874"},"observation_digest":"sha256:d0727817c093d15f9f996819213c07ccec2a8a7cf8dd850a2341c868b5eeeec9","observation_id":"61ac979c-25d9-4ad5-aa99-8b313ae3ec8d","resolution":{"observed_at":"2026-08-07T04:45:18.891032Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2301.12503","last_updated":"2023-09-09T15:27:58Z","snapshot_observed_at":"2026-08-06T16:43:15.954030Z","submitted_at":"2023-01-29T17:48:17Z","title":"AudioLDM: Text-to-Audio Generation with Latent Diffusion Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2301.12503","snapshot_observed_at":"2026-08-07T04:45:18.973851Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.09874","last_updated":"2025-07-10T19:47:47Z","snapshot_observed_at":"2026-08-07T16:56:30.600491Z","submitted_at":"2025-06-11T15:43:08Z","title":"UmbraTTS: Adapting Text-to-Speech to Environmental Contexts with Flow Matching","version":2},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-07T04:45:18.973851Z"},"links":{"cited_paper":"/paper/2301.12503","citing_paper":"/paper/2506.09874"},"observation_digest":"sha256:9a06e81066cc0f562929a49a768b3fa0932e204bb3db028fd7ed142430bd2921","observation_id":"87fd9334-847c-4c91-abcb-77ad8bf938a9","resolution":{"observed_at":"2026-08-07T04:45:18.973851Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.14465","last_updated":"2025-05-20T15:01:30Z","snapshot_observed_at":"2026-08-08T15:36:48.584508Z","submitted_at":"2025-05-20T15:01:30Z","title":"FlowTSE: Target Speaker Extraction with Flow Matching","version":1},"cited_work":{"arxiv_id":"2505.14465","doi":null,"metadata_source":"pith","pith_arxiv_id":"2505.14465","snapshot_observed_at":"2026-08-07T04:45:19.435188Z","title":"FlowTSE: Target Speaker Extraction with Flow Matching","venue":"eess.AS","work_id":"a7ae9083-3a5d-47fa-bcbf-3cdfdd1531e7","year":2025},"citing_paper":{"arxiv_id":"2506.09874","last_updated":"2025-07-10T19:47:47Z","snapshot_observed_at":"2026-08-07T16:56:30.600491Z","submitted_at":"2025-06-11T15:43:08Z","title":"UmbraTTS: Adapting Text-to-Speech to Environmental Contexts with Flow Matching","version":2},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-07T04:45:19.031576Z"},"links":{"cited_paper":"/paper/2505.14465","citing_paper":"/paper/2506.09874"},"observation_digest":"sha256:b9610b888cbba0e8fc7890948e55e8a57c9a567fc460ebcb8e67531e3dacba80","observation_id":"d4c66cb4-ace9-4a88-8fcf-9256a36ca013","resolution":{"observed_at":"2026-08-07T04:45:19.443377Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2006.04558","last_updated":"2022-08-08T01:53:05Z","snapshot_observed_at":"2026-08-06T18:05:37.673476Z","submitted_at":"2020-06-08T13:05:40Z","title":"FastSpeech 2: Fast and High-Quality End-to-End Text to Speech","version":8},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2006.04558","snapshot_observed_at":"2026-08-07T04:45:19.164512Z","title":"Fastspeech 2: Fast and high-quality end-to-end text to speech","venue":null,"work_id":null,"year":2006},"citing_paper":{"arxiv_id":"2506.09874","last_updated":"2025-07-10T19:47:47Z","snapshot_observed_at":"2026-08-07T16:56:30.600491Z","submitted_at":"2025-06-11T15:43:08Z","title":"UmbraTTS: Adapting Text-to-Speech to Environmental Contexts with Flow Matching","version":2},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-07T04:45:19.164512Z"},"links":{"cited_paper":"/paper/2006.04558","citing_paper":"/paper/2506.09874"},"observation_digest":"sha256:c200cb4cb1e2ce61a71fab4fabd3f11dada32b3838e67507420427b5fa4880c0","observation_id":"e0cd1bd0-62d1-4a9c-8e8c-c581427ab987","resolution":{"observed_at":"2026-08-07T04:45:19.164512Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2106.15561","last_updated":"2021-07-23T12:32:52Z","snapshot_observed_at":"2026-08-08T12:28:23.489422Z","submitted_at":"2021-06-29T16:50:51Z","title":"A Survey on Neural Speech Synthesis","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2106.15561","snapshot_observed_at":"2026-08-07T04:45:19.182281Z","title":"A survey on neural speech synthesis","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.09874","last_updated":"2025-07-10T19:47:47Z","snapshot_observed_at":"2026-08-07T16:56:30.600491Z","submitted_at":"2025-06-11T15:43:08Z","title":"UmbraTTS: Adapting Text-to-Speech to Environmental Contexts with Flow Matching","version":2},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-07T04:45:19.182281Z"},"links":{"cited_paper":"/paper/2106.15561","citing_paper":"/paper/2506.09874"},"observation_digest":"sha256:ffd4d26174f54946bf3a0663a40c4832424beda7d92ad174483ee05f68f6449c","observation_id":"397edf0a-3a63-4222-8951-32e8d2ce87a7","resolution":{"observed_at":"2026-08-07T04:45:19.182281Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:45:19.573775Z","title":"Large-scale contrastive language-audio pretraining with feature fusion and keyword-to-caption augmentation","venue":null,"work_id":"e01050f1-4820-43af-91bf-28788729a7c8","year":2023},"citing_paper":{"arxiv_id":"2506.09874","last_updated":"2025-07-10T19:47:47Z","snapshot_observed_at":"2026-08-07T16:56:30.600491Z","submitted_at":"2025-06-11T15:43:08Z","title":"UmbraTTS: Adapting Text-to-Speech to Environmental Contexts with Flow Matching","version":2},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-07T04:45:19.283562Z"},"links":{"citing_paper":"/paper/2506.09874"},"observation_digest":"sha256:af3459ffe0abdb4f0871474338f9d59fbf2096833df688398d2d29a676031ac5","observation_id":"32340c6e-8d6a-47fb-92eb-cd7e6ca085cd","resolution":{"observed_at":"2026-08-07T04:45:19.578299Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2303.13336","last_updated":"2023-04-02T09:27:20Z","snapshot_observed_at":"2026-07-06T15:07:11.623462Z","submitted_at":"2023-03-23T15:17:15Z","title":"A Survey on Audio Diffusion Models: Text To Speech Synthesis and Enhancement in Generative AI","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.13336","snapshot_observed_at":"2026-08-07T04:45:19.307090Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.09874","last_updated":"2025-07-10T19:47:47Z","snapshot_observed_at":"2026-08-07T16:56:30.600491Z","submitted_at":"2025-06-11T15:43:08Z","title":"UmbraTTS: Adapting Text-to-Speech to Environmental Contexts with Flow Matching","version":2},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-07T04:45:19.307090Z"},"links":{"cited_paper":"/paper/2303.13336","citing_paper":"/paper/2506.09874"},"observation_digest":"sha256:39ed86cdb57479cba38c5f6ddcc969fad8e35cfd7a3e2ab95da5495f942da446","observation_id":"ba40f52d-e387-48a7-9d1b-dcec9d791bdd","resolution":{"observed_at":"2026-08-07T04:45:19.307090Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2008.05809","last_updated":"2020-08-13T10:51:56Z","snapshot_observed_at":"2026-08-09T04:11:17.946422Z","submitted_at":"2020-08-13T10:51:56Z","title":"Enhancing Speech Intelligibility in Text-To-Speech Synthesis using Speaking Style Conversion","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2008.05809","snapshot_observed_at":"2026-08-07T04:45:19.104573Z","title":"P., Pantazis, Y ., and Stylianou, Y","venue":null,"work_id":null,"year":2008},"citing_paper":{"arxiv_id":"2506.09874","last_updated":"2025-07-10T19:47:47Z","snapshot_observed_at":"2026-08-07T16:56:30.600491Z","submitted_at":"2025-06-11T15:43:08Z","title":"UmbraTTS: Adapting Text-to-Speech to Environmental Contexts with Flow Matching","version":2},"reference_index":2015,"source":"pdf_text","source_observed_at":"2026-08-07T04:45:19.104573Z"},"links":{"cited_paper":"/paper/2008.05809","citing_paper":"/paper/2506.09874"},"observation_digest":"sha256:a09e34d9e505984e68c57acf843d4a3f5ddb60ccb5d7b253f631053df77d02cb","observation_id":"453f421e-7868-45c0-af7c-3bc0739412a9","resolution":{"observed_at":"2026-08-07T04:45:19.104573Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:45:19.589008Z","title":"Emilia: An extensive, multi- lingual, and diverse speech dataset for large-scale speech generation","venue":null,"work_id":"115ba519-42df-4fb4-9bc9-935bc0edc28f","year":2024},"citing_paper":{"arxiv_id":"2506.09874","last_updated":"2025-07-10T19:47:47Z","snapshot_observed_at":"2026-08-07T16:56:30.600491Z","submitted_at":"2025-06-11T15:43:08Z","title":"UmbraTTS: Adapting Text-to-Speech to Environmental Contexts with Flow Matching","version":2},"reference_index":2017,"source":"pdf_text","source_observed_at":"2026-08-07T04:45:18.667628Z"},"links":{"citing_paper":"/paper/2506.09874"},"observation_digest":"sha256:f00383a5587d97b1afa4b03096b2b052dc230dcb55fcbd7f06e7477214916990","observation_id":"80e90982-39fd-4958-8789-b936820b4f61","resolution":{"observed_at":"2026-08-07T04:45:19.593624Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.12688","last_updated":"2024-06-18T15:00:25Z","snapshot_observed_at":"2026-08-04T17:53:31.272957Z","submitted_at":"2024-06-18T15:00:25Z","title":"Speak in the Scene: Diffusion-based Acoustic Scene Transfer toward Immersive Speech Generation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.12688","snapshot_observed_at":"2026-08-07T04:45:18.755238Z","title":"Speak in the scene: Diffusion-based acoustic scene trans- fer toward immersive speech generation","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.09874","last_updated":"2025-07-10T19:47:47Z","snapshot_observed_at":"2026-08-07T16:56:30.600491Z","submitted_at":"2025-06-11T15:43:08Z","title":"UmbraTTS: Adapting Text-to-Speech to Environmental Contexts with Flow Matching","version":2},"reference_index":2018,"source":"pdf_text","source_observed_at":"2026-08-07T04:45:18.755238Z"},"links":{"cited_paper":"/paper/2406.12688","citing_paper":"/paper/2506.09874"},"observation_digest":"sha256:0e9a8de10ae803a0f7077f74870b41c24acf4c2aa14cdc406ff6745d0fa8dfa6","observation_id":"850f0b23-de79-4904-b426-71fde83fc81d","resolution":{"observed_at":"2026-08-07T04:45:18.755238Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.06885","last_updated":"2025-05-20T15:53:10Z","snapshot_observed_at":"2026-08-01T23:52:25.071174Z","submitted_at":"2024-10-09T13:46:34Z","title":"F5-TTS: A Fairytaler that Fakes Fluent and Faithful Speech with Flow Matching","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.06885","snapshot_observed_at":"2026-08-07T04:45:18.608842Z","title":"F5-tts: A fairytaler that fakes fluent and faithful speech with flow matching","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.09874","last_updated":"2025-07-10T19:47:47Z","snapshot_observed_at":"2026-08-07T16:56:30.600491Z","submitted_at":"2025-06-11T15:43:08Z","title":"UmbraTTS: Adapting Text-to-Speech to Environmental Contexts with Flow Matching","version":2},"reference_index":2022,"source":"pdf_text","source_observed_at":"2026-08-07T04:45:18.608842Z"},"links":{"cited_paper":"/paper/2410.06885","citing_paper":"/paper/2506.09874"},"observation_digest":"sha256:ed0c2a24fc4432b932df5c097b8dfb061c566b53d6df1e06abd4d4370b08e248","observation_id":"f960d625-ac9f-4934-ac86-60a071372484","resolution":{"observed_at":"2026-08-07T04:45:18.608842Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.19259","last_updated":"2024-12-26T15:52:58Z","snapshot_observed_at":"2026-07-06T20:13:27.068339Z","submitted_at":"2024-12-26T15:52:58Z","title":"VoiceDiT: Dual-Condition Diffusion Transformer for Environment-Aware Speech Synthesis","version":1},"cited_work":{"arxiv_id":"2412.19259","doi":null,"metadata_source":"pith","pith_arxiv_id":"2412.19259","snapshot_observed_at":"2026-08-07T04:45:19.541066Z","title":"VoiceDiT: Dual-Condition Diffusion Transformer for Environment-Aware Speech Synthesis","venue":"eess.AS","work_id":"2f00520b-6b1b-470d-830b-fcaf58a790d6","year":2024},"citing_paper":{"arxiv_id":"2506.09874","last_updated":"2025-07-10T19:47:47Z","snapshot_observed_at":"2026-08-07T16:56:30.600491Z","submitted_at":"2025-06-11T15:43:08Z","title":"UmbraTTS: Adapting Text-to-Speech to Environmental Contexts with Flow Matching","version":2},"reference_index":2023,"source":"pdf_text","source_observed_at":"2026-08-07T04:45:18.672137Z"},"links":{"cited_paper":"/paper/2412.19259","citing_paper":"/paper/2506.09874"},"observation_digest":"sha256:015227cfa2d50ed089dce717eac44f40e12a708e07079f2cc6e7ca2d1ab8ed85","observation_id":"0176a76c-24a2-4bec-b123-ff19bb18f4bf","resolution":{"observed_at":"2026-08-07T04:45:19.546105Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:45:19.603650Z","title":"E., Wang, X., Thakker, M., Li, C., Tsai, C.-H., Xiao, Z., Yang, H., Zhu, Z., Tang, M., Tan, X., et al","venue":null,"work_id":"ad741b87-a51c-4f7d-9505-1a56cc8d50be","year":2024},"citing_paper":{"arxiv_id":"2506.09874","last_updated":"2025-07-10T19:47:47Z","snapshot_observed_at":"2026-08-07T16:56:30.600491Z","submitted_at":"2025-06-11T15:43:08Z","title":"UmbraTTS: Adapting Text-to-Speech to Environmental Contexts with Flow Matching","version":2},"reference_index":2024,"source":"pdf_text","source_observed_at":"2026-08-07T04:45:18.647201Z"},"links":{"citing_paper":"/paper/2506.09874"},"observation_digest":"sha256:1cfe3d8fc70828455b2f9d15b661e98f35dc0579341f0e617810c4fa68d9c788","observation_id":"7b16013c-daf3-4120-bcbe-ffb91856b964","resolution":{"observed_at":"2026-08-07T04:45:19.608252Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2506.09874","last_updated":"2025-07-10T19:47:47Z","latest_version":2,"primary_category":"cs.SD","snapshot_observed_at":"2026-08-07T16:56:30.600491Z","submitted_at":"2025-06-11T15:43:08Z","title":"UmbraTTS: Adapting Text-to-Speech to Environmental Contexts with Flow Matching"},"reference_resolution":{"displayed":16,"state_counts":{"malformed_identifier":0,"metadata_mismatch":1,"parse_uncertain":0,"unresolved":11,"verified_exact":1,"verified_fuzzy":3},"total_outbound_references":16},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"thesis":"As of 10 August 2026, this Paper Citation Record lists 16 of 16 outbound references and 1 inbound Pith citation observation for arXiv:2506.09874."}