{"as_of":"2026-08-10T00:54:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:e76d0e3b373d325c6178aa997ba754f3ed3cc1694202c8e3de543e1dd0218aad","coverage":[{"denominator":0,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":21,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":21,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-09T06:31:02.800959+00:00","state":"measured"},{"denominator":21,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":21,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-09T05:54:18.525240Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-07-03T03:37:35.221767Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2407.05361","last_updated":"2024-09-07T15:08:24Z","snapshot_observed_at":"2026-08-07T13:19:22.496186Z","submitted_at":"2024-07-07T13:24:54Z","title":"Emilia: An Extensive, Multilingual, and Diverse Speech Dataset for Large-Scale Speech Generation","version":3},"cited_work":{"arxiv_id":"2407.05361","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2407.05361","snapshot_observed_at":"2026-07-03T03:37:35.221767Z","title":"arXiv preprint arXiv:2407.05361 , year=","venue":null,"work_id":"1cf20033-c768-4fc5-bcdd-f566ab0b9231","year":2024},"citing_paper":{"arxiv_id":"2410.06885","last_updated":"2025-05-20T15:53:10Z","snapshot_observed_at":"2026-08-01T23:52:25.071174Z","submitted_at":"2024-10-09T13:46:34Z","title":"F5-TTS: A Fairytaler that Fakes Fluent and Faithful Speech with Flow Matching","version":3},"reference_index":101,"source":"arxiv_source","source_observed_at":"2026-05-16T06:06:41.348728Z"},"links":{"cited_paper":"/paper/2407.05361","citing_paper":"/paper/2410.06885"},"observation_digest":"sha256:16ce39b0e858b3a1334438713d94d500c1a0f5320ef912178bed869637d4e92d","observation_id":"0847645e-1357-4457-be39-54962b7a6d8c","resolution":{"observed_at":"2026-05-16T06:06:41.461429Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.05361","last_updated":"2024-09-07T15:08:24Z","snapshot_observed_at":"2026-08-07T13:19:22.496186Z","submitted_at":"2024-07-07T13:24:54Z","title":"Emilia: An Extensive, Multilingual, and Diverse Speech Dataset for Large-Scale Speech Generation","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.05361","snapshot_observed_at":"2026-08-09T05:54:18.525240Z","title":"Emilia: An extensive, multilingual, and diverse speech dataset for large-scale speech generation","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.03128","last_updated":"2025-02-05T12:36:21Z","snapshot_observed_at":"2026-08-09T08:33:22.897642Z","submitted_at":"2025-02-05T12:36:21Z","title":"Metis: A Foundation Speech Generation Model with Masked Generative Pre-training","version":1},"reference_index":33,"source":"arxiv_source","source_observed_at":"2026-08-09T05:54:18.525240Z"},"links":{"cited_paper":"/paper/2407.05361","citing_paper":"/paper/2502.03128"},"observation_digest":"sha256:2c9f7b1cb969e2282f47f88842ceda10b3d859fab65abaea165947c88eba57b6","observation_id":"12b976f6-b36a-401e-b381-059329f04c31","resolution":{"observed_at":"2026-08-09T05:54:18.525240Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.05361","last_updated":"2024-09-07T15:08:24Z","snapshot_observed_at":"2026-08-07T13:19:22.496186Z","submitted_at":"2024-07-07T13:24:54Z","title":"Emilia: An Extensive, Multilingual, and Diverse Speech Dataset for Large-Scale Speech Generation","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.05361","snapshot_observed_at":"2026-08-07T15:07:10.212017Z","title":"Emilia: An extensive, multilingual, and diverse speech dataset for large-scale speech generation,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.16279","last_updated":"2025-05-22T06:23:05Z","snapshot_observed_at":"2026-08-07T15:02:09.826242Z","submitted_at":"2025-05-22T06:23:05Z","title":"MM-MovieDubber: Towards Multi-Modal Learning for Multi-Modal Movie Dubbing","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-07T15:07:10.212017Z"},"links":{"cited_paper":"/paper/2407.05361","citing_paper":"/paper/2505.16279"},"observation_digest":"sha256:70e57d5f520af47d310c54a2632ee4df70a627e6748354b690420b8dfb996f8f","observation_id":"f3fe19ef-6c80-4bbd-9835-209e6f266201","resolution":{"observed_at":"2026-08-07T15:07:10.212017Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.05361","last_updated":"2024-09-07T15:08:24Z","snapshot_observed_at":"2026-08-07T13:19:22.496186Z","submitted_at":"2024-07-07T13:24:54Z","title":"Emilia: An Extensive, Multilingual, and Diverse Speech Dataset for Large-Scale Speech Generation","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.05361","snapshot_observed_at":"2026-08-07T14:55:55.604407Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.16972","last_updated":"2025-05-22T17:51:05Z","snapshot_observed_at":"2026-08-09T09:32:42.256193Z","submitted_at":"2025-05-22T17:51:05Z","title":"From Tens of Hours to Tens of Thousands: Scaling Back-Translation for Speech Recognition","version":1},"reference_index":25,"source":"arxiv_source","source_observed_at":"2026-08-07T14:55:55.604407Z"},"links":{"cited_paper":"/paper/2407.05361","citing_paper":"/paper/2505.16972"},"observation_digest":"sha256:2e3b166d995202dc6a56006f547ba95367a5aa5703ef7cf407db112d2e502f46","observation_id":"aa6c3185-dcb8-4aa5-93ae-5dd8727a85ab","resolution":{"observed_at":"2026-08-07T14:55:55.604407Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.05361","last_updated":"2024-09-07T15:08:24Z","snapshot_observed_at":"2026-08-07T13:19:22.496186Z","submitted_at":"2024-07-07T13:24:54Z","title":"Emilia: An Extensive, Multilingual, and Diverse Speech Dataset for Large-Scale Speech Generation","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.05361","snapshot_observed_at":"2026-08-07T04:58:07.862140Z","title":"Emilia: An extensive, multilingual, and diverse speech dataset for large-scale speech generation, 2024.https://arxiv.org/abs/2407.05361","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.09344","last_updated":"2025-06-11T02:50:49Z","snapshot_observed_at":"2026-08-08T17:53:50.843512Z","submitted_at":"2025-06-11T02:50:49Z","title":"Ming-Omni: A Unified Multimodal Model for Perception and Generation","version":1},"reference_index":2025,"source":"pdf_text","source_observed_at":"2026-08-07T04:58:07.862140Z"},"links":{"cited_paper":"/paper/2407.05361","citing_paper":"/paper/2506.09344"},"observation_digest":"sha256:5cc44b4e5de9d0fd666dac980c666b8aab7d11b4515d5ad125a981d2f99ecb49","observation_id":"619ad11f-4d92-493b-ac30-edf1ab09139c","resolution":{"observed_at":"2026-08-07T04:58:07.862140Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.05361","last_updated":"2024-09-07T15:08:24Z","snapshot_observed_at":"2026-08-07T13:19:22.496186Z","submitted_at":"2024-07-07T13:24:54Z","title":"Emilia: An Extensive, Multilingual, and Diverse Speech Dataset for Large-Scale Speech Generation","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.05361","snapshot_observed_at":"2026-08-06T21:33:09.346129Z","title":"Emilia: An extensive, multilingual, and diverse speech dataset for large-scale speech generation,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.23986","last_updated":"2025-07-01T16:23:28Z","snapshot_observed_at":"2026-08-07T19:47:51.420051Z","submitted_at":"2025-06-30T15:50:08Z","title":"StreamFlow: Streaming Flow Matching with Block-wise Guided Attention Mask for Speech Token Decoding","version":2},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-06T21:33:09.346129Z"},"links":{"cited_paper":"/paper/2407.05361","citing_paper":"/paper/2506.23986"},"observation_digest":"sha256:64e407ea139c99c330a73a5a09ec9c1742bd166a1394ee1a3ceaaf11baef8f38","observation_id":"9984cf1e-8e2c-41fd-8878-4c2e019d5754","resolution":{"observed_at":"2026-08-06T21:33:09.346129Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.05361","last_updated":"2024-09-07T15:08:24Z","snapshot_observed_at":"2026-08-07T13:19:22.496186Z","submitted_at":"2024-07-07T13:24:54Z","title":"Emilia: An Extensive, Multilingual, and Diverse Speech Dataset for Large-Scale Speech Generation","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.05361","snapshot_observed_at":"2026-08-06T16:33:52.444640Z","title":"Emilia: An extensive, multilingual, and diverse speech dataset for large-scale speech generation,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.13155","last_updated":"2025-07-17T14:17:40Z","snapshot_observed_at":"2026-08-07T19:53:51.352286Z","submitted_at":"2025-07-17T14:17:40Z","title":"NonverbalTTS: A Public English Corpus of Text-Aligned Nonverbal Vocalizations with Emotion Annotations for Text-to-Speech","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-06T16:33:52.444640Z"},"links":{"cited_paper":"/paper/2407.05361","citing_paper":"/paper/2507.13155"},"observation_digest":"sha256:937d832a8a8c3ecf358ad27cba2837e36ab21de6655596a16ddfc372258b00d8","observation_id":"89261381-9e78-4f79-bcef-a759ffdab20e","resolution":{"observed_at":"2026-08-06T16:33:52.444640Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.05361","last_updated":"2024-09-07T15:08:24Z","snapshot_observed_at":"2026-08-07T13:19:22.496186Z","submitted_at":"2024-07-07T13:24:54Z","title":"Emilia: An Extensive, Multilingual, and Diverse Speech Dataset for Large-Scale Speech Generation","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.05361","snapshot_observed_at":"2026-08-06T12:36:16.250981Z","title":"Emilia: An extensive, multilingual, and diverse speech dataset for large-scale speech generation,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.21642","last_updated":"2025-08-25T08:17:22Z","snapshot_observed_at":"2026-08-09T21:10:08.060777Z","submitted_at":"2025-07-29T09:58:45Z","title":"Whilter: A Whisper-based Data Filter for \"In-the-Wild\" Speech Corpora Using Utterance-level Multi-Task Classification","version":2},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-06T12:36:16.250981Z"},"links":{"cited_paper":"/paper/2407.05361","citing_paper":"/paper/2507.21642"},"observation_digest":"sha256:f0627dd55c32ff613c64557c71cf59ae0bf2cdcf4eec5e2365ae37817744b136","observation_id":"d4a39cdd-a493-4d96-90f3-f2082407f8dd","resolution":{"observed_at":"2026-08-06T12:36:16.250981Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.05361","last_updated":"2024-09-07T15:08:24Z","snapshot_observed_at":"2026-08-07T13:19:22.496186Z","submitted_at":"2024-07-07T13:24:54Z","title":"Emilia: An Extensive, Multilingual, and Diverse Speech Dataset for Large-Scale Speech Generation","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.05361","snapshot_observed_at":"2026-08-05T23:41:51.083471Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.04996","last_updated":"2025-08-08T01:59:26Z","snapshot_observed_at":"2026-08-05T23:41:48.793102Z","submitted_at":"2025-08-07T03:08:49Z","title":"REF-VC: Robust, Expressive and Fast Zero-Shot Voice Conversion with Diffusion Transformers","version":2},"reference_index":28,"source":"arxiv_source","source_observed_at":"2026-08-05T23:41:51.083471Z"},"links":{"cited_paper":"/paper/2407.05361","citing_paper":"/paper/2508.04996"},"observation_digest":"sha256:4b165ee097deb64e9eb4bebe2c836bf246b91078edd7b2490cf4b037732e2fb9","observation_id":"2dd37568-2bd1-4ee7-bb30-6599b6d618ad","resolution":{"observed_at":"2026-08-05T23:41:51.083471Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.05361","last_updated":"2024-09-07T15:08:24Z","snapshot_observed_at":"2026-08-07T13:19:22.496186Z","submitted_at":"2024-07-07T13:24:54Z","title":"Emilia: An Extensive, Multilingual, and Diverse Speech Dataset for Large-Scale Speech Generation","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.05361","snapshot_observed_at":"2026-08-05T11:41:00.064681Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.02349","last_updated":"2025-09-04T14:25:57Z","snapshot_observed_at":"2026-08-09T00:24:32.254551Z","submitted_at":"2025-09-02T14:15:22Z","title":"AudioCodecBench: A Comprehensive Benchmark for Audio Codec Evaluation","version":2},"reference_index":17,"source":"arxiv_source","source_observed_at":"2026-08-05T11:41:00.064681Z"},"links":{"cited_paper":"/paper/2407.05361","citing_paper":"/paper/2509.02349"},"observation_digest":"sha256:9a043b459ea69930039334571fe52c30a664350c5a83534d30df53328d383a22","observation_id":"8d757418-74ce-4c4a-bd83-d8a955f0829b","resolution":{"observed_at":"2026-08-05T11:41:00.064681Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.05361","last_updated":"2024-09-07T15:08:24Z","snapshot_observed_at":"2026-08-07T13:19:22.496186Z","submitted_at":"2024-07-07T13:24:54Z","title":"Emilia: An Extensive, Multilingual, and Diverse Speech Dataset for Large-Scale Speech Generation","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.05361","snapshot_observed_at":"2026-08-04T19:27:38.516808Z","title":"Emilia: An Extensive, Multilingual, and Diverse Speech Dataset for Large-Scale Speech Generation,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.09296","last_updated":"2025-09-11T09:36:31Z","snapshot_observed_at":"2026-08-04T19:27:37.669061Z","submitted_at":"2025-09-11T09:36:31Z","title":"Over-the-Air Adversarial Attack Detection: from Datasets to Defenses","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-04T19:27:38.516808Z"},"links":{"cited_paper":"/paper/2407.05361","citing_paper":"/paper/2509.09296"},"observation_digest":"sha256:a97043ed2da717a14eefc4a9c20503f1189798bb87616b55302e2ca040c67b2b","observation_id":"8623222a-d6e0-4eec-9ba4-f132b042c462","resolution":{"observed_at":"2026-08-04T19:27:38.516808Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.05361","last_updated":"2024-09-07T15:08:24Z","snapshot_observed_at":"2026-08-07T13:19:22.496186Z","submitted_at":"2024-07-07T13:24:54Z","title":"Emilia: An Extensive, Multilingual, and Diverse Speech Dataset for Large-Scale Speech Generation","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.05361","snapshot_observed_at":"2026-08-04T11:29:32.656117Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2510.04593","last_updated":"2026-06-08T05:49:30Z","snapshot_observed_at":"2026-08-06T08:55:28.794308Z","submitted_at":"2025-10-06T08:47:38Z","title":"UniVoice: Unifying Autoregressive ASR and Flow-Matching based TTS with Large Language Models","version":3},"reference_index":28,"source":"arxiv_source","source_observed_at":"2026-08-04T11:29:32.656117Z"},"links":{"cited_paper":"/paper/2407.05361","citing_paper":"/paper/2510.04593"},"observation_digest":"sha256:38d63bcc0ca4e45305894c09c36ce10f5a2e4b7e3a9ba93d2bdc45a0d85a38b6","observation_id":"67778385-97e8-4920-b666-a32c0c30aee5","resolution":{"observed_at":"2026-08-04T11:29:32.656117Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.05361","last_updated":"2024-09-07T15:08:24Z","snapshot_observed_at":"2026-08-07T13:19:22.496186Z","submitted_at":"2024-07-07T13:24:54Z","title":"Emilia: An Extensive, Multilingual, and Diverse Speech Dataset for Large-Scale Speech Generation","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.05361","snapshot_observed_at":"2026-08-02T18:03:42.435007Z","title":"Emilia: An extensive, multilingual, and diverse speech dataset for large-scale speech generation,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2603.16805","last_updated":"2026-07-16T07:47:56Z","snapshot_observed_at":"2026-08-09T03:29:09.729679Z","submitted_at":"2026-03-17T17:09:45Z","title":"Making Separation-First Multi-Stream Audio Watermarking Feasible via Joint Training","version":2},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-02T18:03:42.435007Z"},"links":{"cited_paper":"/paper/2407.05361","citing_paper":"/paper/2603.16805"},"observation_digest":"sha256:e1fdc450bc7d1ec5107f6a142f9647b58f135817af29ea3c6f1427603bf8c04d","observation_id":"74e8b097-9b56-4718-84c0-761387fba4d7","resolution":{"observed_at":"2026-08-02T18:03:42.435007Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.05361","last_updated":"2024-09-07T15:08:24Z","snapshot_observed_at":"2026-08-07T13:19:22.496186Z","submitted_at":"2024-07-07T13:24:54Z","title":"Emilia: An Extensive, Multilingual, and Diverse Speech Dataset for Large-Scale Speech Generation","version":3},"cited_work":{"arxiv_id":"2407.05361","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2407.05361","snapshot_observed_at":"2026-07-03T03:37:35.221767Z","title":"arXiv preprint arXiv:2407.05361 , year=","venue":null,"work_id":"1cf20033-c768-4fc5-bcdd-f566ab0b9231","year":2024},"citing_paper":{"arxiv_id":"2605.25659","last_updated":"2026-05-25T10:04:52Z","snapshot_observed_at":"2026-07-06T23:35:36.158984Z","submitted_at":"2026-05-25T10:04:52Z","title":"StreamChar: Long-Horizon Streaming Character Audio-Video Generation with Decoupled Orchestration","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-06-29T22:15:17.804936Z"},"links":{"cited_paper":"/paper/2407.05361","citing_paper":"/paper/2605.25659"},"observation_digest":"sha256:736c9f1cb25d420783f0b0f051dfe9c86d73d07f47c71eeb4412a049031acc8a","observation_id":"608f90e4-bc54-4082-943e-6bf1fa17f6bf","resolution":{"observed_at":"2026-06-29T22:24:00.893750Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.05361","last_updated":"2024-09-07T15:08:24Z","snapshot_observed_at":"2026-08-07T13:19:22.496186Z","submitted_at":"2024-07-07T13:24:54Z","title":"Emilia: An Extensive, Multilingual, and Diverse Speech Dataset for Large-Scale Speech Generation","version":3},"cited_work":{"arxiv_id":"2407.05361","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2407.05361","snapshot_observed_at":"2026-07-03T03:37:35.221767Z","title":"arXiv preprint arXiv:2407.05361 , year=","venue":null,"work_id":"1cf20033-c768-4fc5-bcdd-f566ab0b9231","year":2024},"citing_paper":{"arxiv_id":"2605.30748","last_updated":"2026-06-01T01:53:31Z","snapshot_observed_at":"2026-07-06T23:39:58.378823Z","submitted_at":"2026-05-29T02:25:02Z","title":"Chatterbox-Flash: Prior-Calibrated Block Diffusion for Streaming Zero-Shot TTS","version":2},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-06-28T21:31:09.399885Z"},"links":{"cited_paper":"/paper/2407.05361","citing_paper":"/paper/2605.30748"},"observation_digest":"sha256:e1a32d1cb6153d15a6f1eb9d270d938df5b83a91af59591ddc3d2f3be0eab187","observation_id":"e34932ed-ecdb-42da-a5f3-21cdaa1d3d9f","resolution":{"observed_at":"2026-07-01T20:16:11.062977Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.05361","last_updated":"2024-09-07T15:08:24Z","snapshot_observed_at":"2026-08-07T13:19:22.496186Z","submitted_at":"2024-07-07T13:24:54Z","title":"Emilia: An Extensive, Multilingual, and Diverse Speech Dataset for Large-Scale Speech Generation","version":3},"cited_work":{"arxiv_id":"2407.05361","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2407.05361","snapshot_observed_at":"2026-07-03T03:37:35.221767Z","title":"arXiv preprint arXiv:2407.05361 , year=","venue":null,"work_id":"1cf20033-c768-4fc5-bcdd-f566ab0b9231","year":2024},"citing_paper":{"arxiv_id":"2606.09048","last_updated":"2026-06-08T05:36:42Z","snapshot_observed_at":"2026-07-06T23:48:26.076260Z","submitted_at":"2026-06-08T05:36:42Z","title":"BareWave: Waveform-Native Flow-Matching Text-to-Speech","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-06-27T15:14:03.681833Z"},"links":{"cited_paper":"/paper/2407.05361","citing_paper":"/paper/2606.09048"},"observation_digest":"sha256:1d81d642c9ede2bcc5d7b85548669e4ee6fc3c83d280fe967c7c4497c170beec","observation_id":"d62537a3-9ff4-49c5-9a60-64ed195b9888","resolution":{"observed_at":"2026-07-03T03:37:35.223279Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.05361","last_updated":"2024-09-07T15:08:24Z","snapshot_observed_at":"2026-08-07T13:19:22.496186Z","submitted_at":"2024-07-07T13:24:54Z","title":"Emilia: An Extensive, Multilingual, and Diverse Speech Dataset for Large-Scale Speech Generation","version":3},"cited_work":{"arxiv_id":"2407.05361","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2407.05361","snapshot_observed_at":"2026-07-03T03:37:35.221767Z","title":"arXiv preprint arXiv:2407.05361 , year=","venue":null,"work_id":"1cf20033-c768-4fc5-bcdd-f566ab0b9231","year":2024},"citing_paper":{"arxiv_id":"2606.10029","last_updated":"2026-06-08T18:09:37Z","snapshot_observed_at":"2026-08-06T14:10:31.952975Z","submitted_at":"2026-06-08T18:09:37Z","title":"Interpreting and Steering a Text-to-Speech Language Model with Sparse Autoencoders","version":1},"reference_index":7,"source":"arxiv_source","source_observed_at":"2026-06-27T17:09:36.845217Z"},"links":{"cited_paper":"/paper/2407.05361","citing_paper":"/paper/2606.10029"},"observation_digest":"sha256:9db35754fdb6779bea2a232bb5400e56a316f2831cf3201e9e89f9d108f10ed6","observation_id":"7de01159-c38e-444b-aa96-f909a7d722ed","resolution":{"observed_at":"2026-07-03T00:27:30.042911Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.05361","last_updated":"2024-09-07T15:08:24Z","snapshot_observed_at":"2026-08-07T13:19:22.496186Z","submitted_at":"2024-07-07T13:24:54Z","title":"Emilia: An Extensive, Multilingual, and Diverse Speech Dataset for Large-Scale Speech Generation","version":3},"cited_work":{"arxiv_id":"2407.05361","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2407.05361","snapshot_observed_at":"2026-07-03T03:37:35.221767Z","title":"arXiv preprint arXiv:2407.05361 , year=","venue":null,"work_id":"1cf20033-c768-4fc5-bcdd-f566ab0b9231","year":2024},"citing_paper":{"arxiv_id":"2606.31247","last_updated":"2026-06-30T07:24:10Z","snapshot_observed_at":"2026-07-07T00:04:58.486133Z","submitted_at":"2026-06-30T07:24:10Z","title":"FlexiSLM: A Dynamic and Controllable Frame Rate Spoken Language Model","version":1},"reference_index":170,"source":"arxiv_source","source_observed_at":"2026-07-01T03:50:26.873406Z"},"links":{"cited_paper":"/paper/2407.05361","citing_paper":"/paper/2606.31247"},"observation_digest":"sha256:3700324f209c95ea2286b85d0a0af5e0c0629d59e95ec5819d3ba0066d61130d","observation_id":"1524d8be-3023-4edb-aeea-5ff6d095c286","resolution":{"observed_at":"2026-07-01T11:45:47.191378Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.05361","last_updated":"2024-09-07T15:08:24Z","snapshot_observed_at":"2026-08-07T13:19:22.496186Z","submitted_at":"2024-07-07T13:24:54Z","title":"Emilia: An Extensive, Multilingual, and Diverse Speech Dataset for Large-Scale Speech Generation","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.05361","snapshot_observed_at":"2026-08-01T11:33:14.162197Z","title":"Emilia: An extensive, multilingual, and diverse speech dataset for large-scale speech gener- ation,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.19859","last_updated":"2026-07-22T07:48:37Z","snapshot_observed_at":"2026-08-07T12:49:18.178302Z","submitted_at":"2026-07-22T07:48:37Z","title":"StellarTTS: Sparse Temporal Embedding for Low-Latency and Robust Speech Synthesis","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-01T11:33:14.162197Z"},"links":{"cited_paper":"/paper/2407.05361","citing_paper":"/paper/2607.19859"},"observation_digest":"sha256:5ccc5b64cd39d57c1bdfbe8021cb5c1e78e05fb0ca88079e17b3335132565187","observation_id":"dcfe1bb0-7916-43a6-ad3b-06d4a79bf3d3","resolution":{"observed_at":"2026-08-01T11:33:14.162197Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.05361","last_updated":"2024-09-07T15:08:24Z","snapshot_observed_at":"2026-08-07T13:19:22.496186Z","submitted_at":"2024-07-07T13:24:54Z","title":"Emilia: An Extensive, Multilingual, and Diverse Speech Dataset for Large-Scale Speech Generation","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.05361","snapshot_observed_at":"2026-08-01T08:25:28.128920Z","title":"Emilia: An extensive, multilingual, and diverse speech dataset for large-scale speech generation,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.21132","last_updated":"2026-07-23T10:12:36Z","snapshot_observed_at":"2026-08-06T20:43:47.837332Z","submitted_at":"2026-07-23T10:12:36Z","title":"Investigating Codec-Internal Latent Audio Watermarking for Neural Codec Robustness","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-01T08:25:28.128920Z"},"links":{"cited_paper":"/paper/2407.05361","citing_paper":"/paper/2607.21132"},"observation_digest":"sha256:dd49f44c7cdfc9daa55aa3f8bb9631671a42a165193a85082c8a33800f09cfd3","observation_id":"5cca810b-9b01-4a15-9bcd-fb0ddc527fdc","resolution":{"observed_at":"2026-08-01T08:25:28.128920Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.05361","last_updated":"2024-09-07T15:08:24Z","snapshot_observed_at":"2026-08-07T13:19:22.496186Z","submitted_at":"2024-07-07T13:24:54Z","title":"Emilia: An Extensive, Multilingual, and Diverse Speech Dataset for Large-Scale Speech Generation","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.05361","snapshot_observed_at":"2026-08-04T02:47:37.291105Z","title":"Emilia: An extensive, multi- lingual, and diverse speech dataset for large-scale speech genera- tion,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.00011","last_updated":"2026-06-19T17:35:42Z","snapshot_observed_at":"2026-08-07T13:04:54.841823Z","submitted_at":"2026-06-19T17:35:42Z","title":"DLLM-TTS: Block Discrete Diffusion Language Model for Text-to-Speech Synthesis","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-04T02:47:37.291105Z"},"links":{"cited_paper":"/paper/2407.05361","citing_paper":"/paper/2608.00011"},"observation_digest":"sha256:334c304e295f0e27074fcb98f6a3dbab22d1e8e7ae62c69c9cb0d32069602f37","observation_id":"552f8c7f-7728-4854-8caa-0392f27ae99d","resolution":{"observed_at":"2026-08-04T02:47:37.291105Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2407.05361/citation-record","integrity":"/paper/2407.05361/integrity","json":"/paper/2407.05361/citation-record.json","paper":"/paper/2407.05361"},"outbound":[],"paper":{"arxiv_id":"2407.05361","last_updated":"2024-09-07T15:08:24Z","latest_version":3,"primary_category":"eess.AS","snapshot_observed_at":"2026-08-07T13:19:22.496186Z","submitted_at":"2024-07-07T13:24:54Z","title":"Emilia: An Extensive, Multilingual, and Diverse Speech Dataset for Large-Scale Speech Generation"},"reference_resolution":{"displayed":0,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":0,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":0},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"thesis":"As of 10 August 2026, this Paper Citation Record lists 0 of 0 outbound references and 21 inbound Pith citation observations for arXiv:2407.05361."}