{"as_of":"2026-08-09T17:01:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:f72b0539cbf1e87502b0d0df9e9ee53f1183aa7db3b8557c9435afc59c6caf5f","coverage":[{"denominator":0,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":46,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":46,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-09T06:31:02.800959+00:00","state":"measured"},{"denominator":46,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":46,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-09T05:54:18.810390Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":1,"source":"pith","source_observed_at":"2026-08-05T02:28:24.338817Z","state":"measured"}],"external_citation_measurements":[{"count":14,"observed_at":"2026-08-05T02:28:24.338817Z","source":"pith"}],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2310.00704","last_updated":"2024-12-10T03:17:56Z","snapshot_observed_at":"2026-08-08T23:01:50.650593Z","submitted_at":"2023-10-01T15:49:46Z","title":"UniAudio: An Audio Foundation Model Toward Universal Audio Generation","version":6},"cited_work":{"arxiv_id":"2310.00704","doi":"10.48550/arxiv.2310.00704","metadata_source":"pith","pith_arxiv_id":"2310.00704","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Uniaudio: An audio founda- tion model toward universal audio generation","venue":"cs.SD","work_id":"32877994-1a46-4754-bfc9-a1b6f56ead50","year":2023},"citing_paper":{"arxiv_id":"2410.00037","last_updated":"2024-10-02T09:11:45Z","snapshot_observed_at":"2026-07-30T10:21:14.474746Z","submitted_at":"2024-09-17T17:55:39Z","title":"Moshi: a speech-text foundation model for real-time dialogue","version":2},"reference_index":105,"source":"arxiv_source","source_observed_at":"2026-05-12T08:13:21.962488Z"},"links":{"cited_paper":"/paper/2310.00704","citing_paper":"/paper/2410.00037"},"observation_digest":"sha256:527c29b901c217e5c475c22247f8dacaa1c023aa94c01d7d2663af028c1607c1","observation_id":"e4360b2b-7a9d-4c88-ab5f-5dff3bc5fc37","resolution":{"observed_at":"2026-05-12T08:13:22.565669Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.00704","last_updated":"2024-12-10T03:17:56Z","snapshot_observed_at":"2026-08-08T23:01:50.650593Z","submitted_at":"2023-10-01T15:49:46Z","title":"UniAudio: An Audio Foundation Model Toward Universal Audio Generation","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.00704","snapshot_observed_at":"2026-08-09T05:54:18.810390Z","title":"Uniaudio: An audio foundation model toward universal audio generation","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2502.03128","last_updated":"2025-02-05T12:36:21Z","snapshot_observed_at":"2026-08-09T08:33:22.897642Z","submitted_at":"2025-02-05T12:36:21Z","title":"Metis: A Foundation Speech Generation Model with Masked Generative Pre-training","version":1},"reference_index":98,"source":"arxiv_source","source_observed_at":"2026-08-09T05:54:18.810390Z"},"links":{"cited_paper":"/paper/2310.00704","citing_paper":"/paper/2502.03128"},"observation_digest":"sha256:83a19431f7feca69f9e9e373815d7e7b35261e0c678c81ab500a73a6bb2bb8b4","observation_id":"a78a21a8-abbf-4ac3-9259-c77b9d0d1bf3","resolution":{"observed_at":"2026-08-09T05:54:18.810390Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.00704","last_updated":"2024-12-10T03:17:56Z","snapshot_observed_at":"2026-08-08T23:01:50.650593Z","submitted_at":"2023-10-01T15:49:46Z","title":"UniAudio: An Audio Foundation Model Toward Universal Audio Generation","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.00704","snapshot_observed_at":"2026-08-09T05:01:56.194777Z","title":"Uniaudio: An audio foundation model toward universal audio generation","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2502.03382","last_updated":"2025-02-26T09:31:58Z","snapshot_observed_at":"2026-08-09T04:52:56.160863Z","submitted_at":"2025-02-05T17:18:55Z","title":"High-Fidelity Simultaneous Speech-To-Speech Translation","version":2},"reference_index":40,"source":"arxiv_source","source_observed_at":"2026-08-09T05:01:56.194777Z"},"links":{"cited_paper":"/paper/2310.00704","citing_paper":"/paper/2502.03382"},"observation_digest":"sha256:8548ae08f7dc29f4eb42b84e4a7018a4d95497e17912b9b9eafd6a8f4380ef9c","observation_id":"e1ad2248-1f26-4077-b858-4f3daf0ffb90","resolution":{"observed_at":"2026-08-09T05:01:56.194777Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.00704","last_updated":"2024-12-10T03:17:56Z","snapshot_observed_at":"2026-08-08T23:01:50.650593Z","submitted_at":"2023-10-01T15:49:46Z","title":"UniAudio: An Audio Foundation Model Toward Universal Audio Generation","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.00704","snapshot_observed_at":"2026-08-08T21:12:22.509705Z","title":"Uniaudio: An audio foundation model toward universal audio generation","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2502.05240","last_updated":"2025-02-12T14:43:02Z","snapshot_observed_at":"2026-08-09T02:35:47.860082Z","submitted_at":"2025-02-07T12:18:20Z","title":"Survey on AI-Generated Media Detection: From Non-MLLM to MLLM","version":2},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-08T21:12:22.509705Z"},"links":{"cited_paper":"/paper/2310.00704","citing_paper":"/paper/2502.05240"},"observation_digest":"sha256:cd6b1bd3c96c5e6e53988a5fa8ad729c419c1400946bcfd2a35d61d1a51e3636","observation_id":"9cc133a0-5e46-45ce-98ad-a3c78c6985f1","resolution":{"observed_at":"2026-08-08T21:12:22.509705Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.00704","last_updated":"2024-12-10T03:17:56Z","snapshot_observed_at":"2026-08-08T23:01:50.650593Z","submitted_at":"2023-10-01T15:49:46Z","title":"UniAudio: An Audio Foundation Model Toward Universal Audio Generation","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.00704","snapshot_observed_at":"2026-08-08T15:04:29.446787Z","title":"Uniaudio: An audio foundation model toward universal audio generation,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2502.06604","last_updated":"2025-05-16T03:43:21Z","snapshot_observed_at":"2026-08-09T14:54:34.308877Z","submitted_at":"2025-02-10T16:01:55Z","title":"Do we really have to filter out random noise in pre-training data for language models?","version":2},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-08T15:04:29.446787Z"},"links":{"cited_paper":"/paper/2310.00704","citing_paper":"/paper/2502.06604"},"observation_digest":"sha256:dda0ef35330e9651b3a18e677ac3aa1119823385e48eade02442883497d9a896","observation_id":"fe997328-c058-4a0c-b19e-22884066b795","resolution":{"observed_at":"2026-08-08T15:04:29.446787Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.00704","last_updated":"2024-12-10T03:17:56Z","snapshot_observed_at":"2026-08-08T23:01:50.650593Z","submitted_at":"2023-10-01T15:49:46Z","title":"UniAudio: An Audio Foundation Model Toward Universal Audio Generation","version":6},"cited_work":{"arxiv_id":"2310.00704","doi":"10.48550/arxiv.2310.00704","metadata_source":"pith","pith_arxiv_id":"2310.00704","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Uniaudio: An audio founda- tion model toward universal audio generation","venue":"cs.SD","work_id":"32877994-1a46-4754-bfc9-a1b6f56ead50","year":2023},"citing_paper":{"arxiv_id":"2504.18425","last_updated":"2025-04-25T15:31:46Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-04-25T15:31:46Z","title":"Kimi-Audio Technical Report","version":1},"reference_index":77,"source":"pdf_text","source_observed_at":"2026-05-11T19:21:26.933349Z"},"links":{"cited_paper":"/paper/2310.00704","citing_paper":"/paper/2504.18425"},"observation_digest":"sha256:76d6fbd087dd8866907b43f11a05523732f77e191e065c95f94fbb4f0db50044","observation_id":"0c1be9db-808d-43b2-8d74-453dc411fda3","resolution":{"observed_at":"2026-05-11T19:21:27.112262Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.00704","last_updated":"2024-12-10T03:17:56Z","snapshot_observed_at":"2026-08-08T23:01:50.650593Z","submitted_at":"2023-10-01T15:49:46Z","title":"UniAudio: An Audio Foundation Model Toward Universal Audio Generation","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.00704","snapshot_observed_at":"2026-08-07T15:23:16.151902Z","title":"Uniaudio: An audio founda- tion model toward universal audio generation,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.15380","last_updated":"2025-06-03T03:01:24Z","snapshot_observed_at":"2026-08-07T23:24:21.256440Z","submitted_at":"2025-05-21T11:17:04Z","title":"Accelerating Autoregressive Speech Synthesis Inference With Speech Speculative Decoding","version":2},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-07T15:23:16.151902Z"},"links":{"cited_paper":"/paper/2310.00704","citing_paper":"/paper/2505.15380"},"observation_digest":"sha256:219912eee8c7c80470fadc44a9632ce10cd79481be8a93777443112b449a1268","observation_id":"6c5afbac-e9d2-4862-8f5f-cab96a22e33d","resolution":{"observed_at":"2026-08-07T15:23:16.151902Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.00704","last_updated":"2024-12-10T03:17:56Z","snapshot_observed_at":"2026-08-08T23:01:50.650593Z","submitted_at":"2023-10-01T15:49:46Z","title":"UniAudio: An Audio Foundation Model Toward Universal Audio Generation","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.00704","snapshot_observed_at":"2026-08-07T13:21:08.829562Z","title":"UniAudio: An audio founda- tion model toward universal audio generation,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.22106","last_updated":"2025-05-28T08:33:58Z","snapshot_observed_at":"2026-08-07T13:12:43.270911Z","submitted_at":"2025-05-28T08:33:58Z","title":"AudioTurbo: Fast Text-to-Audio Generation with Rectified Diffusion","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-07T13:21:08.829562Z"},"links":{"cited_paper":"/paper/2310.00704","citing_paper":"/paper/2505.22106"},"observation_digest":"sha256:01eecc337c2bc591e0e9e93786bf4150ef947ba7cf2c7596986ab3a14a924583","observation_id":"48e7124c-05e4-43c9-bb0d-10ed4f8b5f88","resolution":{"observed_at":"2026-08-07T13:21:08.829562Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.00704","last_updated":"2024-12-10T03:17:56Z","snapshot_observed_at":"2026-08-08T23:01:50.650593Z","submitted_at":"2023-10-01T15:49:46Z","title":"UniAudio: An Audio Foundation Model Toward Universal Audio Generation","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.00704","snapshot_observed_at":"2026-08-07T11:59:49.805442Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.00927","last_updated":"2025-06-01T09:41:56Z","snapshot_observed_at":"2026-08-08T23:02:00.996998Z","submitted_at":"2025-06-01T09:41:56Z","title":"In-the-wild Audio Spatialization with Flexible Text-guided Localization","version":1},"reference_index":41,"source":"arxiv_source","source_observed_at":"2026-08-07T11:59:49.805442Z"},"links":{"cited_paper":"/paper/2310.00704","citing_paper":"/paper/2506.00927"},"observation_digest":"sha256:683a8b268a6d0aaf147c07a9dc38354b38b12d837bdc31262ae7df906d85d3c9","observation_id":"c87ec37f-a114-40b6-acff-57d356b935c6","resolution":{"observed_at":"2026-08-07T11:59:49.805442Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.00704","last_updated":"2024-12-10T03:17:56Z","snapshot_observed_at":"2026-08-08T23:01:50.650593Z","submitted_at":"2023-10-01T15:49:46Z","title":"UniAudio: An Audio Foundation Model Toward Universal Audio Generation","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.00704","snapshot_observed_at":"2026-08-07T11:57:58.032031Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.01014","last_updated":"2025-06-01T13:53:28Z","snapshot_observed_at":"2026-08-07T23:06:59.165463Z","submitted_at":"2025-06-01T13:53:28Z","title":"Rhythm Controllable and Efficient Zero-Shot Voice Conversion via Shortcut Flow Matching","version":1},"reference_index":60,"source":"arxiv_source","source_observed_at":"2026-08-07T11:57:58.032031Z"},"links":{"cited_paper":"/paper/2310.00704","citing_paper":"/paper/2506.01014"},"observation_digest":"sha256:7be7d40c9a6d17a2229bc9f87f42fc48c66e455bda8f151a990ef8951b87cc74","observation_id":"4eb02c9c-0049-4412-b20a-1d0f0b385f28","resolution":{"observed_at":"2026-08-07T11:57:58.032031Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.00704","last_updated":"2024-12-10T03:17:56Z","snapshot_observed_at":"2026-08-08T23:01:50.650593Z","submitted_at":"2023-10-01T15:49:46Z","title":"UniAudio: An Audio Foundation Model Toward Universal Audio Generation","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.00704","snapshot_observed_at":"2026-08-07T11:54:24.284181Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.01111","last_updated":"2025-06-01T18:29:17Z","snapshot_observed_at":"2026-08-07T11:48:17.343481Z","submitted_at":"2025-06-01T18:29:17Z","title":"FusionAudio-1.2M: Towards Fine-grained Audio Captioning with Multimodal Contextual Fusion","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-07T11:54:24.284181Z"},"links":{"cited_paper":"/paper/2310.00704","citing_paper":"/paper/2506.01111"},"observation_digest":"sha256:b70af4421e848152df4f03ef5cc14c939a5b435435820641979f812cbc0f2bcb","observation_id":"93b38794-9dc5-4c3f-b4e9-219efef4dac9","resolution":{"observed_at":"2026-08-07T11:54:24.284181Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.00704","last_updated":"2024-12-10T03:17:56Z","snapshot_observed_at":"2026-08-08T23:01:50.650593Z","submitted_at":"2023-10-01T15:49:46Z","title":"UniAudio: An Audio Foundation Model Toward Universal Audio Generation","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.00704","snapshot_observed_at":"2026-08-07T05:33:55.754374Z","title":"UniAudio: An Audio Foundation Model Toward Universal Audio Generation,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.07647","last_updated":"2025-06-09T11:12:02Z","snapshot_observed_at":"2026-08-09T11:40:16.573138Z","submitted_at":"2025-06-09T11:12:02Z","title":"Foundation Model Empowered Synesthesia of Machines (SoM): AI-native Intelligent Multi-Modal Sensing-Communication Integration","version":1},"reference_index":87,"source":"pdf_text","source_observed_at":"2026-08-07T05:33:55.754374Z"},"links":{"cited_paper":"/paper/2310.00704","citing_paper":"/paper/2506.07647"},"observation_digest":"sha256:770859a7b7f05801f9e758c0360ddff68cca8d12b64835b6ee37697e84367ccd","observation_id":"e9596670-4fda-4713-bc55-68aeb0e506e2","resolution":{"observed_at":"2026-08-07T05:33:55.754374Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.00704","last_updated":"2024-12-10T03:17:56Z","snapshot_observed_at":"2026-08-08T23:01:50.650593Z","submitted_at":"2023-10-01T15:49:46Z","title":"UniAudio: An Audio Foundation Model Toward Universal Audio Generation","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.00704","snapshot_observed_at":"2026-08-07T05:23:32.781421Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.08228","last_updated":"2025-09-08T00:53:59Z","snapshot_observed_at":"2026-08-08T23:02:54.953752Z","submitted_at":"2025-06-09T20:54:23Z","title":"Scaling Laws of Motion Forecasting and Planning -- Technical Report","version":2},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-07T05:23:32.781421Z"},"links":{"cited_paper":"/paper/2310.00704","citing_paper":"/paper/2506.08228"},"observation_digest":"sha256:93157fd693186c11e20cbb6ce4aece81bb0531e8973fced86e7cc0ccdf096e94","observation_id":"4572b879-d5a4-4980-9e0d-41350217fb08","resolution":{"observed_at":"2026-08-07T05:23:32.781421Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.00704","last_updated":"2024-12-10T03:17:56Z","snapshot_observed_at":"2026-08-08T23:01:50.650593Z","submitted_at":"2023-10-01T15:49:46Z","title":"UniAudio: An Audio Foundation Model Toward Universal Audio Generation","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.00704","snapshot_observed_at":"2026-08-06T19:02:24.387244Z","title":"Uniaudio: An audio foundation model toward universal audio gener- ation,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.06674","last_updated":"2025-07-09T09:05:18Z","snapshot_observed_at":"2026-08-08T23:02:01.289592Z","submitted_at":"2025-07-09T09:05:18Z","title":"Exploring State-Space-Model based Language Model in Music Generation","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-06T19:02:24.387244Z"},"links":{"cited_paper":"/paper/2310.00704","citing_paper":"/paper/2507.06674"},"observation_digest":"sha256:b90e5f1cc94482da7905231e9d8bbc019f9ced0a3ebd93c0e6899048c9bc5c28","observation_id":"981006d2-d1a6-4647-8332-b80cd2f36eda","resolution":{"observed_at":"2026-08-06T19:02:24.387244Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.00704","last_updated":"2024-12-10T03:17:56Z","snapshot_observed_at":"2026-08-08T23:01:50.650593Z","submitted_at":"2023-10-01T15:49:46Z","title":"UniAudio: An Audio Foundation Model Toward Universal Audio Generation","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.00704","snapshot_observed_at":"2026-08-06T18:14:07.244165Z","title":"Uniaudio: An audio founda- tion model toward universal audio generation,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.09070","last_updated":"2025-07-11T23:14:07Z","snapshot_observed_at":"2026-08-08T12:24:08.608942Z","submitted_at":"2025-07-11T23:14:07Z","title":"SemAlignVC: Enhancing zero-shot timbre conversion using semantic alignment","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-06T18:14:07.244165Z"},"links":{"cited_paper":"/paper/2310.00704","citing_paper":"/paper/2507.09070"},"observation_digest":"sha256:7d3d92e300a92c9f502d519db89bf7c62878a54cbd2b417de5c5b0b9c1931650","observation_id":"72949c76-f247-4187-949e-bf301ca95cc7","resolution":{"observed_at":"2026-08-06T18:14:07.244165Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.00704","last_updated":"2024-12-10T03:17:56Z","snapshot_observed_at":"2026-08-08T23:01:50.650593Z","submitted_at":"2023-10-01T15:49:46Z","title":"UniAudio: An Audio Foundation Model Toward Universal Audio Generation","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.00704","snapshot_observed_at":"2026-08-06T17:52:01.524187Z","title":"Uniaudio: An audio foundation model toward universal audio generation","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.09834","last_updated":"2025-07-14T00:14:54Z","snapshot_observed_at":"2026-08-08T23:02:17.585184Z","submitted_at":"2025-07-14T00:14:54Z","title":"Generative Audio Language Modeling with Continuous-valued Tokens and Masked Next-Token Prediction","version":1},"reference_index":94,"source":"arxiv_source","source_observed_at":"2026-08-06T17:52:01.524187Z"},"links":{"cited_paper":"/paper/2310.00704","citing_paper":"/paper/2507.09834"},"observation_digest":"sha256:c39750bf925a144e70a438f580e54161f410fd452aa85666606e16658b5010bd","observation_id":"d682d2a4-1638-47e1-b3b7-c04993354b10","resolution":{"observed_at":"2026-08-06T17:52:01.524187Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.00704","last_updated":"2024-12-10T03:17:56Z","snapshot_observed_at":"2026-08-08T23:01:50.650593Z","submitted_at":"2023-10-01T15:49:46Z","title":"UniAudio: An Audio Foundation Model Toward Universal Audio Generation","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.00704","snapshot_observed_at":"2026-08-06T17:46:18.500277Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.10109","last_updated":"2025-07-14T09:50:53Z","snapshot_observed_at":"2026-08-08T02:46:03.641224Z","submitted_at":"2025-07-14T09:50:53Z","title":"DualDub: Video-to-Soundtrack Generation via Joint Speech and Background Audio Synthesis","version":1},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-06T17:46:18.500277Z"},"links":{"cited_paper":"/paper/2310.00704","citing_paper":"/paper/2507.10109"},"observation_digest":"sha256:48207959a5c486383219d6a1b8d609e6f971cd6f93f69fd35d3d490e2aa9f528","observation_id":"c6e79082-fc53-44c9-8f1e-6ec750618d11","resolution":{"observed_at":"2026-08-06T17:46:18.500277Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.00704","last_updated":"2024-12-10T03:17:56Z","snapshot_observed_at":"2026-08-08T23:01:50.650593Z","submitted_at":"2023-10-01T15:49:46Z","title":"UniAudio: An Audio Foundation Model Toward Universal Audio Generation","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.00704","snapshot_observed_at":"2026-08-06T17:05:28.943831Z","title":"UniAudio: An audio foundation model toward universal audio generation,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.11773","last_updated":"2025-07-15T22:24:17Z","snapshot_observed_at":"2026-08-08T23:02:16.492031Z","submitted_at":"2025-07-15T22:24:17Z","title":"Small Data Explainer -- The impact of small data methods in everyday life","version":1},"reference_index":77,"source":"pdf_text","source_observed_at":"2026-08-06T17:05:28.943831Z"},"links":{"cited_paper":"/paper/2310.00704","citing_paper":"/paper/2507.11773"},"observation_digest":"sha256:c95fe8fb34a7a2d88d4c932ad731a70483c5a388811a7f3fefe7a4d9884ff26f","observation_id":"118c0019-ded0-417d-97e5-48b2b48b530c","resolution":{"observed_at":"2026-08-06T17:05:28.943831Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.00704","last_updated":"2024-12-10T03:17:56Z","snapshot_observed_at":"2026-08-08T23:01:50.650593Z","submitted_at":"2023-10-01T15:49:46Z","title":"UniAudio: An Audio Foundation Model Toward Universal Audio Generation","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.00704","snapshot_observed_at":"2026-08-06T16:55:50.479314Z","title":"Uniaudio: An audio foundation model toward universal audio generation","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.12197","last_updated":"2025-07-16T12:47:09Z","snapshot_observed_at":"2026-08-07T14:59:35.759272Z","submitted_at":"2025-07-16T12:47:09Z","title":"Quantize More, Lose Less: Autoregressive Generation from Residually Quantized Speech Representations","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-06T16:55:50.479314Z"},"links":{"cited_paper":"/paper/2310.00704","citing_paper":"/paper/2507.12197"},"observation_digest":"sha256:53e4c1df67b871910d60d9df482893495c18031a7d6ad9e489e8b04f2d8853b8","observation_id":"506e6954-1a24-43c5-aaa2-a2c3c992b00e","resolution":{"observed_at":"2026-08-06T16:55:50.479314Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.00704","last_updated":"2024-12-10T03:17:56Z","snapshot_observed_at":"2026-08-08T23:01:50.650593Z","submitted_at":"2023-10-01T15:49:46Z","title":"UniAudio: An Audio Foundation Model Toward Universal Audio Generation","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.00704","snapshot_observed_at":"2026-08-06T14:50:04.199707Z","title":"ArXiv abs/2310.00704 (2023)","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.17563","last_updated":"2025-07-23T14:53:50Z","snapshot_observed_at":"2026-08-07T18:31:16.203029Z","submitted_at":"2025-07-23T14:53:50Z","title":"BoSS: Beyond-Semantic Speech","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-06T14:50:04.199707Z"},"links":{"cited_paper":"/paper/2310.00704","citing_paper":"/paper/2507.17563"},"observation_digest":"sha256:85636ce8ce78bb94faef30f3152c7a58848b86917852755347047c05acd237ba","observation_id":"8ff6b37b-4359-4374-8562-1d9f47b94cca","resolution":{"observed_at":"2026-08-06T14:50:04.199707Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.00704","last_updated":"2024-12-10T03:17:56Z","snapshot_observed_at":"2026-08-08T23:01:50.650593Z","submitted_at":"2023-10-01T15:49:46Z","title":"UniAudio: An Audio Foundation Model Toward Universal Audio Generation","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.00704","snapshot_observed_at":"2026-08-06T10:59:05.807002Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.23267","last_updated":"2025-07-31T05:56:21Z","snapshot_observed_at":"2026-08-08T17:40:45.284284Z","submitted_at":"2025-07-31T05:56:21Z","title":"Your Spending Needs Attention: Modeling Financial Habits with Transformers","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-06T10:59:05.807002Z"},"links":{"cited_paper":"/paper/2310.00704","citing_paper":"/paper/2507.23267"},"observation_digest":"sha256:73193e59632f634992b85511d9f0941bc5fc218f7b02cca3113c73c49219558e","observation_id":"ecd473e6-b5a8-42f0-9157-10e01aae665a","resolution":{"observed_at":"2026-08-06T10:59:05.807002Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.00704","last_updated":"2024-12-10T03:17:56Z","snapshot_observed_at":"2026-08-08T23:01:50.650593Z","submitted_at":"2023-10-01T15:49:46Z","title":"UniAudio: An Audio Foundation Model Toward Universal Audio Generation","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.00704","snapshot_observed_at":"2026-08-05T15:29:25.573605Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2508.19852","last_updated":"2025-08-28T07:08:03Z","snapshot_observed_at":"2026-08-07T08:18:37.593830Z","submitted_at":"2025-08-27T13:09:55Z","title":"Ego-centric Predictive Model Conditioned on Hand Trajectories","version":2},"reference_index":51,"source":"arxiv_source","source_observed_at":"2026-08-05T15:29:25.573605Z"},"links":{"cited_paper":"/paper/2310.00704","citing_paper":"/paper/2508.19852"},"observation_digest":"sha256:a3dad4ae0c3edad7238bbe1a1e651db20a110dcba6cfc02c8032b89d1c9ab289","observation_id":"404acb60-0c1c-40f7-93ad-3c6b2d3cc334","resolution":{"observed_at":"2026-08-05T15:29:25.573605Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.00704","last_updated":"2024-12-10T03:17:56Z","snapshot_observed_at":"2026-08-08T23:01:50.650593Z","submitted_at":"2023-10-01T15:49:46Z","title":"UniAudio: An Audio Foundation Model Toward Universal Audio Generation","version":6},"cited_work":{"arxiv_id":"2310.00704","doi":"10.48550/arxiv.2310.00704","metadata_source":"pith","pith_arxiv_id":"2310.00704","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Uniaudio: An audio founda- tion model toward universal audio generation","venue":"cs.SD","work_id":"32877994-1a46-4754-bfc9-a1b6f56ead50","year":2023},"citing_paper":{"arxiv_id":"2509.03526","last_updated":"2026-05-20T03:07:46Z","snapshot_observed_at":"2026-08-07T01:53:38.136292Z","submitted_at":"2025-08-25T07:31:48Z","title":"Enhancing Speech Large Language Models through Reinforced Behavior Alignment","version":2},"reference_index":53,"source":"arxiv_source","source_observed_at":"2026-05-21T22:23:52.392075Z"},"links":{"cited_paper":"/paper/2310.00704","citing_paper":"/paper/2509.03526"},"observation_digest":"sha256:6912e9620128f76270356a71b5cbbb7d16e1ca0beca0f0517b39c83102839942","observation_id":"e6197b20-9dbe-4590-945c-9a1418149def","resolution":{"observed_at":"2026-05-21T22:24:23.543438Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.00704","last_updated":"2024-12-10T03:17:56Z","snapshot_observed_at":"2026-08-08T23:01:50.650593Z","submitted_at":"2023-10-01T15:49:46Z","title":"UniAudio: An Audio Foundation Model Toward Universal Audio Generation","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.00704","snapshot_observed_at":"2026-08-04T11:29:36.870189Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2510.04593","last_updated":"2026-06-08T05:49:30Z","snapshot_observed_at":"2026-08-06T08:55:28.794308Z","submitted_at":"2025-10-06T08:47:38Z","title":"UniVoice: Unifying Autoregressive ASR and Flow-Matching based TTS with Large Language Models","version":3},"reference_index":61,"source":"arxiv_source","source_observed_at":"2026-08-04T11:29:36.870189Z"},"links":{"cited_paper":"/paper/2310.00704","citing_paper":"/paper/2510.04593"},"observation_digest":"sha256:fc73dcb10af066f8de1a38287b6095495dffbc75a9bda1f46647bdcb6ca7ab0b","observation_id":"a6ccd059-323c-4831-b26c-401f61f95b9c","resolution":{"observed_at":"2026-08-04T11:29:36.870189Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.00704","last_updated":"2024-12-10T03:17:56Z","snapshot_observed_at":"2026-08-08T23:01:50.650593Z","submitted_at":"2023-10-01T15:49:46Z","title":"UniAudio: An Audio Foundation Model Toward Universal Audio Generation","version":6},"cited_work":{"arxiv_id":"2310.00704","doi":"10.48550/arxiv.2310.00704","metadata_source":"pith","pith_arxiv_id":"2310.00704","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Uniaudio: An audio founda- tion model toward universal audio generation","venue":"cs.SD","work_id":"32877994-1a46-4754-bfc9-a1b6f56ead50","year":2023},"citing_paper":{"arxiv_id":"2510.13293","last_updated":"2026-06-10T05:54:25Z","snapshot_observed_at":"2026-08-04T09:49:40.217695Z","submitted_at":"2025-10-15T08:37:16Z","title":"Cross-modal Consistency Guidance for Robust Emotion Control in Auto-Regressive TTS Models","version":2},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-05-18T07:42:43.077644Z"},"links":{"cited_paper":"/paper/2310.00704","citing_paper":"/paper/2510.13293"},"observation_digest":"sha256:1e0b2891fb230309d7e8f6c894d6709be0dd07f79d7ad0edd7bcf7010edcbee2","observation_id":"7c4c84d1-c061-4e10-a641-3c466918b1cd","resolution":{"observed_at":"2026-05-18T07:46:03.644203Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.00704","last_updated":"2024-12-10T03:17:56Z","snapshot_observed_at":"2026-08-08T23:01:50.650593Z","submitted_at":"2023-10-01T15:49:46Z","title":"UniAudio: An Audio Foundation Model Toward Universal Audio Generation","version":6},"cited_work":{"arxiv_id":"2310.00704","doi":"10.48550/arxiv.2310.00704","metadata_source":"pith","pith_arxiv_id":"2310.00704","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Uniaudio: An audio founda- tion model toward universal audio generation","venue":"cs.SD","work_id":"32877994-1a46-4754-bfc9-a1b6f56ead50","year":2023},"citing_paper":{"arxiv_id":"2510.13293","last_updated":"2026-06-10T05:54:25Z","snapshot_observed_at":"2026-08-04T09:49:40.217695Z","submitted_at":"2025-10-15T08:37:16Z","title":"Cross-modal Consistency Guidance for Robust Emotion Control in Auto-Regressive TTS Models","version":3},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-05-21T20:56:37.533183Z"},"links":{"cited_paper":"/paper/2310.00704","citing_paper":"/paper/2510.13293"},"observation_digest":"sha256:fa10ff6628ff669c661ef9db2e9882827380aadc9e8bafc316a928ae47f2e351","observation_id":"cefc0374-dafb-439b-9a9f-a548839f2bdf","resolution":{"observed_at":"2026-05-21T21:00:39.106539Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.00704","last_updated":"2024-12-10T03:17:56Z","snapshot_observed_at":"2026-08-08T23:01:50.650593Z","submitted_at":"2023-10-01T15:49:46Z","title":"UniAudio: An Audio Foundation Model Toward Universal Audio Generation","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.00704","snapshot_observed_at":"2026-08-04T09:49:42.653482Z","title":"Uniaudio: An audio founda- tion model toward universal audio generation,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2510.13293","last_updated":"2026-06-10T05:54:25Z","snapshot_observed_at":"2026-08-04T09:49:40.217695Z","submitted_at":"2025-10-15T08:37:16Z","title":"Cross-modal Consistency Guidance for Robust Emotion Control in Auto-Regressive TTS Models","version":4},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-04T09:49:42.653482Z"},"links":{"cited_paper":"/paper/2310.00704","citing_paper":"/paper/2510.13293"},"observation_digest":"sha256:4603f58d02c03ad4f8bb2019e8a511400b2ba074e4d0f04336c92858aa41056c","observation_id":"b07c37f9-d40f-46f2-91cb-41d3251b0bbc","resolution":{"observed_at":"2026-08-04T09:49:42.653482Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.00704","last_updated":"2024-12-10T03:17:56Z","snapshot_observed_at":"2026-08-08T23:01:50.650593Z","submitted_at":"2023-10-01T15:49:46Z","title":"UniAudio: An Audio Foundation Model Toward Universal Audio Generation","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.00704","snapshot_observed_at":"2026-08-04T06:47:10.473180Z","title":"Uniaudio: An audio founda- tion model toward universal audio generation.arXiv preprint arXiv:2310.00704, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2511.20635","last_updated":"2026-08-02T05:27:14Z","snapshot_observed_at":"2026-08-08T05:22:59.737639Z","submitted_at":"2025-11-25T18:54:16Z","title":"iMontage: Unified, Versatile, Highly Dynamic Many-to-many Image Generation","version":3},"reference_index":63,"source":"pdf_text","source_observed_at":"2026-08-04T06:47:10.473180Z"},"links":{"cited_paper":"/paper/2310.00704","citing_paper":"/paper/2511.20635"},"observation_digest":"sha256:df176f5c890943daf7072833ad161f4b142ae7233c07ca883633c8ebadbd4e3d","observation_id":"3fb4263e-3399-4e4f-b0ee-b933c3288000","resolution":{"observed_at":"2026-08-04T06:47:10.473180Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.00704","last_updated":"2024-12-10T03:17:56Z","snapshot_observed_at":"2026-08-08T23:01:50.650593Z","submitted_at":"2023-10-01T15:49:46Z","title":"UniAudio: An Audio Foundation Model Toward Universal Audio Generation","version":6},"cited_work":{"arxiv_id":"2310.00704","doi":"10.48550/arxiv.2310.00704","metadata_source":"pith","pith_arxiv_id":"2310.00704","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Uniaudio: An audio founda- tion model toward universal audio generation","venue":"cs.SD","work_id":"32877994-1a46-4754-bfc9-a1b6f56ead50","year":2023},"citing_paper":{"arxiv_id":"2601.15621","last_updated":"2026-01-22T03:51:43Z","snapshot_observed_at":"2026-08-04T12:22:34.670840Z","submitted_at":"2026-01-22T03:51:43Z","title":"Qwen3-TTS Technical Report","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-05-16T19:24:56.057631Z"},"links":{"cited_paper":"/paper/2310.00704","citing_paper":"/paper/2601.15621"},"observation_digest":"sha256:9330b326a834fc4fde53b37a0e6e2a2977a9723d394aa3a4ea4b69d0fd83da58","observation_id":"c6f8bd97-d23e-4c84-ae04-9a6fff638289","resolution":{"observed_at":"2026-05-16T19:24:56.178157Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.00704","last_updated":"2024-12-10T03:17:56Z","snapshot_observed_at":"2026-08-08T23:01:50.650593Z","submitted_at":"2023-10-01T15:49:46Z","title":"UniAudio: An Audio Foundation Model Toward Universal Audio Generation","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.00704","snapshot_observed_at":"2026-08-03T06:03:33.272230Z","title":"Uniaudio: An audio foundation model toward universal audio generation,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2602.00560","last_updated":"2026-06-10T10:57:05Z","snapshot_observed_at":"2026-08-07T06:26:40.381217Z","submitted_at":"2026-01-31T06:56:50Z","title":"Edit Content, Preserve Acoustics: Imperceptible Text-Based Speech Editing via Self-Consistency Rewards","version":2},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-03T06:03:33.272230Z"},"links":{"cited_paper":"/paper/2310.00704","citing_paper":"/paper/2602.00560"},"observation_digest":"sha256:07a3b15c46c2166384a9268fb1811ca2970412db4abe71ff68d78306f8b416e1","observation_id":"bbcbef27-93d7-41b0-986d-1c53182bed16","resolution":{"observed_at":"2026-08-03T06:03:33.272230Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.00704","last_updated":"2024-12-10T03:17:56Z","snapshot_observed_at":"2026-08-08T23:01:50.650593Z","submitted_at":"2023-10-01T15:49:46Z","title":"UniAudio: An Audio Foundation Model Toward Universal Audio Generation","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.00704","snapshot_observed_at":"2026-08-03T00:57:01.237575Z","title":"findings-acl.828/","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2602.11072","last_updated":"2026-07-22T13:29:14Z","snapshot_observed_at":"2026-08-09T15:21:39.959741Z","submitted_at":"2026-02-11T17:41:01Z","title":"Simultaneous Speech-to-Speech Translation Without Aligned Data","version":2},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-03T00:57:01.237575Z"},"links":{"cited_paper":"/paper/2310.00704","citing_paper":"/paper/2602.11072"},"observation_digest":"sha256:b7e224b97ab90b54f6bcbf3cb23f16d57b365e571b88d50ac2969a75f66232c1","observation_id":"71031306-d505-4e03-98b8-542f9d4370e0","resolution":{"observed_at":"2026-08-03T00:57:01.237575Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.00704","last_updated":"2024-12-10T03:17:56Z","snapshot_observed_at":"2026-08-08T23:01:50.650593Z","submitted_at":"2023-10-01T15:49:46Z","title":"UniAudio: An Audio Foundation Model Toward Universal Audio Generation","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.00704","snapshot_observed_at":"2026-08-02T20:00:06.136667Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2603.00395","last_updated":"2026-07-10T08:34:01Z","snapshot_observed_at":"2026-08-08T23:02:32.782172Z","submitted_at":"2026-02-28T00:50:00Z","title":"Fine-grained Soundscape Control for Augmented Hearing","version":3},"reference_index":61,"source":"pdf_text","source_observed_at":"2026-08-02T20:00:06.136667Z"},"links":{"cited_paper":"/paper/2310.00704","citing_paper":"/paper/2603.00395"},"observation_digest":"sha256:24cc609b4852ee00ade1222c86d769ce0aa867601cfbeb7d4c84ed0ec956bb4b","observation_id":"0f88f706-4546-4784-8303-9f521e2f6234","resolution":{"observed_at":"2026-08-02T20:00:06.136667Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.00704","last_updated":"2024-12-10T03:17:56Z","snapshot_observed_at":"2026-08-08T23:01:50.650593Z","submitted_at":"2023-10-01T15:49:46Z","title":"UniAudio: An Audio Foundation Model Toward Universal Audio Generation","version":6},"cited_work":{"arxiv_id":"2310.00704","doi":"10.48550/arxiv.2310.00704","metadata_source":"pith","pith_arxiv_id":"2310.00704","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Uniaudio: An audio founda- tion model toward universal audio generation","venue":"cs.SD","work_id":"32877994-1a46-4754-bfc9-a1b6f56ead50","year":2023},"citing_paper":{"arxiv_id":"2605.09259","last_updated":"2026-05-10T02:08:07Z","snapshot_observed_at":"2026-07-06T23:21:21.560069Z","submitted_at":"2026-05-10T02:08:07Z","title":"Remix the Timbre: Diffusion-Based Style Transfer Across Polyphonic Stems","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-05-12T04:58:26.634355Z"},"links":{"cited_paper":"/paper/2310.00704","citing_paper":"/paper/2605.09259"},"observation_digest":"sha256:57f9d4c2b6317ce7c961c507f73cdb9a47c11d9dff276abd5813be09e476c4ca","observation_id":"1f131168-718f-4581-ae3f-3eab37b2d5eb","resolution":{"observed_at":"2026-05-12T05:46:27.928071Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.00704","last_updated":"2024-12-10T03:17:56Z","snapshot_observed_at":"2026-08-08T23:01:50.650593Z","submitted_at":"2023-10-01T15:49:46Z","title":"UniAudio: An Audio Foundation Model Toward Universal Audio Generation","version":6},"cited_work":{"arxiv_id":"2310.00704","doi":"10.48550/arxiv.2310.00704","metadata_source":"pith","pith_arxiv_id":"2310.00704","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Uniaudio: An audio founda- tion model toward universal audio generation","venue":"cs.SD","work_id":"32877994-1a46-4754-bfc9-a1b6f56ead50","year":2023},"citing_paper":{"arxiv_id":"2605.15831","last_updated":"2026-05-15T10:35:49Z","snapshot_observed_at":"2026-07-06T23:27:05.961780Z","submitted_at":"2026-05-15T10:35:49Z","title":"Modeling Music as a Time-Frequency Image: A 2D Tokenizer for Music Generation","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-05-19T18:47:32.003545Z"},"links":{"cited_paper":"/paper/2310.00704","citing_paper":"/paper/2605.15831"},"observation_digest":"sha256:78a2312e69143c5157441ac84ae12de69b63c2dc53ee48ffb18d6f6ab59d972c","observation_id":"c0fb6750-12f8-47aa-b72c-659f602c332e","resolution":{"observed_at":"2026-05-19T18:47:43.034952Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.00704","last_updated":"2024-12-10T03:17:56Z","snapshot_observed_at":"2026-08-08T23:01:50.650593Z","submitted_at":"2023-10-01T15:49:46Z","title":"UniAudio: An Audio Foundation Model Toward Universal Audio Generation","version":6},"cited_work":{"arxiv_id":"2310.00704","doi":"10.48550/arxiv.2310.00704","metadata_source":"pith","pith_arxiv_id":"2310.00704","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Uniaudio: An audio founda- tion model toward universal audio generation","venue":"cs.SD","work_id":"32877994-1a46-4754-bfc9-a1b6f56ead50","year":2023},"citing_paper":{"arxiv_id":"2605.28063","last_updated":"2026-05-27T07:15:35Z","snapshot_observed_at":"2026-08-06T20:35:40.532245Z","submitted_at":"2026-05-27T07:15:35Z","title":"Unified Synthesis of Compositional Speech and Sound from Free-Form Text Prompts","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-06-29T10:28:18.202974Z"},"links":{"cited_paper":"/paper/2310.00704","citing_paper":"/paper/2605.28063"},"observation_digest":"sha256:8e7bff4bd6f026cdd3a536479b953196bd6ba3abc753ba19423c43d3cbb73180","observation_id":"e2101993-a06f-4051-818d-136ce8d283bc","resolution":{"observed_at":"2026-06-29T10:33:17.934369Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.00704","last_updated":"2024-12-10T03:17:56Z","snapshot_observed_at":"2026-08-08T23:01:50.650593Z","submitted_at":"2023-10-01T15:49:46Z","title":"UniAudio: An Audio Foundation Model Toward Universal Audio Generation","version":6},"cited_work":{"arxiv_id":"2310.00704","doi":"10.48550/arxiv.2310.00704","metadata_source":"pith","pith_arxiv_id":"2310.00704","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Uniaudio: An audio founda- tion model toward universal audio generation","venue":"cs.SD","work_id":"32877994-1a46-4754-bfc9-a1b6f56ead50","year":2023},"citing_paper":{"arxiv_id":"2606.01677","last_updated":"2026-06-01T04:35:28Z","snapshot_observed_at":"2026-08-01T15:52:02.822088Z","submitted_at":"2026-06-01T04:35:28Z","title":"UniVocal: Unified Speech-Singing Code-Switching Synthesis","version":1},"reference_index":61,"source":"arxiv_source","source_observed_at":"2026-06-28T13:17:13.510587Z"},"links":{"cited_paper":"/paper/2310.00704","citing_paper":"/paper/2606.01677"},"observation_digest":"sha256:53fc619d30d8f62b8c944d68474da3adeea2a7306b938628b74b38344210909b","observation_id":"323b2215-b214-4cd6-a90a-ff2a2dc5a7c7","resolution":{"observed_at":"2026-07-02T00:46:24.586510Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.00704","last_updated":"2024-12-10T03:17:56Z","snapshot_observed_at":"2026-08-08T23:01:50.650593Z","submitted_at":"2023-10-01T15:49:46Z","title":"UniAudio: An Audio Foundation Model Toward Universal Audio Generation","version":6},"cited_work":{"arxiv_id":"2310.00704","doi":"10.48550/arxiv.2310.00704","metadata_source":"pith","pith_arxiv_id":"2310.00704","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Uniaudio: An audio founda- tion model toward universal audio generation","venue":"cs.SD","work_id":"32877994-1a46-4754-bfc9-a1b6f56ead50","year":2023},"citing_paper":{"arxiv_id":"2606.12940","last_updated":"2026-06-11T06:06:02Z","snapshot_observed_at":"2026-07-06T23:51:45.306189Z","submitted_at":"2026-06-11T06:06:02Z","title":"Self-Guidance: Enhancing Neural Codecs via Decoder Manifold Alignment","version":1},"reference_index":134,"source":"arxiv_source","source_observed_at":"2026-06-27T06:05:26.735340Z"},"links":{"cited_paper":"/paper/2310.00704","citing_paper":"/paper/2606.12940"},"observation_digest":"sha256:1a62848f563a0535e1e3015157d4e547ef1739e87e4408b6a4fbe1a73b047621","observation_id":"3f22033f-a2cb-4491-8224-66d7c5fdcebc","resolution":{"observed_at":"2026-07-03T16:08:37.522604Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.00704","last_updated":"2024-12-10T03:17:56Z","snapshot_observed_at":"2026-08-08T23:01:50.650593Z","submitted_at":"2023-10-01T15:49:46Z","title":"UniAudio: An Audio Foundation Model Toward Universal Audio Generation","version":6},"cited_work":{"arxiv_id":"2310.00704","doi":"10.48550/arxiv.2310.00704","metadata_source":"pith","pith_arxiv_id":"2310.00704","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Uniaudio: An audio founda- tion model toward universal audio generation","venue":"cs.SD","work_id":"32877994-1a46-4754-bfc9-a1b6f56ead50","year":2023},"citing_paper":{"arxiv_id":"2606.21372","last_updated":"2026-06-19T12:24:49Z","snapshot_observed_at":"2026-08-01T15:59:11.712537Z","submitted_at":"2026-06-19T12:24:49Z","title":"NAC: Neural Action Codec for Vision-Language-Action Models","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-06-26T13:59:53.484305Z"},"links":{"cited_paper":"/paper/2310.00704","citing_paper":"/paper/2606.21372"},"observation_digest":"sha256:31f8028bb73235c5a13755de3798e3fc3eed4547f9b9f7266654bfc61419757d","observation_id":"7746aa85-7f8c-453c-b45b-f0bc2f686713","resolution":{"observed_at":"2026-07-04T06:59:37.873935Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.00704","last_updated":"2024-12-10T03:17:56Z","snapshot_observed_at":"2026-08-08T23:01:50.650593Z","submitted_at":"2023-10-01T15:49:46Z","title":"UniAudio: An Audio Foundation Model Toward Universal Audio Generation","version":6},"cited_work":{"arxiv_id":"2310.00704","doi":"10.48550/arxiv.2310.00704","metadata_source":"pith","pith_arxiv_id":"2310.00704","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Uniaudio: An audio founda- tion model toward universal audio generation","venue":"cs.SD","work_id":"32877994-1a46-4754-bfc9-a1b6f56ead50","year":2023},"citing_paper":{"arxiv_id":"2606.23080","last_updated":"2026-06-22T09:30:02Z","snapshot_observed_at":"2026-07-06T23:57:53.101659Z","submitted_at":"2026-06-22T09:30:02Z","title":"AudioCALM: Continuous Autoregressive Language Modeling for Universal Audio Generation","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-06-26T07:24:01.244733Z"},"links":{"cited_paper":"/paper/2310.00704","citing_paper":"/paper/2606.23080"},"observation_digest":"sha256:6104fabdac20ac6a304250dec42e837f141ee98247009c9bf78fae8681384ed1","observation_id":"e05d13f6-79a7-4bf1-a267-e5cfad63baa1","resolution":{"observed_at":"2026-07-04T11:59:50.989373Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.00704","last_updated":"2024-12-10T03:17:56Z","snapshot_observed_at":"2026-08-08T23:01:50.650593Z","submitted_at":"2023-10-01T15:49:46Z","title":"UniAudio: An Audio Foundation Model Toward Universal Audio Generation","version":6},"cited_work":{"arxiv_id":"2310.00704","doi":"10.48550/arxiv.2310.00704","metadata_source":"pith","pith_arxiv_id":"2310.00704","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Uniaudio: An audio founda- tion model toward universal audio generation","venue":"cs.SD","work_id":"32877994-1a46-4754-bfc9-a1b6f56ead50","year":2023},"citing_paper":{"arxiv_id":"2607.05196","last_updated":"2026-07-07T15:36:48Z","snapshot_observed_at":"2026-08-09T15:40:13.197295Z","submitted_at":"2026-07-06T15:11:57Z","title":"Unified Audio Intelligence Without Regressing on Text Intelligence","version":1},"reference_index":49,"source":"arxiv_source","source_observed_at":"2026-07-07T23:59:38.702609Z"},"links":{"cited_paper":"/paper/2310.00704","citing_paper":"/paper/2607.05196"},"observation_digest":"sha256:e7aa86798aa56250f563fe5f0416d27308286201d9a63908f15f508484b222f3","observation_id":"22c60912-0aec-4dea-9cd9-2e2be7da006e","resolution":{"observed_at":"2026-07-08T00:04:22.397390Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.00704","last_updated":"2024-12-10T03:17:56Z","snapshot_observed_at":"2026-08-08T23:01:50.650593Z","submitted_at":"2023-10-01T15:49:46Z","title":"UniAudio: An Audio Foundation Model Toward Universal Audio Generation","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.00704","snapshot_observed_at":"2026-07-11T07:46:49.059192Z","title":"arXiv preprint arXiv:2310.00704 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.05196","last_updated":"2026-07-07T15:36:48Z","snapshot_observed_at":"2026-08-09T15:40:13.197295Z","submitted_at":"2026-07-06T15:11:57Z","title":"Unified Audio Intelligence Without Regressing on Text Intelligence","version":2},"reference_index":49,"source":"arxiv_source","source_observed_at":"2026-07-11T07:46:49.059192Z"},"links":{"cited_paper":"/paper/2310.00704","citing_paper":"/paper/2607.05196"},"observation_digest":"sha256:9ef857bd42b6d37a56e4ef189cef9e84906b5a0117c60e237d7f63c3337834ec","observation_id":"59d0817a-b1a7-4eff-8df7-4707f059cc02","resolution":{"observed_at":"2026-07-11T07:46:49.059192Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.00704","last_updated":"2024-12-10T03:17:56Z","snapshot_observed_at":"2026-08-08T23:01:50.650593Z","submitted_at":"2023-10-01T15:49:46Z","title":"UniAudio: An Audio Foundation Model Toward Universal Audio Generation","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.00704","snapshot_observed_at":"2026-07-13T05:10:26.667731Z","title":"arXiv preprint arXiv:2310.00704 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.09134","last_updated":"2026-07-10T06:44:04Z","snapshot_observed_at":"2026-08-07T15:40:45.553118Z","submitted_at":"2026-07-10T06:44:04Z","title":"ReGen: Hierarchical Multi-Prompt Representation Generation for Efficient Waveform Diffusion Models","version":1},"reference_index":29,"source":"arxiv_source","source_observed_at":"2026-07-13T05:10:26.667731Z"},"links":{"cited_paper":"/paper/2310.00704","citing_paper":"/paper/2607.09134"},"observation_digest":"sha256:b2711f798720597da960e1fe7579b46f1ccd4df8bc84bf6339739b99f9c468dc","observation_id":"2aa98018-0654-4444-959f-a554c30ce503","resolution":{"observed_at":"2026-07-13T05:10:26.667731Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.00704","last_updated":"2024-12-10T03:17:56Z","snapshot_observed_at":"2026-08-08T23:01:50.650593Z","submitted_at":"2023-10-01T15:49:46Z","title":"UniAudio: An Audio Foundation Model Toward Universal Audio Generation","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.00704","snapshot_observed_at":"2026-07-30T14:08:14.574038Z","title":"UniAudio: An audio foundation model toward universal audio generation.arXiv preprint arXiv:2310.00704, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.27011","last_updated":"2026-07-30T08:12:52Z","snapshot_observed_at":"2026-08-04T22:37:07.722518Z","submitted_at":"2026-07-29T15:06:58Z","title":"Qwen-Audio-3.0-Gen-Preview Technical Report","version":1},"reference_index":61,"source":"pdf_text","source_observed_at":"2026-07-30T14:08:14.574038Z"},"links":{"cited_paper":"/paper/2310.00704","citing_paper":"/paper/2607.27011"},"observation_digest":"sha256:f64b7d98d0111c191570fb1aad91ff1b8a4c92bdae6b15de2199771251bb9745","observation_id":"ba1e27fc-e26b-4c2d-8126-fa61f865c25f","resolution":{"observed_at":"2026-07-30T14:08:14.574038Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.00704","last_updated":"2024-12-10T03:17:56Z","snapshot_observed_at":"2026-08-08T23:01:50.650593Z","submitted_at":"2023-10-01T15:49:46Z","title":"UniAudio: An Audio Foundation Model Toward Universal Audio Generation","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.00704","snapshot_observed_at":"2026-08-01T10:17:27.671246Z","title":"UniAudio: An audio foundation model toward universal audio generation.arXiv preprint arXiv:2310.00704, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.27011","last_updated":"2026-07-30T08:12:52Z","snapshot_observed_at":"2026-08-04T22:37:07.722518Z","submitted_at":"2026-07-29T15:06:58Z","title":"Qwen-Audio-3.0-Gen-Preview Technical Report","version":2},"reference_index":61,"source":"pdf_text","source_observed_at":"2026-08-01T10:17:27.671246Z"},"links":{"cited_paper":"/paper/2310.00704","citing_paper":"/paper/2607.27011"},"observation_digest":"sha256:3ae9b8121e9e5fdcd4c907723dd0bc64786b2ddde2504cb45571d854cc563ca8","observation_id":"e8563ad7-2fc0-47f6-abc6-efa67a33c4ee","resolution":{"observed_at":"2026-08-01T10:17:27.671246Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.00704","last_updated":"2024-12-10T03:17:56Z","snapshot_observed_at":"2026-08-08T23:01:50.650593Z","submitted_at":"2023-10-01T15:49:46Z","title":"UniAudio: An Audio Foundation Model Toward Universal Audio Generation","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.00704","snapshot_observed_at":"2026-08-04T16:29:30.088106Z","title":"Uniaudio: An audio foundation model toward universal audio generation","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2608.02023","last_updated":"2026-08-04T08:54:48Z","snapshot_observed_at":"2026-08-09T11:38:54.510697Z","submitted_at":"2026-08-03T10:20:52Z","title":"SwanTale: Unified Multi-Speaker Speech and Audio Generation for Instruct and Zero-Shot Tasks","version":1},"reference_index":101,"source":"pdf_text","source_observed_at":"2026-08-04T16:29:30.088106Z"},"links":{"cited_paper":"/paper/2310.00704","citing_paper":"/paper/2608.02023"},"observation_digest":"sha256:7978691ae48bfc60d820992675ae76a561f56e0dcde2a29629ae4158486f5f8d","observation_id":"f6a686b1-0ac0-4803-9929-bcd8db3a2396","resolution":{"observed_at":"2026-08-04T16:29:30.088106Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.00704","last_updated":"2024-12-10T03:17:56Z","snapshot_observed_at":"2026-08-08T23:01:50.650593Z","submitted_at":"2023-10-01T15:49:46Z","title":"UniAudio: An Audio Foundation Model Toward Universal Audio Generation","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.00704","snapshot_observed_at":"2026-08-07T00:14:49.016529Z","title":"Uniaudio: An audio foundation model toward universal audio generation","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.02023","last_updated":"2026-08-04T08:54:48Z","snapshot_observed_at":"2026-08-09T11:38:54.510697Z","submitted_at":"2026-08-03T10:20:52Z","title":"SwanTale: Unified Multi-Speaker Speech and Audio Generation for Instruct and Zero-Shot Tasks","version":2},"reference_index":99,"source":"pdf_text","source_observed_at":"2026-08-07T00:14:49.016529Z"},"links":{"cited_paper":"/paper/2310.00704","citing_paper":"/paper/2608.02023"},"observation_digest":"sha256:36526dd4febf8ab6c2f3e8555ec8fefba00094a2535b0033e73d2634246c8445","observation_id":"bcd2f08e-ee7f-4ed1-b3c2-e482f20237cf","resolution":{"observed_at":"2026-08-07T00:14:49.016529Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2310.00704/citation-record","integrity":"/paper/2310.00704/integrity","json":"/paper/2310.00704/citation-record.json","paper":"/paper/2310.00704"},"outbound":[],"paper":{"arxiv_id":"2310.00704","last_updated":"2024-12-10T03:17:56Z","latest_version":6,"primary_category":"cs.SD","snapshot_observed_at":"2026-08-08T23:01:50.650593Z","submitted_at":"2023-10-01T15:49:46Z","title":"UniAudio: An Audio Foundation Model Toward Universal Audio Generation"},"reference_resolution":{"displayed":0,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":0,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":0},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"thesis":"As of 9 August 2026, this Paper Citation Record lists 0 of 0 outbound references and 46 inbound Pith citation observations for arXiv:2310.00704."}