{"as_of":"2026-08-23T15:19:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:6cc9feecc1eca8a22999bd6efaeaba006eec80a19211a095bd055ac78c54b6ff","coverage":[{"denominator":0,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":69,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":69,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-23T06:30:58.430688+00:00","state":"measured"},{"denominator":69,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":69,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-16T11:43:41.177732Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":1,"source":"pith","source_observed_at":"2026-08-05T02:28:24.338817Z","state":"measured"}],"external_citation_measurements":[{"count":5,"observed_at":"2026-08-05T02:28:24.338817Z","source":"pith"}],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2312.15821","last_updated":"2023-12-25T22:24:49Z","snapshot_observed_at":"2026-08-17T22:52:14.678531Z","submitted_at":"2023-12-25T22:24:49Z","title":"Audiobox: Unified Audio Generation with Natural Language Prompts","version":1},"cited_work":{"arxiv_id":"2312.15821","doi":"10.48550/arxiv.2312.15821","metadata_source":"pith","pith_arxiv_id":"2312.15821","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Audiobox: Unified audio generation with natural language prompts","venue":"cs.SD","work_id":"f7d2982e-a068-43ac-85f8-a5d3fb631fa2","year":2023},"citing_paper":{"arxiv_id":"2410.13720","last_updated":"2025-02-26T16:05:55Z","snapshot_observed_at":"2026-08-17T10:09:03.767186Z","submitted_at":"2024-10-17T16:22:46Z","title":"Movie Gen: A Cast of Media Foundation Models","version":2},"reference_index":69,"source":"pdf_text","source_observed_at":"2026-05-11T14:16:18.521699Z"},"links":{"cited_paper":"/paper/2312.15821","citing_paper":"/paper/2410.13720"},"observation_digest":"sha256:ee75f40cfedcad9a228f865a3b4d98a3576bddbfad31fd7d9c3d957f4a45b602","observation_id":"c1ec0f3c-064d-4904-b008-082d18969987","resolution":{"observed_at":"2026-05-11T14:16:26.065148Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2312.15821","last_updated":"2023-12-25T22:24:49Z","snapshot_observed_at":"2026-08-17T22:52:14.678531Z","submitted_at":"2023-12-25T22:24:49Z","title":"Audiobox: Unified Audio Generation with Natural Language Prompts","version":1},"cited_work":{"arxiv_id":"2312.15821","doi":"10.48550/arxiv.2312.15821","metadata_source":"pith","pith_arxiv_id":"2312.15821","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Audiobox: Unified audio generation with natural language prompts","venue":"cs.SD","work_id":"f7d2982e-a068-43ac-85f8-a5d3fb631fa2","year":2023},"citing_paper":{"arxiv_id":"2412.06264","last_updated":"2024-12-09T07:22:38Z","snapshot_observed_at":"2026-08-20T22:22:58.160467Z","submitted_at":"2024-12-09T07:22:38Z","title":"Flow Matching Guide and Code","version":1},"reference_index":87,"source":"arxiv_source","source_observed_at":"2026-05-12T10:28:14.014706Z"},"links":{"cited_paper":"/paper/2312.15821","citing_paper":"/paper/2412.06264"},"observation_digest":"sha256:9b515c5c8287b3a6fbce40e0d41a0ca977f04efb1a3459eea2220c043d64d830","observation_id":"82917358-2cb2-4ecd-a980-b3ad05c3c46f","resolution":{"observed_at":"2026-05-12T10:28:14.138973Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2312.15821","last_updated":"2023-12-25T22:24:49Z","snapshot_observed_at":"2026-08-17T22:52:14.678531Z","submitted_at":"2023-12-25T22:24:49Z","title":"Audiobox: Unified Audio Generation with Natural Language Prompts","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.15821","snapshot_observed_at":"2026-08-11T17:17:49.434184Z","title":"Audiobox: Unified audio genera- tion with natural language prompts","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.09168","last_updated":"2024-12-12T10:55:57Z","snapshot_observed_at":"2026-08-19T16:13:49.463844Z","submitted_at":"2024-12-12T10:55:57Z","title":"YingSound: Video-Guided Sound Effects Generation with Multi-modal Chain-of-Thought Controls","version":1},"reference_index":91,"source":"pdf_text","source_observed_at":"2026-08-11T17:17:49.434184Z"},"links":{"cited_paper":"/paper/2312.15821","citing_paper":"/paper/2412.09168"},"observation_digest":"sha256:e713d8c057c2102aa806bce4627159d0f0fffd99ba0fbb624ce79fd684a00c15","observation_id":"b145e811-63a4-4038-8a01-4e156adc5cd8","resolution":{"observed_at":"2026-08-11T17:17:49.434184Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.15821","last_updated":"2023-12-25T22:24:49Z","snapshot_observed_at":"2026-08-17T22:52:14.678531Z","submitted_at":"2023-12-25T22:24:49Z","title":"Audiobox: Unified Audio Generation with Natural Language Prompts","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.15821","snapshot_observed_at":"2026-08-11T12:52:03.920679Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.13786","last_updated":"2025-01-28T17:29:51Z","snapshot_observed_at":"2026-08-16T22:49:00.152867Z","submitted_at":"2024-12-18T12:28:26Z","title":"SongEditor: Adapting Zero-Shot Song Generation Language Model as a Multi-Task Editor","version":2},"reference_index":51,"source":"arxiv_source","source_observed_at":"2026-08-11T12:52:03.920679Z"},"links":{"cited_paper":"/paper/2312.15821","citing_paper":"/paper/2412.13786"},"observation_digest":"sha256:5d7d716003928dc7134081ffd69bc0bc5f86ea7d0c33d0f000100a816b03d35e","observation_id":"ea093d5d-1bc7-4f91-b41f-9bbc2cd20518","resolution":{"observed_at":"2026-08-11T12:52:03.920679Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.15821","last_updated":"2023-12-25T22:24:49Z","snapshot_observed_at":"2026-08-17T22:52:14.678531Z","submitted_at":"2023-12-25T22:24:49Z","title":"Audiobox: Unified Audio Generation with Natural Language Prompts","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.15821","snapshot_observed_at":"2026-08-11T11:38:08.619152Z","title":"Audiobox: Unified audio generation with natural language prompts","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.15191","last_updated":"2025-03-10T18:30:39Z","snapshot_observed_at":"2026-08-18T16:26:34.884540Z","submitted_at":"2024-12-19T18:57:21Z","title":"AV-Link: Temporally-Aligned Diffusion Features for Cross-Modal Audio-Video Generation","version":2},"reference_index":85,"source":"pdf_text","source_observed_at":"2026-08-11T11:38:08.619152Z"},"links":{"cited_paper":"/paper/2312.15821","citing_paper":"/paper/2412.15191"},"observation_digest":"sha256:773a11b45fa9496213dec7beade0f9d6ae5786adbc293515a6e604fe0ad1db14","observation_id":"c5402d15-6c29-4779-b6de-572cb59c2fc0","resolution":{"observed_at":"2026-08-11T11:38:08.619152Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.15821","last_updated":"2023-12-25T22:24:49Z","snapshot_observed_at":"2026-08-17T22:52:14.678531Z","submitted_at":"2023-12-25T22:24:49Z","title":"Audiobox: Unified Audio Generation with Natural Language Prompts","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.15821","snapshot_observed_at":"2026-08-11T23:05:27.439825Z","title":"Audiobox: Unified audio generation with natural language prompts","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.15220","last_updated":"2024-12-03T21:48:08Z","snapshot_observed_at":"2026-08-14T05:21:49.294095Z","submitted_at":"2024-12-03T21:48:08Z","title":"SyncFlow: Toward Temporally Aligned Joint Audio-Video Generation from Text","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-11T23:05:27.439825Z"},"links":{"cited_paper":"/paper/2312.15821","citing_paper":"/paper/2412.15220"},"observation_digest":"sha256:0b529d302a216be6a4c63634136f3cba444637e189e880c287eb63bec3361a59","observation_id":"16951b98-ed79-4e0b-884f-4bed32300366","resolution":{"observed_at":"2026-08-11T23:05:27.439825Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.15821","last_updated":"2023-12-25T22:24:49Z","snapshot_observed_at":"2026-08-17T22:52:14.678531Z","submitted_at":"2023-12-25T22:24:49Z","title":"Audiobox: Unified Audio Generation with Natural Language Prompts","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.15821","snapshot_observed_at":"2026-08-11T00:50:14.370607Z","title":"Audiobox: Unified audio generation with natural language prompts,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.19259","last_updated":"2024-12-26T15:52:58Z","snapshot_observed_at":"2026-08-19T09:25:32.796779Z","submitted_at":"2024-12-26T15:52:58Z","title":"VoiceDiT: Dual-Condition Diffusion Transformer for Environment-Aware Speech Synthesis","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-11T00:50:14.370607Z"},"links":{"cited_paper":"/paper/2312.15821","citing_paper":"/paper/2412.19259"},"observation_digest":"sha256:09522e317f237b291150848b7ae3c8576d1d5e92bd05d0ffe6340553928d66bb","observation_id":"61f37537-7038-4ae3-bf5a-78615cee647e","resolution":{"observed_at":"2026-08-11T00:50:14.370607Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.15821","last_updated":"2023-12-25T22:24:49Z","snapshot_observed_at":"2026-08-17T22:52:14.678531Z","submitted_at":"2023-12-25T22:24:49Z","title":"Audiobox: Unified Audio Generation with Natural Language Prompts","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.15821","snapshot_observed_at":"2026-08-11T00:45:19.900293Z","title":"Audiobox: Unified audio generation with natural language prompts","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.19351","last_updated":"2025-06-30T23:24:17Z","snapshot_observed_at":"2026-08-19T08:38:11.019942Z","submitted_at":"2024-12-26T21:13:12Z","title":"ETTA: Elucidating the Design Space of Text-to-Audio Models","version":2},"reference_index":73,"source":"arxiv_source","source_observed_at":"2026-08-11T00:45:19.900293Z"},"links":{"cited_paper":"/paper/2312.15821","citing_paper":"/paper/2412.19351"},"observation_digest":"sha256:5c4897579ca1a1fbc51c093afaa87d4b7fe35d0337ff05bd7d1fe2e654581198","observation_id":"72c87f90-3104-4ca3-aaaf-cd187fc35c2a","resolution":{"observed_at":"2026-08-11T00:45:19.900293Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.15821","last_updated":"2023-12-25T22:24:49Z","snapshot_observed_at":"2026-08-17T22:52:14.678531Z","submitted_at":"2023-12-25T22:24:49Z","title":"Audiobox: Unified Audio Generation with Natural Language Prompts","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.15821","snapshot_observed_at":"2026-08-10T23:21:34.706605Z","title":"Audiobox: Unified audio generation with natural language prompts, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.21037","last_updated":"2025-04-10T05:01:32Z","snapshot_observed_at":"2026-08-18T08:51:59.333838Z","submitted_at":"2024-12-30T16:02:44Z","title":"TangoFlux: Super Fast and Faithful Text to Audio Generation with Flow Matching and Clap-Ranked Preference Optimization","version":2},"reference_index":56,"source":"arxiv_source","source_observed_at":"2026-08-10T23:21:34.706605Z"},"links":{"cited_paper":"/paper/2312.15821","citing_paper":"/paper/2412.21037"},"observation_digest":"sha256:507e63598c7f3f9ccee0221f9e5c337c1ab4af96a2afadf937caf1f8cf06106d","observation_id":"9ae97aa0-ae99-4f7c-87d9-bcd2b1685718","resolution":{"observed_at":"2026-08-10T23:21:34.706605Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.15821","last_updated":"2023-12-25T22:24:49Z","snapshot_observed_at":"2026-08-17T22:52:14.678531Z","submitted_at":"2023-12-25T22:24:49Z","title":"Audiobox: Unified Audio Generation with Natural Language Prompts","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.15821","snapshot_observed_at":"2026-08-10T21:32:17.100232Z","title":"CoRR, abs/2312.15821","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2501.04644","last_updated":"2025-04-30T09:30:49Z","snapshot_observed_at":"2026-08-20T09:17:10.157991Z","submitted_at":"2025-01-08T17:52:35Z","title":"FleSpeech: Flexibly Controllable Speech Generation with Various Prompts","version":2},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-10T21:32:17.100232Z"},"links":{"cited_paper":"/paper/2312.15821","citing_paper":"/paper/2501.04644"},"observation_digest":"sha256:9f878d02dd7af4c14ec43bd48daaf46d7e955abcc8b930466d4836abc0bf98a8","observation_id":"87d9f7e2-56b7-46f9-80fe-ff1f47f62436","resolution":{"observed_at":"2026-08-10T21:32:17.100232Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.15821","last_updated":"2023-12-25T22:24:49Z","snapshot_observed_at":"2026-08-17T22:52:14.678531Z","submitted_at":"2023-12-25T22:24:49Z","title":"Audiobox: Unified Audio Generation with Natural Language Prompts","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.15821","snapshot_observed_at":"2026-08-10T21:31:29.191010Z","title":"Audiobox: Unified audio generation with natural language prompts,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2501.04926","last_updated":"2025-01-09T02:30:26Z","snapshot_observed_at":"2026-08-14T17:10:57.826880Z","submitted_at":"2025-01-09T02:30:26Z","title":"FLowHigh: Towards Efficient and High-Quality Audio Super-Resolution with Single-Step Flow Matching","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-10T21:31:29.191010Z"},"links":{"cited_paper":"/paper/2312.15821","citing_paper":"/paper/2501.04926"},"observation_digest":"sha256:71ce32c0f06c47b1a1476ca9a1f2a9fd32a94f27543bbb59575d7480acf63d79","observation_id":"425947f0-4c8c-414e-9f71-c685b3c9fc17","resolution":{"observed_at":"2026-08-10T21:31:29.191010Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.15821","last_updated":"2023-12-25T22:24:49Z","snapshot_observed_at":"2026-08-17T22:52:14.678531Z","submitted_at":"2023-12-25T22:24:49Z","title":"Audiobox: Unified Audio Generation with Natural Language Prompts","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.15821","snapshot_observed_at":"2026-08-10T14:21:56.979989Z","title":"Audiobox: Unified audio generation with natural language prompts","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2501.15442","last_updated":"2025-02-11T13:05:36Z","snapshot_observed_at":"2026-08-19T01:21:28.929963Z","submitted_at":"2025-01-26T08:10:13Z","title":"Overview of the Amphion Toolkit (v0.2)","version":2},"reference_index":115,"source":"pdf_text","source_observed_at":"2026-08-10T14:21:56.979989Z"},"links":{"cited_paper":"/paper/2312.15821","citing_paper":"/paper/2501.15442"},"observation_digest":"sha256:5b1c05d4fc934b45eae465ac1b4e4bee959c3857b3324776f9b216cb8b3fde1e","observation_id":"3e0fe9cf-f618-4751-95ca-173c00fee50e","resolution":{"observed_at":"2026-08-10T14:21:56.979989Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.15821","last_updated":"2023-12-25T22:24:49Z","snapshot_observed_at":"2026-08-17T22:52:14.678531Z","submitted_at":"2023-12-25T22:24:49Z","title":"Audiobox: Unified Audio Generation with Natural Language Prompts","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.15821","snapshot_observed_at":"2026-08-10T10:58:29.045502Z","title":"Audiobox: Unified audio genera- tion with natural language prompts,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2501.16761","last_updated":"2025-01-28T07:32:07Z","snapshot_observed_at":"2026-08-16T17:49:12.890340Z","submitted_at":"2025-01-28T07:32:07Z","title":"CosyAudio: Improving Audio Generation with Confidence Scores and Synthetic Captions","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-10T10:58:29.045502Z"},"links":{"cited_paper":"/paper/2312.15821","citing_paper":"/paper/2501.16761"},"observation_digest":"sha256:3ca236b2438a56390b80203b0b164a10b15ed5b1dff6120052bff1b924d48a92","observation_id":"1f6b83bd-d021-4081-b844-7266387cb578","resolution":{"observed_at":"2026-08-10T10:58:29.045502Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.15821","last_updated":"2023-12-25T22:24:49Z","snapshot_observed_at":"2026-08-17T22:52:14.678531Z","submitted_at":"2023-12-25T22:24:49Z","title":"Audiobox: Unified Audio Generation with Natural Language Prompts","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.15821","snapshot_observed_at":"2026-08-09T20:50:17.331087Z","title":"Audiobox: Unified au- dio generation with natural language prompts,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2501.19258","last_updated":"2025-08-16T21:44:41Z","snapshot_observed_at":"2026-08-21T15:03:52.661179Z","submitted_at":"2025-01-31T16:16:52Z","title":"VisualSpeech: Enhancing Prosody Modeling in TTS Using Video","version":2},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-09T20:50:17.331087Z"},"links":{"cited_paper":"/paper/2312.15821","citing_paper":"/paper/2501.19258"},"observation_digest":"sha256:150061ea8d8a39d65d4bb2dbcc2a22a01bd8362131260f5474ea9ed26f14b48e","observation_id":"ba086c40-95b3-425b-8253-8c5412fe4d0d","resolution":{"observed_at":"2026-08-09T20:50:17.331087Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.15821","last_updated":"2023-12-25T22:24:49Z","snapshot_observed_at":"2026-08-17T22:52:14.678531Z","submitted_at":"2023-12-25T22:24:49Z","title":"Audiobox: Unified Audio Generation with Natural Language Prompts","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.15821","snapshot_observed_at":"2026-08-09T18:51:12.656812Z","title":"Audiobox: Unified audio generation with natural language prompts","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2502.00500","last_updated":"2025-02-04T15:19:12Z","snapshot_observed_at":"2026-08-19T16:29:11.817831Z","submitted_at":"2025-02-01T17:40:11Z","title":"Video Latent Flow Matching: Optimal Polynomial Projections for Video Interpolation and Extrapolation","version":2},"reference_index":73,"source":"pdf_text","source_observed_at":"2026-08-09T18:51:12.656812Z"},"links":{"cited_paper":"/paper/2312.15821","citing_paper":"/paper/2502.00500"},"observation_digest":"sha256:7eacb090520439c6ed2064b8684d184bc8485f573ef5bfe6f92a79e8cf320a8a","observation_id":"2415d845-f9a1-4ae3-bb0b-742007a90c25","resolution":{"observed_at":"2026-08-09T18:51:12.656812Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.15821","last_updated":"2023-12-25T22:24:49Z","snapshot_observed_at":"2026-08-17T22:52:14.678531Z","submitted_at":"2023-12-25T22:24:49Z","title":"Audiobox: Unified Audio Generation with Natural Language Prompts","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.15821","snapshot_observed_at":"2026-08-09T05:54:18.761884Z","title":"Audiobox: Unified audio generation with natural language prompts","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2502.03128","last_updated":"2025-02-05T12:36:21Z","snapshot_observed_at":"2026-08-18T17:13:14.270187Z","submitted_at":"2025-02-05T12:36:21Z","title":"Metis: A Foundation Speech Generation Model with Masked Generative Pre-training","version":1},"reference_index":87,"source":"arxiv_source","source_observed_at":"2026-08-09T05:54:18.761884Z"},"links":{"cited_paper":"/paper/2312.15821","citing_paper":"/paper/2502.03128"},"observation_digest":"sha256:0b6e447119cabcca02e91dfe492d7ecd97908e65fe9a1c0f819e53005b5a2164","observation_id":"163393c2-c867-4746-b125-fe627ac4467d","resolution":{"observed_at":"2026-08-09T05:54:18.761884Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.15821","last_updated":"2023-12-25T22:24:49Z","snapshot_observed_at":"2026-08-17T22:52:14.678531Z","submitted_at":"2023-12-25T22:24:49Z","title":"Audiobox: Unified Audio Generation with Natural Language Prompts","version":1},"cited_work":{"arxiv_id":"2312.15821","doi":"10.48550/arxiv.2312.15821","metadata_source":"pith","pith_arxiv_id":"2312.15821","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Audiobox: Unified audio generation with natural language prompts","venue":"cs.SD","work_id":"f7d2982e-a068-43ac-85f8-a5d3fb631fa2","year":2023},"citing_paper":{"arxiv_id":"2502.05139","last_updated":"2025-02-07T18:15:57Z","snapshot_observed_at":"2026-08-20T12:00:11.254046Z","submitted_at":"2025-02-07T18:15:57Z","title":"Meta Audiobox Aesthetics: Unified Automatic Quality Assessment for Speech, Music, and Sound","version":1},"reference_index":86,"source":"arxiv_source","source_observed_at":"2026-05-17T00:30:51.265062Z"},"links":{"cited_paper":"/paper/2312.15821","citing_paper":"/paper/2502.05139"},"observation_digest":"sha256:8b5e9868d2fcd33c3c4ae59c9ef354dda4a7f42ec8c0f0d0a48833b673888c42","observation_id":"1de5ba83-5a11-4c40-9eda-c9d19a19f0fa","resolution":{"observed_at":"2026-05-17T00:30:51.367209Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2312.15821","last_updated":"2023-12-25T22:24:49Z","snapshot_observed_at":"2026-08-17T22:52:14.678531Z","submitted_at":"2023-12-25T22:24:49Z","title":"Audiobox: Unified Audio Generation with Natural Language Prompts","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.15821","snapshot_observed_at":"2026-08-08T13:26:19.205829Z","title":"Audiobox: Unified audio generation with natural language prompts","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2502.07243","last_updated":"2025-02-11T04:18:33Z","snapshot_observed_at":"2026-08-17T12:48:30.254472Z","submitted_at":"2025-02-11T04:18:33Z","title":"Vevo: Controllable Zero-Shot Voice Imitation with Self-Supervised Disentanglement","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-08T13:26:19.205829Z"},"links":{"cited_paper":"/paper/2312.15821","citing_paper":"/paper/2502.07243"},"observation_digest":"sha256:b736d522db0cb785dea3fbfebccde2efedc9f5fbaac73b00f5e55068c42e22a9","observation_id":"f9b274d1-daa9-4b5a-85f6-5411061b25d3","resolution":{"observed_at":"2026-08-08T13:26:19.205829Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.15821","last_updated":"2023-12-25T22:24:49Z","snapshot_observed_at":"2026-08-17T22:52:14.678531Z","submitted_at":"2023-12-25T22:24:49Z","title":"Audiobox: Unified Audio Generation with Natural Language Prompts","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.15821","snapshot_observed_at":"2026-08-08T13:06:32.937055Z","title":"Audiobox: Unified audio gener- ation with natural language prompts,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2502.07345","last_updated":"2025-02-11T08:17:07Z","snapshot_observed_at":"2026-08-19T10:56:06.708529Z","submitted_at":"2025-02-11T08:17:07Z","title":"Advanced Zero-Shot Text-to-Speech for Background Removal and Preservation with Controllable Masked Speech Prediction","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-08T13:06:32.937055Z"},"links":{"cited_paper":"/paper/2312.15821","citing_paper":"/paper/2502.07345"},"observation_digest":"sha256:1eb153cacc7aaa1906b2a28d3ddb694fa36fa6df14e4f0fb12f011919a399e83","observation_id":"2ab885eb-2fbd-44b9-a22a-87a76227beed","resolution":{"observed_at":"2026-08-08T13:06:32.937055Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.15821","last_updated":"2023-12-25T22:24:49Z","snapshot_observed_at":"2026-08-17T22:52:14.678531Z","submitted_at":"2023-12-25T22:24:49Z","title":"Audiobox: Unified Audio Generation with Natural Language Prompts","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.15821","snapshot_observed_at":"2026-08-08T12:21:44.261324Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2502.07562","last_updated":"2025-02-11T14:00:12Z","snapshot_observed_at":"2026-08-13T23:36:56.304820Z","submitted_at":"2025-02-11T14:00:12Z","title":"LoRP-TTS: Low-Rank Personalized Text-To-Speech","version":1},"reference_index":33,"source":"arxiv_source","source_observed_at":"2026-08-08T12:21:44.261324Z"},"links":{"cited_paper":"/paper/2312.15821","citing_paper":"/paper/2502.07562"},"observation_digest":"sha256:f0aefef482e0234b78a9cedcaf723f2b98c5f4ad79f5fa08b915932dec73a9f5","observation_id":"053015d6-0d7b-49f1-b8b8-ec50576d9198","resolution":{"observed_at":"2026-08-08T12:21:44.261324Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.15821","last_updated":"2023-12-25T22:24:49Z","snapshot_observed_at":"2026-08-17T22:52:14.678531Z","submitted_at":"2023-12-25T22:24:49Z","title":"Audiobox: Unified Audio Generation with Natural Language Prompts","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.15821","snapshot_observed_at":"2026-08-08T11:51:21.819764Z","title":"Audiobox: Unified Au- dio Generation with Natural Language Prompts","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2502.07711","last_updated":"2025-02-11T17:10:31Z","snapshot_observed_at":"2026-08-16T15:26:56.673287Z","submitted_at":"2025-02-11T17:10:31Z","title":"RenderBox: Expressive Performance Rendering with Text Control","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-08T11:51:21.819764Z"},"links":{"cited_paper":"/paper/2312.15821","citing_paper":"/paper/2502.07711"},"observation_digest":"sha256:b6ed2a2d5b96911805dd34faebfe331782910f8e479a1ebf286f3a943c542806","observation_id":"5236f2fc-4bde-4a3f-a90b-7afba7cc9d0f","resolution":{"observed_at":"2026-08-08T11:51:21.819764Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.15821","last_updated":"2023-12-25T22:24:49Z","snapshot_observed_at":"2026-08-17T22:52:14.678531Z","submitted_at":"2023-12-25T22:24:49Z","title":"Audiobox: Unified Audio Generation with Natural Language Prompts","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.15821","snapshot_observed_at":"2026-08-16T11:43:41.177732Z","title":"Audiobox: Unified audio generation with natural language prompts","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2504.14906","last_updated":"2025-06-03T03:27:47Z","snapshot_observed_at":"2026-08-20T00:55:08.973218Z","submitted_at":"2025-04-21T07:21:28Z","title":"OmniAudio: Generating Spatial Audio from 360-Degree Video","version":3},"reference_index":50,"source":"arxiv_source","source_observed_at":"2026-08-16T11:43:41.177732Z"},"links":{"cited_paper":"/paper/2312.15821","citing_paper":"/paper/2504.14906"},"observation_digest":"sha256:c263e33d57f372958d1fb804a9bc252c3e9861532bd6fe65164b63ec04ef921f","observation_id":"efdf9d49-2f0a-44b7-b1d1-1595bad1553c","resolution":{"observed_at":"2026-08-16T11:43:41.177732Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.15821","last_updated":"2023-12-25T22:24:49Z","snapshot_observed_at":"2026-08-17T22:52:14.678531Z","submitted_at":"2023-12-25T22:24:49Z","title":"Audiobox: Unified Audio Generation with Natural Language Prompts","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.15821","snapshot_observed_at":"2026-08-15T20:43:56.733736Z","title":"Audiobox: Unified au- dio generation with natural language prompts.arXiv preprint arXiv:2312.15821, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.12154","last_updated":"2025-05-17T22:03:57Z","snapshot_observed_at":"2026-08-20T15:50:18.086392Z","submitted_at":"2025-05-17T22:03:57Z","title":"Learning to Highlight Audio by Watching Movies","version":1},"reference_index":63,"source":"pdf_text","source_observed_at":"2026-08-15T20:43:56.733736Z"},"links":{"cited_paper":"/paper/2312.15821","citing_paper":"/paper/2505.12154"},"observation_digest":"sha256:b452ac9d62640e4ab6cd851d96771337a02ab3b5b49c624097426450de6ec622","observation_id":"e82070b1-dc75-47cd-8e42-a328bcf9458e","resolution":{"observed_at":"2026-08-15T20:43:56.733736Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.15821","last_updated":"2023-12-25T22:24:49Z","snapshot_observed_at":"2026-08-17T22:52:14.678531Z","submitted_at":"2023-12-25T22:24:49Z","title":"Audiobox: Unified Audio Generation with Natural Language Prompts","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.15821","snapshot_observed_at":"2026-08-15T20:30:51.011593Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.12800","last_updated":"2025-05-19T07:31:55Z","snapshot_observed_at":"2026-08-17T12:38:34.601646Z","submitted_at":"2025-05-19T07:31:55Z","title":"OZSpeech: One-step Zero-shot Speech Synthesis with Learned-Prior-Conditioned Flow Matching","version":1},"reference_index":49,"source":"arxiv_source","source_observed_at":"2026-08-15T20:30:51.011593Z"},"links":{"cited_paper":"/paper/2312.15821","citing_paper":"/paper/2505.12800"},"observation_digest":"sha256:0edddbf896343fec9d97860844acab69998f30d848c1de8e4ef53c6fd1ff06d0","observation_id":"c81ab182-aedb-4645-a4b4-e43539110abd","resolution":{"observed_at":"2026-08-15T20:30:51.011593Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.15821","last_updated":"2023-12-25T22:24:49Z","snapshot_observed_at":"2026-08-17T22:52:14.678531Z","submitted_at":"2023-12-25T22:24:49Z","title":"Audiobox: Unified Audio Generation with Natural Language Prompts","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.15821","snapshot_observed_at":"2026-08-15T20:25:11.530233Z","title":"Audiobox: Unified au- dio generation with natural language prompts,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.13082","last_updated":"2025-05-19T13:13:46Z","snapshot_observed_at":"2026-08-21T21:25:14.447108Z","submitted_at":"2025-05-19T13:13:46Z","title":"MultiActor-Audiobook: Zero-Shot Audiobook Generation with Faces and Voices of Multiple Speakers","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-15T20:25:11.530233Z"},"links":{"cited_paper":"/paper/2312.15821","citing_paper":"/paper/2505.13082"},"observation_digest":"sha256:aa2621142bf366d59322c10d9832ecaf0e20a5d9413ed1954a92ba014c780367","observation_id":"d6df0607-d94d-45b3-8f6f-d6798b6b6e8c","resolution":{"observed_at":"2026-08-15T20:25:11.530233Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.15821","last_updated":"2023-12-25T22:24:49Z","snapshot_observed_at":"2026-08-17T22:52:14.678531Z","submitted_at":"2023-12-25T22:24:49Z","title":"Audiobox: Unified Audio Generation with Natural Language Prompts","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.15821","snapshot_observed_at":"2026-08-07T14:32:42.653144Z","title":"Audiobox: Unified audio generation with natural language prompts,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.18609","last_updated":"2025-05-27T14:19:23Z","snapshot_observed_at":"2026-08-17T22:52:51.046328Z","submitted_at":"2025-05-24T09:16:14Z","title":"RASMALAI: Resources for Adaptive Speech Modeling in Indian Languages with Accents and Intonations","version":2},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-07T14:32:42.653144Z"},"links":{"cited_paper":"/paper/2312.15821","citing_paper":"/paper/2505.18609"},"observation_digest":"sha256:cd1d8240e8438f2b651e0f9f49bd17302c4ae50c851e047e6269110ae43f1f32","observation_id":"9ae32be0-7d26-4b9d-b5f7-32d78822003b","resolution":{"observed_at":"2026-08-07T14:32:42.653144Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.15821","last_updated":"2023-12-25T22:24:49Z","snapshot_observed_at":"2026-08-17T22:52:14.678531Z","submitted_at":"2023-12-25T22:24:49Z","title":"Audiobox: Unified Audio Generation with Natural Language Prompts","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.15821","snapshot_observed_at":"2026-08-07T14:19:56.842801Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.19462","last_updated":"2025-05-31T22:36:04Z","snapshot_observed_at":"2026-08-09T03:57:33.373890Z","submitted_at":"2025-05-26T03:35:44Z","title":"VoiceStar: Robust Zero-Shot Autoregressive TTS with Duration Control and Extrapolation","version":2},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-08-07T14:19:56.842801Z"},"links":{"cited_paper":"/paper/2312.15821","citing_paper":"/paper/2505.19462"},"observation_digest":"sha256:2c4e935c987e70ce7fd66f1ea16e7c376b0a26459045cc8492c069a0850d34ff","observation_id":"a77996d5-2d3b-4528-9b14-7bd57feddcde","resolution":{"observed_at":"2026-08-07T14:19:56.842801Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.15821","last_updated":"2023-12-25T22:24:49Z","snapshot_observed_at":"2026-08-17T22:52:14.678531Z","submitted_at":"2023-12-25T22:24:49Z","title":"Audiobox: Unified Audio Generation with Natural Language Prompts","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.15821","snapshot_observed_at":"2026-08-07T14:05:04.049255Z","title":"Audiobox: Unified audio generation with natural language prompts","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.20147","last_updated":"2025-07-24T05:31:36Z","snapshot_observed_at":"2026-08-18T22:51:20.969084Z","submitted_at":"2025-05-26T15:46:53Z","title":"FUDOKI: Discrete Flow-based Unified Understanding and Generation via Kinetic-Optimal Velocities","version":3},"reference_index":107,"source":"pdf_text","source_observed_at":"2026-08-07T14:05:04.049255Z"},"links":{"cited_paper":"/paper/2312.15821","citing_paper":"/paper/2505.20147"},"observation_digest":"sha256:67736553fc2f6ae9b915c08a84b54e00606387d9e4921fe8b2f6aab80cef7bc9","observation_id":"7ec86a7c-90b7-4ae1-af69-b106424ed52e","resolution":{"observed_at":"2026-08-07T14:05:04.049255Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.15821","last_updated":"2023-12-25T22:24:49Z","snapshot_observed_at":"2026-08-17T22:52:14.678531Z","submitted_at":"2023-12-25T22:24:49Z","title":"Audiobox: Unified Audio Generation with Natural Language Prompts","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.15821","snapshot_observed_at":"2026-08-07T11:59:49.503496Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.00927","last_updated":"2025-06-01T09:41:56Z","snapshot_observed_at":"2026-08-14T09:49:53.196140Z","submitted_at":"2025-06-01T09:41:56Z","title":"In-the-wild Audio Spatialization with Flexible Text-guided Localization","version":1},"reference_index":38,"source":"arxiv_source","source_observed_at":"2026-08-07T11:59:49.503496Z"},"links":{"cited_paper":"/paper/2312.15821","citing_paper":"/paper/2506.00927"},"observation_digest":"sha256:7927b7461382bf74ac0b76c094cbb13f61b59923d4c61271c03f5d89a3236671","observation_id":"0cad407e-8458-4f77-ac9a-8ffe4e44edda","resolution":{"observed_at":"2026-08-07T11:59:49.503496Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.15821","last_updated":"2023-12-25T22:24:49Z","snapshot_observed_at":"2026-08-17T22:52:14.678531Z","submitted_at":"2023-12-25T22:24:49Z","title":"Audiobox: Unified Audio Generation with Natural Language Prompts","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.15821","snapshot_observed_at":"2026-08-07T11:15:29.298666Z","title":"Audiobox: Unified audio generation with natural language prompts,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.03020","last_updated":"2025-06-03T15:57:55Z","snapshot_observed_at":"2026-08-20T05:40:38.804645Z","submitted_at":"2025-06-03T15:57:55Z","title":"InfiniteAudio: Infinite-Length Audio Generation with Consistency","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-07T11:15:29.298666Z"},"links":{"cited_paper":"/paper/2312.15821","citing_paper":"/paper/2506.03020"},"observation_digest":"sha256:d0aa010001007c78aa39b9714d3c24f40109495d5e4503cc5009b4039bbcd087","observation_id":"8a35ce5e-51c7-41c7-b247-0f98169daa3c","resolution":{"observed_at":"2026-08-07T11:15:29.298666Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.15821","last_updated":"2023-12-25T22:24:49Z","snapshot_observed_at":"2026-08-17T22:52:14.678531Z","submitted_at":"2023-12-25T22:24:49Z","title":"Audiobox: Unified Audio Generation with Natural Language Prompts","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.15821","snapshot_observed_at":"2026-08-07T05:12:24.856067Z","title":"Audiobox: Unified audio generation with natural language prompts","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.08570","last_updated":"2025-09-04T11:54:13Z","snapshot_observed_at":"2026-08-19T10:58:35.883753Z","submitted_at":"2025-06-10T08:37:45Z","title":"Auto-Regressive vs Flow-Matching: a Comparative Study of Modeling Paradigms for Text-to-Music Generation","version":3},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-07T05:12:24.856067Z"},"links":{"cited_paper":"/paper/2312.15821","citing_paper":"/paper/2506.08570"},"observation_digest":"sha256:b551b27ceb9b7439a6a14c8c0bd32acc6f61864b7758ad90e23ee4331529071e","observation_id":"25c4f62d-2778-41f1-879b-66735e0cfc0f","resolution":{"observed_at":"2026-08-07T05:12:24.856067Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.15821","last_updated":"2023-12-25T22:24:49Z","snapshot_observed_at":"2026-08-17T22:52:14.678531Z","submitted_at":"2023-12-25T22:24:49Z","title":"Audiobox: Unified Audio Generation with Natural Language Prompts","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.15821","snapshot_observed_at":"2026-08-07T04:45:19.234441Z","title":"Vyas, A., Shi, B., Le, M., Tjandra, A., Wu, Y .-C., Guo, B., Zhang, J., Zhang, X., Adkins, R., Ngan, W., et al","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.09874","last_updated":"2025-07-10T19:47:47Z","snapshot_observed_at":"2026-08-17T02:21:03.433032Z","submitted_at":"2025-06-11T15:43:08Z","title":"UmbraTTS: Adapting Text-to-Speech to Environmental Contexts with Flow Matching","version":2},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-07T04:45:19.234441Z"},"links":{"cited_paper":"/paper/2312.15821","citing_paper":"/paper/2506.09874"},"observation_digest":"sha256:7808f3c32b5a102c5362c71978463dee84e45c12010270f627fd13f432ba9395","observation_id":"78962cc4-95b9-4726-bf81-1735024ca5ba","resolution":{"observed_at":"2026-08-07T04:45:19.234441Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.15821","last_updated":"2023-12-25T22:24:49Z","snapshot_observed_at":"2026-08-17T22:52:14.678531Z","submitted_at":"2023-12-25T22:24:49Z","title":"Audiobox: Unified Audio Generation with Natural Language Prompts","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.15821","snapshot_observed_at":"2026-08-06T20:17:14.641009Z","title":"Audiobox: Unified audio gener- ation with natural language prompts,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.03468","last_updated":"2025-08-29T06:01:31Z","snapshot_observed_at":"2026-08-17T22:52:52.169402Z","submitted_at":"2025-07-04T10:46:11Z","title":"Robust Localization of Partially Fake Speech: Metrics and Out-of-Domain Evaluation","version":3},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-06T20:17:14.641009Z"},"links":{"cited_paper":"/paper/2312.15821","citing_paper":"/paper/2507.03468"},"observation_digest":"sha256:e387b037ee229ef55dc53521536c186b1f23563894f842a07f85e845e1e97a87","observation_id":"d77c8120-21a5-4283-bef7-4f137d735d91","resolution":{"observed_at":"2026-08-06T20:17:14.641009Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.15821","last_updated":"2023-12-25T22:24:49Z","snapshot_observed_at":"2026-08-17T22:52:14.678531Z","submitted_at":"2023-12-25T22:24:49Z","title":"Audiobox: Unified Audio Generation with Natural Language Prompts","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.15821","snapshot_observed_at":"2026-08-06T17:52:01.451574Z","title":"Audiobox: Unified audio generation with natural language prompts","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.09834","last_updated":"2025-07-14T00:14:54Z","snapshot_observed_at":"2026-08-15T03:32:36.161797Z","submitted_at":"2025-07-14T00:14:54Z","title":"Generative Audio Language Modeling with Continuous-valued Tokens and Masked Next-Token Prediction","version":1},"reference_index":85,"source":"arxiv_source","source_observed_at":"2026-08-06T17:52:01.451574Z"},"links":{"cited_paper":"/paper/2312.15821","citing_paper":"/paper/2507.09834"},"observation_digest":"sha256:e82ad96cd6b506eabbbbee1d1cb4738272490c4116a0ef5418ffc716358af059","observation_id":"cca6c30e-5db6-455d-9495-cd915c13d794","resolution":{"observed_at":"2026-08-06T17:52:01.451574Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.15821","last_updated":"2023-12-25T22:24:49Z","snapshot_observed_at":"2026-08-17T22:52:14.678531Z","submitted_at":"2023-12-25T22:24:49Z","title":"Audiobox: Unified Audio Generation with Natural Language Prompts","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.15821","snapshot_observed_at":"2026-08-06T16:40:49.645421Z","title":"Audiobox: Unified audio generation with natural language prompts,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.12890","last_updated":"2025-07-24T08:15:02Z","snapshot_observed_at":"2026-08-22T01:27:36.635937Z","submitted_at":"2025-07-17T08:18:55Z","title":"DiffRhythm+: Controllable and Flexible Full-Length Song Generation with Preference Optimization","version":2},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-06T16:40:49.645421Z"},"links":{"cited_paper":"/paper/2312.15821","citing_paper":"/paper/2507.12890"},"observation_digest":"sha256:a92a9b70a3190ae7ac043f33a00a6276d8f8b513cf563234cf3ad6acc8e13473","observation_id":"f3fd9f59-84fe-4f00-8876-9f085173922a","resolution":{"observed_at":"2026-08-06T16:40:49.645421Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.15821","last_updated":"2023-12-25T22:24:49Z","snapshot_observed_at":"2026-08-17T22:52:14.678531Z","submitted_at":"2023-12-25T22:24:49Z","title":"Audiobox: Unified Audio Generation with Natural Language Prompts","version":1},"cited_work":{"arxiv_id":"2312.15821","doi":"10.48550/arxiv.2312.15821","metadata_source":"pith","pith_arxiv_id":"2312.15821","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Audiobox: Unified audio generation with natural language prompts","venue":"cs.SD","work_id":"f7d2982e-a068-43ac-85f8-a5d3fb631fa2","year":2023},"citing_paper":{"arxiv_id":"2509.06027","last_updated":"2026-04-27T10:03:51Z","snapshot_observed_at":"2026-08-12T13:13:57.375681Z","submitted_at":"2025-09-07T12:06:21Z","title":"DreamAudio: Customized Text-to-Audio Generation with Diffusion Models","version":3},"reference_index":75,"source":"pdf_text","source_observed_at":"2026-05-18T18:26:51.583145Z"},"links":{"cited_paper":"/paper/2312.15821","citing_paper":"/paper/2509.06027"},"observation_digest":"sha256:96638444cc58de4cedd440cd85ae4b37e3ca84fd5160a34921f715458a955889","observation_id":"5e1be8c0-385a-42bf-8d7f-0378490c6428","resolution":{"observed_at":"2026-05-18T18:31:44.672162Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2312.15821","last_updated":"2023-12-25T22:24:49Z","snapshot_observed_at":"2026-08-17T22:52:14.678531Z","submitted_at":"2023-12-25T22:24:49Z","title":"Audiobox: Unified Audio Generation with Natural Language Prompts","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.15821","snapshot_observed_at":"2026-08-04T21:25:27.303876Z","title":"Audiobox: Unified Audio Generation with Natural Language Prompts.ArXiv, 2312.15821, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2509.09717","last_updated":"2025-09-09T18:57:10Z","snapshot_observed_at":"2026-08-15T13:12:57.491333Z","submitted_at":"2025-09-09T18:57:10Z","title":"Testing chatbots on the creation of encoders for audio conditioned image generation","version":1},"reference_index":103,"source":"pdf_text","source_observed_at":"2026-08-04T21:25:27.303876Z"},"links":{"cited_paper":"/paper/2312.15821","citing_paper":"/paper/2509.09717"},"observation_digest":"sha256:442b51e355a2fd2a7156bc893a770c55f1011c7676661bdab2468010e4383448","observation_id":"0c609199-248d-450a-8ba7-1316a92b2f4f","resolution":{"observed_at":"2026-08-04T21:25:27.303876Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.15821","last_updated":"2023-12-25T22:24:49Z","snapshot_observed_at":"2026-08-17T22:52:14.678531Z","submitted_at":"2023-12-25T22:24:49Z","title":"Audiobox: Unified Audio Generation with Natural Language Prompts","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.15821","snapshot_observed_at":"2026-08-04T08:29:17.809858Z","title":"Audiobox: Unified audio genera- tion with natural language prompts,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2510.20441","last_updated":"2026-07-02T11:50:55Z","snapshot_observed_at":"2026-08-15T06:29:47.526342Z","submitted_at":"2025-10-23T11:22:24Z","title":"UniSE: A Unified Framework for Decoder-Only Autoregressive LM-Based Speech Enhancement","version":2},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-04T08:29:17.809858Z"},"links":{"cited_paper":"/paper/2312.15821","citing_paper":"/paper/2510.20441"},"observation_digest":"sha256:e08f6fdec91dd9131dbe8a5c73351eeee755902886f686982b753cdefb5bc003","observation_id":"85c5340e-9405-4a0c-a097-db088a4fb847","resolution":{"observed_at":"2026-08-04T08:29:17.809858Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.15821","last_updated":"2023-12-25T22:24:49Z","snapshot_observed_at":"2026-08-17T22:52:14.678531Z","submitted_at":"2023-12-25T22:24:49Z","title":"Audiobox: Unified Audio Generation with Natural Language Prompts","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.15821","snapshot_observed_at":"2026-08-04T06:47:08.922024Z","title":"Audiobox: Unified au- dio generation with natural language prompts.arXiv preprint arXiv:2312.15821, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2511.20635","last_updated":"2026-08-02T05:27:14Z","snapshot_observed_at":"2026-08-17T20:56:12.941886Z","submitted_at":"2025-11-25T18:54:16Z","title":"iMontage: Unified, Versatile, Highly Dynamic Many-to-many Image Generation","version":3},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-04T06:47:08.922024Z"},"links":{"cited_paper":"/paper/2312.15821","citing_paper":"/paper/2511.20635"},"observation_digest":"sha256:e58b5a8f16b5950bd68d136ec5ff570327b5b49bcae16b98cb3fb7cc8e7dc4db","observation_id":"abe87faf-64e1-4cfe-9174-d11e04825029","resolution":{"observed_at":"2026-08-04T06:47:08.922024Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.15821","last_updated":"2023-12-25T22:24:49Z","snapshot_observed_at":"2026-08-17T22:52:14.678531Z","submitted_at":"2023-12-25T22:24:49Z","title":"Audiobox: Unified Audio Generation with Natural Language Prompts","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.15821","snapshot_observed_at":"2026-08-03T20:15:14.257145Z","title":"Audiobox: Unified au- dio generation with natural language prompts.arXiv preprint arXiv:2312.15821, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2511.21029","last_updated":"2026-06-22T20:04:30Z","snapshot_observed_at":"2026-08-20T07:35:04.607357Z","submitted_at":"2025-11-26T03:53:10Z","title":"FlowerDance: MeanFlow for Efficient and Refined 3D Dance Generation","version":3},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-03T20:15:14.257145Z"},"links":{"cited_paper":"/paper/2312.15821","citing_paper":"/paper/2511.21029"},"observation_digest":"sha256:f53fd6c62cb14ab944c4dd849f97819ef8a253ae0d10b561c3633890e41d785f","observation_id":"54156058-05fa-4072-93ba-39b32cde10fd","resolution":{"observed_at":"2026-08-03T20:15:14.257145Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.15821","last_updated":"2023-12-25T22:24:49Z","snapshot_observed_at":"2026-08-17T22:52:14.678531Z","submitted_at":"2023-12-25T22:24:49Z","title":"Audiobox: Unified Audio Generation with Natural Language Prompts","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.15821","snapshot_observed_at":"2026-08-03T06:36:33.115934Z","title":"Au- diobox: Unified audio generation with natural language prompts.arXiv preprint arXiv:2312.15821,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2601.22661","last_updated":"2026-05-27T18:10:43Z","snapshot_observed_at":"2026-08-13T04:26:16.591748Z","submitted_at":"2026-01-30T07:27:48Z","title":"Evaluating and Rewarding LALMs for Expressive Role-Play TTS via Mean Continuation Log-Probability","version":2},"reference_index":2022,"source":"pdf_text","source_observed_at":"2026-08-03T06:36:33.115934Z"},"links":{"cited_paper":"/paper/2312.15821","citing_paper":"/paper/2601.22661"},"observation_digest":"sha256:0589b74b6d52b905b0047dd83e612807bd76238d5cb2209320714a3366b753dd","observation_id":"78d2d6a9-4041-44da-9dfb-4a344fb57ac6","resolution":{"observed_at":"2026-08-03T06:36:33.115934Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.15821","last_updated":"2023-12-25T22:24:49Z","snapshot_observed_at":"2026-08-17T22:52:14.678531Z","submitted_at":"2023-12-25T22:24:49Z","title":"Audiobox: Unified Audio Generation with Natural Language Prompts","version":1},"cited_work":{"arxiv_id":"2312.15821","doi":"10.48550/arxiv.2312.15821","metadata_source":"pith","pith_arxiv_id":"2312.15821","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Audiobox: Unified audio generation with natural language prompts","venue":"cs.SD","work_id":"f7d2982e-a068-43ac-85f8-a5d3fb631fa2","year":2023},"citing_paper":{"arxiv_id":"2604.05526","last_updated":"2026-04-07T07:25:59Z","snapshot_observed_at":"2026-08-15T21:37:47.228626Z","submitted_at":"2026-04-07T07:25:59Z","title":"Controllable Singing Style Conversion with Boundary-Aware Information Bottleneck","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-05-10T18:51:38.030059Z"},"links":{"cited_paper":"/paper/2312.15821","citing_paper":"/paper/2604.05526"},"observation_digest":"sha256:97d418242f1c6063c61d6e27603631f51aad7d5ee67b20ca84fd0ff52828b35d","observation_id":"42ed3b4b-f6c3-4c91-ba67-bc68f8dad714","resolution":{"observed_at":"2026-05-10T23:50:51.864433Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2312.15821","last_updated":"2023-12-25T22:24:49Z","snapshot_observed_at":"2026-08-17T22:52:14.678531Z","submitted_at":"2023-12-25T22:24:49Z","title":"Audiobox: Unified Audio Generation with Natural Language Prompts","version":1},"cited_work":{"arxiv_id":"2312.15821","doi":"10.48550/arxiv.2312.15821","metadata_source":"pith","pith_arxiv_id":"2312.15821","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Audiobox: Unified audio generation with natural language prompts","venue":"cs.SD","work_id":"f7d2982e-a068-43ac-85f8-a5d3fb631fa2","year":2023},"citing_paper":{"arxiv_id":"2604.08580","last_updated":"2026-07-01T19:51:03Z","snapshot_observed_at":"2026-07-13T17:03:24.183921Z","submitted_at":"2026-03-28T13:01:01Z","title":"Adjoint Matching through the Lens of the Stochastic Maximum Principle in Optimal Control","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-05-14T22:25:53.037164Z"},"links":{"cited_paper":"/paper/2312.15821","citing_paper":"/paper/2604.08580"},"observation_digest":"sha256:d2d9d212d2279896feead6d7135ea2c70b22494bdacd240bb93830013fb0f402","observation_id":"b384b49b-ef6e-4168-93ae-0a5b55b3b17d","resolution":{"observed_at":"2026-05-14T22:28:04.692081Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2312.15821","last_updated":"2023-12-25T22:24:49Z","snapshot_observed_at":"2026-08-17T22:52:14.678531Z","submitted_at":"2023-12-25T22:24:49Z","title":"Audiobox: Unified Audio Generation with Natural Language Prompts","version":1},"cited_work":{"arxiv_id":"2312.15821","doi":"10.48550/arxiv.2312.15821","metadata_source":"pith","pith_arxiv_id":"2312.15821","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Audiobox: Unified audio generation with natural language prompts","venue":"cs.SD","work_id":"f7d2982e-a068-43ac-85f8-a5d3fb631fa2","year":2023},"citing_paper":{"arxiv_id":"2604.09111","last_updated":"2026-05-02T12:23:17Z","snapshot_observed_at":"2026-08-14T01:49:56.106441Z","submitted_at":"2026-04-10T08:42:45Z","title":"PS-TTS: Phonetic Synchronization in Text-to-Speech for Achieving Natural Automated Dubbing","version":4},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-05-10T17:21:43.379525Z"},"links":{"cited_paper":"/paper/2312.15821","citing_paper":"/paper/2604.09111"},"observation_digest":"sha256:ced0f94d08cfac63fd73d863ec2363fe63f48fd2c5d26fa658a787c6dc63e790","observation_id":"ffc0fb2c-350d-44f9-86f3-c1c906de81fc","resolution":{"observed_at":"2026-05-11T06:56:04.361972Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2312.15821","last_updated":"2023-12-25T22:24:49Z","snapshot_observed_at":"2026-08-17T22:52:14.678531Z","submitted_at":"2023-12-25T22:24:49Z","title":"Audiobox: Unified Audio Generation with Natural Language Prompts","version":1},"cited_work":{"arxiv_id":"2312.15821","doi":"10.48550/arxiv.2312.15821","metadata_source":"pith","pith_arxiv_id":"2312.15821","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Audiobox: Unified audio generation with natural language prompts","venue":"cs.SD","work_id":"f7d2982e-a068-43ac-85f8-a5d3fb631fa2","year":2023},"citing_paper":{"arxiv_id":"2605.00229","last_updated":"2026-04-30T21:06:46Z","snapshot_observed_at":"2026-07-06T23:13:42.661364Z","submitted_at":"2026-04-30T21:06:46Z","title":"A unified perspective on fine-tuning and sampling with diffusion and flow models","version":1},"reference_index":50,"source":"arxiv_source","source_observed_at":"2026-05-09T19:43:42.331642Z"},"links":{"cited_paper":"/paper/2312.15821","citing_paper":"/paper/2605.00229"},"observation_digest":"sha256:5c69c186e34f754be6e9d90029bbc888d2330f4bae6448a52bd1087e3d69933b","observation_id":"0746874f-c294-4504-8dd5-241db0182cff","resolution":{"observed_at":"2026-05-11T15:31:21.370267Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2312.15821","last_updated":"2023-12-25T22:24:49Z","snapshot_observed_at":"2026-08-17T22:52:14.678531Z","submitted_at":"2023-12-25T22:24:49Z","title":"Audiobox: Unified Audio Generation with Natural Language Prompts","version":1},"cited_work":{"arxiv_id":"2312.15821","doi":"10.48550/arxiv.2312.15821","metadata_source":"pith","pith_arxiv_id":"2312.15821","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Audiobox: Unified audio generation with natural language prompts","venue":"cs.SD","work_id":"f7d2982e-a068-43ac-85f8-a5d3fb631fa2","year":2023},"citing_paper":{"arxiv_id":"2605.00329","last_updated":"2026-05-01T01:13:50Z","snapshot_observed_at":"2026-08-16T23:48:33.860447Z","submitted_at":"2026-05-01T01:13:50Z","title":"Fast Text-to-Audio Generation with One-Step Sampling via Energy-Scoring and Auxiliary Contextual Representation Distillation","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-05-09T19:17:09.247932Z"},"links":{"cited_paper":"/paper/2312.15821","citing_paper":"/paper/2605.00329"},"observation_digest":"sha256:1763d399ad90fcaa05cfb39993ecfa5156b28785bc6d0e9af86264c43d3ab711","observation_id":"1d819b93-7627-48bd-b92b-619c12b3a0ee","resolution":{"observed_at":"2026-05-11T15:46:41.933376Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2312.15821","last_updated":"2023-12-25T22:24:49Z","snapshot_observed_at":"2026-08-17T22:52:14.678531Z","submitted_at":"2023-12-25T22:24:49Z","title":"Audiobox: Unified Audio Generation with Natural Language Prompts","version":1},"cited_work":{"arxiv_id":"2312.15821","doi":"10.48550/arxiv.2312.15821","metadata_source":"pith","pith_arxiv_id":"2312.15821","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Audiobox: Unified audio generation with natural language prompts","venue":"cs.SD","work_id":"f7d2982e-a068-43ac-85f8-a5d3fb631fa2","year":2023},"citing_paper":{"arxiv_id":"2605.08729","last_updated":"2026-06-29T11:45:55Z","snapshot_observed_at":"2026-08-12T18:43:13.847795Z","submitted_at":"2026-05-09T06:32:54Z","title":"Unison: Harmonizing Motion, Speech, and Sound for Human-Centric Audio-Video Generation","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-05-12T02:28:14.734682Z"},"links":{"cited_paper":"/paper/2312.15821","citing_paper":"/paper/2605.08729"},"observation_digest":"sha256:dc46d3a82d4d3665146ae80006db21391c89232100e3c169ecf3ffbb74cce58b","observation_id":"66c3dcb2-33d5-4afa-a404-39d9a448298f","resolution":{"observed_at":"2026-05-12T07:36:45.292578Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2312.15821","last_updated":"2023-12-25T22:24:49Z","snapshot_observed_at":"2026-08-17T22:52:14.678531Z","submitted_at":"2023-12-25T22:24:49Z","title":"Audiobox: Unified Audio Generation with Natural Language Prompts","version":1},"cited_work":{"arxiv_id":"2312.15821","doi":"10.48550/arxiv.2312.15821","metadata_source":"pith","pith_arxiv_id":"2312.15821","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Audiobox: Unified audio generation with natural language prompts","venue":"cs.SD","work_id":"f7d2982e-a068-43ac-85f8-a5d3fb631fa2","year":2023},"citing_paper":{"arxiv_id":"2605.08729","last_updated":"2026-06-29T11:45:55Z","snapshot_observed_at":"2026-08-12T18:43:13.847795Z","submitted_at":"2026-05-09T06:32:54Z","title":"Unison: Harmonizing Motion, Speech, and Sound for Human-Centric Audio-Video Generation","version":2},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-06-30T23:26:46.077894Z"},"links":{"cited_paper":"/paper/2312.15821","citing_paper":"/paper/2605.08729"},"observation_digest":"sha256:9b282a5d079e863ee529376aa6733c7bb0a1111f570e1d90181c5e1876d83a78","observation_id":"fae6d979-9042-4207-ac15-07057f9144df","resolution":{"observed_at":"2026-06-30T23:35:07.877386Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2312.15821","last_updated":"2023-12-25T22:24:49Z","snapshot_observed_at":"2026-08-17T22:52:14.678531Z","submitted_at":"2023-12-25T22:24:49Z","title":"Audiobox: Unified Audio Generation with Natural Language Prompts","version":1},"cited_work":{"arxiv_id":"2312.15821","doi":"10.48550/arxiv.2312.15821","metadata_source":"pith","pith_arxiv_id":"2312.15821","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Audiobox: Unified audio generation with natural language prompts","venue":"cs.SD","work_id":"f7d2982e-a068-43ac-85f8-a5d3fb631fa2","year":2023},"citing_paper":{"arxiv_id":"2605.17488","last_updated":"2026-05-17T14:56:52Z","snapshot_observed_at":"2026-08-16T04:42:39.882027Z","submitted_at":"2026-05-17T14:56:52Z","title":"Omni-Customizer: End-to-End MultiModal Customization for Joint Audio-Video Generation","version":1},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-05-20T14:08:30.802619Z"},"links":{"cited_paper":"/paper/2312.15821","citing_paper":"/paper/2605.17488"},"observation_digest":"sha256:fc3296390eb33fe6514e0a0c7d31a908928dbb6a3a10eb249fe4d78dbe144cb1","observation_id":"adaf4418-7ee9-45c4-a77b-e9c57146a96f","resolution":{"observed_at":"2026-05-20T14:13:21.342726Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2312.15821","last_updated":"2023-12-25T22:24:49Z","snapshot_observed_at":"2026-08-17T22:52:14.678531Z","submitted_at":"2023-12-25T22:24:49Z","title":"Audiobox: Unified Audio Generation with Natural Language Prompts","version":1},"cited_work":{"arxiv_id":"2312.15821","doi":"10.48550/arxiv.2312.15821","metadata_source":"pith","pith_arxiv_id":"2312.15821","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Audiobox: Unified audio generation with natural language prompts","venue":"cs.SD","work_id":"f7d2982e-a068-43ac-85f8-a5d3fb631fa2","year":2023},"citing_paper":{"arxiv_id":"2605.24652","last_updated":"2026-05-23T16:42:39Z","snapshot_observed_at":"2026-08-14T17:33:33.384858Z","submitted_at":"2026-05-23T16:42:39Z","title":"AVBench: Human-Aligned and Automated Evaluation Benchmark for Audio-Video Generative Models","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-06-30T13:35:01.226818Z"},"links":{"cited_paper":"/paper/2312.15821","citing_paper":"/paper/2605.24652"},"observation_digest":"sha256:719195d2f4ebb3485d5525d46380b2e562880d1df069a4e16906d843f1297b35","observation_id":"6c1d55db-e97a-4f06-b3ca-42f193b15c9e","resolution":{"observed_at":"2026-06-30T13:44:41.261751Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2312.15821","last_updated":"2023-12-25T22:24:49Z","snapshot_observed_at":"2026-08-17T22:52:14.678531Z","submitted_at":"2023-12-25T22:24:49Z","title":"Audiobox: Unified Audio Generation with Natural Language Prompts","version":1},"cited_work":{"arxiv_id":"2312.15821","doi":"10.48550/arxiv.2312.15821","metadata_source":"pith","pith_arxiv_id":"2312.15821","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Audiobox: Unified audio generation with natural language prompts","venue":"cs.SD","work_id":"f7d2982e-a068-43ac-85f8-a5d3fb631fa2","year":2023},"citing_paper":{"arxiv_id":"2605.28063","last_updated":"2026-05-27T07:15:35Z","snapshot_observed_at":"2026-08-15T15:58:57.045936Z","submitted_at":"2026-05-27T07:15:35Z","title":"Unified Synthesis of Compositional Speech and Sound from Free-Form Text Prompts","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-06-29T10:28:18.202974Z"},"links":{"cited_paper":"/paper/2312.15821","citing_paper":"/paper/2605.28063"},"observation_digest":"sha256:918dd4ff2cb09ace9c9902e301bba19fd08a75a19963a97b28b72316299b9e59","observation_id":"444d884a-4575-45da-9dac-ac58abdf689f","resolution":{"observed_at":"2026-06-29T10:33:17.930200Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2312.15821","last_updated":"2023-12-25T22:24:49Z","snapshot_observed_at":"2026-08-17T22:52:14.678531Z","submitted_at":"2023-12-25T22:24:49Z","title":"Audiobox: Unified Audio Generation with Natural Language Prompts","version":1},"cited_work":{"arxiv_id":"2312.15821","doi":"10.48550/arxiv.2312.15821","metadata_source":"pith","pith_arxiv_id":"2312.15821","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Audiobox: Unified audio generation with natural language prompts","venue":"cs.SD","work_id":"f7d2982e-a068-43ac-85f8-a5d3fb631fa2","year":2023},"citing_paper":{"arxiv_id":"2605.30965","last_updated":"2026-05-29T07:58:54Z","snapshot_observed_at":"2026-08-14T12:11:56.947880Z","submitted_at":"2026-05-29T07:58:54Z","title":"ImmersiveTTS: Environment-Aware Text-to-Speech with Multimodal Diffusion Transformer and Domain-Specific Representation Alignment","version":1},"reference_index":63,"source":"arxiv_source","source_observed_at":"2026-06-28T21:12:19.893944Z"},"links":{"cited_paper":"/paper/2312.15821","citing_paper":"/paper/2605.30965"},"observation_digest":"sha256:1792095841fe5e28d8b5becb7d5e1311bd0ee68a68658b9034e91f9cc9041e29","observation_id":"688eb36f-523f-4e77-a7fc-6e0b0fb11064","resolution":{"observed_at":"2026-07-01T20:26:12.626271Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2312.15821","last_updated":"2023-12-25T22:24:49Z","snapshot_observed_at":"2026-08-17T22:52:14.678531Z","submitted_at":"2023-12-25T22:24:49Z","title":"Audiobox: Unified Audio Generation with Natural Language Prompts","version":1},"cited_work":{"arxiv_id":"2312.15821","doi":"10.48550/arxiv.2312.15821","metadata_source":"pith","pith_arxiv_id":"2312.15821","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Audiobox: Unified audio generation with natural language prompts","venue":"cs.SD","work_id":"f7d2982e-a068-43ac-85f8-a5d3fb631fa2","year":2023},"citing_paper":{"arxiv_id":"2605.31530","last_updated":"2026-06-02T14:24:03Z","snapshot_observed_at":"2026-08-14T05:36:12.019199Z","submitted_at":"2026-05-29T16:43:07Z","title":"UNISON: A Unified Sound Generation and Editing Framework via Deep LLM Fusion","version":2},"reference_index":57,"source":"arxiv_source","source_observed_at":"2026-06-28T20:44:20.190064Z"},"links":{"cited_paper":"/paper/2312.15821","citing_paper":"/paper/2605.31530"},"observation_digest":"sha256:af892a140a8e437fea7a19eeb7e631a2baf0f6548f8bf1ff755da20b7d143b02","observation_id":"087fe4f2-13f7-432f-bd41-19685fa2e3c3","resolution":{"observed_at":"2026-06-28T20:52:37.917213Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2312.15821","last_updated":"2023-12-25T22:24:49Z","snapshot_observed_at":"2026-08-17T22:52:14.678531Z","submitted_at":"2023-12-25T22:24:49Z","title":"Audiobox: Unified Audio Generation with Natural Language Prompts","version":1},"cited_work":{"arxiv_id":"2312.15821","doi":"10.48550/arxiv.2312.15821","metadata_source":"pith","pith_arxiv_id":"2312.15821","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Audiobox: Unified audio generation with natural language prompts","venue":"cs.SD","work_id":"f7d2982e-a068-43ac-85f8-a5d3fb631fa2","year":2023},"citing_paper":{"arxiv_id":"2606.02739","last_updated":"2026-06-01T18:05:18Z","snapshot_observed_at":"2026-08-12T22:07:52.223207Z","submitted_at":"2026-06-01T18:05:18Z","title":"EntangleCodec: A Unified Discrete Audio Tokenizer via Semantic-Acoustic Entanglement","version":1},"reference_index":30,"source":"arxiv_source","source_observed_at":"2026-06-28T12:34:06.024192Z"},"links":{"cited_paper":"/paper/2312.15821","citing_paper":"/paper/2606.02739"},"observation_digest":"sha256:44a2e96849251046a2462afcce051148ce48a4f6e2e0864db6168527ad19b7e1","observation_id":"435d69f2-c82f-4b7e-b121-cff147ec5199","resolution":{"observed_at":"2026-06-28T12:42:08.983227Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2312.15821","last_updated":"2023-12-25T22:24:49Z","snapshot_observed_at":"2026-08-17T22:52:14.678531Z","submitted_at":"2023-12-25T22:24:49Z","title":"Audiobox: Unified Audio Generation with Natural Language Prompts","version":1},"cited_work":{"arxiv_id":"2312.15821","doi":"10.48550/arxiv.2312.15821","metadata_source":"pith","pith_arxiv_id":"2312.15821","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Audiobox: Unified audio generation with natural language prompts","venue":"cs.SD","work_id":"f7d2982e-a068-43ac-85f8-a5d3fb631fa2","year":2023},"citing_paper":{"arxiv_id":"2606.06928","last_updated":"2026-06-05T05:43:15Z","snapshot_observed_at":"2026-08-16T17:28:12.915614Z","submitted_at":"2026-06-05T05:43:15Z","title":"VoxCPM2 Technical Report","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-06-27T21:18:22.911332Z"},"links":{"cited_paper":"/paper/2312.15821","citing_paper":"/paper/2606.06928"},"observation_digest":"sha256:e3a6b0f03da6965f7f996dd915c5a5ee5e9ad46b4849f725c2e86a0bb89eeb6a","observation_id":"590a8127-654d-4387-90f6-df1426c6ce91","resolution":{"observed_at":"2026-07-02T19:47:19.711855Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2312.15821","last_updated":"2023-12-25T22:24:49Z","snapshot_observed_at":"2026-08-17T22:52:14.678531Z","submitted_at":"2023-12-25T22:24:49Z","title":"Audiobox: Unified Audio Generation with Natural Language Prompts","version":1},"cited_work":{"arxiv_id":"2312.15821","doi":"10.48550/arxiv.2312.15821","metadata_source":"pith","pith_arxiv_id":"2312.15821","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Audiobox: Unified audio generation with natural language prompts","venue":"cs.SD","work_id":"f7d2982e-a068-43ac-85f8-a5d3fb631fa2","year":2023},"citing_paper":{"arxiv_id":"2606.09098","last_updated":"2026-06-08T06:49:50Z","snapshot_observed_at":"2026-08-12T18:53:54.003220Z","submitted_at":"2026-06-08T06:49:50Z","title":"HoliDubber: Holistic Video Dubbing for Complex Acoustic Scenes via Text-Guided Audio Synthesis","version":1},"reference_index":63,"source":"pdf_text","source_observed_at":"2026-06-27T15:20:14.761337Z"},"links":{"cited_paper":"/paper/2312.15821","citing_paper":"/paper/2606.09098"},"observation_digest":"sha256:65fae6fcfcd506676123d4c6411aa3f13acc1280f89da347645e2c0de5eb59b0","observation_id":"2c590f6f-ae5c-47a6-bbc3-0c9cbd2afdb7","resolution":{"observed_at":"2026-07-03T03:27:35.662075Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2312.15821","last_updated":"2023-12-25T22:24:49Z","snapshot_observed_at":"2026-08-17T22:52:14.678531Z","submitted_at":"2023-12-25T22:24:49Z","title":"Audiobox: Unified Audio Generation with Natural Language Prompts","version":1},"cited_work":{"arxiv_id":"2312.15821","doi":"10.48550/arxiv.2312.15821","metadata_source":"pith","pith_arxiv_id":"2312.15821","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Audiobox: Unified audio generation with natural language prompts","venue":"cs.SD","work_id":"f7d2982e-a068-43ac-85f8-a5d3fb631fa2","year":2023},"citing_paper":{"arxiv_id":"2606.23080","last_updated":"2026-06-22T09:30:02Z","snapshot_observed_at":"2026-08-17T00:39:07.624929Z","submitted_at":"2026-06-22T09:30:02Z","title":"AudioCALM: Continuous Autoregressive Language Modeling for Universal Audio Generation","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-06-26T07:24:01.244733Z"},"links":{"cited_paper":"/paper/2312.15821","citing_paper":"/paper/2606.23080"},"observation_digest":"sha256:a418f6a4f1d532db6173eb0cfbcab9ad6a1069aec3c805acd3a1d9e0fa9205a5","observation_id":"2278720b-7402-4a96-ade9-baf10dabe26a","resolution":{"observed_at":"2026-07-04T11:59:50.917841Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2312.15821","last_updated":"2023-12-25T22:24:49Z","snapshot_observed_at":"2026-08-17T22:52:14.678531Z","submitted_at":"2023-12-25T22:24:49Z","title":"Audiobox: Unified Audio Generation with Natural Language Prompts","version":1},"cited_work":{"arxiv_id":"2312.15821","doi":"10.48550/arxiv.2312.15821","metadata_source":"pith","pith_arxiv_id":"2312.15821","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Audiobox: Unified audio generation with natural language prompts","venue":"cs.SD","work_id":"f7d2982e-a068-43ac-85f8-a5d3fb631fa2","year":2023},"citing_paper":{"arxiv_id":"2606.31729","last_updated":"2026-06-30T14:28:41Z","snapshot_observed_at":"2026-08-17T22:44:15.415308Z","submitted_at":"2026-06-30T14:28:41Z","title":"Is Natural Always Appropriate? Investigating Naturalness and Appropriateness Across Different Domains for TTS Evaluation","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-07-01T03:32:23.838961Z"},"links":{"cited_paper":"/paper/2312.15821","citing_paper":"/paper/2606.31729"},"observation_digest":"sha256:2730d8d0ef987f1721c5af02f20ad6657c12d3611785d6c5c9a1a1363e0cd51a","observation_id":"980e0768-d242-4eb0-a098-4155afd207f7","resolution":{"observed_at":"2026-07-01T11:55:42.956747Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2312.15821","last_updated":"2023-12-25T22:24:49Z","snapshot_observed_at":"2026-08-17T22:52:14.678531Z","submitted_at":"2023-12-25T22:24:49Z","title":"Audiobox: Unified Audio Generation with Natural Language Prompts","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.15821","snapshot_observed_at":"2026-07-11T12:34:20.057072Z","title":"Available: https://arxiv.org/abs/2312.15821","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.04848","last_updated":"2026-07-06T09:19:03Z","snapshot_observed_at":"2026-08-17T14:48:24.065098Z","submitted_at":"2026-07-06T09:19:03Z","title":"SynSFX: Multi-Model Sound Effects Synthesis Dataset for Deepfake Detection and Evaluation","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-07-11T12:34:20.057072Z"},"links":{"cited_paper":"/paper/2312.15821","citing_paper":"/paper/2607.04848"},"observation_digest":"sha256:df3c670fe2b5e418a197c29495b30b8bb5e1b3e6978c9efa580a8cb11cb7bffb","observation_id":"a3d23cec-77d5-403f-9493-0bf03a9ec394","resolution":{"observed_at":"2026-07-11T12:34:20.057072Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.15821","last_updated":"2023-12-25T22:24:49Z","snapshot_observed_at":"2026-08-17T22:52:14.678531Z","submitted_at":"2023-12-25T22:24:49Z","title":"Audiobox: Unified Audio Generation with Natural Language Prompts","version":1},"cited_work":{"arxiv_id":"2312.15821","doi":"10.48550/arxiv.2312.15821","metadata_source":"pith","pith_arxiv_id":"2312.15821","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Audiobox: Unified audio generation with natural language prompts","venue":"cs.SD","work_id":"f7d2982e-a068-43ac-85f8-a5d3fb631fa2","year":2023},"citing_paper":{"arxiv_id":"2607.05196","last_updated":"2026-07-07T15:36:48Z","snapshot_observed_at":"2026-08-19T04:43:08.967042Z","submitted_at":"2026-07-06T15:11:57Z","title":"Unified Audio Intelligence Without Regressing on Text Intelligence","version":1},"reference_index":45,"source":"arxiv_source","source_observed_at":"2026-07-07T23:59:38.702609Z"},"links":{"cited_paper":"/paper/2312.15821","citing_paper":"/paper/2607.05196"},"observation_digest":"sha256:77a58190e35009cb206b4b12b4cb4730e7e30a4496197812f087ae56852445cb","observation_id":"a4231bb2-8c63-4c46-82fd-17b2e69f233a","resolution":{"observed_at":"2026-07-08T00:04:22.480374Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2312.15821","last_updated":"2023-12-25T22:24:49Z","snapshot_observed_at":"2026-08-17T22:52:14.678531Z","submitted_at":"2023-12-25T22:24:49Z","title":"Audiobox: Unified Audio Generation with Natural Language Prompts","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.15821","snapshot_observed_at":"2026-07-11T07:46:49.059192Z","title":"arXiv preprint arXiv:2312.15821 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.05196","last_updated":"2026-07-07T15:36:48Z","snapshot_observed_at":"2026-08-19T04:43:08.967042Z","submitted_at":"2026-07-06T15:11:57Z","title":"Unified Audio Intelligence Without Regressing on Text Intelligence","version":2},"reference_index":45,"source":"arxiv_source","source_observed_at":"2026-07-11T07:46:49.059192Z"},"links":{"cited_paper":"/paper/2312.15821","citing_paper":"/paper/2607.05196"},"observation_digest":"sha256:b113736109a092f8afaf51cbf61ce4679999d62044753eae6632de0ea5cda705","observation_id":"7a7202ec-e2cb-4f8f-b476-2fe65d39ecad","resolution":{"observed_at":"2026-07-11T07:46:49.059192Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.15821","last_updated":"2023-12-25T22:24:49Z","snapshot_observed_at":"2026-08-17T22:52:14.678531Z","submitted_at":"2023-12-25T22:24:49Z","title":"Audiobox: Unified Audio Generation with Natural Language Prompts","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.15821","snapshot_observed_at":"2026-07-30T14:08:14.459751Z","title":"Audiobox: Unified audio generation with natural language prompts.arXiv preprint arXiv:2312.15821, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.27011","last_updated":"2026-07-30T08:12:52Z","snapshot_observed_at":"2026-08-20T09:36:54.854342Z","submitted_at":"2026-07-29T15:06:58Z","title":"Qwen-Audio-3.0-Gen-Preview Technical Report","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-07-30T14:08:14.459751Z"},"links":{"cited_paper":"/paper/2312.15821","citing_paper":"/paper/2607.27011"},"observation_digest":"sha256:25c88dd9ef87bc610de3ef88cd5f158f3590a375a97b6f79dae9a3535e40851b","observation_id":"4d288361-f52f-4898-a045-1092ca4af2de","resolution":{"observed_at":"2026-07-30T14:08:14.459751Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.15821","last_updated":"2023-12-25T22:24:49Z","snapshot_observed_at":"2026-08-17T22:52:14.678531Z","submitted_at":"2023-12-25T22:24:49Z","title":"Audiobox: Unified Audio Generation with Natural Language Prompts","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.15821","snapshot_observed_at":"2026-08-01T10:17:26.573299Z","title":"Audiobox: Unified audio generation with natural language prompts.arXiv preprint arXiv:2312.15821, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.27011","last_updated":"2026-07-30T08:12:52Z","snapshot_observed_at":"2026-08-20T09:36:54.854342Z","submitted_at":"2026-07-29T15:06:58Z","title":"Qwen-Audio-3.0-Gen-Preview Technical Report","version":2},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-01T10:17:26.573299Z"},"links":{"cited_paper":"/paper/2312.15821","citing_paper":"/paper/2607.27011"},"observation_digest":"sha256:2ab45bdf1aeae40f9aae935f31326934b1048ee2ec48650d6d51e54cffcd471a","observation_id":"e525aefd-e97b-4c32-93ce-dc1f3fa08ff8","resolution":{"observed_at":"2026-08-01T10:17:26.573299Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.15821","last_updated":"2023-12-25T22:24:49Z","snapshot_observed_at":"2026-08-17T22:52:14.678531Z","submitted_at":"2023-12-25T22:24:49Z","title":"Audiobox: Unified Audio Generation with Natural Language Prompts","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.15821","snapshot_observed_at":"2026-08-15T14:42:59.876083Z","title":"arXiv preprint arXiv:2312.15821 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.04479","last_updated":"2026-08-05T06:06:54Z","snapshot_observed_at":"2026-08-19T07:42:04.360814Z","submitted_at":"2026-08-05T06:06:54Z","title":"AudioScape-TTA: A Structured Soundscape Benchmark for Fine-Grained Text-to-Audio Evaluation","version":1},"reference_index":40,"source":"arxiv_source","source_observed_at":"2026-08-15T14:42:59.876083Z"},"links":{"cited_paper":"/paper/2312.15821","citing_paper":"/paper/2608.04479"},"observation_digest":"sha256:50cbbb46e45219388db36ce1a4d42fb71a5cfee443505ccc93ba9012c1aa1e5c","observation_id":"81c4d6f4-71c1-480f-bd87-420838acd450","resolution":{"observed_at":"2026-08-15T14:42:59.876083Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.15821","last_updated":"2023-12-25T22:24:49Z","snapshot_observed_at":"2026-08-17T22:52:14.678531Z","submitted_at":"2023-12-25T22:24:49Z","title":"Audiobox: Unified Audio Generation with Natural Language Prompts","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.15821","snapshot_observed_at":"2026-08-10T21:56:38.468327Z","title":"arXiv preprint arXiv:2312.15821 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.06722","last_updated":"2026-08-19T17:35:26Z","snapshot_observed_at":"2026-08-22T23:11:55.397035Z","submitted_at":"2026-08-07T02:32:11Z","title":"CustomDance: Customized 3D Dance Generation with Coarse-to-Fine Human-Centered Interactive Control","version":1},"reference_index":110,"source":"arxiv_source","source_observed_at":"2026-08-10T21:56:38.468327Z"},"links":{"cited_paper":"/paper/2312.15821","citing_paper":"/paper/2608.06722"},"observation_digest":"sha256:ae99fe649281c49a40a1ff467291e1831b8a365b0dfa9753d98ff10ceacae8a0","observation_id":"820fd6b8-e181-498f-af51-69118670a257","resolution":{"observed_at":"2026-08-10T21:56:38.468327Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.15821","last_updated":"2023-12-25T22:24:49Z","snapshot_observed_at":"2026-08-17T22:52:14.678531Z","submitted_at":"2023-12-25T22:24:49Z","title":"Audiobox: Unified Audio Generation with Natural Language Prompts","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.15821","snapshot_observed_at":"2026-08-12T00:44:06.171201Z","title":"Audiobox: Unified audio generation with natural language prompts,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2608.07944","last_updated":"2026-08-08T06:08:02Z","snapshot_observed_at":"2026-08-22T04:12:50.468450Z","submitted_at":"2026-08-08T06:08:02Z","title":"VIOLET: High-Fidelity Violin Synthesis with Techniques and Dynamics","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-12T00:44:06.171201Z"},"links":{"cited_paper":"/paper/2312.15821","citing_paper":"/paper/2608.07944"},"observation_digest":"sha256:173f35d1cef5361b6f740d06e8cbfc14f1206e93fc1299c52c8d521a93a9668a","observation_id":"ee3026f6-d04c-4633-8cde-7ce50f2bfcb9","resolution":{"observed_at":"2026-08-12T00:44:06.171201Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.15821","last_updated":"2023-12-25T22:24:49Z","snapshot_observed_at":"2026-08-17T22:52:14.678531Z","submitted_at":"2023-12-25T22:24:49Z","title":"Audiobox: Unified Audio Generation with Natural Language Prompts","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.15821","snapshot_observed_at":"2026-08-11T14:54:55.057843Z","title":"Audiobox: Unified audio generation with natural language prompts.CoRR, abs/2312.15821,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.09571","last_updated":"2026-08-10T13:07:24Z","snapshot_observed_at":"2026-08-16T18:03:20.297490Z","submitted_at":"2026-08-10T13:07:24Z","title":"SonicWeave: Chunk-Routed Mixture-of-Experts for Unified Audio Scene Generation","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-11T14:54:55.057843Z"},"links":{"cited_paper":"/paper/2312.15821","citing_paper":"/paper/2608.09571"},"observation_digest":"sha256:9331916040b55bc776f7b37183cf507b587913c3333b94b25ab128c7e004ea40","observation_id":"cdbad638-fd23-48e1-bf05-11a5343a5750","resolution":{"observed_at":"2026-08-11T14:54:55.057843Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.15821","last_updated":"2023-12-25T22:24:49Z","snapshot_observed_at":"2026-08-17T22:52:14.678531Z","submitted_at":"2023-12-25T22:24:49Z","title":"Audiobox: Unified Audio Generation with Natural Language Prompts","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.15821","snapshot_observed_at":"2026-08-11T14:54:55.062732Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.09571","last_updated":"2026-08-10T13:07:24Z","snapshot_observed_at":"2026-08-16T18:03:20.297490Z","submitted_at":"2026-08-10T13:07:24Z","title":"SonicWeave: Chunk-Routed Mixture-of-Experts for Unified Audio Scene Generation","version":1},"reference_index":2023,"source":"pdf_text","source_observed_at":"2026-08-11T14:54:55.062732Z"},"links":{"cited_paper":"/paper/2312.15821","citing_paper":"/paper/2608.09571"},"observation_digest":"sha256:65f3fef3541521c8122aaf2343e2fcce5b66b826c8d926bf7248c6e1aa2f6766","observation_id":"57e5ad33-fe50-4da2-b06f-b3c4ed53a099","resolution":{"observed_at":"2026-08-11T14:54:55.062732Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.15821","last_updated":"2023-12-25T22:24:49Z","snapshot_observed_at":"2026-08-17T22:52:14.678531Z","submitted_at":"2023-12-25T22:24:49Z","title":"Audiobox: Unified Audio Generation with Natural Language Prompts","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.15821","snapshot_observed_at":"2026-08-15T19:59:27.785493Z","title":"Audiobox: Unified audio gener- ation with natural language prompts,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2608.12951","last_updated":"2026-08-13T08:27:22Z","snapshot_observed_at":"2026-08-22T06:39:10.386092Z","submitted_at":"2026-08-13T08:27:22Z","title":"VoxAudio: Vocalized Audio Synthesis via Multi-Reward Autoregressive Flow Matching","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-15T19:59:27.785493Z"},"links":{"cited_paper":"/paper/2312.15821","citing_paper":"/paper/2608.12951"},"observation_digest":"sha256:7b08bf553e174f8abb1a63e91c5bf845e299c647cf3816c056f908aeb726203a","observation_id":"d5d7220c-6f7b-4fc1-92d5-a9c9ae5d514e","resolution":{"observed_at":"2026-08-15T19:59:27.785493Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2312.15821/citation-record","integrity":"/paper/2312.15821/integrity","json":"/paper/2312.15821/citation-record.json","paper":"/paper/2312.15821"},"outbound":[],"paper":{"arxiv_id":"2312.15821","last_updated":"2023-12-25T22:24:49Z","latest_version":1,"primary_category":"cs.SD","snapshot_observed_at":"2026-08-17T22:52:14.678531Z","submitted_at":"2023-12-25T22:24:49Z","title":"Audiobox: Unified Audio Generation with Natural Language Prompts"},"reference_resolution":{"displayed":0,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":0,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":0},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"thesis":"As of 23 August 2026, this Paper Citation Record lists 0 of 0 outbound references and 69 inbound Pith citation observations for arXiv:2312.15821."}