{"as_of":"2026-08-15T20:39:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:d4fce18b81e078302ba8ae21cacb0624c64fb26643568102640a39831bd35307","coverage":[{"denominator":0,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":33,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":33,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-15T06:32:42.880941+00:00","state":"measured"},{"denominator":33,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":33,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-15T19:59:28.108913Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":1,"source":"arxiv_reference","source_observed_at":"2026-08-05T02:28:24.338817Z","state":"measured"}],"external_citation_measurements":[{"count":15,"observed_at":"2026-08-05T02:28:24.338817Z","source":"arxiv_reference"}],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2304.13731","last_updated":"2023-05-29T12:09:08Z","snapshot_observed_at":"2026-08-13T11:57:06.524503Z","submitted_at":"2023-04-24T07:45:28Z","title":"Text-to-Audio Generation using Instruction-Tuned LLM and Latent Diffusion Model","version":2},"cited_work":{"arxiv_id":"2304.13731","doi":"10.48550/arxiv.2304.13731","metadata_source":"arxiv_reference","pith_arxiv_id":"2304.13731","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Text-to-audio generation using instruction- tuned LLM and latent diffusion model","venue":"arXiv (Cornell University)","work_id":"492d96c3-fca9-41b7-a64d-3e3313ff9da1","year":2023},"citing_paper":{"arxiv_id":"2306.04321","last_updated":"2026-01-12T14:12:43Z","snapshot_observed_at":"2026-08-12T18:50:26.830845Z","submitted_at":"2023-06-07T10:36:36Z","title":"Generative Semantic Communication: Diffusion Models Beyond Bit Recovery","version":2},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-05-24T08:43:17.500704Z"},"links":{"cited_paper":"/paper/2304.13731","citing_paper":"/paper/2306.04321"},"observation_digest":"sha256:825c3ffd0c9dfba7ea9f1aeaf9f1dbdc5a558e07f34f7c6a393c846df70d7b0c","observation_id":"69860cd6-e039-4abb-818e-5f10f765f5be","resolution":{"observed_at":"2026-05-24T08:44:13.902413Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2304.13731","last_updated":"2023-05-29T12:09:08Z","snapshot_observed_at":"2026-08-13T11:57:06.524503Z","submitted_at":"2023-04-24T07:45:28Z","title":"Text-to-Audio Generation using Instruction-Tuned LLM and Latent Diffusion Model","version":2},"cited_work":{"arxiv_id":"2304.13731","doi":"10.48550/arxiv.2304.13731","metadata_source":"arxiv_reference","pith_arxiv_id":"2304.13731","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Text-to-audio generation using instruction- tuned LLM and latent diffusion model","venue":"arXiv (Cornell University)","work_id":"492d96c3-fca9-41b7-a64d-3e3313ff9da1","year":2023},"citing_paper":{"arxiv_id":"2405.09866","last_updated":"2026-04-13T16:23:32Z","snapshot_observed_at":"2026-08-13T11:02:44.816157Z","submitted_at":"2024-05-16T07:43:15Z","title":"Training-Free Multi-User Generative Semantic Communications via Null-Space Diffusion Sampling","version":2},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-05-24T01:38:42.441433Z"},"links":{"cited_paper":"/paper/2304.13731","citing_paper":"/paper/2405.09866"},"observation_digest":"sha256:6880c9d13dcd11343e03a537e72ada1fc72ec4dc4db61296e33eae0ca43e6c89","observation_id":"1c1ce906-c66e-457a-9914-2eec6b7bf2f4","resolution":{"observed_at":"2026-05-24T01:43:43.467983Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2304.13731","last_updated":"2023-05-29T12:09:08Z","snapshot_observed_at":"2026-08-13T11:57:06.524503Z","submitted_at":"2023-04-24T07:45:28Z","title":"Text-to-Audio Generation using Instruction-Tuned LLM and Latent Diffusion Model","version":2},"cited_work":{"arxiv_id":"2304.13731","doi":"10.48550/arxiv.2304.13731","metadata_source":"arxiv_reference","pith_arxiv_id":"2304.13731","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Text-to-audio generation using instruction- tuned LLM and latent diffusion model","venue":"arXiv (Cornell University)","work_id":"492d96c3-fca9-41b7-a64d-3e3313ff9da1","year":2023},"citing_paper":{"arxiv_id":"2410.13720","last_updated":"2025-02-26T16:05:55Z","snapshot_observed_at":"2026-08-14T11:08:32.950294Z","submitted_at":"2024-10-17T16:22:46Z","title":"Movie Gen: A Cast of Media Foundation Models","version":2},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-05-11T14:16:18.521699Z"},"links":{"cited_paper":"/paper/2304.13731","citing_paper":"/paper/2410.13720"},"observation_digest":"sha256:bca5afb379cf79859a1864fb78134d9f7ae742455511469fb0664cc9398b082a","observation_id":"707a0d2c-634c-4acf-a713-b365b0ec29d6","resolution":{"observed_at":"2026-05-11T14:16:23.275961Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2304.13731","last_updated":"2023-05-29T12:09:08Z","snapshot_observed_at":"2026-08-13T11:57:06.524503Z","submitted_at":"2023-04-24T07:45:28Z","title":"Text-to-Audio Generation using Instruction-Tuned LLM and Latent Diffusion Model","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2304.13731","snapshot_observed_at":"2026-08-11T17:27:20.859159Z","title":"arXiv preprint arXiv:2304.13731 (2023)","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.09001","last_updated":"2024-12-12T07:07:56Z","snapshot_observed_at":"2026-08-13T22:26:45.563788Z","submitted_at":"2024-12-12T07:07:56Z","title":"MindScratch: A Visual Programming Support Tool for Classroom Learning Based on Multimodal Generative AI","version":1},"reference_index":2023,"source":"pdf_text","source_observed_at":"2026-08-11T17:27:20.859159Z"},"links":{"cited_paper":"/paper/2304.13731","citing_paper":"/paper/2412.09001"},"observation_digest":"sha256:9ecc2f349bf9d1d04c0185b03ac88d1db265b1022a56b6a79897de5fdb111a0d","observation_id":"ca53461d-b78d-4ea0-8b5e-812a18c0efc1","resolution":{"observed_at":"2026-08-11T17:27:20.859159Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2304.13731","last_updated":"2023-05-29T12:09:08Z","snapshot_observed_at":"2026-08-13T11:57:06.524503Z","submitted_at":"2023-04-24T07:45:28Z","title":"Text-to-Audio Generation using Instruction-Tuned LLM and Latent Diffusion Model","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2304.13731","snapshot_observed_at":"2026-08-11T17:17:49.398258Z","title":"Text-to- audio generation using instruction tuned llm and latent diffusion model","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.09168","last_updated":"2024-12-12T10:55:57Z","snapshot_observed_at":"2026-08-15T15:50:08.591739Z","submitted_at":"2024-12-12T10:55:57Z","title":"YingSound: Video-Guided Sound Effects Generation with Multi-modal Chain-of-Thought Controls","version":1},"reference_index":85,"source":"pdf_text","source_observed_at":"2026-08-11T17:17:49.398258Z"},"links":{"cited_paper":"/paper/2304.13731","citing_paper":"/paper/2412.09168"},"observation_digest":"sha256:2ab9415977de41462c30156ddf3fdefb0ef88bcdc65752bd6714240186442c9f","observation_id":"060332f0-dc0d-4512-9549-4f8f5ab1e690","resolution":{"observed_at":"2026-08-11T17:17:49.398258Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2304.13731","last_updated":"2023-05-29T12:09:08Z","snapshot_observed_at":"2026-08-13T11:57:06.524503Z","submitted_at":"2023-04-24T07:45:28Z","title":"Text-to-Audio Generation using Instruction-Tuned LLM and Latent Diffusion Model","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2304.13731","snapshot_observed_at":"2026-08-11T15:43:00.881954Z","title":"Text-to-audio generation using instruc- tion tuned llm and latent diffusion model","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.10768","last_updated":"2024-12-14T09:36:10Z","snapshot_observed_at":"2026-08-12T23:16:59.467415Z","submitted_at":"2024-12-14T09:36:10Z","title":"VinTAGe: Joint Video and Text Conditioning for Holistic Audio Generation","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-11T15:43:00.881954Z"},"links":{"cited_paper":"/paper/2304.13731","citing_paper":"/paper/2412.10768"},"observation_digest":"sha256:cba479d8c6e1d1de3e96128dfa5b774da384d1b45acbbaa12b3d445439d44b43","observation_id":"f9bd243d-5c75-4739-afa0-c72c3a3200c4","resolution":{"observed_at":"2026-08-11T15:43:00.881954Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2304.13731","last_updated":"2023-05-29T12:09:08Z","snapshot_observed_at":"2026-08-13T11:57:06.524503Z","submitted_at":"2023-04-24T07:45:28Z","title":"Text-to-Audio Generation using Instruction-Tuned LLM and Latent Diffusion Model","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2304.13731","snapshot_observed_at":"2026-08-11T11:35:57.679504Z","title":"Text-to-audio generation using instruc- tion tuned llm and latent diffusion model","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.15322","last_updated":"2025-04-07T18:00:00Z","snapshot_observed_at":"2026-08-13T15:37:50.191308Z","submitted_at":"2024-12-19T18:59:55Z","title":"MMAudio: Taming Multimodal Joint Training for High-Quality Video-to-Audio Synthesis","version":2},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-11T11:35:57.679504Z"},"links":{"cited_paper":"/paper/2304.13731","citing_paper":"/paper/2412.15322"},"observation_digest":"sha256:06b7dcc70925c52abbeac8360d15a4ac8a7a9a65c8a5e057118a9e4aa6e92280","observation_id":"9ea5d44d-f34d-4927-b625-ef939d97f6f8","resolution":{"observed_at":"2026-08-11T11:35:57.679504Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2304.13731","last_updated":"2023-05-29T12:09:08Z","snapshot_observed_at":"2026-08-13T11:57:06.524503Z","submitted_at":"2023-04-24T07:45:28Z","title":"Text-to-Audio Generation using Instruction-Tuned LLM and Latent Diffusion Model","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2304.13731","snapshot_observed_at":"2026-08-10T23:21:34.520734Z","title":"Text-to-audio generation using instruction-tuned llm and latent diffusion model, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.21037","last_updated":"2025-04-10T05:01:32Z","snapshot_observed_at":"2026-08-10T23:01:20.648881Z","submitted_at":"2024-12-30T16:02:44Z","title":"TangoFlux: Super Fast and Faithful Text to Audio Generation with Flow Matching and Clap-Ranked Preference Optimization","version":2},"reference_index":14,"source":"arxiv_source","source_observed_at":"2026-08-10T23:21:34.520734Z"},"links":{"cited_paper":"/paper/2304.13731","citing_paper":"/paper/2412.21037"},"observation_digest":"sha256:7cbf49b4b990ffd9578ad142fdd892208e28a45ccf9fb39e71cc11cdfd6b10ec","observation_id":"fee7105a-96f9-46eb-bcba-338e0d6ac279","resolution":{"observed_at":"2026-08-10T23:21:34.520734Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2304.13731","last_updated":"2023-05-29T12:09:08Z","snapshot_observed_at":"2026-08-13T11:57:06.524503Z","submitted_at":"2023-04-24T07:45:28Z","title":"Text-to-Audio Generation using Instruction-Tuned LLM and Latent Diffusion Model","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2304.13731","snapshot_observed_at":"2026-08-10T15:59:21.026366Z","title":"Text-to-audio generation using instruction-tuned llm and latent diffusion model,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2501.13465","last_updated":"2025-01-23T08:27:01Z","snapshot_observed_at":"2026-08-15T10:50:29.685462Z","submitted_at":"2025-01-23T08:27:01Z","title":"Neural Vocoders as Speech Enhancers","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-10T15:59:21.026366Z"},"links":{"cited_paper":"/paper/2304.13731","citing_paper":"/paper/2501.13465"},"observation_digest":"sha256:43a57decf196a62d08aa166ac6a53e46edb51c0cb986e4dd3f6df969a3a6f328","observation_id":"fa2e99e3-c5b0-481b-8d65-5d64ab32c365","resolution":{"observed_at":"2026-08-10T15:59:21.026366Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2304.13731","last_updated":"2023-05-29T12:09:08Z","snapshot_observed_at":"2026-08-13T11:57:06.524503Z","submitted_at":"2023-04-24T07:45:28Z","title":"Text-to-Audio Generation using Instruction-Tuned LLM and Latent Diffusion Model","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2304.13731","snapshot_observed_at":"2026-08-10T14:21:56.752505Z","title":"Text-to- audio generation using instruction-tuned llm and latent diffusion model","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2501.15442","last_updated":"2025-02-11T13:05:36Z","snapshot_observed_at":"2026-08-12T05:22:54.792291Z","submitted_at":"2025-01-26T08:10:13Z","title":"Overview of the Amphion Toolkit (v0.2)","version":2},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-10T14:21:56.752505Z"},"links":{"cited_paper":"/paper/2304.13731","citing_paper":"/paper/2501.15442"},"observation_digest":"sha256:93b766e27fa06306d51d86e02f0ae18cb7d8a54db651345d32bf32eeebd8e249","observation_id":"f7d37e2e-d5cb-4911-88fd-5825de27fe83","resolution":{"observed_at":"2026-08-10T14:21:56.752505Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2304.13731","last_updated":"2023-05-29T12:09:08Z","snapshot_observed_at":"2026-08-13T11:57:06.524503Z","submitted_at":"2023-04-24T07:45:28Z","title":"Text-to-Audio Generation using Instruction-Tuned LLM and Latent Diffusion Model","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2304.13731","snapshot_observed_at":"2026-08-10T04:36:38.383890Z","title":"Text-to-audio generation using instruction-tuned llm and latent diffusion model","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2501.18648","last_updated":"2025-03-21T18:17:47Z","snapshot_observed_at":"2026-08-15T08:28:05.057834Z","submitted_at":"2025-01-29T16:38:57Z","title":"Multimodal Large Language Models for Image, Text, and Speech Data Augmentation: A Survey","version":2},"reference_index":285,"source":"pdf_text","source_observed_at":"2026-08-10T04:36:38.383890Z"},"links":{"cited_paper":"/paper/2304.13731","citing_paper":"/paper/2501.18648"},"observation_digest":"sha256:00c7d55d86bbf0322bd3f1550fb61aa63d9b24accd2b5fa35c0e81dc1e3ce1b3","observation_id":"652e3360-2970-470c-80d9-3d11db5d2752","resolution":{"observed_at":"2026-08-10T04:36:38.383890Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2304.13731","last_updated":"2023-05-29T12:09:08Z","snapshot_observed_at":"2026-08-13T11:57:06.524503Z","submitted_at":"2023-04-24T07:45:28Z","title":"Text-to-Audio Generation using Instruction-Tuned LLM and Latent Diffusion Model","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2304.13731","snapshot_observed_at":"2026-08-09T11:21:17.307566Z","title":"Text-to-audio generation using instruction-tuned llm and latent diffusion model","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2502.02747","last_updated":"2025-06-10T18:19:40Z","snapshot_observed_at":"2026-08-15T15:18:53.275887Z","submitted_at":"2025-02-04T22:30:02Z","title":"PatchPilot: A Cost-Efficient Software Engineering Agent with Early Attempts on Formal Verification","version":2},"reference_index":20,"source":"arxiv_source","source_observed_at":"2026-08-09T11:21:17.307566Z"},"links":{"cited_paper":"/paper/2304.13731","citing_paper":"/paper/2502.02747"},"observation_digest":"sha256:ba3b6d5be1cc74a00b74374ff8526584f7bed2612c524eb945b370f2177b7f34","observation_id":"cb759659-6ea3-46ce-a086-8709c5d47140","resolution":{"observed_at":"2026-08-09T11:21:17.307566Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2304.13731","last_updated":"2023-05-29T12:09:08Z","snapshot_observed_at":"2026-08-13T11:57:06.524503Z","submitted_at":"2023-04-24T07:45:28Z","title":"Text-to-Audio Generation using Instruction-Tuned LLM and Latent Diffusion Model","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2304.13731","snapshot_observed_at":"2026-08-09T06:01:13.239173Z","title":"Text-to-audio generation using instruction-tuned LLM and latent diffusion model","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2502.04371","last_updated":"2025-02-05T11:28:11Z","snapshot_observed_at":"2026-08-14T11:41:11.089540Z","submitted_at":"2025-02-05T11:28:11Z","title":"PerPO: Perceptual Preference Optimization via Discriminative Rewarding","version":1},"reference_index":19,"source":"arxiv_source","source_observed_at":"2026-08-09T06:01:13.239173Z"},"links":{"cited_paper":"/paper/2304.13731","citing_paper":"/paper/2502.04371"},"observation_digest":"sha256:5f4569edf7bbf371521aaed95ab0d3275239d73f91337ee2ab30230f3666bac0","observation_id":"ca845220-fa6c-49bd-a730-253acc8ed52f","resolution":{"observed_at":"2026-08-09T06:01:13.239173Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2304.13731","last_updated":"2023-05-29T12:09:08Z","snapshot_observed_at":"2026-08-13T11:57:06.524503Z","submitted_at":"2023-04-24T07:45:28Z","title":"Text-to-Audio Generation using Instruction-Tuned LLM and Latent Diffusion Model","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2304.13731","snapshot_observed_at":"2026-08-08T20:12:29.425344Z","title":"Text-to-audio generation using instruction- tuned llm and latent diffusion model","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2502.05130","last_updated":"2025-07-29T07:31:59Z","snapshot_observed_at":"2026-08-14T17:54:29.566180Z","submitted_at":"2025-02-07T18:02:47Z","title":"Latent Swap Joint Diffusion for 2D Long-Form Latent Generation","version":3},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-08T20:12:29.425344Z"},"links":{"cited_paper":"/paper/2304.13731","citing_paper":"/paper/2502.05130"},"observation_digest":"sha256:6c62708f9227d836c109a3a0dafdbb86b1c670bfb6a797eb7eb675c119346b8f","observation_id":"537e01b1-1e2e-4d28-8e31-4aaebdd6d25d","resolution":{"observed_at":"2026-08-08T20:12:29.425344Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2304.13731","last_updated":"2023-05-29T12:09:08Z","snapshot_observed_at":"2026-08-13T11:57:06.524503Z","submitted_at":"2023-04-24T07:45:28Z","title":"Text-to-Audio Generation using Instruction-Tuned LLM and Latent Diffusion Model","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2304.13731","snapshot_observed_at":"2026-08-08T21:12:22.502166Z","title":"Text-to-audio generation using instruction-tuned llm and latent diffusion model","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2502.05240","last_updated":"2025-02-12T14:43:02Z","snapshot_observed_at":"2026-08-10T00:38:45.519768Z","submitted_at":"2025-02-07T12:18:20Z","title":"Survey on AI-Generated Media Detection: From Non-MLLM to MLLM","version":2},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-08T21:12:22.502166Z"},"links":{"cited_paper":"/paper/2304.13731","citing_paper":"/paper/2502.05240"},"observation_digest":"sha256:a8cf2d3e78449678b1a18892c2f99d7bed58beb309ca5b88d02ce1c09f4d577b","observation_id":"3ac16a45-5bd5-4f75-a9ae-0834e90d4fc4","resolution":{"observed_at":"2026-08-08T21:12:22.502166Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2304.13731","last_updated":"2023-05-29T12:09:08Z","snapshot_observed_at":"2026-08-13T11:57:06.524503Z","submitted_at":"2023-04-24T07:45:28Z","title":"Text-to-Audio Generation using Instruction-Tuned LLM and Latent Diffusion Model","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2304.13731","snapshot_observed_at":"2026-08-07T20:14:03.585698Z","title":"arXiv preprint arXiv:2304.13731 (2023)","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2502.09906","last_updated":"2025-02-14T04:29:17Z","snapshot_observed_at":"2026-08-12T00:27:40.324757Z","submitted_at":"2025-02-14T04:29:17Z","title":"Insect-Foundation: A Foundation Model and Large Multimodal Dataset for Vision-Language Insect Understanding","version":1},"reference_index":69,"source":"pdf_text","source_observed_at":"2026-08-07T20:14:03.585698Z"},"links":{"cited_paper":"/paper/2304.13731","citing_paper":"/paper/2502.09906"},"observation_digest":"sha256:8383e73438c3379b966a0aa74df9aed078518047945ac524fd488853a9d71d24","observation_id":"67958216-8203-4b5c-bd0c-bd450947469c","resolution":{"observed_at":"2026-08-07T20:14:03.585698Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2304.13731","last_updated":"2023-05-29T12:09:08Z","snapshot_observed_at":"2026-08-13T11:57:06.524503Z","submitted_at":"2023-04-24T07:45:28Z","title":"Text-to-Audio Generation using Instruction-Tuned LLM and Latent Diffusion Model","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2304.13731","snapshot_observed_at":"2026-08-07T12:03:24.909538Z","title":"Text-to-audio generation using instruction-tuned llm and latent diffusion model","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.00736","last_updated":"2025-05-31T22:51:36Z","snapshot_observed_at":"2026-08-09T04:35:50.309243Z","submitted_at":"2025-05-31T22:51:36Z","title":"IMPACT: Iterative Mask-based Parallel Decoding for Text-to-Audio Generation with Diffusion Modeling","version":1},"reference_index":14,"source":"arxiv_source","source_observed_at":"2026-08-07T12:03:24.909538Z"},"links":{"cited_paper":"/paper/2304.13731","citing_paper":"/paper/2506.00736"},"observation_digest":"sha256:174c396df63e20f14aff6869954d12f9276d4afe57d1b57dd13a793351a3fd6a","observation_id":"039e2613-8da5-4e80-a2dd-bbb982f6bfe7","resolution":{"observed_at":"2026-08-07T12:03:24.909538Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2304.13731","last_updated":"2023-05-29T12:09:08Z","snapshot_observed_at":"2026-08-13T11:57:06.524503Z","submitted_at":"2023-04-24T07:45:28Z","title":"Text-to-Audio Generation using Instruction-Tuned LLM and Latent Diffusion Model","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2304.13731","snapshot_observed_at":"2026-08-06T17:52:00.192473Z","title":"Text-to-audio generation using instruction-tuned LLM and latent diffusion model","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.09834","last_updated":"2025-07-14T00:14:54Z","snapshot_observed_at":"2026-08-15T03:32:36.161797Z","submitted_at":"2025-07-14T00:14:54Z","title":"Generative Audio Language Modeling with Continuous-valued Tokens and Masked Next-Token Prediction","version":1},"reference_index":27,"source":"arxiv_source","source_observed_at":"2026-08-06T17:52:00.192473Z"},"links":{"cited_paper":"/paper/2304.13731","citing_paper":"/paper/2507.09834"},"observation_digest":"sha256:eb653be0e6b26661fcf1a219f11505af03a9be173663033148bb5f2dcacc19e8","observation_id":"8cc0151b-43c8-4f68-a72c-50d218cdacc8","resolution":{"observed_at":"2026-08-06T17:52:00.192473Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2304.13731","last_updated":"2023-05-29T12:09:08Z","snapshot_observed_at":"2026-08-13T11:57:06.524503Z","submitted_at":"2023-04-24T07:45:28Z","title":"Text-to-Audio Generation using Instruction-Tuned LLM and Latent Diffusion Model","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2304.13731","snapshot_observed_at":"2026-08-06T13:14:37.504432Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.20880","last_updated":"2025-07-28T14:34:02Z","snapshot_observed_at":"2026-08-14T04:55:21.946715Z","submitted_at":"2025-07-28T14:34:02Z","title":"JAM: A Tiny Flow-based Song Generator with Fine-grained Controllability and Aesthetic Alignment","version":1},"reference_index":13,"source":"arxiv_source","source_observed_at":"2026-08-06T13:14:37.504432Z"},"links":{"cited_paper":"/paper/2304.13731","citing_paper":"/paper/2507.20880"},"observation_digest":"sha256:b44ce6a957450ace8999c429b27adfcc73c2a1363798aea8f1dde5a7d2bbbc2b","observation_id":"90dc13ef-de70-403c-83d4-b6dcc99ece2f","resolution":{"observed_at":"2026-08-06T13:14:37.504432Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2304.13731","last_updated":"2023-05-29T12:09:08Z","snapshot_observed_at":"2026-08-13T11:57:06.524503Z","submitted_at":"2023-04-24T07:45:28Z","title":"Text-to-Audio Generation using Instruction-Tuned LLM and Latent Diffusion Model","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2304.13731","snapshot_observed_at":"2026-08-05T15:29:25.386327Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2508.19852","last_updated":"2025-08-28T07:08:03Z","snapshot_observed_at":"2026-08-13T08:30:59.513568Z","submitted_at":"2025-08-27T13:09:55Z","title":"Ego-centric Predictive Model Conditioned on Hand Trajectories","version":2},"reference_index":10,"source":"arxiv_source","source_observed_at":"2026-08-05T15:29:25.386327Z"},"links":{"cited_paper":"/paper/2304.13731","citing_paper":"/paper/2508.19852"},"observation_digest":"sha256:170a927e2492c67c9b1dde73fead62a27b910a9b1530eaf92e8f6ab4b8e6dbad","observation_id":"77d4c176-df34-4284-a3c6-df2bc1bf91ef","resolution":{"observed_at":"2026-08-05T15:29:25.386327Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2304.13731","last_updated":"2023-05-29T12:09:08Z","snapshot_observed_at":"2026-08-13T11:57:06.524503Z","submitted_at":"2023-04-24T07:45:28Z","title":"Text-to-Audio Generation using Instruction-Tuned LLM and Latent Diffusion Model","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2304.13731","snapshot_observed_at":"2026-08-05T11:41:37.929378Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2509.02398","last_updated":"2025-09-02T15:10:09Z","snapshot_observed_at":"2026-08-15T02:03:40.133783Z","submitted_at":"2025-09-02T15:10:09Z","title":"TTA-Bench: A Comprehensive Benchmark for Evaluating Text-to-Audio Models","version":1},"reference_index":15,"source":"arxiv_source","source_observed_at":"2026-08-05T11:41:37.929378Z"},"links":{"cited_paper":"/paper/2304.13731","citing_paper":"/paper/2509.02398"},"observation_digest":"sha256:f5181b760c8b302b467335928fd8e26f94c3be56374f4cf8ffc9aec6fdd6cc66","observation_id":"c73a878b-9120-4d7c-b9d8-0d069b9b32f4","resolution":{"observed_at":"2026-08-05T11:41:37.929378Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2304.13731","last_updated":"2023-05-29T12:09:08Z","snapshot_observed_at":"2026-08-13T11:57:06.524503Z","submitted_at":"2023-04-24T07:45:28Z","title":"Text-to-Audio Generation using Instruction-Tuned LLM and Latent Diffusion Model","version":2},"cited_work":{"arxiv_id":"2304.13731","doi":"10.48550/arxiv.2304.13731","metadata_source":"arxiv_reference","pith_arxiv_id":"2304.13731","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Text-to-audio generation using instruction- tuned LLM and latent diffusion model","venue":"arXiv (Cornell University)","work_id":"492d96c3-fca9-41b7-a64d-3e3313ff9da1","year":2023},"citing_paper":{"arxiv_id":"2509.06027","last_updated":"2026-04-27T10:03:51Z","snapshot_observed_at":"2026-08-12T13:13:57.375681Z","submitted_at":"2025-09-07T12:06:21Z","title":"DreamAudio: Customized Text-to-Audio Generation with Diffusion Models","version":3},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-05-18T18:26:51.583145Z"},"links":{"cited_paper":"/paper/2304.13731","citing_paper":"/paper/2509.06027"},"observation_digest":"sha256:3417f94fde79d4845d718035f28ab155e30bf254f263280973d8b1d3e78d43cf","observation_id":"eb26b8d8-ce1c-4a41-a413-4f98fe9b0774","resolution":{"observed_at":"2026-05-18T18:31:44.694499Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2304.13731","last_updated":"2023-05-29T12:09:08Z","snapshot_observed_at":"2026-08-13T11:57:06.524503Z","submitted_at":"2023-04-24T07:45:28Z","title":"Text-to-Audio Generation using Instruction-Tuned LLM and Latent Diffusion Model","version":2},"cited_work":{"arxiv_id":"2304.13731","doi":"10.48550/arxiv.2304.13731","metadata_source":"arxiv_reference","pith_arxiv_id":"2304.13731","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Text-to-audio generation using instruction- tuned LLM and latent diffusion model","venue":"arXiv (Cornell University)","work_id":"492d96c3-fca9-41b7-a64d-3e3313ff9da1","year":2023},"citing_paper":{"arxiv_id":"2509.23727","last_updated":"2026-04-09T14:19:05Z","snapshot_observed_at":"2026-08-13T22:24:46.691730Z","submitted_at":"2025-09-28T08:12:43Z","title":"AudioMoG: Guiding Audio Generation with Mixture-of-Guidance","version":2},"reference_index":10,"source":"arxiv_source","source_observed_at":"2026-05-18T13:10:18.700497Z"},"links":{"cited_paper":"/paper/2304.13731","citing_paper":"/paper/2509.23727"},"observation_digest":"sha256:8498af3e6c3ae19248dcaa35ad6a9ee2c6ad1a64cab191e6ae92a57a6006f332","observation_id":"8205c891-3462-4416-a8a8-d7edb75a6565","resolution":{"observed_at":"2026-05-18T13:11:23.841838Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2304.13731","last_updated":"2023-05-29T12:09:08Z","snapshot_observed_at":"2026-08-13T11:57:06.524503Z","submitted_at":"2023-04-24T07:45:28Z","title":"Text-to-Audio Generation using Instruction-Tuned LLM and Latent Diffusion Model","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2304.13731","snapshot_observed_at":"2026-08-04T11:29:31.996283Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2510.04593","last_updated":"2026-06-08T05:49:30Z","snapshot_observed_at":"2026-08-13T22:52:06.796347Z","submitted_at":"2025-10-06T08:47:38Z","title":"UniVoice: Unifying Autoregressive ASR and Flow-Matching based TTS with Large Language Models","version":3},"reference_index":22,"source":"arxiv_source","source_observed_at":"2026-08-04T11:29:31.996283Z"},"links":{"cited_paper":"/paper/2304.13731","citing_paper":"/paper/2510.04593"},"observation_digest":"sha256:ecac5f9fbfdd0abab5d54c2760e79022f498777c65e666f02807563fc1543e67","observation_id":"6dc1f721-c254-40e8-bbb1-550d02063719","resolution":{"observed_at":"2026-08-04T11:29:31.996283Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2304.13731","last_updated":"2023-05-29T12:09:08Z","snapshot_observed_at":"2026-08-13T11:57:06.524503Z","submitted_at":"2023-04-24T07:45:28Z","title":"Text-to-Audio Generation using Instruction-Tuned LLM and Latent Diffusion Model","version":2},"cited_work":{"arxiv_id":"2304.13731","doi":"10.48550/arxiv.2304.13731","metadata_source":"arxiv_reference","pith_arxiv_id":"2304.13731","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Text-to-audio generation using instruction- tuned LLM and latent diffusion model","venue":"arXiv (Cornell University)","work_id":"492d96c3-fca9-41b7-a64d-3e3313ff9da1","year":2023},"citing_paper":{"arxiv_id":"2601.02731","last_updated":"2026-04-29T02:44:11Z","snapshot_observed_at":"2026-08-11T16:06:15.387767Z","submitted_at":"2026-01-06T05:49:41Z","title":"Omni2Sound: Towards Unified Video-Text-to-Audio Generation","version":3},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-05-16T17:25:38.591071Z"},"links":{"cited_paper":"/paper/2304.13731","citing_paper":"/paper/2601.02731"},"observation_digest":"sha256:768c7d8b65457bda8891743794307503f02e8411057415097cb7cf92ee0244db","observation_id":"cbe1b4c2-5e26-453d-bb72-c04d068231c1","resolution":{"observed_at":"2026-05-16T17:28:10.035503Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2304.13731","last_updated":"2023-05-29T12:09:08Z","snapshot_observed_at":"2026-08-13T11:57:06.524503Z","submitted_at":"2023-04-24T07:45:28Z","title":"Text-to-Audio Generation using Instruction-Tuned LLM and Latent Diffusion Model","version":2},"cited_work":{"arxiv_id":"2304.13731","doi":"10.48550/arxiv.2304.13731","metadata_source":"arxiv_reference","pith_arxiv_id":"2304.13731","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Text-to-audio generation using instruction- tuned LLM and latent diffusion model","venue":"arXiv (Cornell University)","work_id":"492d96c3-fca9-41b7-a64d-3e3313ff9da1","year":2023},"citing_paper":{"arxiv_id":"2603.19857","last_updated":"2026-04-18T07:29:42Z","snapshot_observed_at":"2026-08-11T06:30:51.892484Z","submitted_at":"2026-03-20T11:19:29Z","title":"FoleyDirector: Fine-Grained Temporal Steering for Video-to-Audio Generation via Structured Scripts","version":2},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-05-15T07:35:14.257562Z"},"links":{"cited_paper":"/paper/2304.13731","citing_paper":"/paper/2603.19857"},"observation_digest":"sha256:ffd814443610982b7007bf2c8d1d7d7f5c48c6ae2f5d853fe428b189278b76e3","observation_id":"cc2f9143-e0da-45f8-90c0-5b8af801aee5","resolution":{"observed_at":"2026-05-15T07:39:50.497266Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2304.13731","last_updated":"2023-05-29T12:09:08Z","snapshot_observed_at":"2026-08-13T11:57:06.524503Z","submitted_at":"2023-04-24T07:45:28Z","title":"Text-to-Audio Generation using Instruction-Tuned LLM and Latent Diffusion Model","version":2},"cited_work":{"arxiv_id":"2304.13731","doi":"10.48550/arxiv.2304.13731","metadata_source":"arxiv_reference","pith_arxiv_id":"2304.13731","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Text-to-audio generation using instruction- tuned LLM and latent diffusion model","venue":"arXiv (Cornell University)","work_id":"492d96c3-fca9-41b7-a64d-3e3313ff9da1","year":2023},"citing_paper":{"arxiv_id":"2605.28063","last_updated":"2026-05-27T07:15:35Z","snapshot_observed_at":"2026-08-15T15:58:57.045936Z","submitted_at":"2026-05-27T07:15:35Z","title":"Unified Synthesis of Compositional Speech and Sound from Free-Form Text Prompts","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-06-29T10:28:18.202974Z"},"links":{"cited_paper":"/paper/2304.13731","citing_paper":"/paper/2605.28063"},"observation_digest":"sha256:99a79540e0978d1b530a635a89e42f902b4b018ca8ec7ee466f811f6cf6e4a2e","observation_id":"08905fd2-4446-4e2b-ac4a-c5d44b33ca3a","resolution":{"observed_at":"2026-06-29T10:33:17.943293Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2304.13731","last_updated":"2023-05-29T12:09:08Z","snapshot_observed_at":"2026-08-13T11:57:06.524503Z","submitted_at":"2023-04-24T07:45:28Z","title":"Text-to-Audio Generation using Instruction-Tuned LLM and Latent Diffusion Model","version":2},"cited_work":{"arxiv_id":"2304.13731","doi":"10.48550/arxiv.2304.13731","metadata_source":"arxiv_reference","pith_arxiv_id":"2304.13731","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Text-to-audio generation using instruction- tuned LLM and latent diffusion model","venue":"arXiv (Cornell University)","work_id":"492d96c3-fca9-41b7-a64d-3e3313ff9da1","year":2023},"citing_paper":{"arxiv_id":"2605.29202","last_updated":"2026-05-28T00:28:22Z","snapshot_observed_at":"2026-08-02T08:56:23.894748Z","submitted_at":"2026-05-28T00:28:22Z","title":"Auditing Training Data in Generative Music Models via Black-Box Membership Inference","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-06-29T08:45:23.523801Z"},"links":{"cited_paper":"/paper/2304.13731","citing_paper":"/paper/2605.29202"},"observation_digest":"sha256:a71ca041f4cd36ddaae8dbce18676b348f0a90cfe4cb925b3128de4a2ebe24ee","observation_id":"8b57c942-0463-4f7b-86f1-960219ace007","resolution":{"observed_at":"2026-06-29T08:53:16.272877Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2304.13731","last_updated":"2023-05-29T12:09:08Z","snapshot_observed_at":"2026-08-13T11:57:06.524503Z","submitted_at":"2023-04-24T07:45:28Z","title":"Text-to-Audio Generation using Instruction-Tuned LLM and Latent Diffusion Model","version":2},"cited_work":{"arxiv_id":"2304.13731","doi":"10.48550/arxiv.2304.13731","metadata_source":"arxiv_reference","pith_arxiv_id":"2304.13731","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Text-to-audio generation using instruction- tuned LLM and latent diffusion model","venue":"arXiv (Cornell University)","work_id":"492d96c3-fca9-41b7-a64d-3e3313ff9da1","year":2023},"citing_paper":{"arxiv_id":"2606.12555","last_updated":"2026-07-02T19:10:03Z","snapshot_observed_at":"2026-07-12T14:16:32.755376Z","submitted_at":"2026-06-10T18:06:27Z","title":"AudioX-Turbo: A Unified Framework for Efficient Anything-to-Audio Generation","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-06-27T08:04:48.283908Z"},"links":{"cited_paper":"/paper/2304.13731","citing_paper":"/paper/2606.12555"},"observation_digest":"sha256:6030eb443a01142f43f5123ffdbffaf138db523323cf3e25775b4535d3d37510","observation_id":"3fc835a8-7169-4cb2-8a84-a653542dc1b0","resolution":{"observed_at":"2026-07-03T13:28:18.725940Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2304.13731","last_updated":"2023-05-29T12:09:08Z","snapshot_observed_at":"2026-08-13T11:57:06.524503Z","submitted_at":"2023-04-24T07:45:28Z","title":"Text-to-Audio Generation using Instruction-Tuned LLM and Latent Diffusion Model","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2304.13731","snapshot_observed_at":"2026-08-02T05:19:57.089048Z","title":"Text-to- audio generation using instruction tuned llm and latent diffusion model,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.13408","last_updated":"2026-07-26T03:09:03Z","snapshot_observed_at":"2026-08-14T13:27:55.861429Z","submitted_at":"2026-07-15T03:13:06Z","title":"Improving Text-to-Audio Instruction Following via Fine-Grained Feedback from Audio-Aware Large Language Models","version":2},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-02T05:19:57.089048Z"},"links":{"cited_paper":"/paper/2304.13731","citing_paper":"/paper/2607.13408"},"observation_digest":"sha256:1720a52717afd26b1f44d7023586bb3dbc00bb00ef99f0db29c13d9d5491c059","observation_id":"cd8dac01-cc08-4c03-b8de-40e5cddd78c1","resolution":{"observed_at":"2026-08-02T05:19:57.089048Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2304.13731","last_updated":"2023-05-29T12:09:08Z","snapshot_observed_at":"2026-08-13T11:57:06.524503Z","submitted_at":"2023-04-24T07:45:28Z","title":"Text-to-Audio Generation using Instruction-Tuned LLM and Latent Diffusion Model","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2304.13731","snapshot_observed_at":"2026-08-01T17:47:15.593693Z","title":"Text-to-audio generation using instruction-tuned LLM and latent diffusion model,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.17526","last_updated":"2026-07-20T04:00:16Z","snapshot_observed_at":"2026-08-05T11:29:26.582848Z","submitted_at":"2026-07-20T04:00:16Z","title":"FlowSonic: Stable Zero-Shot Music Editing via High-Order Trajectory Integration","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-01T17:47:15.593693Z"},"links":{"cited_paper":"/paper/2304.13731","citing_paper":"/paper/2607.17526"},"observation_digest":"sha256:0ba0d21c59cca15f89efc201981f1c26d9b2ad9adf745d2480cbfbd456449e54","observation_id":"a07c5b1f-b16c-444f-af20-39dc2fe7e313","resolution":{"observed_at":"2026-08-01T17:47:15.593693Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2304.13731","last_updated":"2023-05-29T12:09:08Z","snapshot_observed_at":"2026-08-13T11:57:06.524503Z","submitted_at":"2023-04-24T07:45:28Z","title":"Text-to-Audio Generation using Instruction-Tuned LLM and Latent Diffusion Model","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2304.13731","snapshot_observed_at":"2026-08-08T17:54:22.896826Z","title":"Ho, J.; Jain, A.; and Abbeel, P","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.05222","last_updated":"2026-08-05T11:03:33Z","snapshot_observed_at":"2026-08-13T13:23:56.376856Z","submitted_at":"2026-08-05T11:03:33Z","title":"Diff-Symbo: Text-Controlled Long-Duration Symbolic Music Generation Using Autoregressive Latent Diffusion Model","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-08T17:54:22.896826Z"},"links":{"cited_paper":"/paper/2304.13731","citing_paper":"/paper/2608.05222"},"observation_digest":"sha256:f53675599a7a04a83c236310e29dbf293dbaa1c1a9493e41330ddd1f4fa27372","observation_id":"105e8c7f-b948-40ec-9d5a-68954b12baaa","resolution":{"observed_at":"2026-08-08T17:54:22.896826Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2304.13731","last_updated":"2023-05-29T12:09:08Z","snapshot_observed_at":"2026-08-13T11:57:06.524503Z","submitted_at":"2023-04-24T07:45:28Z","title":"Text-to-Audio Generation using Instruction-Tuned LLM and Latent Diffusion Model","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2304.13731","snapshot_observed_at":"2026-08-15T19:59:28.108913Z","title":"Text-to-audio generation using instruction tuned llm and latent diffusion model,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2608.12951","last_updated":"2026-08-13T08:27:22Z","snapshot_observed_at":"2026-08-15T20:17:37.751843Z","submitted_at":"2026-08-13T08:27:22Z","title":"VoxAudio: Vocalized Audio Synthesis via Multi-Reward Autoregressive Flow Matching","version":1},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-15T19:59:28.108913Z"},"links":{"cited_paper":"/paper/2304.13731","citing_paper":"/paper/2608.12951"},"observation_digest":"sha256:1e06f8afa89cbe99e3d7cb8017a2a246bb51facb16d497f1c354f8010a4e157d","observation_id":"1ce6a461-38e5-4e33-923e-615220c5ba34","resolution":{"observed_at":"2026-08-15T19:59:28.108913Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2304.13731/citation-record","integrity":"/paper/2304.13731/integrity","json":"/paper/2304.13731/citation-record.json","paper":"/paper/2304.13731"},"outbound":[],"paper":{"arxiv_id":"2304.13731","last_updated":"2023-05-29T12:09:08Z","latest_version":2,"primary_category":"eess.AS","snapshot_observed_at":"2026-08-13T11:57:06.524503Z","submitted_at":"2023-04-24T07:45:28Z","title":"Text-to-Audio Generation using Instruction-Tuned LLM and Latent Diffusion Model"},"reference_resolution":{"displayed":0,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":0,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":0},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"thesis":"As of 15 August 2026, this Paper Citation Record lists 0 of 0 outbound references and 33 inbound Pith citation observations for arXiv:2304.13731."}