{"as_of":"2026-08-09T05:15:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:151ed636b0bbdfa997b53c83f4ba6f7699d8243fd8dc9f3a28f87cf149d2ff5c","coverage":[{"denominator":0,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":69,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":69,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-08T06:32:00.761636+00:00","state":"measured"},{"denominator":69,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":69,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-08T21:50:24.528386Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-07-04T11:59:50.469153Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2301.12503","last_updated":"2023-09-09T15:27:58Z","snapshot_observed_at":"2026-08-06T16:43:15.954030Z","submitted_at":"2023-01-29T17:48:17Z","title":"AudioLDM: Text-to-Audio Generation with Latent Diffusion Models","version":3},"cited_work":{"arxiv_id":"2301.12503","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2301.12503","snapshot_observed_at":"2026-07-04T11:59:50.469153Z","title":"Audioldm: Text-to-audio generation with latent diffusion models","venue":null,"work_id":"b44ebce5-47f1-4f14-b13b-b5b4eb072d2c","year":2023},"citing_paper":{"arxiv_id":"2411.12363","last_updated":"2026-04-20T02:56:02Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-11-19T09:23:22Z","title":"DGSNA: Dynamic Generative Scene-based Noise Addition method","version":6},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-05-23T17:43:47.086524Z"},"links":{"cited_paper":"/paper/2301.12503","citing_paper":"/paper/2411.12363"},"observation_digest":"sha256:240d11a9ca50ac7a65afd2440bd0d67de3155d52a7e90ef22cff38fea9002157","observation_id":"4244a785-d3d1-4482-8f44-0db941ed88c7","resolution":{"observed_at":"2026-05-23T17:45:46.270816Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2301.12503","last_updated":"2023-09-09T15:27:58Z","snapshot_observed_at":"2026-08-06T16:43:15.954030Z","submitted_at":"2023-01-29T17:48:17Z","title":"AudioLDM: Text-to-Audio Generation with Latent Diffusion Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2301.12503","snapshot_observed_at":"2026-08-08T21:50:24.528386Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2502.04725","last_updated":"2025-02-07T07:49:37Z","snapshot_observed_at":"2026-08-08T21:40:08.779592Z","submitted_at":"2025-02-07T07:49:37Z","title":"Can Diffusion Models Learn Hidden Inter-Feature Rules Behind Images?","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-08T21:50:24.528386Z"},"links":{"cited_paper":"/paper/2301.12503","citing_paper":"/paper/2502.04725"},"observation_digest":"sha256:e09eb7bad58497d43231348e653f0784cdf05ab35944ed2e5ea68e14b5de07b7","observation_id":"a2b08fd3-bbf8-47ee-9e82-1e6a31f7c351","resolution":{"observed_at":"2026-08-08T21:50:24.528386Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2301.12503","last_updated":"2023-09-09T15:27:58Z","snapshot_observed_at":"2026-08-06T16:43:15.954030Z","submitted_at":"2023-01-29T17:48:17Z","title":"AudioLDM: Text-to-Audio Generation with Latent Diffusion Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2301.12503","snapshot_observed_at":"2026-08-08T20:12:29.512372Z","title":"Audi- oldm: Text-to-audio generation with latent diffusion models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2502.05130","last_updated":"2025-07-29T07:31:59Z","snapshot_observed_at":"2026-08-09T05:08:43.033940Z","submitted_at":"2025-02-07T18:02:47Z","title":"Latent Swap Joint Diffusion for 2D Long-Form Latent Generation","version":3},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-08T20:12:29.512372Z"},"links":{"cited_paper":"/paper/2301.12503","citing_paper":"/paper/2502.05130"},"observation_digest":"sha256:59bdf4fe3ad8881265a96327b54c6b076242c83dfbd9e37ebe7294feeb5477e1","observation_id":"cb6f92ae-e297-4f0e-b7bb-17fd5d576c9e","resolution":{"observed_at":"2026-08-08T20:12:29.512372Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2301.12503","last_updated":"2023-09-09T15:27:58Z","snapshot_observed_at":"2026-08-06T16:43:15.954030Z","submitted_at":"2023-01-29T17:48:17Z","title":"AudioLDM: Text-to-Audio Generation with Latent Diffusion Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2301.12503","snapshot_observed_at":"2026-08-08T14:26:46.757326Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2502.06782","last_updated":"2025-02-12T10:07:07Z","snapshot_observed_at":"2026-08-08T14:18:27.556352Z","submitted_at":"2025-02-10T18:58:11Z","title":"Lumina-Video: Efficient and Flexible Video Generation with Multi-scale Next-DiT","version":2},"reference_index":48,"source":"arxiv_source","source_observed_at":"2026-08-08T14:26:46.757326Z"},"links":{"cited_paper":"/paper/2301.12503","citing_paper":"/paper/2502.06782"},"observation_digest":"sha256:aabb08cedc70ddbf5329fa65856f0ca0b9b02f7b8a5dc0ac4cd1a1e9271777bd","observation_id":"2f0e8708-68cd-4cad-9cde-f14bd224c3b7","resolution":{"observed_at":"2026-08-08T14:26:46.757326Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2301.12503","last_updated":"2023-09-09T15:27:58Z","snapshot_observed_at":"2026-08-06T16:43:15.954030Z","submitted_at":"2023-01-29T17:48:17Z","title":"AudioLDM: Text-to-Audio Generation with Latent Diffusion Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2301.12503","snapshot_observed_at":"2026-08-07T15:09:57.138047Z","title":"Audioldm: Text-to-audio generation with latent diffusion models,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.16195","last_updated":"2025-07-17T19:01:00Z","snapshot_observed_at":"2026-08-07T16:55:17.995778Z","submitted_at":"2025-05-22T03:58:16Z","title":"SpecMaskFoley: Steering Pretrained Spectral Masked Generative Transformer Toward Synchronized Video-to-audio Synthesis via ControlNet","version":2},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-07T15:09:57.138047Z"},"links":{"cited_paper":"/paper/2301.12503","citing_paper":"/paper/2505.16195"},"observation_digest":"sha256:c25ddf8f114fae8b16ba5b7ed6857a3f914d1fb3f62c0f34071570269546eb67","observation_id":"ead1e612-6841-4a2b-817b-ab9faebc6d7d","resolution":{"observed_at":"2026-08-07T15:09:57.138047Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2301.12503","last_updated":"2023-09-09T15:27:58Z","snapshot_observed_at":"2026-08-06T16:43:15.954030Z","submitted_at":"2023-01-29T17:48:17Z","title":"AudioLDM: Text-to-Audio Generation with Latent Diffusion Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2301.12503","snapshot_observed_at":"2026-08-07T13:21:55.918085Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.22053","last_updated":"2025-08-05T07:47:10Z","snapshot_observed_at":"2026-08-09T00:00:10.885056Z","submitted_at":"2025-05-28T07:23:53Z","title":"AudioGenie: A Training-Free Multi-Agent Framework for Diverse Multimodality-to-Multiaudio Generation","version":2},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-07T13:21:55.918085Z"},"links":{"cited_paper":"/paper/2301.12503","citing_paper":"/paper/2505.22053"},"observation_digest":"sha256:052ea9e67d6fb82b2eed45040dd994596918a65aaa194c8742eea027b306ce89","observation_id":"9d153604-3a49-4782-899a-23fbe1ff70e2","resolution":{"observed_at":"2026-08-07T13:21:55.918085Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2301.12503","last_updated":"2023-09-09T15:27:58Z","snapshot_observed_at":"2026-08-06T16:43:15.954030Z","submitted_at":"2023-01-29T17:48:17Z","title":"AudioLDM: Text-to-Audio Generation with Latent Diffusion Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2301.12503","snapshot_observed_at":"2026-08-07T11:59:48.144450Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.00927","last_updated":"2025-06-01T09:41:56Z","snapshot_observed_at":"2026-08-08T23:02:00.996998Z","submitted_at":"2025-06-01T09:41:56Z","title":"In-the-wild Audio Spatialization with Flexible Text-guided Localization","version":1},"reference_index":25,"source":"arxiv_source","source_observed_at":"2026-08-07T11:59:48.144450Z"},"links":{"cited_paper":"/paper/2301.12503","citing_paper":"/paper/2506.00927"},"observation_digest":"sha256:155ae7791c8935f03ee9aa4c3b35ebaa4fcc76d5fd3518f34b6a45423241fe4c","observation_id":"5cd6f166-9bb0-45a3-93d8-cf787e908f48","resolution":{"observed_at":"2026-08-07T11:59:48.144450Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2301.12503","last_updated":"2023-09-09T15:27:58Z","snapshot_observed_at":"2026-08-06T16:43:15.954030Z","submitted_at":"2023-01-29T17:48:17Z","title":"AudioLDM: Text-to-Audio Generation with Latent Diffusion Models","version":3},"cited_work":{"arxiv_id":"2301.12503","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2301.12503","snapshot_observed_at":"2026-07-04T11:59:50.469153Z","title":"Audioldm: Text-to-audio generation with latent diffusion models","venue":null,"work_id":"b44ebce5-47f1-4f14-b13b-b5b4eb072d2c","year":2023},"citing_paper":{"arxiv_id":"2506.03530","last_updated":"2026-05-22T06:55:17Z","snapshot_observed_at":"2026-08-01T13:49:24.957131Z","submitted_at":"2025-06-04T03:22:44Z","title":"How Far Are We from Generating Missing Modalities with Foundation Models?","version":3},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-05-25T08:15:12.947854Z"},"links":{"cited_paper":"/paper/2301.12503","citing_paper":"/paper/2506.03530"},"observation_digest":"sha256:8d32852ab0ed2f33c26997c0147c050315a6ea931ee987ac756d306d2249cd67","observation_id":"833355d6-6bc7-45e7-b768-abac05b45178","resolution":{"observed_at":"2026-05-25T08:15:33.620840Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2301.12503","last_updated":"2023-09-09T15:27:58Z","snapshot_observed_at":"2026-08-06T16:43:15.954030Z","submitted_at":"2023-01-29T17:48:17Z","title":"AudioLDM: Text-to-Audio Generation with Latent Diffusion Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2301.12503","snapshot_observed_at":"2026-08-07T10:16:54.194385Z","title":"Audioldm: Text-to-audio generation with latent diffusion models,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.05899","last_updated":"2025-06-06T09:12:51Z","snapshot_observed_at":"2026-08-07T10:10:58.136271Z","submitted_at":"2025-06-06T09:12:51Z","title":"WhisQ: Cross-Modal Representation Learning for Text-to-Music MOS Prediction","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-07T10:16:54.194385Z"},"links":{"cited_paper":"/paper/2301.12503","citing_paper":"/paper/2506.05899"},"observation_digest":"sha256:35e9d33411c5141db2b3d305152236e4d3532a5da5262944d92ab70002bc501f","observation_id":"ad315d80-4b72-4627-83d5-86978052c1e7","resolution":{"observed_at":"2026-08-07T10:16:54.194385Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2301.12503","last_updated":"2023-09-09T15:27:58Z","snapshot_observed_at":"2026-08-06T16:43:15.954030Z","submitted_at":"2023-01-29T17:48:17Z","title":"AudioLDM: Text-to-Audio Generation with Latent Diffusion Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2301.12503","snapshot_observed_at":"2026-08-07T04:45:18.973851Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.09874","last_updated":"2025-07-10T19:47:47Z","snapshot_observed_at":"2026-08-07T16:56:30.600491Z","submitted_at":"2025-06-11T15:43:08Z","title":"UmbraTTS: Adapting Text-to-Speech to Environmental Contexts with Flow Matching","version":2},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-07T04:45:18.973851Z"},"links":{"cited_paper":"/paper/2301.12503","citing_paper":"/paper/2506.09874"},"observation_digest":"sha256:9a06e81066cc0f562929a49a768b3fa0932e204bb3db028fd7ed142430bd2921","observation_id":"87fd9334-847c-4c91-abcb-77ad8bf938a9","resolution":{"observed_at":"2026-08-07T04:45:18.973851Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2301.12503","last_updated":"2023-09-09T15:27:58Z","snapshot_observed_at":"2026-08-06T16:43:15.954030Z","submitted_at":"2023-01-29T17:48:17Z","title":"AudioLDM: Text-to-Audio Generation with Latent Diffusion Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2301.12503","snapshot_observed_at":"2026-08-06T23:58:34.577052Z","title":"Audioldm: Text-to-audio genera- tion with latent diffusion models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.15530","last_updated":"2025-06-18T15:01:25Z","snapshot_observed_at":"2026-08-08T08:30:17.628486Z","submitted_at":"2025-06-18T15:01:25Z","title":"Diff-TONE: Timestep Optimization for iNstrument Editing in Text-to-Music Diffusion Models","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-06T23:58:34.577052Z"},"links":{"cited_paper":"/paper/2301.12503","citing_paper":"/paper/2506.15530"},"observation_digest":"sha256:d2edb3bce0a56141ec782f050897f1f8083a29450fff36082af991cd2dda80f7","observation_id":"401ae98b-4024-41b3-ad2e-c5b3acd1d977","resolution":{"observed_at":"2026-08-06T23:58:34.577052Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2301.12503","last_updated":"2023-09-09T15:27:58Z","snapshot_observed_at":"2026-08-06T16:43:15.954030Z","submitted_at":"2023-01-29T17:48:17Z","title":"AudioLDM: Text-to-Audio Generation with Latent Diffusion Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2301.12503","snapshot_observed_at":"2026-08-06T19:39:54.589254Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.04959","last_updated":"2025-07-13T09:31:19Z","snapshot_observed_at":"2026-08-07T10:47:44.341783Z","submitted_at":"2025-07-07T13:01:50Z","title":"Hear-Your-Click: Interactive Object-Specific Video-to-Audio Generation","version":2},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-06T19:39:54.589254Z"},"links":{"cited_paper":"/paper/2301.12503","citing_paper":"/paper/2507.04959"},"observation_digest":"sha256:2094dd1db4ab3edb6a52ed7f56b0a34ee25c67c99faa8e0d77743cf2fb454381","observation_id":"3384e3c5-011a-4867-b15e-0451f2ba050a","resolution":{"observed_at":"2026-08-06T19:39:54.589254Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2301.12503","last_updated":"2023-09-09T15:27:58Z","snapshot_observed_at":"2026-08-06T16:43:15.954030Z","submitted_at":"2023-01-29T17:48:17Z","title":"AudioLDM: Text-to-Audio Generation with Latent Diffusion Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2301.12503","snapshot_observed_at":"2026-08-06T19:26:42.399897Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.05624","last_updated":"2026-07-02T13:55:00Z","snapshot_observed_at":"2026-08-06T19:19:17.831766Z","submitted_at":"2025-07-08T03:08:52Z","title":"ADMC: Attention-based Diffusion Model for Missing Modalities Feature Completion","version":2},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-06T19:26:42.399897Z"},"links":{"cited_paper":"/paper/2301.12503","citing_paper":"/paper/2507.05624"},"observation_digest":"sha256:31274dd398f2637c117ed331da451cfba5890fccccecc3902a5677f91fe2c19d","observation_id":"8afa710d-257f-449e-a116-60b3e028de26","resolution":{"observed_at":"2026-08-06T19:26:42.399897Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2301.12503","last_updated":"2023-09-09T15:27:58Z","snapshot_observed_at":"2026-08-06T16:43:15.954030Z","submitted_at":"2023-01-29T17:48:17Z","title":"AudioLDM: Text-to-Audio Generation with Latent Diffusion Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2301.12503","snapshot_observed_at":"2026-08-06T15:58:50.494374Z","title":"Audioldm: Text-to-audio generation with latent diffusion models,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.14507","last_updated":"2025-08-31T10:48:07Z","snapshot_observed_at":"2026-08-08T14:34:28.295992Z","submitted_at":"2025-07-19T07:04:04Z","title":"Diffusion Models for Time Series Forecasting: A Survey","version":2},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-08-06T15:58:50.494374Z"},"links":{"cited_paper":"/paper/2301.12503","citing_paper":"/paper/2507.14507"},"observation_digest":"sha256:b6241d017aba3bab7dea3ebf480eccc7998665023914d30862c3d643b16a887a","observation_id":"c1a90ca5-8730-466f-96ed-44324b7d35cd","resolution":{"observed_at":"2026-08-06T15:58:50.494374Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2301.12503","last_updated":"2023-09-09T15:27:58Z","snapshot_observed_at":"2026-08-06T16:43:15.954030Z","submitted_at":"2023-01-29T17:48:17Z","title":"AudioLDM: Text-to-Audio Generation with Latent Diffusion Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2301.12503","snapshot_observed_at":"2026-08-06T15:47:02.687551Z","title":"Audi- oldm: Text-to-audio generation with latent diffusion models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.15260","last_updated":"2025-07-21T05:48:47Z","snapshot_observed_at":"2026-08-07T19:48:15.771269Z","submitted_at":"2025-07-21T05:48:47Z","title":"CHORDS: Diffusion Sampling Accelerator with Multi-core Hierarchical ODE Solvers","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-06T15:47:02.687551Z"},"links":{"cited_paper":"/paper/2301.12503","citing_paper":"/paper/2507.15260"},"observation_digest":"sha256:95d8e43675989e523bda196b6d3e099b9e5413c3d347a0fec99a6a4b5ad36046","observation_id":"9139e409-ca8c-43d2-9ce7-0a57256d1a80","resolution":{"observed_at":"2026-08-06T15:47:02.687551Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2301.12503","last_updated":"2023-09-09T15:27:58Z","snapshot_observed_at":"2026-08-06T16:43:15.954030Z","submitted_at":"2023-01-29T17:48:17Z","title":"AudioLDM: Text-to-Audio Generation with Latent Diffusion Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2301.12503","snapshot_observed_at":"2026-08-06T14:04:00.776212Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.19835","last_updated":"2025-07-26T07:12:02Z","snapshot_observed_at":"2026-08-07T16:55:18.620169Z","submitted_at":"2025-07-26T07:12:02Z","title":"SonicGauss: Position-Aware Physical Sound Synthesis for 3D Gaussian Representations","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-06T14:04:00.776212Z"},"links":{"cited_paper":"/paper/2301.12503","citing_paper":"/paper/2507.19835"},"observation_digest":"sha256:ad1a227dfce5893c3751757fbab8455a365ce73f6e50f99dff00079c1e2d7cfe","observation_id":"035f79e7-9d79-4d62-83f6-e690c2962950","resolution":{"observed_at":"2026-08-06T14:04:00.776212Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2301.12503","last_updated":"2023-09-09T15:27:58Z","snapshot_observed_at":"2026-08-06T16:43:15.954030Z","submitted_at":"2023-01-29T17:48:17Z","title":"AudioLDM: Text-to-Audio Generation with Latent Diffusion Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2301.12503","snapshot_observed_at":"2026-08-06T13:07:09.495265Z","title":"Plumbley","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.21053","last_updated":"2025-08-01T13:04:28Z","snapshot_observed_at":"2026-08-07T22:31:18.221722Z","submitted_at":"2025-07-28T17:59:57Z","title":"Flow Matching Policy Gradients","version":2},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-06T13:07:09.495265Z"},"links":{"cited_paper":"/paper/2301.12503","citing_paper":"/paper/2507.21053"},"observation_digest":"sha256:e0082c7011eff5a981061f005ccb3ceadd91053dcd655c3c808358b08302d337","observation_id":"511d80a0-aa90-46af-93dc-954e0950af30","resolution":{"observed_at":"2026-08-06T13:07:09.495265Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2301.12503","last_updated":"2023-09-09T15:27:58Z","snapshot_observed_at":"2026-08-06T16:43:15.954030Z","submitted_at":"2023-01-29T17:48:17Z","title":"AudioLDM: Text-to-Audio Generation with Latent Diffusion Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2301.12503","snapshot_observed_at":"2026-08-06T12:19:01.944976Z","title":"Audioldm: Text-to- audio generation with latent diffusion models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.21893","last_updated":"2025-08-05T14:01:48Z","snapshot_observed_at":"2026-08-09T04:35:34.268198Z","submitted_at":"2025-07-29T15:01:31Z","title":"Aether Weaver: Multimodal Affective Narrative Co-Generation with Dynamic Scene Graphs","version":2},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-06T12:19:01.944976Z"},"links":{"cited_paper":"/paper/2301.12503","citing_paper":"/paper/2507.21893"},"observation_digest":"sha256:957b2d3477e91d39d301854501c435337ce3ba1263106917d6012a3122171caa","observation_id":"d212bfcf-8c24-4765-b564-a318947e4b00","resolution":{"observed_at":"2026-08-06T12:19:01.944976Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2301.12503","last_updated":"2023-09-09T15:27:58Z","snapshot_observed_at":"2026-08-06T16:43:15.954030Z","submitted_at":"2023-01-29T17:48:17Z","title":"AudioLDM: Text-to-Audio Generation with Latent Diffusion Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2301.12503","snapshot_observed_at":"2026-08-06T11:14:46.151866Z","title":"Audioldm: Text-to-audio generation with latent diffusion models,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.22995","last_updated":"2025-07-30T18:00:09Z","snapshot_observed_at":"2026-08-07T05:00:27.384082Z","submitted_at":"2025-07-30T18:00:09Z","title":"Balancing Information Preservation and Disentanglement in Self-Supervised Music Representation Learning","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-06T11:14:46.151866Z"},"links":{"cited_paper":"/paper/2301.12503","citing_paper":"/paper/2507.22995"},"observation_digest":"sha256:7c00a1d8138f2e8441b926cb94137985a78dd7a61f2b2eec4fa460322b419397","observation_id":"eae0bf53-89bc-4d9b-adb5-4745a5dce62d","resolution":{"observed_at":"2026-08-06T11:14:46.151866Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2301.12503","last_updated":"2023-09-09T15:27:58Z","snapshot_observed_at":"2026-08-06T16:43:15.954030Z","submitted_at":"2023-01-29T17:48:17Z","title":"AudioLDM: Text-to-Audio Generation with Latent Diffusion Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2301.12503","snapshot_observed_at":"2026-08-06T06:04:29.913997Z","title":"Audioldm: Text-to-audio generation with latent diffusion models","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2508.00733","last_updated":"2025-08-07T04:31:04Z","snapshot_observed_at":"2026-08-06T20:34:36.422314Z","submitted_at":"2025-08-01T16:03:57Z","title":"AudioGen-Omni: A Unified Multimodal Diffusion Transformer for Video-Synchronized Audio, Speech, and Song Generation","version":4},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-06T06:04:29.913997Z"},"links":{"cited_paper":"/paper/2301.12503","citing_paper":"/paper/2508.00733"},"observation_digest":"sha256:f99f9838561d34f4dea01b2525977224e0283509cc7a7b8c0380fd496955f089","observation_id":"1d75771a-4415-4798-b175-2d463d71af6d","resolution":{"observed_at":"2026-08-06T06:04:29.913997Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2301.12503","last_updated":"2023-09-09T15:27:58Z","snapshot_observed_at":"2026-08-06T16:43:15.954030Z","submitted_at":"2023-01-29T17:48:17Z","title":"AudioLDM: Text-to-Audio Generation with Latent Diffusion Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2301.12503","snapshot_observed_at":"2026-08-06T05:40:56.915651Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2508.01394","last_updated":"2025-08-02T14:58:34Z","snapshot_observed_at":"2026-08-08T20:33:04.043154Z","submitted_at":"2025-08-02T14:58:34Z","title":"Via Score to Performance: Efficient Human-Controllable Long Song Generation with Bar-Level Symbolic Notation","version":1},"reference_index":22,"source":"arxiv_source","source_observed_at":"2026-08-06T05:40:56.915651Z"},"links":{"cited_paper":"/paper/2301.12503","citing_paper":"/paper/2508.01394"},"observation_digest":"sha256:d7d349b48d03f907eb467aa268b84d022a59b34fe3003b077e3881c378cb13d7","observation_id":"64148a22-c14a-43ff-a71a-acb113314683","resolution":{"observed_at":"2026-08-06T05:40:56.915651Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2301.12503","last_updated":"2023-09-09T15:27:58Z","snapshot_observed_at":"2026-08-06T16:43:15.954030Z","submitted_at":"2023-01-29T17:48:17Z","title":"AudioLDM: Text-to-Audio Generation with Latent Diffusion Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2301.12503","snapshot_observed_at":"2026-08-06T05:05:27.134039Z","title":"Audioldm: Text-to-audio generation with latent diffusion models.arXiv preprint arXiv:2301.12503, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2508.02391","last_updated":"2025-08-04T13:17:49Z","snapshot_observed_at":"2026-08-08T02:50:04.116531Z","submitted_at":"2025-08-04T13:17:49Z","title":"Inference-time Scaling for Diffusion-based Audio Super-resolution","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-06T05:05:27.134039Z"},"links":{"cited_paper":"/paper/2301.12503","citing_paper":"/paper/2508.02391"},"observation_digest":"sha256:4fddb1074d2b7ddc22b59a375ca1aec2d8d2a43ead6b921983017c781c169060","observation_id":"e0fee5c5-370f-447c-94d1-65406a061189","resolution":{"observed_at":"2026-08-06T05:05:27.134039Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2301.12503","last_updated":"2023-09-09T15:27:58Z","snapshot_observed_at":"2026-08-06T16:43:15.954030Z","submitted_at":"2023-01-29T17:48:17Z","title":"AudioLDM: Text-to-Audio Generation with Latent Diffusion Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2301.12503","snapshot_observed_at":"2026-08-05T22:54:55.090118Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2508.10924","last_updated":"2025-08-20T08:48:57Z","snapshot_observed_at":"2026-08-08T05:49:19.993515Z","submitted_at":"2025-08-08T09:03:13Z","title":"ASAudio: A Survey of Advanced Spatial Audio Research","version":2},"reference_index":98,"source":"arxiv_source","source_observed_at":"2026-08-05T22:54:55.090118Z"},"links":{"cited_paper":"/paper/2301.12503","citing_paper":"/paper/2508.10924"},"observation_digest":"sha256:f167fe635b0dc15a235fe54e48348ff937150e7077f78c3f7e26add957e0f1dc","observation_id":"986d2272-7240-4034-913a-4c095f3bd0ca","resolution":{"observed_at":"2026-08-05T22:54:55.090118Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2301.12503","last_updated":"2023-09-09T15:27:58Z","snapshot_observed_at":"2026-08-06T16:43:15.954030Z","submitted_at":"2023-01-29T17:48:17Z","title":"AudioLDM: Text-to-Audio Generation with Latent Diffusion Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2301.12503","snapshot_observed_at":"2026-08-05T17:45:10.648281Z","title":"Audioldm: Text-to-audio generation with latent diffusion models.arXiv preprint arXiv:2301.12503 , 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2508.16306","last_updated":"2025-08-22T11:29:06Z","snapshot_observed_at":"2026-08-07T04:54:54.775407Z","submitted_at":"2025-08-22T11:29:06Z","title":"A Sharp KL-Convergence Analysis for Diffusion Models under Minimal Assumptions","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-05T17:45:10.648281Z"},"links":{"cited_paper":"/paper/2301.12503","citing_paper":"/paper/2508.16306"},"observation_digest":"sha256:43801ede7a0b742bf82f1ce21381ca33106d19181118148b77bd8f4055eb6cc2","observation_id":"b40285ca-fcc7-4c76-86fb-d4cc7f16590e","resolution":{"observed_at":"2026-08-05T17:45:10.648281Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2301.12503","last_updated":"2023-09-09T15:27:58Z","snapshot_observed_at":"2026-08-06T16:43:15.954030Z","submitted_at":"2023-01-29T17:48:17Z","title":"AudioLDM: Text-to-Audio Generation with Latent Diffusion Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2301.12503","snapshot_observed_at":"2026-08-05T15:10:31.753877Z","title":"Audioldm: Text-to-audio generation with latent diffusion models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2508.20379","last_updated":"2025-08-28T03:00:30Z","snapshot_observed_at":"2026-08-08T13:26:19.436875Z","submitted_at":"2025-08-28T03:00:30Z","title":"Audio-Guided Visual Editing with Complex Multi-Modal Prompts","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-05T15:10:31.753877Z"},"links":{"cited_paper":"/paper/2301.12503","citing_paper":"/paper/2508.20379"},"observation_digest":"sha256:2b273ca11d0813ce217817fd58101b2a24f17fd2f9fd179bdc2ff58808cbf848","observation_id":"b0ef9092-7b6a-45a5-a957-900a8070585c","resolution":{"observed_at":"2026-08-05T15:10:31.753877Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2301.12503","last_updated":"2023-09-09T15:27:58Z","snapshot_observed_at":"2026-08-06T16:43:15.954030Z","submitted_at":"2023-01-29T17:48:17Z","title":"AudioLDM: Text-to-Audio Generation with Latent Diffusion Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2301.12503","snapshot_observed_at":"2026-08-05T14:36:37.617270Z","title":"AudioLDM: Text-to-Audio Generation with Latent Diffusion Models,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2508.21153","last_updated":"2025-08-28T18:38:42Z","snapshot_observed_at":"2026-08-07T14:49:09.772290Z","submitted_at":"2025-08-28T18:38:42Z","title":"WaveLLDM: Design and Development of a Lightweight Latent Diffusion Model for Speech Enhancement and Restoration","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-05T14:36:37.617270Z"},"links":{"cited_paper":"/paper/2301.12503","citing_paper":"/paper/2508.21153"},"observation_digest":"sha256:8d53de6f34288dcc3d0c85dc33b1c7cd313813e5e1e8ca28a65977a4904ab79a","observation_id":"01204637-e03e-46bd-86aa-ef69bf55b79c","resolution":{"observed_at":"2026-08-05T14:36:37.617270Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2301.12503","last_updated":"2023-09-09T15:27:58Z","snapshot_observed_at":"2026-08-06T16:43:15.954030Z","submitted_at":"2023-01-29T17:48:17Z","title":"AudioLDM: Text-to-Audio Generation with Latent Diffusion Models","version":3},"cited_work":{"arxiv_id":"2301.12503","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2301.12503","snapshot_observed_at":"2026-07-04T11:59:50.469153Z","title":"Audioldm: Text-to-audio generation with latent diffusion models","venue":null,"work_id":"b44ebce5-47f1-4f14-b13b-b5b4eb072d2c","year":2023},"citing_paper":{"arxiv_id":"2509.23727","last_updated":"2026-04-09T14:19:05Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-09-28T08:12:43Z","title":"AudioMoG: Guiding Audio Generation with Mixture-of-Guidance","version":2},"reference_index":48,"source":"arxiv_source","source_observed_at":"2026-05-18T13:10:18.700497Z"},"links":{"cited_paper":"/paper/2301.12503","citing_paper":"/paper/2509.23727"},"observation_digest":"sha256:1e5c376215e8aece45a42bc641abdb3def8c725fde7552554f390ecb3099fb19","observation_id":"29112a42-28a7-48ca-a089-aee4158f9105","resolution":{"observed_at":"2026-05-18T13:11:23.790250Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2301.12503","last_updated":"2023-09-09T15:27:58Z","snapshot_observed_at":"2026-08-06T16:43:15.954030Z","submitted_at":"2023-01-29T17:48:17Z","title":"AudioLDM: Text-to-Audio Generation with Latent Diffusion Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2301.12503","snapshot_observed_at":"2026-08-04T12:38:58.198477Z","title":"Audioldm: Text-to-audio generation with latent diffusion models.arXiv preprint arXiv:2301.12503,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2510.03117","last_updated":"2026-06-26T03:58:11Z","snapshot_observed_at":"2026-08-07T05:08:17.345661Z","submitted_at":"2025-10-03T15:43:56Z","title":"Taming Text-to-Sounding Video Generation via Advanced Modality Condition and Interaction","version":2},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-04T12:38:58.198477Z"},"links":{"cited_paper":"/paper/2301.12503","citing_paper":"/paper/2510.03117"},"observation_digest":"sha256:f05399bd0a62602a46e72551080b5d7df2fdb7543d5586d2e28de7e8524de3fd","observation_id":"cf197551-189e-4413-bfbb-75800a2a5d56","resolution":{"observed_at":"2026-08-04T12:38:58.198477Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2301.12503","last_updated":"2023-09-09T15:27:58Z","snapshot_observed_at":"2026-08-06T16:43:15.954030Z","submitted_at":"2023-01-29T17:48:17Z","title":"AudioLDM: Text-to-Audio Generation with Latent Diffusion Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2301.12503","snapshot_observed_at":"2026-08-04T11:29:33.883026Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2510.04593","last_updated":"2026-06-08T05:49:30Z","snapshot_observed_at":"2026-08-06T08:55:28.794308Z","submitted_at":"2025-10-06T08:47:38Z","title":"UniVoice: Unifying Autoregressive ASR and Flow-Matching based TTS with Large Language Models","version":3},"reference_index":38,"source":"arxiv_source","source_observed_at":"2026-08-04T11:29:33.883026Z"},"links":{"cited_paper":"/paper/2301.12503","citing_paper":"/paper/2510.04593"},"observation_digest":"sha256:ee22a0794d3709c77f274e7eea22911d6edf7ce275355891c9ef40335c820e0c","observation_id":"9ba08cfd-6e72-4426-9c96-74149d070b56","resolution":{"observed_at":"2026-08-04T11:29:33.883026Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2301.12503","last_updated":"2023-09-09T15:27:58Z","snapshot_observed_at":"2026-08-06T16:43:15.954030Z","submitted_at":"2023-01-29T17:48:17Z","title":"AudioLDM: Text-to-Audio Generation with Latent Diffusion Models","version":3},"cited_work":{"arxiv_id":"2301.12503","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2301.12503","snapshot_observed_at":"2026-07-04T11:59:50.469153Z","title":"Audioldm: Text-to-audio generation with latent diffusion models","venue":null,"work_id":"b44ebce5-47f1-4f14-b13b-b5b4eb072d2c","year":2023},"citing_paper":{"arxiv_id":"2510.13293","last_updated":"2026-06-10T05:54:25Z","snapshot_observed_at":"2026-08-04T09:49:40.217695Z","submitted_at":"2025-10-15T08:37:16Z","title":"Cross-modal Consistency Guidance for Robust Emotion Control in Auto-Regressive TTS Models","version":2},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-05-18T07:42:43.077644Z"},"links":{"cited_paper":"/paper/2301.12503","citing_paper":"/paper/2510.13293"},"observation_digest":"sha256:aa7846fb56226a92d4e10f0fa818fc09cddc58156a9b21b517deaa5951dde567","observation_id":"5cab15e9-428c-48d5-8f1c-1590be20ebf8","resolution":{"observed_at":"2026-05-18T07:46:03.658946Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2301.12503","last_updated":"2023-09-09T15:27:58Z","snapshot_observed_at":"2026-08-06T16:43:15.954030Z","submitted_at":"2023-01-29T17:48:17Z","title":"AudioLDM: Text-to-Audio Generation with Latent Diffusion Models","version":3},"cited_work":{"arxiv_id":"2301.12503","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2301.12503","snapshot_observed_at":"2026-07-04T11:59:50.469153Z","title":"Audioldm: Text-to-audio generation with latent diffusion models","venue":null,"work_id":"b44ebce5-47f1-4f14-b13b-b5b4eb072d2c","year":2023},"citing_paper":{"arxiv_id":"2510.13293","last_updated":"2026-06-10T05:54:25Z","snapshot_observed_at":"2026-08-04T09:49:40.217695Z","submitted_at":"2025-10-15T08:37:16Z","title":"Cross-modal Consistency Guidance for Robust Emotion Control in Auto-Regressive TTS Models","version":3},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-05-21T20:56:37.533183Z"},"links":{"cited_paper":"/paper/2301.12503","citing_paper":"/paper/2510.13293"},"observation_digest":"sha256:d3dce2c4d807889463f09fd16cfa17ac95e571a68f5a43e0a38f7833f12e2668","observation_id":"7f33acef-db98-43a1-926c-d821ecfb8475","resolution":{"observed_at":"2026-05-21T21:00:39.130192Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2301.12503","last_updated":"2023-09-09T15:27:58Z","snapshot_observed_at":"2026-08-06T16:43:15.954030Z","submitted_at":"2023-01-29T17:48:17Z","title":"AudioLDM: Text-to-Audio Generation with Latent Diffusion Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2301.12503","snapshot_observed_at":"2026-08-04T09:49:43.654091Z","title":"Audi- oldm: Text-to-audio generation with latent diffusion models,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2510.13293","last_updated":"2026-06-10T05:54:25Z","snapshot_observed_at":"2026-08-04T09:49:40.217695Z","submitted_at":"2025-10-15T08:37:16Z","title":"Cross-modal Consistency Guidance for Robust Emotion Control in Auto-Regressive TTS Models","version":4},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-04T09:49:43.654091Z"},"links":{"cited_paper":"/paper/2301.12503","citing_paper":"/paper/2510.13293"},"observation_digest":"sha256:267f38b55f218a5eee65e7d96713e8d157e3bd4874968b8b65beafa8d5d33761","observation_id":"34d78cc4-a91d-4143-a1b0-bab32f6be7fa","resolution":{"observed_at":"2026-08-04T09:49:43.654091Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2301.12503","last_updated":"2023-09-09T15:27:58Z","snapshot_observed_at":"2026-08-06T16:43:15.954030Z","submitted_at":"2023-01-29T17:48:17Z","title":"AudioLDM: Text-to-Audio Generation with Latent Diffusion Models","version":3},"cited_work":{"arxiv_id":"2301.12503","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2301.12503","snapshot_observed_at":"2026-07-04T11:59:50.469153Z","title":"Audioldm: Text-to-audio generation with latent diffusion models","venue":null,"work_id":"b44ebce5-47f1-4f14-b13b-b5b4eb072d2c","year":2023},"citing_paper":{"arxiv_id":"2601.22143","last_updated":"2026-05-11T12:30:46Z","snapshot_observed_at":"2026-08-07T23:58:58.734836Z","submitted_at":"2026-01-29T18:57:13Z","title":"JUST-DUB-IT: Video Dubbing via Joint Audio-Visual Diffusion","version":2},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-05-16T09:55:32.044506Z"},"links":{"cited_paper":"/paper/2301.12503","citing_paper":"/paper/2601.22143"},"observation_digest":"sha256:7f4cc0366e0f39345d2b5dc0d3bb355f36edb0be28c7d998f0bac54a611555ab","observation_id":"ad9ddeab-612d-4c4d-806d-6591e5de0714","resolution":{"observed_at":"2026-05-16T09:57:42.900012Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2301.12503","last_updated":"2023-09-09T15:27:58Z","snapshot_observed_at":"2026-08-06T16:43:15.954030Z","submitted_at":"2023-01-29T17:48:17Z","title":"AudioLDM: Text-to-Audio Generation with Latent Diffusion Models","version":3},"cited_work":{"arxiv_id":"2301.12503","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2301.12503","snapshot_observed_at":"2026-07-04T11:59:50.469153Z","title":"Audioldm: Text-to-audio generation with latent diffusion models","venue":null,"work_id":"b44ebce5-47f1-4f14-b13b-b5b4eb072d2c","year":2023},"citing_paper":{"arxiv_id":"2602.10764","last_updated":"2026-06-28T05:06:30Z","snapshot_observed_at":"2026-08-07T16:07:50.099539Z","submitted_at":"2026-02-11T11:51:01Z","title":"Dual-End Consistency Model","version":2},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-05-16T05:40:36.406150Z"},"links":{"cited_paper":"/paper/2301.12503","citing_paper":"/paper/2602.10764"},"observation_digest":"sha256:03e0bc6096165e38b2225a44db63e840cd85870c5104f478228fcd4b183077c9","observation_id":"ad26e427-935b-4ab3-bf78-e31e4327eb8f","resolution":{"observed_at":"2026-05-16T05:40:39.814660Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2301.12503","last_updated":"2023-09-09T15:27:58Z","snapshot_observed_at":"2026-08-06T16:43:15.954030Z","submitted_at":"2023-01-29T17:48:17Z","title":"AudioLDM: Text-to-Audio Generation with Latent Diffusion Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2301.12503","snapshot_observed_at":"2026-08-03T01:04:20.684172Z","title":"arXiv preprint arXiv:2301.12503 (2023)","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2602.10764","last_updated":"2026-06-28T05:06:30Z","snapshot_observed_at":"2026-08-07T16:07:50.099539Z","submitted_at":"2026-02-11T11:51:01Z","title":"Dual-End Consistency Model","version":3},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-03T01:04:20.684172Z"},"links":{"cited_paper":"/paper/2301.12503","citing_paper":"/paper/2602.10764"},"observation_digest":"sha256:5ce5cf4a111e1009086f3064d21beaa27575bc2629433f851265b564bf950424","observation_id":"a5fe170f-ff47-4c70-9b9d-e78aba20a207","resolution":{"observed_at":"2026-08-03T01:04:20.684172Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2301.12503","last_updated":"2023-09-09T15:27:58Z","snapshot_observed_at":"2026-08-06T16:43:15.954030Z","submitted_at":"2023-01-29T17:48:17Z","title":"AudioLDM: Text-to-Audio Generation with Latent Diffusion Models","version":3},"cited_work":{"arxiv_id":"2301.12503","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2301.12503","snapshot_observed_at":"2026-07-04T11:59:50.469153Z","title":"Audioldm: Text-to-audio generation with latent diffusion models","venue":null,"work_id":"b44ebce5-47f1-4f14-b13b-b5b4eb072d2c","year":2023},"citing_paper":{"arxiv_id":"2603.13419","last_updated":"2026-05-20T10:08:19Z","snapshot_observed_at":"2026-07-06T22:48:57.474272Z","submitted_at":"2026-03-12T21:02:17Z","title":"Diffusion Models Memorize in Training -- and Generalize in Inference","version":2},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-05-21T10:52:31.849094Z"},"links":{"cited_paper":"/paper/2301.12503","citing_paper":"/paper/2603.13419"},"observation_digest":"sha256:98277ec51be3270ed9b219f5682acc4b3549ff59026e94d238dc25b91be55ada","observation_id":"d8e4dd18-5751-40fe-bcf0-56855f426025","resolution":{"observed_at":"2026-05-21T10:54:07.907159Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2301.12503","last_updated":"2023-09-09T15:27:58Z","snapshot_observed_at":"2026-08-06T16:43:15.954030Z","submitted_at":"2023-01-29T17:48:17Z","title":"AudioLDM: Text-to-Audio Generation with Latent Diffusion Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2301.12503","snapshot_observed_at":"2026-08-02T18:03:40.092528Z","title":"Audioldm: Text-to-audio generation with latent diffusion models,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2603.16805","last_updated":"2026-07-16T07:47:56Z","snapshot_observed_at":"2026-08-09T03:29:09.729679Z","submitted_at":"2026-03-17T17:09:45Z","title":"Making Separation-First Multi-Stream Audio Watermarking Feasible via Joint Training","version":2},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-02T18:03:40.092528Z"},"links":{"cited_paper":"/paper/2301.12503","citing_paper":"/paper/2603.16805"},"observation_digest":"sha256:dc589f1f3f6805e9d8e9f76fa7ad33edcbf15cca15a84a6a791e1a884c29acaf","observation_id":"6f6fbe12-1056-481f-a394-17d714e80274","resolution":{"observed_at":"2026-08-02T18:03:40.092528Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2301.12503","last_updated":"2023-09-09T15:27:58Z","snapshot_observed_at":"2026-08-06T16:43:15.954030Z","submitted_at":"2023-01-29T17:48:17Z","title":"AudioLDM: Text-to-Audio Generation with Latent Diffusion Models","version":3},"cited_work":{"arxiv_id":"2301.12503","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2301.12503","snapshot_observed_at":"2026-07-04T11:59:50.469153Z","title":"Audioldm: Text-to-audio generation with latent diffusion models","venue":null,"work_id":"b44ebce5-47f1-4f14-b13b-b5b4eb072d2c","year":2023},"citing_paper":{"arxiv_id":"2604.01929","last_updated":"2026-04-29T10:54:09Z","snapshot_observed_at":"2026-07-06T22:51:40.181565Z","submitted_at":"2026-04-02T11:49:00Z","title":"Woosh: A Sound Effects Foundation Model","version":3},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-05-13T20:51:08.144573Z"},"links":{"cited_paper":"/paper/2301.12503","citing_paper":"/paper/2604.01929"},"observation_digest":"sha256:c99e875fd36734834e80ff9ed3f40979783536dd76f7d96a15dc92a11b59b555","observation_id":"7d8d74b6-99e3-412b-a589-d61ee8b439db","resolution":{"observed_at":"2026-05-13T20:53:15.805338Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2301.12503","last_updated":"2023-09-09T15:27:58Z","snapshot_observed_at":"2026-08-06T16:43:15.954030Z","submitted_at":"2023-01-29T17:48:17Z","title":"AudioLDM: Text-to-Audio Generation with Latent Diffusion Models","version":3},"cited_work":{"arxiv_id":"2301.12503","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2301.12503","snapshot_observed_at":"2026-07-04T11:59:50.469153Z","title":"Audioldm: Text-to-audio generation with latent diffusion models","venue":null,"work_id":"b44ebce5-47f1-4f14-b13b-b5b4eb072d2c","year":2023},"citing_paper":{"arxiv_id":"2604.05731","last_updated":"2026-04-07T11:34:04Z","snapshot_observed_at":"2026-08-07T09:04:40.480571Z","submitted_at":"2026-04-07T11:34:04Z","title":"FoleyDesigner: Immersive Stereo Foley Generation with Precise Spatio-Temporal Alignment for Film Clips","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-05-10T18:57:21.434793Z"},"links":{"cited_paper":"/paper/2301.12503","citing_paper":"/paper/2604.05731"},"observation_digest":"sha256:3dc304f900f7642572471669d408e4db3c40f4711919e9442494ebc811fb0823","observation_id":"01351671-3543-4f01-a0f1-0ac538ec27e2","resolution":{"observed_at":"2026-05-10T23:40:51.725801Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2301.12503","last_updated":"2023-09-09T15:27:58Z","snapshot_observed_at":"2026-08-06T16:43:15.954030Z","submitted_at":"2023-01-29T17:48:17Z","title":"AudioLDM: Text-to-Audio Generation with Latent Diffusion Models","version":3},"cited_work":{"arxiv_id":"2301.12503","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2301.12503","snapshot_observed_at":"2026-07-04T11:59:50.469153Z","title":"Audioldm: Text-to-audio generation with latent diffusion models","venue":null,"work_id":"b44ebce5-47f1-4f14-b13b-b5b4eb072d2c","year":2023},"citing_paper":{"arxiv_id":"2604.08184","last_updated":"2026-04-09T12:38:19Z","snapshot_observed_at":"2026-08-02T08:09:42.022596Z","submitted_at":"2026-04-09T12:38:19Z","title":"AT-ADD: All-Type Audio Deepfake Detection Challenge Evaluation Plan","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-05-10T17:40:10.657590Z"},"links":{"cited_paper":"/paper/2301.12503","citing_paper":"/paper/2604.08184"},"observation_digest":"sha256:0bb5dad2b0fa9457dd70f35734a3c4082efd9cf2c67c59812cfd7bd5dd0fa3f6","observation_id":"7a567944-8d5b-41e9-8911-b1b29291eb45","resolution":{"observed_at":"2026-05-11T06:21:00.633260Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2301.12503","last_updated":"2023-09-09T15:27:58Z","snapshot_observed_at":"2026-08-06T16:43:15.954030Z","submitted_at":"2023-01-29T17:48:17Z","title":"AudioLDM: Text-to-Audio Generation with Latent Diffusion Models","version":3},"cited_work":{"arxiv_id":"2301.12503","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2301.12503","snapshot_observed_at":"2026-07-04T11:59:50.469153Z","title":"Audioldm: Text-to-audio generation with latent diffusion models","venue":null,"work_id":"b44ebce5-47f1-4f14-b13b-b5b4eb072d2c","year":2023},"citing_paper":{"arxiv_id":"2604.17986","last_updated":"2026-04-20T09:08:13Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-04-20T09:08:13Z","title":"Latent Fourier Transform","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-05-10T03:45:07.892234Z"},"links":{"cited_paper":"/paper/2301.12503","citing_paper":"/paper/2604.17986"},"observation_digest":"sha256:33e45aa968e626e6d6495ef353a6c51e6fddc0150308cd5d1956bb4d023b5113","observation_id":"29ea7c1a-3e59-4755-a1a7-e76c6cf6c59b","resolution":{"observed_at":"2026-05-11T12:21:07.061004Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2301.12503","last_updated":"2023-09-09T15:27:58Z","snapshot_observed_at":"2026-08-06T16:43:15.954030Z","submitted_at":"2023-01-29T17:48:17Z","title":"AudioLDM: Text-to-Audio Generation with Latent Diffusion Models","version":3},"cited_work":{"arxiv_id":"2301.12503","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2301.12503","snapshot_observed_at":"2026-07-04T11:59:50.469153Z","title":"Audioldm: Text-to-audio generation with latent diffusion models","venue":null,"work_id":"b44ebce5-47f1-4f14-b13b-b5b4eb072d2c","year":2023},"citing_paper":{"arxiv_id":"2604.19055","last_updated":"2026-04-23T13:29:24Z","snapshot_observed_at":"2026-08-02T20:24:54.657148Z","submitted_at":"2026-04-21T04:01:36Z","title":"ATRIE: Adaptive Tuning for Robust Inference and Emotion in Persona-Driven Speech Synthesis","version":2},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-05-10T02:11:12.460695Z"},"links":{"cited_paper":"/paper/2301.12503","citing_paper":"/paper/2604.19055"},"observation_digest":"sha256:16402c53db6821da846dd24722394f297136558c2764744f7e4cd05da41402fd","observation_id":"01797019-b68d-4ae6-ac3f-1015173d9bd7","resolution":{"observed_at":"2026-05-11T13:11:22.315786Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2301.12503","last_updated":"2023-09-09T15:27:58Z","snapshot_observed_at":"2026-08-06T16:43:15.954030Z","submitted_at":"2023-01-29T17:48:17Z","title":"AudioLDM: Text-to-Audio Generation with Latent Diffusion Models","version":3},"cited_work":{"arxiv_id":"2301.12503","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2301.12503","snapshot_observed_at":"2026-07-04T11:59:50.469153Z","title":"Audioldm: Text-to-audio generation with latent diffusion models","venue":null,"work_id":"b44ebce5-47f1-4f14-b13b-b5b4eb072d2c","year":2023},"citing_paper":{"arxiv_id":"2605.00329","last_updated":"2026-05-01T01:13:50Z","snapshot_observed_at":"2026-08-04T21:56:38.114801Z","submitted_at":"2026-05-01T01:13:50Z","title":"Fast Text-to-Audio Generation with One-Step Sampling via Energy-Scoring and Auxiliary Contextual Representation Distillation","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-05-09T19:17:09.247932Z"},"links":{"cited_paper":"/paper/2301.12503","citing_paper":"/paper/2605.00329"},"observation_digest":"sha256:fe632b458105928ce865d496a95a98c135b1ad1e8878f96c5c250b091219a479","observation_id":"39d88a97-f0b0-48b8-9ac7-7861846c0866","resolution":{"observed_at":"2026-05-11T15:46:44.540336Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2301.12503","last_updated":"2023-09-09T15:27:58Z","snapshot_observed_at":"2026-08-06T16:43:15.954030Z","submitted_at":"2023-01-29T17:48:17Z","title":"AudioLDM: Text-to-Audio Generation with Latent Diffusion Models","version":3},"cited_work":{"arxiv_id":"2301.12503","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2301.12503","snapshot_observed_at":"2026-07-04T11:59:50.469153Z","title":"Audioldm: Text-to-audio generation with latent diffusion models","venue":null,"work_id":"b44ebce5-47f1-4f14-b13b-b5b4eb072d2c","year":2023},"citing_paper":{"arxiv_id":"2605.04547","last_updated":"2026-05-06T06:54:00Z","snapshot_observed_at":"2026-07-06T23:17:18.486586Z","submitted_at":"2026-05-06T06:54:00Z","title":"Stage-adaptive audio diffusion modeling","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-05-08T17:21:34.140699Z"},"links":{"cited_paper":"/paper/2301.12503","citing_paper":"/paper/2605.04547"},"observation_digest":"sha256:dd05ebf2f457964e1e9ff3a0e10b9b4abadbf7e635b8e129ab3f409dc7d16e5c","observation_id":"2d7908dd-aed0-4ad3-87ba-adc684434783","resolution":{"observed_at":"2026-05-11T17:41:06.288613Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2301.12503","last_updated":"2023-09-09T15:27:58Z","snapshot_observed_at":"2026-08-06T16:43:15.954030Z","submitted_at":"2023-01-29T17:48:17Z","title":"AudioLDM: Text-to-Audio Generation with Latent Diffusion Models","version":3},"cited_work":{"arxiv_id":"2301.12503","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2301.12503","snapshot_observed_at":"2026-07-04T11:59:50.469153Z","title":"Audioldm: Text-to-audio generation with latent diffusion models","venue":null,"work_id":"b44ebce5-47f1-4f14-b13b-b5b4eb072d2c","year":2023},"citing_paper":{"arxiv_id":"2605.09259","last_updated":"2026-05-10T02:08:07Z","snapshot_observed_at":"2026-07-06T23:21:21.560069Z","submitted_at":"2026-05-10T02:08:07Z","title":"Remix the Timbre: Diffusion-Based Style Transfer Across Polyphonic Stems","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-05-12T04:58:26.634355Z"},"links":{"cited_paper":"/paper/2301.12503","citing_paper":"/paper/2605.09259"},"observation_digest":"sha256:74ef5fe3016f1673f40305dc9698e8bd261e15545e88960772d8c7b8a17b3dd0","observation_id":"9213e690-cbd2-494a-b509-1434c2bb22a9","resolution":{"observed_at":"2026-05-12T05:46:28.002815Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2301.12503","last_updated":"2023-09-09T15:27:58Z","snapshot_observed_at":"2026-08-06T16:43:15.954030Z","submitted_at":"2023-01-29T17:48:17Z","title":"AudioLDM: Text-to-Audio Generation with Latent Diffusion Models","version":3},"cited_work":{"arxiv_id":"2301.12503","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2301.12503","snapshot_observed_at":"2026-07-04T11:59:50.469153Z","title":"Audioldm: Text-to-audio generation with latent diffusion models","venue":null,"work_id":"b44ebce5-47f1-4f14-b13b-b5b4eb072d2c","year":2023},"citing_paper":{"arxiv_id":"2605.09275","last_updated":"2026-05-10T02:53:43Z","snapshot_observed_at":"2026-07-06T23:21:26.017420Z","submitted_at":"2026-05-10T02:53:43Z","title":"DiffATS: Diffusion in Aligned Tensor Space","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-05-12T04:38:12.633086Z"},"links":{"cited_paper":"/paper/2301.12503","citing_paper":"/paper/2605.09275"},"observation_digest":"sha256:eec32f390e2a7dddb57864e5989e433cbb035c04c796d29f8814813bdb244fd1","observation_id":"a8c7fa61-6d59-4926-9f7a-96b99a4fd859","resolution":{"observed_at":"2026-05-12T06:01:26.589603Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2301.12503","last_updated":"2023-09-09T15:27:58Z","snapshot_observed_at":"2026-08-06T16:43:15.954030Z","submitted_at":"2023-01-29T17:48:17Z","title":"AudioLDM: Text-to-Audio Generation with Latent Diffusion Models","version":3},"cited_work":{"arxiv_id":"2301.12503","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2301.12503","snapshot_observed_at":"2026-07-04T11:59:50.469153Z","title":"Audioldm: Text-to-audio generation with latent diffusion models","venue":null,"work_id":"b44ebce5-47f1-4f14-b13b-b5b4eb072d2c","year":2023},"citing_paper":{"arxiv_id":"2605.09971","last_updated":"2026-05-11T04:26:51Z","snapshot_observed_at":"2026-07-06T23:21:59.096464Z","submitted_at":"2026-05-11T04:26:51Z","title":"HapticLDM: A Diffusion Model for Text-to-Vibrotactile Generation","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-05-12T04:11:29.782569Z"},"links":{"cited_paper":"/paper/2301.12503","citing_paper":"/paper/2605.09971"},"observation_digest":"sha256:2d314e2aaafbecf8464ae874911ec62f27e86fdab753932706e1f1c289cc4bad","observation_id":"a5609b5b-8f1c-4de5-8d38-02ceb2028256","resolution":{"observed_at":"2026-05-12T06:31:28.188916Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2301.12503","last_updated":"2023-09-09T15:27:58Z","snapshot_observed_at":"2026-08-06T16:43:15.954030Z","submitted_at":"2023-01-29T17:48:17Z","title":"AudioLDM: Text-to-Audio Generation with Latent Diffusion Models","version":3},"cited_work":{"arxiv_id":"2301.12503","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2301.12503","snapshot_observed_at":"2026-07-04T11:59:50.469153Z","title":"Audioldm: Text-to-audio generation with latent diffusion models","venue":null,"work_id":"b44ebce5-47f1-4f14-b13b-b5b4eb072d2c","year":2023},"citing_paper":{"arxiv_id":"2605.10084","last_updated":"2026-05-11T07:05:11Z","snapshot_observed_at":"2026-07-06T23:22:03.830881Z","submitted_at":"2026-05-11T07:05:11Z","title":"PoDAR: Power-Disentangled Audio Representation for Generative Modeling","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-05-12T04:04:08.420600Z"},"links":{"cited_paper":"/paper/2301.12503","citing_paper":"/paper/2605.10084"},"observation_digest":"sha256:883299b2bbad4a52c26dc4f8576340233dea11d64ab4b6123a647aa5823e3677","observation_id":"1e51d76d-72e3-48e3-9143-9a44fa42d66a","resolution":{"observed_at":"2026-05-12T06:41:35.176549Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2301.12503","last_updated":"2023-09-09T15:27:58Z","snapshot_observed_at":"2026-08-06T16:43:15.954030Z","submitted_at":"2023-01-29T17:48:17Z","title":"AudioLDM: Text-to-Audio Generation with Latent Diffusion Models","version":3},"cited_work":{"arxiv_id":"2301.12503","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2301.12503","snapshot_observed_at":"2026-07-04T11:59:50.469153Z","title":"Audioldm: Text-to-audio generation with latent diffusion models","venue":null,"work_id":"b44ebce5-47f1-4f14-b13b-b5b4eb072d2c","year":2023},"citing_paper":{"arxiv_id":"2605.18749","last_updated":"2026-05-18T17:59:10Z","snapshot_observed_at":"2026-08-01T11:03:45.027975Z","submitted_at":"2026-05-18T17:59:10Z","title":"WavFlow: Audio Generation in Waveform Space","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-05-20T07:33:35.243337Z"},"links":{"cited_paper":"/paper/2301.12503","citing_paper":"/paper/2605.18749"},"observation_digest":"sha256:ef9bf99988e5c94f14cea1ff5b914c54b38c24129542b675a454fa9949608ca8","observation_id":"875fd0db-094b-4cac-a577-9f4e223b7d81","resolution":{"observed_at":"2026-05-20T07:38:09.626883Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2301.12503","last_updated":"2023-09-09T15:27:58Z","snapshot_observed_at":"2026-08-06T16:43:15.954030Z","submitted_at":"2023-01-29T17:48:17Z","title":"AudioLDM: Text-to-Audio Generation with Latent Diffusion Models","version":3},"cited_work":{"arxiv_id":"2301.12503","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2301.12503","snapshot_observed_at":"2026-07-04T11:59:50.469153Z","title":"Audioldm: Text-to-audio generation with latent diffusion models","venue":null,"work_id":"b44ebce5-47f1-4f14-b13b-b5b4eb072d2c","year":2023},"citing_paper":{"arxiv_id":"2605.28101","last_updated":"2026-05-27T07:54:47Z","snapshot_observed_at":"2026-08-01T20:36:16.545203Z","submitted_at":"2026-05-27T07:54:47Z","title":"EigeNet: Geometry-Informed Multi-Modal Learning for Few-shot Novel View RIR Prediction","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-06-29T10:25:14.873276Z"},"links":{"cited_paper":"/paper/2301.12503","citing_paper":"/paper/2605.28101"},"observation_digest":"sha256:86afed1a30ffd9bd7721c019ffabd85957685162e3317e7e14bcb869a18bc149","observation_id":"9e9be8ae-4fc9-4935-9355-e05862a46376","resolution":{"observed_at":"2026-06-29T13:33:28.537734Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2301.12503","last_updated":"2023-09-09T15:27:58Z","snapshot_observed_at":"2026-08-06T16:43:15.954030Z","submitted_at":"2023-01-29T17:48:17Z","title":"AudioLDM: Text-to-Audio Generation with Latent Diffusion Models","version":3},"cited_work":{"arxiv_id":"2301.12503","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2301.12503","snapshot_observed_at":"2026-07-04T11:59:50.469153Z","title":"Audioldm: Text-to-audio generation with latent diffusion models","venue":null,"work_id":"b44ebce5-47f1-4f14-b13b-b5b4eb072d2c","year":2023},"citing_paper":{"arxiv_id":"2605.30365","last_updated":"2026-05-18T02:11:57Z","snapshot_observed_at":"2026-08-08T07:42:34.284374Z","submitted_at":"2026-05-18T02:11:57Z","title":"Mental Damage: Caption Poisoning Attacks on Retrieval-Augmented Text-to-Music Generation","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-06-30T18:57:35.126894Z"},"links":{"cited_paper":"/paper/2301.12503","citing_paper":"/paper/2605.30365"},"observation_digest":"sha256:9386ff2631a6cd919cc6f557effae458b0d0837f7b3879a9a2eadfc375fdee0b","observation_id":"917ed80e-e9b2-4838-8169-7486d16d7403","resolution":{"observed_at":"2026-06-30T19:15:01.184596Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2301.12503","last_updated":"2023-09-09T15:27:58Z","snapshot_observed_at":"2026-08-06T16:43:15.954030Z","submitted_at":"2023-01-29T17:48:17Z","title":"AudioLDM: Text-to-Audio Generation with Latent Diffusion Models","version":3},"cited_work":{"arxiv_id":"2301.12503","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2301.12503","snapshot_observed_at":"2026-07-04T11:59:50.469153Z","title":"Audioldm: Text-to-audio generation with latent diffusion models","venue":null,"work_id":"b44ebce5-47f1-4f14-b13b-b5b4eb072d2c","year":2023},"citing_paper":{"arxiv_id":"2605.30876","last_updated":"2026-06-20T08:46:49Z","snapshot_observed_at":"2026-08-03T23:34:59.657375Z","submitted_at":"2026-05-29T06:03:50Z","title":"dMoE: dLLMs with Learnable Block Experts","version":2},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-06-28T22:50:51.900169Z"},"links":{"cited_paper":"/paper/2301.12503","citing_paper":"/paper/2605.30876"},"observation_digest":"sha256:e6e0baae0955856c8740a8074d5c65a4bedbcf8ead908fb3c044e2cfb7667563","observation_id":"d8b7e1ac-56f6-48d5-9137-35997613f8c2","resolution":{"observed_at":"2026-06-28T22:52:45.089912Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2301.12503","last_updated":"2023-09-09T15:27:58Z","snapshot_observed_at":"2026-08-06T16:43:15.954030Z","submitted_at":"2023-01-29T17:48:17Z","title":"AudioLDM: Text-to-Audio Generation with Latent Diffusion Models","version":3},"cited_work":{"arxiv_id":"2301.12503","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2301.12503","snapshot_observed_at":"2026-07-04T11:59:50.469153Z","title":"Audioldm: Text-to-audio generation with latent diffusion models","venue":null,"work_id":"b44ebce5-47f1-4f14-b13b-b5b4eb072d2c","year":2023},"citing_paper":{"arxiv_id":"2606.07207","last_updated":"2026-06-05T12:19:00Z","snapshot_observed_at":"2026-08-03T23:58:51.636454Z","submitted_at":"2026-06-05T12:19:00Z","title":"Entropy as a Structural Prior: How a Log-Barrier on DiT Belief Space Drives Musical Diversity and Development","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-06-27T21:06:45.886467Z"},"links":{"cited_paper":"/paper/2301.12503","citing_paper":"/paper/2606.07207"},"observation_digest":"sha256:6d608fa3e0651b2afa2b41d038cb75c27b1b8efe67577c952204a64012f8d1b9","observation_id":"b957d6e4-935a-412e-a3f5-2f0b3e30d1e4","resolution":{"observed_at":"2026-07-02T19:57:20.253964Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2301.12503","last_updated":"2023-09-09T15:27:58Z","snapshot_observed_at":"2026-08-06T16:43:15.954030Z","submitted_at":"2023-01-29T17:48:17Z","title":"AudioLDM: Text-to-Audio Generation with Latent Diffusion Models","version":3},"cited_work":{"arxiv_id":"2301.12503","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2301.12503","snapshot_observed_at":"2026-07-04T11:59:50.469153Z","title":"Audioldm: Text-to-audio generation with latent diffusion models","venue":null,"work_id":"b44ebce5-47f1-4f14-b13b-b5b4eb072d2c","year":2023},"citing_paper":{"arxiv_id":"2606.11833","last_updated":"2026-06-10T09:15:33Z","snapshot_observed_at":"2026-08-07T05:35:12.067325Z","submitted_at":"2026-06-10T09:15:33Z","title":"Flow Matching with In-Context Priors for Out-of-Distribution Brain Dynamics","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-06-27T10:44:39.810293Z"},"links":{"cited_paper":"/paper/2301.12503","citing_paper":"/paper/2606.11833"},"observation_digest":"sha256:b999cbb79d7958ab56acbb0393e0464329466c98dc9cb01f5d5ab6931a82e9da","observation_id":"2987213b-e846-46ff-9bad-cb73d2f87e50","resolution":{"observed_at":"2026-07-03T08:27:46.755613Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2301.12503","last_updated":"2023-09-09T15:27:58Z","snapshot_observed_at":"2026-08-06T16:43:15.954030Z","submitted_at":"2023-01-29T17:48:17Z","title":"AudioLDM: Text-to-Audio Generation with Latent Diffusion Models","version":3},"cited_work":{"arxiv_id":"2301.12503","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2301.12503","snapshot_observed_at":"2026-07-04T11:59:50.469153Z","title":"Audioldm: Text-to-audio generation with latent diffusion models","venue":null,"work_id":"b44ebce5-47f1-4f14-b13b-b5b4eb072d2c","year":2023},"citing_paper":{"arxiv_id":"2606.12494","last_updated":"2026-06-10T12:41:17Z","snapshot_observed_at":"2026-08-03T00:00:48.277372Z","submitted_at":"2026-06-10T12:41:17Z","title":"Net-Ev$^2$: A Generative Simulator for Network Event Evolution","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-06-27T10:09:20.657051Z"},"links":{"cited_paper":"/paper/2301.12503","citing_paper":"/paper/2606.12494"},"observation_digest":"sha256:5ce39f041f8a60b26db8932ebe0ec715af9783617773c4d7133bb821931c8c05","observation_id":"b2be330d-b942-43c6-81c4-adebd15d638f","resolution":{"observed_at":"2026-07-03T10:17:57.609498Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2301.12503","last_updated":"2023-09-09T15:27:58Z","snapshot_observed_at":"2026-08-06T16:43:15.954030Z","submitted_at":"2023-01-29T17:48:17Z","title":"AudioLDM: Text-to-Audio Generation with Latent Diffusion Models","version":3},"cited_work":{"arxiv_id":"2301.12503","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2301.12503","snapshot_observed_at":"2026-07-04T11:59:50.469153Z","title":"Audioldm: Text-to-audio generation with latent diffusion models","venue":null,"work_id":"b44ebce5-47f1-4f14-b13b-b5b4eb072d2c","year":2023},"citing_paper":{"arxiv_id":"2606.23064","last_updated":"2026-06-22T09:13:57Z","snapshot_observed_at":"2026-08-06T08:41:01.968593Z","submitted_at":"2026-06-22T09:13:57Z","title":"STAR-VAE: Structured Topology-Aware Regularization for Audio Reconstruction and Generation","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-06-26T07:26:28.527338Z"},"links":{"cited_paper":"/paper/2301.12503","citing_paper":"/paper/2606.23064"},"observation_digest":"sha256:d663cda737393c7ec86333cc94b9c5bd4b1ec671c3b97d2ae95d532bc9b42c94","observation_id":"6553f382-ad31-49dd-8943-a4627ad387a8","resolution":{"observed_at":"2026-07-04T11:59:50.471182Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2301.12503","last_updated":"2023-09-09T15:27:58Z","snapshot_observed_at":"2026-08-06T16:43:15.954030Z","submitted_at":"2023-01-29T17:48:17Z","title":"AudioLDM: Text-to-Audio Generation with Latent Diffusion Models","version":3},"cited_work":{"arxiv_id":"2301.12503","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2301.12503","snapshot_observed_at":"2026-07-04T11:59:50.469153Z","title":"Audioldm: Text-to-audio generation with latent diffusion models","venue":null,"work_id":"b44ebce5-47f1-4f14-b13b-b5b4eb072d2c","year":2023},"citing_paper":{"arxiv_id":"2606.23898","last_updated":"2026-06-22T19:54:25Z","snapshot_observed_at":"2026-08-03T19:05:46.469138Z","submitted_at":"2026-06-22T19:54:25Z","title":"ARIA: Adaptive Region-Based Importance Allocation for Conditional Diffusion Distillation","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-06-26T08:41:11.951712Z"},"links":{"cited_paper":"/paper/2301.12503","citing_paper":"/paper/2606.23898"},"observation_digest":"sha256:daaa3ac54022151612f84e0f1018c4e23695bd17dba9f4b7f4124a1228fb60ad","observation_id":"201afcc3-58ad-49f4-b226-f6f680c2fc2d","resolution":{"observed_at":"2026-07-04T10:39:44.954421Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2301.12503","last_updated":"2023-09-09T15:27:58Z","snapshot_observed_at":"2026-08-06T16:43:15.954030Z","submitted_at":"2023-01-29T17:48:17Z","title":"AudioLDM: Text-to-Audio Generation with Latent Diffusion Models","version":3},"cited_work":{"arxiv_id":"2301.12503","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2301.12503","snapshot_observed_at":"2026-07-04T11:59:50.469153Z","title":"Audioldm: Text-to-audio generation with latent diffusion models","venue":null,"work_id":"b44ebce5-47f1-4f14-b13b-b5b4eb072d2c","year":2023},"citing_paper":{"arxiv_id":"2606.29473","last_updated":"2026-07-13T12:28:13Z","snapshot_observed_at":"2026-07-16T23:19:38.740232Z","submitted_at":"2026-06-28T16:01:04Z","title":"MAVIN: Multi-Shot Audio-Visual Generation with Customized Narrative Control","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-06-30T07:18:20.501369Z"},"links":{"cited_paper":"/paper/2301.12503","citing_paper":"/paper/2606.29473"},"observation_digest":"sha256:896f91831d81efc814519819407ed02c5a413cbc6c56d5f5b611567b83d852be","observation_id":"1f58b6b3-7635-4d6a-b9b4-127dc290554b","resolution":{"observed_at":"2026-06-30T07:24:21.554371Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2301.12503","last_updated":"2023-09-09T15:27:58Z","snapshot_observed_at":"2026-08-06T16:43:15.954030Z","submitted_at":"2023-01-29T17:48:17Z","title":"AudioLDM: Text-to-Audio Generation with Latent Diffusion Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2301.12503","snapshot_observed_at":"2026-07-14T17:03:01.432145Z","title":"arXiv preprint arXiv:2301.12503 (2023)","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2606.29473","last_updated":"2026-07-13T12:28:13Z","snapshot_observed_at":"2026-07-16T23:19:38.740232Z","submitted_at":"2026-06-28T16:01:04Z","title":"MAVIN: Multi-Shot Audio-Visual Generation with Customized Narrative Control","version":2},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-07-14T17:03:01.432145Z"},"links":{"cited_paper":"/paper/2301.12503","citing_paper":"/paper/2606.29473"},"observation_digest":"sha256:034f93c08765df087e9de93fbb87442246eb15c4c9e0c841e150f3887728615b","observation_id":"d870af0f-cf64-45bc-add2-1507338a977b","resolution":{"observed_at":"2026-07-14T17:03:01.432145Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2301.12503","last_updated":"2023-09-09T15:27:58Z","snapshot_observed_at":"2026-08-06T16:43:15.954030Z","submitted_at":"2023-01-29T17:48:17Z","title":"AudioLDM: Text-to-Audio Generation with Latent Diffusion Models","version":3},"cited_work":{"arxiv_id":"2301.12503","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2301.12503","snapshot_observed_at":"2026-07-04T11:59:50.469153Z","title":"Audioldm: Text-to-audio generation with latent diffusion models","venue":null,"work_id":"b44ebce5-47f1-4f14-b13b-b5b4eb072d2c","year":2023},"citing_paper":{"arxiv_id":"2606.30682","last_updated":"2026-06-27T03:56:57Z","snapshot_observed_at":"2026-07-07T00:04:29.879877Z","submitted_at":"2026-06-27T03:56:57Z","title":"ALM2Vec: Learning Audio Embeddings for Universal Audio Retrieval with Large Audio-Language Models","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-07-01T06:47:53.308909Z"},"links":{"cited_paper":"/paper/2301.12503","citing_paper":"/paper/2606.30682"},"observation_digest":"sha256:ca5ee8d394c0521a49339bfb9eeb84eb08aa660476a290dbf5c92501f0ecf781","observation_id":"09db36e7-d0b1-4508-9387-bb85347cb181","resolution":{"observed_at":"2026-07-01T09:05:37.221480Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2301.12503","last_updated":"2023-09-09T15:27:58Z","snapshot_observed_at":"2026-08-06T16:43:15.954030Z","submitted_at":"2023-01-29T17:48:17Z","title":"AudioLDM: Text-to-Audio Generation with Latent Diffusion Models","version":3},"cited_work":{"arxiv_id":"2301.12503","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2301.12503","snapshot_observed_at":"2026-07-04T11:59:50.469153Z","title":"Audioldm: Text-to-audio generation with latent diffusion models","venue":null,"work_id":"b44ebce5-47f1-4f14-b13b-b5b4eb072d2c","year":2023},"citing_paper":{"arxiv_id":"2607.02119","last_updated":"2026-07-02T12:55:11Z","snapshot_observed_at":"2026-08-04T18:11:17.418102Z","submitted_at":"2026-07-02T12:55:11Z","title":"An Efficient vLLM-Based Inference Pipeline for Unified Audio Understanding and Generation","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-07-03T05:04:23.295592Z"},"links":{"cited_paper":"/paper/2301.12503","citing_paper":"/paper/2607.02119"},"observation_digest":"sha256:8111f4af839a8bbaf2eb8708b39e42314fdfb76c9aad519a27ea520fa5a3686a","observation_id":"eda6be9b-5c73-4779-a2c7-3b4ba7304da7","resolution":{"observed_at":"2026-07-03T05:07:38.292439Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2301.12503","last_updated":"2023-09-09T15:27:58Z","snapshot_observed_at":"2026-08-06T16:43:15.954030Z","submitted_at":"2023-01-29T17:48:17Z","title":"AudioLDM: Text-to-Audio Generation with Latent Diffusion Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2301.12503","snapshot_observed_at":"2026-07-11T12:34:20.057072Z","title":"Audioldm: Text-to-audio generation with latent diffusion models,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.04848","last_updated":"2026-07-06T09:19:03Z","snapshot_observed_at":"2026-08-07T07:26:18.976803Z","submitted_at":"2026-07-06T09:19:03Z","title":"SynSFX: Multi-Model Sound Effects Synthesis Dataset for Deepfake Detection and Evaluation","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-07-11T12:34:20.057072Z"},"links":{"cited_paper":"/paper/2301.12503","citing_paper":"/paper/2607.04848"},"observation_digest":"sha256:1e80ab8e058effdcb9b74bdc49bc3d442e813ca1a13122b4d750c0127dbf8f41","observation_id":"6b618a80-5245-450a-b915-ba7b6712dcc8","resolution":{"observed_at":"2026-07-11T12:34:20.057072Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2301.12503","last_updated":"2023-09-09T15:27:58Z","snapshot_observed_at":"2026-08-06T16:43:15.954030Z","submitted_at":"2023-01-29T17:48:17Z","title":"AudioLDM: Text-to-Audio Generation with Latent Diffusion Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2301.12503","snapshot_observed_at":"2026-07-14T10:59:22.914974Z","title":"AudioLDM: Text-to-audio generation with la- tent diffusion models,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.10537","last_updated":"2026-07-12T02:40:27Z","snapshot_observed_at":"2026-08-07T16:13:53.605999Z","submitted_at":"2026-07-12T02:40:27Z","title":"Dance to Music Generation leveraging Pre-training with Unpaired data and Contrastive Alignment","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-07-14T10:59:22.914974Z"},"links":{"cited_paper":"/paper/2301.12503","citing_paper":"/paper/2607.10537"},"observation_digest":"sha256:be873cca6c4d42ae1d273d475819998124a3a64eb5113aecffa3354a0af4cfb2","observation_id":"46dabe77-610a-4901-8c3c-bfea8c1bbebd","resolution":{"observed_at":"2026-07-14T10:59:22.914974Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2301.12503","last_updated":"2023-09-09T15:27:58Z","snapshot_observed_at":"2026-08-06T16:43:15.954030Z","submitted_at":"2023-01-29T17:48:17Z","title":"AudioLDM: Text-to-Audio Generation with Latent Diffusion Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2301.12503","snapshot_observed_at":"2026-08-02T06:45:40.274605Z","title":"Plumbley","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.12121","last_updated":"2026-07-15T22:00:17Z","snapshot_observed_at":"2026-08-02T06:45:34.904229Z","submitted_at":"2026-07-13T20:00:39Z","title":"FlashDiff: Efficient Regional Execution and Scheduling for Diffusion Model Serving","version":2},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-02T06:45:40.274605Z"},"links":{"cited_paper":"/paper/2301.12503","citing_paper":"/paper/2607.12121"},"observation_digest":"sha256:b16c033d826cfa016f11a59ffebdb597feaf8d1c9b06cb918a576eff7503e3d9","observation_id":"c0eb786b-3987-46b9-8017-92c2c3547882","resolution":{"observed_at":"2026-08-02T06:45:40.274605Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2301.12503","last_updated":"2023-09-09T15:27:58Z","snapshot_observed_at":"2026-08-06T16:43:15.954030Z","submitted_at":"2023-01-29T17:48:17Z","title":"AudioLDM: Text-to-Audio Generation with Latent Diffusion Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2301.12503","snapshot_observed_at":"2026-08-01T11:59:45.840064Z","title":"Audioldm: Text-to-audio generation with latent diffusion models.arXiv preprint arXiv:2301.12503, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.19725","last_updated":"2026-08-06T15:36:22Z","snapshot_observed_at":"2026-08-09T05:12:32.244284Z","submitted_at":"2026-07-22T03:53:07Z","title":"Analytic Distribution of Classifier-Free Guidance for Schedule Design","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-01T11:59:45.840064Z"},"links":{"cited_paper":"/paper/2301.12503","citing_paper":"/paper/2607.19725"},"observation_digest":"sha256:6c2c0fcec631ef2875ed8b9bae57a786be40ecc4d49b160cebd459130830f28c","observation_id":"961127b7-5d90-47d2-a72e-207eddba16ef","resolution":{"observed_at":"2026-08-01T11:59:45.840064Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2301.12503","last_updated":"2023-09-09T15:27:58Z","snapshot_observed_at":"2026-08-06T16:43:15.954030Z","submitted_at":"2023-01-29T17:48:17Z","title":"AudioLDM: Text-to-Audio Generation with Latent Diffusion Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2301.12503","snapshot_observed_at":"2026-08-01T11:48:09.922353Z","title":"Audioldm: Text-to- audio generation with latent diffusion models,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.19776","last_updated":"2026-07-22T05:50:47Z","snapshot_observed_at":"2026-08-01T11:48:07.549356Z","submitted_at":"2026-07-22T05:50:47Z","title":"RPPNet: Perceptually-Grouped Rhythm-Pitch Primitives for Long-Term Structure Melody Generation via Boundary-Aware Modeling","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-01T11:48:09.922353Z"},"links":{"cited_paper":"/paper/2301.12503","citing_paper":"/paper/2607.19776"},"observation_digest":"sha256:fec0cec8f17249eafe7b009f4583d1a211bd73ac745972501824d610b1225fcf","observation_id":"09755735-db25-461a-a381-ef03fee5233a","resolution":{"observed_at":"2026-08-01T11:48:09.922353Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2301.12503","last_updated":"2023-09-09T15:27:58Z","snapshot_observed_at":"2026-08-06T16:43:15.954030Z","submitted_at":"2023-01-29T17:48:17Z","title":"AudioLDM: Text-to-Audio Generation with Latent Diffusion Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2301.12503","snapshot_observed_at":"2026-07-30T18:58:28.076405Z","title":"arXiv preprint arXiv:2301.12503 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.26860","last_updated":"2026-07-29T12:44:19Z","snapshot_observed_at":"2026-08-06T09:28:43.159690Z","submitted_at":"2026-07-29T12:44:19Z","title":"Amortized Moment Matching for Visual Generation","version":1},"reference_index":70,"source":"arxiv_source","source_observed_at":"2026-07-30T18:58:28.076405Z"},"links":{"cited_paper":"/paper/2301.12503","citing_paper":"/paper/2607.26860"},"observation_digest":"sha256:7d702124b8c73038920b2712be2fe8dc9c3f38b397e9d24b2d7a7f2474435b97","observation_id":"9bbb7541-3030-47ac-9cc4-64cb3ef81e9f","resolution":{"observed_at":"2026-07-30T18:58:28.076405Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2301.12503","last_updated":"2023-09-09T15:27:58Z","snapshot_observed_at":"2026-08-06T16:43:15.954030Z","submitted_at":"2023-01-29T17:48:17Z","title":"AudioLDM: Text-to-Audio Generation with Latent Diffusion Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2301.12503","snapshot_observed_at":"2026-08-03T12:46:58.947785Z","title":"Audioldm: Text-to-audio genera- tion with latent diffusion models,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.29148","last_updated":"2026-07-31T08:30:23Z","snapshot_observed_at":"2026-08-08T06:11:53.368477Z","submitted_at":"2026-07-31T08:30:23Z","title":"Exploring Efficient Waveform Diffusion Models for Foley Sound Generation","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-03T12:46:58.947785Z"},"links":{"cited_paper":"/paper/2301.12503","citing_paper":"/paper/2607.29148"},"observation_digest":"sha256:dc195398931b1ffa361a21366926e807ed779686569dc0cce96c7b0ea2d41527","observation_id":"8e6509e6-dac5-48c8-9391-0c7876ebc211","resolution":{"observed_at":"2026-08-03T12:46:58.947785Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2301.12503","last_updated":"2023-09-09T15:27:58Z","snapshot_observed_at":"2026-08-06T16:43:15.954030Z","submitted_at":"2023-01-29T17:48:17Z","title":"AudioLDM: Text-to-Audio Generation with Latent Diffusion Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2301.12503","snapshot_observed_at":"2026-08-05T13:43:18.242065Z","title":"DOI 10.48550/arXiv.2301.12503","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2608.03742","last_updated":"2026-08-04T14:36:34Z","snapshot_observed_at":"2026-08-08T01:12:36.890782Z","submitted_at":"2026-08-04T14:36:34Z","title":"AI-Based Sound Effect Generation: A Narrative Review of Generative Models Across Input Modalities","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-05T13:43:18.242065Z"},"links":{"cited_paper":"/paper/2301.12503","citing_paper":"/paper/2608.03742"},"observation_digest":"sha256:8a225d23cf0b4e58df6f75ee813518a3cb2775f06044837a3622edc9a9361594","observation_id":"5c16e57b-094a-4a42-a1dd-9b50a8f604f0","resolution":{"observed_at":"2026-08-05T13:43:18.242065Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2301.12503/citation-record","integrity":"/paper/2301.12503/integrity","json":"/paper/2301.12503/citation-record.json","paper":"/paper/2301.12503"},"outbound":[],"paper":{"arxiv_id":"2301.12503","last_updated":"2023-09-09T15:27:58Z","latest_version":3,"primary_category":"cs.SD","snapshot_observed_at":"2026-08-06T16:43:15.954030Z","submitted_at":"2023-01-29T17:48:17Z","title":"AudioLDM: Text-to-Audio Generation with Latent Diffusion Models"},"reference_resolution":{"displayed":0,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":0,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":0},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"thesis":"As of 9 August 2026, this Paper Citation Record lists 0 of 0 outbound references and 69 inbound Pith citation observations for arXiv:2301.12503."}