{"as_of":"2026-08-23T19:23:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:08070874ab8f56a56c3e06fbe72ec6a256378dc8e58cac99e15ff2c9c981d7b3","coverage":[{"denominator":44,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":44,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T11:15:29.298666Z","state":"measured"},{"denominator":45,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":45,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-23T06:30:58.430688+00:00","state":"measured"},{"denominator":1,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":1,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T11:15:29.130187Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"pith","source_observed_at":"2026-08-07T11:15:29.405841Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2506.03020","last_updated":"2025-06-03T15:57:55Z","snapshot_observed_at":"2026-08-20T05:40:38.804645Z","submitted_at":"2025-06-03T15:57:55Z","title":"InfiniteAudio: Infinite-Length Audio Generation with Consistency","version":1},"cited_work":{"arxiv_id":"2506.03020","doi":null,"metadata_source":"pith","pith_arxiv_id":"2506.03020","snapshot_observed_at":"2026-08-07T11:15:29.405841Z","title":"InfiniteAudio: Infinite-Length Audio Generation with Consistency","venue":"eess.AS","work_id":"50e20cf3-78ae-4075-b227-06d5bb43af67","year":2025},"citing_paper":{"arxiv_id":"2506.03020","last_updated":"2025-06-03T15:57:55Z","snapshot_observed_at":"2026-08-20T05:40:38.804645Z","submitted_at":"2025-06-03T15:57:55Z","title":"InfiniteAudio: Infinite-Length Audio Generation with Consistency","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-07T11:15:29.130187Z"},"links":{"cited_paper":"/paper/2506.03020","citing_paper":"/paper/2506.03020"},"observation_digest":"sha256:d13a25191e6b473b1dc6faef5852f3ecbaba9ea1dc9f052d4ab6a8944236f1c2","observation_id":"5f2371d3-c566-4729-80dc-216f41ef088e","resolution":{"observed_at":"2026-08-07T11:15:29.411903Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2506.03020/citation-record","integrity":"/paper/2506.03020/integrity","json":"/paper/2506.03020/citation-record.json","paper":"/paper/2506.03020"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2506.03020","last_updated":"2025-06-03T15:57:55Z","snapshot_observed_at":"2026-08-20T05:40:38.804645Z","submitted_at":"2025-06-03T15:57:55Z","title":"InfiniteAudio: Infinite-Length Audio Generation with Consistency","version":1},"cited_work":{"arxiv_id":"2506.03020","doi":null,"metadata_source":"pith","pith_arxiv_id":"2506.03020","snapshot_observed_at":"2026-08-07T11:15:29.405841Z","title":"InfiniteAudio: Infinite-Length Audio Generation with Consistency","venue":"eess.AS","work_id":"50e20cf3-78ae-4075-b227-06d5bb43af67","year":2025},"citing_paper":{"arxiv_id":"2506.03020","last_updated":"2025-06-03T15:57:55Z","snapshot_observed_at":"2026-08-20T05:40:38.804645Z","submitted_at":"2025-06-03T15:57:55Z","title":"InfiniteAudio: Infinite-Length Audio Generation with Consistency","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-07T11:15:29.130187Z"},"links":{"cited_paper":"/paper/2506.03020","citing_paper":"/paper/2506.03020"},"observation_digest":"sha256:d13a25191e6b473b1dc6faef5852f3ecbaba9ea1dc9f052d4ab6a8944236f1c2","observation_id":"5f2371d3-c566-4729-80dc-216f41ef088e","resolution":{"observed_at":"2026-08-07T11:15:29.411903Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:15:29.842414Z","title":null,"venue":null,"work_id":"4085a78f-3071-42a4-9ae2-ccc46bcb215b","year":null},"citing_paper":{"arxiv_id":"2506.03020","last_updated":"2025-06-03T15:57:55Z","snapshot_observed_at":"2026-08-20T05:40:38.804645Z","submitted_at":"2025-06-03T15:57:55Z","title":"InfiniteAudio: Infinite-Length Audio Generation with Consistency","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-07T11:15:29.135180Z"},"links":{"citing_paper":"/paper/2506.03020"},"observation_digest":"sha256:accd62d0f4bcf7b55c8a9c732e4957a47971dc452e6ebe3137399b7f4f8dbdc8","observation_id":"eb069cf2-2a63-4fe1-9bbe-861218c88589","resolution":{"observed_at":"2026-08-07T11:15:29.846267Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:15:29.830995Z","title":"Experimental Settings 3.1.1","venue":null,"work_id":"3f7ef162-2d05-47be-a57a-56081d2103ad","year":null},"citing_paper":{"arxiv_id":"2506.03020","last_updated":"2025-06-03T15:57:55Z","snapshot_observed_at":"2026-08-20T05:40:38.804645Z","submitted_at":"2025-06-03T15:57:55Z","title":"InfiniteAudio: Infinite-Length Audio Generation with Consistency","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-07T11:15:29.139433Z"},"links":{"citing_paper":"/paper/2506.03020"},"observation_digest":"sha256:907f9d4974939ef87b262c772ce29e805998238b672f44d9e8c5cdf4e1e85573","observation_id":"ccfe05a7-832a-4a0e-a5f0-8b7c1d392d4c","resolution":{"observed_at":"2026-08-07T11:15:29.835060Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:15:29.818561Z","title":"By maintaining a fixed memory footprint, InfiniteAudio overcomes memory constraints in existing mod- els and integrates seamlessly with diffusion-based TTA ap- proaches","venue":null,"work_id":"0d922448-75e4-4518-b25c-58c4867ae055","year":null},"citing_paper":{"arxiv_id":"2506.03020","last_updated":"2025-06-03T15:57:55Z","snapshot_observed_at":"2026-08-20T05:40:38.804645Z","submitted_at":"2025-06-03T15:57:55Z","title":"InfiniteAudio: Infinite-Length Audio Generation with Consistency","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-07T11:15:29.143842Z"},"links":{"citing_paper":"/paper/2506.03020"},"observation_digest":"sha256:35ff096da17f179db75848bea069d77b93fcf5c20e6ec336f520ccc316e24e21","observation_id":"5f530b7e-feea-49de-bca8-e9fba3285a5f","resolution":{"observed_at":"2026-08-07T11:15:29.823563Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:15:29.806193Z","title":"RS-2023-00212845, Multimodal Speech Processing for Human-Computer Interaction)","venue":null,"work_id":"ee54f6eb-7570-4478-9500-12289f056e1a","year":2023},"citing_paper":{"arxiv_id":"2506.03020","last_updated":"2025-06-03T15:57:55Z","snapshot_observed_at":"2026-08-20T05:40:38.804645Z","submitted_at":"2025-06-03T15:57:55Z","title":"InfiniteAudio: Infinite-Length Audio Generation with Consistency","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-07T11:15:29.148066Z"},"links":{"citing_paper":"/paper/2506.03020"},"observation_digest":"sha256:114ffef607a2e301b8a85a9e68ed2466f21c5bf2cddf33401b0f95f33168fefb","observation_id":"eb729819-53bf-45d0-af9e-0c204c2b2d6e","resolution":{"observed_at":"2026-08-07T11:15:29.810334Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:15:29.152190Z","title":"Denoising diffusion probabilistic models,","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2506.03020","last_updated":"2025-06-03T15:57:55Z","snapshot_observed_at":"2026-08-20T05:40:38.804645Z","submitted_at":"2025-06-03T15:57:55Z","title":"InfiniteAudio: Infinite-Length Audio Generation with Consistency","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-07T11:15:29.152190Z"},"links":{"citing_paper":"/paper/2506.03020"},"observation_digest":"sha256:db1faf5fb52059d45d27ecb3bbecf79059f5972dd6759dcc449336c5b7973356","observation_id":"3b86a537-961c-48aa-9a72-acffa1455aee","resolution":{"observed_at":"2026-08-07T11:15:29.152190Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:15:29.787328Z","title":"Score-based generative modeling through stochas- tic differential equations,","venue":null,"work_id":"b6bd09fd-b8f3-44c3-90bc-1f89425e9488","year":2021},"citing_paper":{"arxiv_id":"2506.03020","last_updated":"2025-06-03T15:57:55Z","snapshot_observed_at":"2026-08-20T05:40:38.804645Z","submitted_at":"2025-06-03T15:57:55Z","title":"InfiniteAudio: Infinite-Length Audio Generation with Consistency","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-07T11:15:29.156369Z"},"links":{"citing_paper":"/paper/2506.03020"},"observation_digest":"sha256:f3f16d0ce16420db3d84ed4ba0acd6d1321623c6e4a626fffb874f86f8eee90e","observation_id":"f8a3312a-1f31-4440-a7a2-7a336cac691a","resolution":{"observed_at":"2026-08-07T11:15:29.791011Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:15:29.776869Z","title":"Diffusion models beat gans on image synthesis,","venue":null,"work_id":"4516595d-81b5-4d08-9a47-ae2d848cc2fc","year":2021},"citing_paper":{"arxiv_id":"2506.03020","last_updated":"2025-06-03T15:57:55Z","snapshot_observed_at":"2026-08-20T05:40:38.804645Z","submitted_at":"2025-06-03T15:57:55Z","title":"InfiniteAudio: Infinite-Length Audio Generation with Consistency","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-07T11:15:29.160078Z"},"links":{"citing_paper":"/paper/2506.03020"},"observation_digest":"sha256:53dec734986420b2c0cac72ef64ecab524a6c587b80545f1d1d30c6fc8e7859f","observation_id":"5cfc2770-d11e-4cae-a9d4-50d641926407","resolution":{"observed_at":"2026-08-07T11:15:29.780498Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:15:29.764845Z","title":"High-resolution image synthesis with latent diffusion models,","venue":null,"work_id":"cad346bc-244f-4ac9-8880-c557b0445213","year":2022},"citing_paper":{"arxiv_id":"2506.03020","last_updated":"2025-06-03T15:57:55Z","snapshot_observed_at":"2026-08-20T05:40:38.804645Z","submitted_at":"2025-06-03T15:57:55Z","title":"InfiniteAudio: Infinite-Length Audio Generation with Consistency","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-07T11:15:29.163704Z"},"links":{"citing_paper":"/paper/2506.03020"},"observation_digest":"sha256:9b7b44eb42d61f8390a654588ae07e59859bdb3f3db69b2ef179ea6ad6ac5e9e","observation_id":"de5250bd-5132-4b34-8e03-c182c788b73f","resolution":{"observed_at":"2026-08-07T11:15:29.769571Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:15:29.753924Z","title":"Photorealistic text-to-image diffusion models with deep language understanding,","venue":null,"work_id":"c77af51d-b859-4d86-bee8-0c0511db19e6","year":2022},"citing_paper":{"arxiv_id":"2506.03020","last_updated":"2025-06-03T15:57:55Z","snapshot_observed_at":"2026-08-20T05:40:38.804645Z","submitted_at":"2025-06-03T15:57:55Z","title":"InfiniteAudio: Infinite-Length Audio Generation with Consistency","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-07T11:15:29.168320Z"},"links":{"citing_paper":"/paper/2506.03020"},"observation_digest":"sha256:fa24ed34cab8402746f964137e728e0a3f271c9c1317d30f85a33e0617d706be","observation_id":"39634684-3279-47b8-9d7d-1f23a7dfaa90","resolution":{"observed_at":"2026-08-07T11:15:29.757806Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2112.10741","last_updated":"2022-03-08T18:18:49Z","snapshot_observed_at":"2026-08-07T12:21:17.790675Z","submitted_at":"2021-12-20T18:42:55Z","title":"GLIDE: Towards Photorealistic Image Generation and Editing with Text-Guided Diffusion Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2112.10741","snapshot_observed_at":"2026-08-07T11:15:29.172025Z","title":"Glide: Towards photorealistic image generation and editing with text-guided diffusion models,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2506.03020","last_updated":"2025-06-03T15:57:55Z","snapshot_observed_at":"2026-08-20T05:40:38.804645Z","submitted_at":"2025-06-03T15:57:55Z","title":"InfiniteAudio: Infinite-Length Audio Generation with Consistency","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-07T11:15:29.172025Z"},"links":{"cited_paper":"/paper/2112.10741","citing_paper":"/paper/2506.03020"},"observation_digest":"sha256:ba0b1f435685c2e85b4b2d0fb05657def4bcdcd65ca78f4f755ea8a0ba181035","observation_id":"a106569f-de3c-4989-8d91-310ea0224355","resolution":{"observed_at":"2026-08-07T11:15:29.172025Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:15:29.741462Z","title":"Video diffusion models,","venue":null,"work_id":"62e15cd5-8cd8-421a-8a00-fabf0aa6ba15","year":2022},"citing_paper":{"arxiv_id":"2506.03020","last_updated":"2025-06-03T15:57:55Z","snapshot_observed_at":"2026-08-20T05:40:38.804645Z","submitted_at":"2025-06-03T15:57:55Z","title":"InfiniteAudio: Infinite-Length Audio Generation with Consistency","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-07T11:15:29.175795Z"},"links":{"citing_paper":"/paper/2506.03020"},"observation_digest":"sha256:a6aab388110cf0dcb1a10e5638a1b8b9e58809fe77cab195cc72ec5ee155b337","observation_id":"89313319-e468-4e86-9719-a64693174a01","resolution":{"observed_at":"2026-08-07T11:15:29.746532Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2209.14792","last_updated":"2022-09-29T13:59:46Z","snapshot_observed_at":"2026-07-06T13:57:47.051387Z","submitted_at":"2022-09-29T13:59:46Z","title":"Make-A-Video: Text-to-Video Generation without Text-Video Data","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2209.14792","snapshot_observed_at":"2026-08-07T11:15:29.179818Z","title":"Make-a-video: Text- to-video generation without text-video data,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.03020","last_updated":"2025-06-03T15:57:55Z","snapshot_observed_at":"2026-08-20T05:40:38.804645Z","submitted_at":"2025-06-03T15:57:55Z","title":"InfiniteAudio: Infinite-Length Audio Generation with Consistency","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-07T11:15:29.179818Z"},"links":{"cited_paper":"/paper/2209.14792","citing_paper":"/paper/2506.03020"},"observation_digest":"sha256:1da811cdf761d2f102ea9e558ee8ac18b48d05a68e254d0b4bd06c28807f2173","observation_id":"9e4a09d3-ffac-4e31-8307-e7602abf7efd","resolution":{"observed_at":"2026-08-07T11:15:29.179818Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2308.06571","last_updated":"2023-08-12T13:53:10Z","snapshot_observed_at":"2026-08-14T13:59:50.878772Z","submitted_at":"2023-08-12T13:53:10Z","title":"ModelScope Text-to-Video Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2308.06571","snapshot_observed_at":"2026-08-07T11:15:29.183502Z","title":"Modelscope text-to-video technical report,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.03020","last_updated":"2025-06-03T15:57:55Z","snapshot_observed_at":"2026-08-20T05:40:38.804645Z","submitted_at":"2025-06-03T15:57:55Z","title":"InfiniteAudio: Infinite-Length Audio Generation with Consistency","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-07T11:15:29.183502Z"},"links":{"cited_paper":"/paper/2308.06571","citing_paper":"/paper/2506.03020"},"observation_digest":"sha256:584f434948d680d54553c8defd07642ef73a8cced2db9880702bee602643e557","observation_id":"86b55108-fd9e-4768-a155-1502d06f969a","resolution":{"observed_at":"2026-08-07T11:15:29.183502Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:15:29.728679Z","title":"Diffusion probabilistic modeling for video generation,","venue":null,"work_id":"ebe65bdd-a054-46b6-b865-ac378530c2a3","year":2023},"citing_paper":{"arxiv_id":"2506.03020","last_updated":"2025-06-03T15:57:55Z","snapshot_observed_at":"2026-08-20T05:40:38.804645Z","submitted_at":"2025-06-03T15:57:55Z","title":"InfiniteAudio: Infinite-Length Audio Generation with Consistency","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-07T11:15:29.187871Z"},"links":{"citing_paper":"/paper/2506.03020"},"observation_digest":"sha256:c8eff502a022ae0c4603e8a07f5457bd07c4e7ea7cf1a74b1f6e7e95ae31ffca","observation_id":"f3b41be3-f794-42d8-9dcc-f95958b0c9aa","resolution":{"observed_at":"2026-08-07T11:15:29.733236Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:15:29.716284Z","title":"Lavie: High-quality video generation with cascaded latent diffusion models,","venue":null,"work_id":"6c975728-957c-44ce-bb36-00f6c532d080","year":2024},"citing_paper":{"arxiv_id":"2506.03020","last_updated":"2025-06-03T15:57:55Z","snapshot_observed_at":"2026-08-20T05:40:38.804645Z","submitted_at":"2025-06-03T15:57:55Z","title":"InfiniteAudio: Infinite-Length Audio Generation with Consistency","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-07T11:15:29.191718Z"},"links":{"citing_paper":"/paper/2506.03020"},"observation_digest":"sha256:76854a111b5759ae213ee286e2fd17f1e679157bc31aef5a1c6ffc1ade80ea3e","observation_id":"0d60dd27-254f-4b35-a71b-0e5c6909fb64","resolution":{"observed_at":"2026-08-07T11:15:29.720733Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:15:29.704164Z","title":"Lumiere: A space-time diffusion model for video generation,","venue":null,"work_id":"4c907478-6d4f-46a6-b48e-22780d3fcb9d","year":2024},"citing_paper":{"arxiv_id":"2506.03020","last_updated":"2025-06-03T15:57:55Z","snapshot_observed_at":"2026-08-20T05:40:38.804645Z","submitted_at":"2025-06-03T15:57:55Z","title":"InfiniteAudio: Infinite-Length Audio Generation with Consistency","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-07T11:15:29.195481Z"},"links":{"citing_paper":"/paper/2506.03020"},"observation_digest":"sha256:3dc48c3d447598aed5ab79c7334cb9bcb5d8687a0713081e332c9b4dfdb46647","observation_id":"d5a38f46-b585-457e-800a-7cbe84c5ea66","resolution":{"observed_at":"2026-08-07T11:15:29.707985Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.19512","last_updated":"2023-10-30T13:12:40Z","snapshot_observed_at":"2026-08-19T21:14:32.076838Z","submitted_at":"2023-10-30T13:12:40Z","title":"VideoCrafter1: Open Diffusion Models for High-Quality Video Generation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.19512","snapshot_observed_at":"2026-08-07T11:15:29.199056Z","title":"Videocrafter1: Open diffusion models for high-quality video generation,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.03020","last_updated":"2025-06-03T15:57:55Z","snapshot_observed_at":"2026-08-20T05:40:38.804645Z","submitted_at":"2025-06-03T15:57:55Z","title":"InfiniteAudio: Infinite-Length Audio Generation with Consistency","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-07T11:15:29.199056Z"},"links":{"cited_paper":"/paper/2310.19512","citing_paper":"/paper/2506.03020"},"observation_digest":"sha256:fe9abe4cd01095b91e929afce083144291a8b7bfeec4fcf96cdf67ddde1b436a","observation_id":"27ba4731-e7cd-467a-9b30-89b0c2bc7a72","resolution":{"observed_at":"2026-08-07T11:15:29.199056Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:15:29.691774Z","title":"Grad-tts: A diffusion probabilistic model for text-to-speech,","venue":null,"work_id":"ebc71d59-1ac5-4706-91c5-05976a52fb2e","year":2021},"citing_paper":{"arxiv_id":"2506.03020","last_updated":"2025-06-03T15:57:55Z","snapshot_observed_at":"2026-08-20T05:40:38.804645Z","submitted_at":"2025-06-03T15:57:55Z","title":"InfiniteAudio: Infinite-Length Audio Generation with Consistency","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-07T11:15:29.203252Z"},"links":{"citing_paper":"/paper/2506.03020"},"observation_digest":"sha256:20bc466a45714248ff3af9951e4ae4b79c38322c76c6974a1d2a0812d8b6aa6c","observation_id":"f54f27e5-cb6c-4de6-8483-d128bf4a38b5","resolution":{"observed_at":"2026-08-07T11:15:29.696207Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:15:29.680143Z","title":"Guided-tts: A diffusion model for text-to-speech via classifier guidance,","venue":null,"work_id":"507a6ff2-891d-4683-8cfc-e4cfc2f5d0a8","year":2022},"citing_paper":{"arxiv_id":"2506.03020","last_updated":"2025-06-03T15:57:55Z","snapshot_observed_at":"2026-08-20T05:40:38.804645Z","submitted_at":"2025-06-03T15:57:55Z","title":"InfiniteAudio: Infinite-Length Audio Generation with Consistency","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-07T11:15:29.207000Z"},"links":{"citing_paper":"/paper/2506.03020"},"observation_digest":"sha256:2044afc8b6a32b91661ddda91ba188840484e6dd61d280472fa22fe3a7374277","observation_id":"f051bee3-0b76-403f-9de9-b12b77f1778a","resolution":{"observed_at":"2026-08-07T11:15:29.684350Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:15:29.669043Z","title":"Styletts 2: Towards human-level text-to-speech through style dif- fusion and adversarial training with large speech language mod- els,","venue":null,"work_id":"b4639248-37cd-4ecf-9eb9-357167c70311","year":2024},"citing_paper":{"arxiv_id":"2506.03020","last_updated":"2025-06-03T15:57:55Z","snapshot_observed_at":"2026-08-20T05:40:38.804645Z","submitted_at":"2025-06-03T15:57:55Z","title":"InfiniteAudio: Infinite-Length Audio Generation with Consistency","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-07T11:15:29.210883Z"},"links":{"citing_paper":"/paper/2506.03020"},"observation_digest":"sha256:a1890a9b070c272da432e5a1fa837ca163f384b20d536d2f4cb30c2dcf02fa36","observation_id":"8109f49c-d5af-4bcc-9661-c823f76a7e9d","resolution":{"observed_at":"2026-08-07T11:15:29.672918Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:15:29.657353Z","title":"Diff- tts: A denoising diffusion model for text-to-speech,","venue":null,"work_id":"1832beb5-d145-4219-9a7a-c787d36b30bd","year":2021},"citing_paper":{"arxiv_id":"2506.03020","last_updated":"2025-06-03T15:57:55Z","snapshot_observed_at":"2026-08-20T05:40:38.804645Z","submitted_at":"2025-06-03T15:57:55Z","title":"InfiniteAudio: Infinite-Length Audio Generation with Consistency","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-07T11:15:29.214462Z"},"links":{"citing_paper":"/paper/2506.03020"},"observation_digest":"sha256:9b8c579bc28c01dfbd79b1de8da0c30d0394426ce27434622c4c71775b8b82e9","observation_id":"57d6dd6b-933e-4d3f-9750-035faa31b2e9","resolution":{"observed_at":"2026-08-07T11:15:29.661613Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:15:29.645317Z","title":"Diffvoice: Text-to-speech with latent diffusion,","venue":null,"work_id":"101a2634-88a8-47b5-93a9-b2e6fc50aa93","year":2023},"citing_paper":{"arxiv_id":"2506.03020","last_updated":"2025-06-03T15:57:55Z","snapshot_observed_at":"2026-08-20T05:40:38.804645Z","submitted_at":"2025-06-03T15:57:55Z","title":"InfiniteAudio: Infinite-Length Audio Generation with Consistency","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-07T11:15:29.218091Z"},"links":{"citing_paper":"/paper/2506.03020"},"observation_digest":"sha256:2c6947d3e90ef16bbc16f724cf5504769275d1fe89929e976850c9f3714cb3a4","observation_id":"7b86be98-725f-4c92-b5c5-a23c123821a2","resolution":{"observed_at":"2026-08-07T11:15:29.649795Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:15:29.632912Z","title":"Seeing through the conversation: Audio-visual speech separation based on diffu- sion model,","venue":null,"work_id":"57afd72c-e067-4bca-852b-dc92dcc682eb","year":2024},"citing_paper":{"arxiv_id":"2506.03020","last_updated":"2025-06-03T15:57:55Z","snapshot_observed_at":"2026-08-20T05:40:38.804645Z","submitted_at":"2025-06-03T15:57:55Z","title":"InfiniteAudio: Infinite-Length Audio Generation with Consistency","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-07T11:15:29.221522Z"},"links":{"citing_paper":"/paper/2506.03020"},"observation_digest":"sha256:d36dc0bdb1c85eb187f276c2732817d936a795cd4b61a9413ceec035898836b3","observation_id":"af3b32da-6ab6-4187-bf6b-e1c406edae89","resolution":{"observed_at":"2026-08-07T11:15:29.637107Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:15:29.620345Z","title":"Flowavse: Efficient audio-visual speech enhancement with conditional flow match- ing,","venue":null,"work_id":"cd26dc00-d776-4372-b84c-d09f35f87696","year":2024},"citing_paper":{"arxiv_id":"2506.03020","last_updated":"2025-06-03T15:57:55Z","snapshot_observed_at":"2026-08-20T05:40:38.804645Z","submitted_at":"2025-06-03T15:57:55Z","title":"InfiniteAudio: Infinite-Length Audio Generation with Consistency","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-07T11:15:29.224925Z"},"links":{"citing_paper":"/paper/2506.03020"},"observation_digest":"sha256:fe6a6554390eb9afeb7f1df87e4202f2a75300170f317ceeed72a0befd564be6","observation_id":"6156ec42-0b25-4925-8bd0-abb46993b330","resolution":{"observed_at":"2026-08-07T11:15:29.624372Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:15:29.608209Z","title":"Align your latents: High-resolution video synthesis with latent diffusion models,","venue":null,"work_id":"bffbe5ba-cbfd-4789-bcdc-47598cd99ff2","year":2023},"citing_paper":{"arxiv_id":"2506.03020","last_updated":"2025-06-03T15:57:55Z","snapshot_observed_at":"2026-08-20T05:40:38.804645Z","submitted_at":"2025-06-03T15:57:55Z","title":"InfiniteAudio: Infinite-Length Audio Generation with Consistency","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-07T11:15:29.228519Z"},"links":{"citing_paper":"/paper/2506.03020"},"observation_digest":"sha256:51cae29b0cc42f9ff6348b33c5f206dd0903a85078ae2c0effe488c84c9ed1bf","observation_id":"5a976e0a-cc9a-49af-8e78-7237cf7278bf","resolution":{"observed_at":"2026-08-07T11:15:29.612176Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:15:29.595639Z","title":"Sdxl: Improving latent diffusion models for high-resolution image synthesis,","venue":null,"work_id":"4af690b2-3952-4e16-a0ff-97091877ae02","year":2025},"citing_paper":{"arxiv_id":"2506.03020","last_updated":"2025-06-03T15:57:55Z","snapshot_observed_at":"2026-08-20T05:40:38.804645Z","submitted_at":"2025-06-03T15:57:55Z","title":"InfiniteAudio: Infinite-Length Audio Generation with Consistency","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-07T11:15:29.231988Z"},"links":{"citing_paper":"/paper/2506.03020"},"observation_digest":"sha256:a77ee1b83a9789fcfe09e22247066f21099d35bfb8e6c3c5fa3ea13955bbc5f0","observation_id":"cb3aa06b-f215-4c34-86cc-a3673c53dfab","resolution":{"observed_at":"2026-08-07T11:15:29.600274Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2211.11018","last_updated":"2023-05-11T11:23:03Z","snapshot_observed_at":"2026-08-16T05:49:16.026825Z","submitted_at":"2022-11-20T16:40:31Z","title":"MagicVideo: Efficient Video Generation With Latent Diffusion Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2211.11018","snapshot_observed_at":"2026-08-07T11:15:29.235872Z","title":"Mag- icvideo: Efficient video generation with latent diffusion models,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.03020","last_updated":"2025-06-03T15:57:55Z","snapshot_observed_at":"2026-08-20T05:40:38.804645Z","submitted_at":"2025-06-03T15:57:55Z","title":"InfiniteAudio: Infinite-Length Audio Generation with Consistency","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-07T11:15:29.235872Z"},"links":{"cited_paper":"/paper/2211.11018","citing_paper":"/paper/2506.03020"},"observation_digest":"sha256:7d01ab55986dcb5bc4192ee7d8bb135b60d1be361e213b9f39b7a469d7fe98cb","observation_id":"9fd8a0f5-ff5e-4a06-8312-4a56ff561ddf","resolution":{"observed_at":"2026-08-07T11:15:29.235872Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:15:29.583873Z","title":"Audioldm: Text-to-audio generation with latent diffusion models,","venue":null,"work_id":"8d2cbe99-e346-4406-bf1d-448575a3c387","year":2023},"citing_paper":{"arxiv_id":"2506.03020","last_updated":"2025-06-03T15:57:55Z","snapshot_observed_at":"2026-08-20T05:40:38.804645Z","submitted_at":"2025-06-03T15:57:55Z","title":"InfiniteAudio: Infinite-Length Audio Generation with Consistency","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-07T11:15:29.240112Z"},"links":{"citing_paper":"/paper/2506.03020"},"observation_digest":"sha256:199fbe3950b56216e1867680b75b24e92c8603fa03da7cf3e77806f55ede55b9","observation_id":"7e820fc2-4075-482c-9639-746512f3fa34","resolution":{"observed_at":"2026-08-07T11:15:29.588251Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:15:29.572759Z","title":"Make-an-audio: Text-to-audio generation with prompt-enhanced diffusion models,","venue":null,"work_id":"4382cffd-a054-4c12-85c9-633a0fe945df","year":2023},"citing_paper":{"arxiv_id":"2506.03020","last_updated":"2025-06-03T15:57:55Z","snapshot_observed_at":"2026-08-20T05:40:38.804645Z","submitted_at":"2025-06-03T15:57:55Z","title":"InfiniteAudio: Infinite-Length Audio Generation with Consistency","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-07T11:15:29.244323Z"},"links":{"citing_paper":"/paper/2506.03020"},"observation_digest":"sha256:889f38263c1fbf6ec267e57eb9f1b2fa9621d5be7ac206c96dd7292c153e036c","observation_id":"e048eff2-ba2f-44ed-b190-22c4e382ed04","resolution":{"observed_at":"2026-08-07T11:15:29.576666Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:15:29.561209Z","title":"V oiceldm: Text-to- speech with environmental context,","venue":null,"work_id":"4ba4b1f3-317b-4898-9b67-049d5c5939bb","year":2024},"citing_paper":{"arxiv_id":"2506.03020","last_updated":"2025-06-03T15:57:55Z","snapshot_observed_at":"2026-08-20T05:40:38.804645Z","submitted_at":"2025-06-03T15:57:55Z","title":"InfiniteAudio: Infinite-Length Audio Generation with Consistency","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-07T11:15:29.248684Z"},"links":{"citing_paper":"/paper/2506.03020"},"observation_digest":"sha256:b5176fc9c3474675b65390a2d285521b1d16b251c3897765b8b3d14b0567e000","observation_id":"a49d0fa2-2227-43b8-b8d3-af11e8663197","resolution":{"observed_at":"2026-08-07T11:15:29.564876Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:15:29.549092Z","title":"Audioldm 2: Learn- ing holistic audio generation with self-supervised pretraining,","venue":null,"work_id":"166d9893-ae98-4a43-839e-aa258fb988f1","year":2024},"citing_paper":{"arxiv_id":"2506.03020","last_updated":"2025-06-03T15:57:55Z","snapshot_observed_at":"2026-08-20T05:40:38.804645Z","submitted_at":"2025-06-03T15:57:55Z","title":"InfiniteAudio: Infinite-Length Audio Generation with Consistency","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-07T11:15:29.252711Z"},"links":{"citing_paper":"/paper/2506.03020"},"observation_digest":"sha256:43d8999aaba59add37deb5e160ce10b729b1670e8b0882e6a1b03e9301b88ebc","observation_id":"6ea3cae4-b986-49c2-8a79-a1681b2fab8a","resolution":{"observed_at":"2026-08-07T11:15:29.553485Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:15:29.537165Z","title":"Text-to- audio generation using instruction-tuned llm and latent diffusion model,","venue":null,"work_id":"745d316a-6439-4279-b6a8-8c457d80b857","year":2023},"citing_paper":{"arxiv_id":"2506.03020","last_updated":"2025-06-03T15:57:55Z","snapshot_observed_at":"2026-08-20T05:40:38.804645Z","submitted_at":"2025-06-03T15:57:55Z","title":"InfiniteAudio: Infinite-Length Audio Generation with Consistency","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-07T11:15:29.256544Z"},"links":{"citing_paper":"/paper/2506.03020"},"observation_digest":"sha256:91ccd1a27478cbd23d1712eac09f63e08a5d75bb3de41221eee3e2d931f10290","observation_id":"a97b098f-ae67-4d01-b6b8-da99958be779","resolution":{"observed_at":"2026-08-07T11:15:29.541745Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:15:29.525291Z","title":"Diffsound: Discrete diffusion model for text-to-sound genera- tion,","venue":null,"work_id":"5fc1f7e2-b8fe-4a3e-b91a-864e49a3b2bd","year":2023},"citing_paper":{"arxiv_id":"2506.03020","last_updated":"2025-06-03T15:57:55Z","snapshot_observed_at":"2026-08-20T05:40:38.804645Z","submitted_at":"2025-06-03T15:57:55Z","title":"InfiniteAudio: Infinite-Length Audio Generation with Consistency","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-07T11:15:29.260392Z"},"links":{"citing_paper":"/paper/2506.03020"},"observation_digest":"sha256:a48f05e6ce92ecda83d2ffc0bdec310b133742e9b4986fef7c378b43497cd40f","observation_id":"58978121-011a-44ec-bb1e-92546c2d17c2","resolution":{"observed_at":"2026-08-07T11:15:29.529402Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:15:29.512719Z","title":"Retrieval-augmented text-to-audio generation,","venue":null,"work_id":"0be3acad-2541-4d49-b86c-f6bbf261aabc","year":2024},"citing_paper":{"arxiv_id":"2506.03020","last_updated":"2025-06-03T15:57:55Z","snapshot_observed_at":"2026-08-20T05:40:38.804645Z","submitted_at":"2025-06-03T15:57:55Z","title":"InfiniteAudio: Infinite-Length Audio Generation with Consistency","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-07T11:15:29.264732Z"},"links":{"citing_paper":"/paper/2506.03020"},"observation_digest":"sha256:0e3ac81d42959d78e82fdceddc22d7bdb1ae59a3e36136242e6e21ee1a934f37","observation_id":"791730e3-5328-434f-9034-6d1415e4bd80","resolution":{"observed_at":"2026-08-07T11:15:29.517574Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:15:29.500330Z","title":"Audiogen: Tex- tually guided audio generation,","venue":null,"work_id":"a817a636-5cf8-461f-99b2-30b793467f30","year":2023},"citing_paper":{"arxiv_id":"2506.03020","last_updated":"2025-06-03T15:57:55Z","snapshot_observed_at":"2026-08-20T05:40:38.804645Z","submitted_at":"2025-06-03T15:57:55Z","title":"InfiniteAudio: Infinite-Length Audio Generation with Consistency","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-07T11:15:29.268602Z"},"links":{"citing_paper":"/paper/2506.03020"},"observation_digest":"sha256:25333eb281fe2e486c805bb3dfab6f8f69a43897b823f00b208d1ad7fdda44fe","observation_id":"876d4dba-e86e-46a1-ba67-cca7bfe0fe8f","resolution":{"observed_at":"2026-08-07T11:15:29.504410Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:15:29.487859Z","title":"Audiolcm: Text-to-audio generation with latent consistency models,","venue":null,"work_id":"ba0e24a9-84ab-43f7-8798-992d20609488","year":2024},"citing_paper":{"arxiv_id":"2506.03020","last_updated":"2025-06-03T15:57:55Z","snapshot_observed_at":"2026-08-20T05:40:38.804645Z","submitted_at":"2025-06-03T15:57:55Z","title":"InfiniteAudio: Infinite-Length Audio Generation with Consistency","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-07T11:15:29.272490Z"},"links":{"citing_paper":"/paper/2506.03020"},"observation_digest":"sha256:1037a5a65142553b000b39f6c727a1e85d63ef85c9fcd630cbcd9507d991fdf3","observation_id":"286cda28-fcb7-407d-aeb5-71461309ea0a","resolution":{"observed_at":"2026-08-07T11:15:29.491876Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:15:29.475669Z","title":"V oicedit: Dual-condition diffusion transformer for environment- aware speech synthesis,","venue":null,"work_id":"41011cf7-efe3-47b1-88bc-ba7fda8ae3c6","year":2025},"citing_paper":{"arxiv_id":"2506.03020","last_updated":"2025-06-03T15:57:55Z","snapshot_observed_at":"2026-08-20T05:40:38.804645Z","submitted_at":"2025-06-03T15:57:55Z","title":"InfiniteAudio: Infinite-Length Audio Generation with Consistency","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-07T11:15:29.276204Z"},"links":{"citing_paper":"/paper/2506.03020"},"observation_digest":"sha256:62168d59030ccd9884f19e91fbebe65e33029d1885fc76d94aeaad00e6d2dfa9","observation_id":"16c97098-b746-4ff7-8b05-c0e87b5fe47a","resolution":{"observed_at":"2026-08-07T11:15:29.479722Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:15:29.280072Z","title":"Large-scale contrastive language-audio pretraining with feature fusion and keyword-to-caption augmentation,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.03020","last_updated":"2025-06-03T15:57:55Z","snapshot_observed_at":"2026-08-20T05:40:38.804645Z","submitted_at":"2025-06-03T15:57:55Z","title":"InfiniteAudio: Infinite-Length Audio Generation with Consistency","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-07T11:15:29.280072Z"},"links":{"citing_paper":"/paper/2506.03020"},"observation_digest":"sha256:dbd0786c3c6cf54747fc3dff36137c7e2f581ae26b3d8e939ad65dda103b3044","observation_id":"06c6a679-7c00-43cc-b16f-c8541797b9c7","resolution":{"observed_at":"2026-08-07T11:15:29.280072Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:15:29.456159Z","title":"Audio generation with multiple conditional diffusion model,","venue":null,"work_id":"2ec2999e-b88b-4060-9642-5ed2503981cc","year":2024},"citing_paper":{"arxiv_id":"2506.03020","last_updated":"2025-06-03T15:57:55Z","snapshot_observed_at":"2026-08-20T05:40:38.804645Z","submitted_at":"2025-06-03T15:57:55Z","title":"InfiniteAudio: Infinite-Length Audio Generation with Consistency","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-07T11:15:29.283889Z"},"links":{"citing_paper":"/paper/2506.03020"},"observation_digest":"sha256:9ff9f3d9c00eb2a793f16654798f076b5e278cbbb14c00783d4139547dd4abcc","observation_id":"e21c7011-5331-479c-b62f-2a4e6b41e9fe","resolution":{"observed_at":"2026-08-07T11:15:29.460184Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:15:29.287760Z","title":"Fifo-diffusion: Generating infinite videos from text without training,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.03020","last_updated":"2025-06-03T15:57:55Z","snapshot_observed_at":"2026-08-20T05:40:38.804645Z","submitted_at":"2025-06-03T15:57:55Z","title":"InfiniteAudio: Infinite-Length Audio Generation with Consistency","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-07T11:15:29.287760Z"},"links":{"citing_paper":"/paper/2506.03020"},"observation_digest":"sha256:7d7c5b3b797b76fe27b9ddaeb1942a458c9701c87e683038a1084a1fd8adadef","observation_id":"167e2606-7bd3-421b-977f-d923e44fcc9b","resolution":{"observed_at":"2026-08-07T11:15:29.287760Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:15:29.433425Z","title":"Denoising diffusion implicit models,","venue":null,"work_id":"2805ba94-fb65-4ac7-807f-2967a0bbc855","year":2021},"citing_paper":{"arxiv_id":"2506.03020","last_updated":"2025-06-03T15:57:55Z","snapshot_observed_at":"2026-08-20T05:40:38.804645Z","submitted_at":"2025-06-03T15:57:55Z","title":"InfiniteAudio: Infinite-Length Audio Generation with Consistency","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-07T11:15:29.291346Z"},"links":{"citing_paper":"/paper/2506.03020"},"observation_digest":"sha256:3ac0afcb3e1bb1af2cc928e9a6d7603358e2d4084dec2f279c88739a472f3f1f","observation_id":"2133b333-4427-44e8-b34d-4f1631106118","resolution":{"observed_at":"2026-08-07T11:15:29.438900Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:15:29.421286Z","title":"AudioCaps: Generating captions for audios in the wild,","venue":null,"work_id":"5ea66245-7796-421f-865a-99bc79534e5c","year":2019},"citing_paper":{"arxiv_id":"2506.03020","last_updated":"2025-06-03T15:57:55Z","snapshot_observed_at":"2026-08-20T05:40:38.804645Z","submitted_at":"2025-06-03T15:57:55Z","title":"InfiniteAudio: Infinite-Length Audio Generation with Consistency","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-07T11:15:29.294757Z"},"links":{"citing_paper":"/paper/2506.03020"},"observation_digest":"sha256:482b5a5b6abd986fe157d6f48338aa03e332919951b3ff80a2dd06043d36e412","observation_id":"d7552b1a-00c2-490e-9072-51585041efcf","resolution":{"observed_at":"2026-08-07T11:15:29.425552Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2312.15821","last_updated":"2023-12-25T22:24:49Z","snapshot_observed_at":"2026-08-17T22:52:14.678531Z","submitted_at":"2023-12-25T22:24:49Z","title":"Audiobox: Unified Audio Generation with Natural Language Prompts","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.15821","snapshot_observed_at":"2026-08-07T11:15:29.298666Z","title":"Audiobox: Unified audio generation with natural language prompts,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.03020","last_updated":"2025-06-03T15:57:55Z","snapshot_observed_at":"2026-08-20T05:40:38.804645Z","submitted_at":"2025-06-03T15:57:55Z","title":"InfiniteAudio: Infinite-Length Audio Generation with Consistency","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-07T11:15:29.298666Z"},"links":{"cited_paper":"/paper/2312.15821","citing_paper":"/paper/2506.03020"},"observation_digest":"sha256:d0aa010001007c78aa39b9714d3c24f40109495d5e4503cc5009b4039bbcd087","observation_id":"8a35ce5e-51c7-41c7-b247-0f98169daa3c","resolution":{"observed_at":"2026-08-07T11:15:29.298666Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2506.03020","last_updated":"2025-06-03T15:57:55Z","latest_version":1,"primary_category":"eess.AS","snapshot_observed_at":"2026-08-20T05:40:38.804645Z","submitted_at":"2025-06-03T15:57:55Z","title":"InfiniteAudio: Infinite-Length Audio Generation with Consistency"},"reference_resolution":{"displayed":44,"state_counts":{"malformed_identifier":0,"metadata_mismatch":1,"parse_uncertain":0,"unresolved":10,"verified_exact":0,"verified_fuzzy":33},"total_outbound_references":44},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"thesis":"As of 23 August 2026, this Paper Citation Record lists 44 of 44 outbound references and 1 inbound Pith citation observation for arXiv:2506.03020."}