{"as_of":"2026-08-18T06:05:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:a6bc8afe23986296191b992e2153773fec9b95fab6a4c8db943b3feac1b3e63a","coverage":[{"denominator":63,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":63,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-01T17:47:18.852570Z","state":"measured"},{"denominator":63,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":63,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-17T06:30:58.91139+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2607.17526/citation-record","integrity":"/paper/2607.17526/integrity","json":"/paper/2607.17526/citation-record.json","paper":"/paper/2607.17526"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2006.11239","last_updated":"2020-12-16T21:15:05Z","snapshot_observed_at":"2026-08-10T05:21:27.485481Z","submitted_at":"2020-06-19T17:24:44Z","title":"Denoising Diffusion Probabilistic Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2006.11239","snapshot_observed_at":"2026-08-01T17:47:11.176438Z","title":"Denoising diffusion probabilistic models,","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2607.17526","last_updated":"2026-07-20T04:00:16Z","snapshot_observed_at":"2026-08-16T06:04:29.231090Z","submitted_at":"2026-07-20T04:00:16Z","title":"FlowSonic: Stable Zero-Shot Music Editing via High-Order Trajectory Integration","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-01T17:47:11.176438Z"},"links":{"cited_paper":"/paper/2006.11239","citing_paper":"/paper/2607.17526"},"observation_digest":"sha256:dd19981dfd719c40ec347c529fd8365e4c9fda46ba0d34439621e3e0d4d422dc","observation_id":"c2fe4643-2e89-43e2-b9d8-a478e40622c5","resolution":{"observed_at":"2026-08-01T17:47:11.176438Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2011.13456","last_updated":"2021-02-10T18:17:04Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2020-11-26T19:39:10Z","title":"Score-Based Generative Modeling through Stochastic Differential Equations","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2011.13456","snapshot_observed_at":"2026-08-01T17:47:11.299704Z","title":"Score-based generative modeling through stochastic differential equations,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2607.17526","last_updated":"2026-07-20T04:00:16Z","snapshot_observed_at":"2026-08-16T06:04:29.231090Z","submitted_at":"2026-07-20T04:00:16Z","title":"FlowSonic: Stable Zero-Shot Music Editing via High-Order Trajectory Integration","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-01T17:47:11.299704Z"},"links":{"cited_paper":"/paper/2011.13456","citing_paper":"/paper/2607.17526"},"observation_digest":"sha256:4c2215b84349bf87b7af83747e74c4aad7e0f11ed12a04bb53c46ca835d55f19","observation_id":"3ba7b517-4372-416d-972e-2822a27a00b4","resolution":{"observed_at":"2026-08-01T17:47:11.299704Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2206.00364","last_updated":"2022-10-11T13:20:30Z","snapshot_observed_at":"2026-07-06T13:16:16.926712Z","submitted_at":"2022-06-01T10:03:24Z","title":"Elucidating the Design Space of Diffusion-Based Generative Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2206.00364","snapshot_observed_at":"2026-08-01T17:47:11.456299Z","title":"Elucidating the design space of diffusion-based generative models,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2607.17526","last_updated":"2026-07-20T04:00:16Z","snapshot_observed_at":"2026-08-16T06:04:29.231090Z","submitted_at":"2026-07-20T04:00:16Z","title":"FlowSonic: Stable Zero-Shot Music Editing via High-Order Trajectory Integration","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-01T17:47:11.456299Z"},"links":{"cited_paper":"/paper/2206.00364","citing_paper":"/paper/2607.17526"},"observation_digest":"sha256:cf7ef834ba9c49a755e5e62ab1f029490f62415e05037de11001b6b92ba5af63","observation_id":"609b3d45-76f2-44f3-b74f-ec054de16073","resolution":{"observed_at":"2026-08-01T17:47:11.456299Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2210.02747","last_updated":"2023-02-08T15:46:05Z","snapshot_observed_at":"2026-08-16T02:30:42.660030Z","submitted_at":"2022-10-06T08:32:20Z","title":"Flow Matching for Generative Modeling","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2210.02747","snapshot_observed_at":"2026-08-01T17:47:11.625563Z","title":"Flow matching for generative modeling,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.17526","last_updated":"2026-07-20T04:00:16Z","snapshot_observed_at":"2026-08-16T06:04:29.231090Z","submitted_at":"2026-07-20T04:00:16Z","title":"FlowSonic: Stable Zero-Shot Music Editing via High-Order Trajectory Integration","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-01T17:47:11.625563Z"},"links":{"cited_paper":"/paper/2210.02747","citing_paper":"/paper/2607.17526"},"observation_digest":"sha256:12c6833e9e5dce5f700258e1b3ab0fbb411440a6bb832570d7ca214d9b50edf7","observation_id":"1a003726-c119-47dc-8b6c-0ed50703b8fc","resolution":{"observed_at":"2026-08-01T17:47:11.625563Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2112.10752","last_updated":"2022-04-13T11:38:44Z","snapshot_observed_at":"2026-07-06T12:20:47.369918Z","submitted_at":"2021-12-20T18:55:25Z","title":"High-Resolution Image Synthesis with Latent Diffusion Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2112.10752","snapshot_observed_at":"2026-08-01T17:47:11.737595Z","title":"High-resolution image synthesis with latent diffusion models,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2607.17526","last_updated":"2026-07-20T04:00:16Z","snapshot_observed_at":"2026-08-16T06:04:29.231090Z","submitted_at":"2026-07-20T04:00:16Z","title":"FlowSonic: Stable Zero-Shot Music Editing via High-Order Trajectory Integration","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-01T17:47:11.737595Z"},"links":{"cited_paper":"/paper/2112.10752","citing_paper":"/paper/2607.17526"},"observation_digest":"sha256:c5482da3496d431ce81d7a5dea1e4dc4e568bef950b801433502c136caca8fe0","observation_id":"e04a6e62-cc11-4c9e-aebd-342a7660deb4","resolution":{"observed_at":"2026-08-01T17:47:11.737595Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2205.11487","last_updated":"2022-05-23T17:42:53Z","snapshot_observed_at":"2026-08-17T05:51:02.087480Z","submitted_at":"2022-05-23T17:42:53Z","title":"Photorealistic Text-to-Image Diffusion Models with Deep Language Understanding","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2205.11487","snapshot_observed_at":"2026-08-01T17:47:11.848879Z","title":"Photorealistic text-to-image diffusion models with deep language understanding,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2607.17526","last_updated":"2026-07-20T04:00:16Z","snapshot_observed_at":"2026-08-16T06:04:29.231090Z","submitted_at":"2026-07-20T04:00:16Z","title":"FlowSonic: Stable Zero-Shot Music Editing via High-Order Trajectory Integration","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-01T17:47:11.848879Z"},"links":{"cited_paper":"/paper/2205.11487","citing_paper":"/paper/2607.17526"},"observation_digest":"sha256:91e917a0d2ab7940ee079d5eedbbac4489ff8dd21267434deaaa1b622cf53658","observation_id":"79948f06-f69e-4dba-8886-84adf90c4d39","resolution":{"observed_at":"2026-08-01T17:47:11.848879Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2308.05734","last_updated":"2024-05-11T11:24:51Z","snapshot_observed_at":"2026-08-16T15:09:17.721814Z","submitted_at":"2023-08-10T17:55:13Z","title":"AudioLDM 2: Learning Holistic Audio Generation with Self-supervised Pretraining","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2308.05734","snapshot_observed_at":"2026-08-01T17:47:11.967115Z","title":"AudioLDM 2: Learning holis- tic audio generation with self-supervised pretraining,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.17526","last_updated":"2026-07-20T04:00:16Z","snapshot_observed_at":"2026-08-16T06:04:29.231090Z","submitted_at":"2026-07-20T04:00:16Z","title":"FlowSonic: Stable Zero-Shot Music Editing via High-Order Trajectory Integration","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-01T17:47:11.967115Z"},"links":{"cited_paper":"/paper/2308.05734","citing_paper":"/paper/2607.17526"},"observation_digest":"sha256:7f211136e7feecff347be1cf7887c6d760cb50cb5d433cd79b3c50f0c85f0864","observation_id":"9a6d927d-40b9-4c36-ab0a-c965da0af895","resolution":{"observed_at":"2026-08-01T17:47:11.967115Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T17:47:12.089208Z","title":"Riffusion: Stable diffusion for real-time music generation,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2607.17526","last_updated":"2026-07-20T04:00:16Z","snapshot_observed_at":"2026-08-16T06:04:29.231090Z","submitted_at":"2026-07-20T04:00:16Z","title":"FlowSonic: Stable Zero-Shot Music Editing via High-Order Trajectory Integration","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-01T17:47:12.089208Z"},"links":{"citing_paper":"/paper/2607.17526"},"observation_digest":"sha256:6fb48e3ea229c55d9644d47018e875e70f7163bfff372cd07e46d8c4c0356f2d","observation_id":"4683054e-7305-4ea9-b921-8bdf5008d90e","resolution":{"observed_at":"2026-08-01T17:47:12.089208Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2302.03917","last_updated":"2023-03-06T18:09:56Z","snapshot_observed_at":"2026-08-17T19:40:07.322177Z","submitted_at":"2023-02-08T07:27:27Z","title":"Noise2Music: Text-conditioned Music Generation with Diffusion Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2302.03917","snapshot_observed_at":"2026-08-01T17:47:12.237390Z","title":"Noise2music: Text-conditioned music generation with diffusion models,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.17526","last_updated":"2026-07-20T04:00:16Z","snapshot_observed_at":"2026-08-16T06:04:29.231090Z","submitted_at":"2026-07-20T04:00:16Z","title":"FlowSonic: Stable Zero-Shot Music Editing via High-Order Trajectory Integration","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-01T17:47:12.237390Z"},"links":{"cited_paper":"/paper/2302.03917","citing_paper":"/paper/2607.17526"},"observation_digest":"sha256:3ea55fef6833d238340fcbd539fc2c853e1951d3a94ec9e2714e2fa0169c77f5","observation_id":"ede239d2-b610-4e20-a7c0-d065cdc4d680","resolution":{"observed_at":"2026-08-01T17:47:12.237390Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T17:47:12.350322Z","title":"Auffusion: Leveraging the power of diffusion and large language models for text-to-audio generation,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.17526","last_updated":"2026-07-20T04:00:16Z","snapshot_observed_at":"2026-08-16T06:04:29.231090Z","submitted_at":"2026-07-20T04:00:16Z","title":"FlowSonic: Stable Zero-Shot Music Editing via High-Order Trajectory Integration","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-01T17:47:12.350322Z"},"links":{"citing_paper":"/paper/2607.17526"},"observation_digest":"sha256:579f05a76343349eb476a0cdede00cc51e5f055b97bcc2b8b1dd91e33909c157","observation_id":"5ae0056b-6461-4672-b5b9-62c147800198","resolution":{"observed_at":"2026-08-01T17:47:12.350322Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2308.01546","last_updated":"2023-08-03T05:35:37Z","snapshot_observed_at":"2026-08-16T15:11:09.659487Z","submitted_at":"2023-08-03T05:35:37Z","title":"MusicLDM: Enhancing Novelty in Text-to-Music Generation Using Beat-Synchronous Mixup Strategies","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2308.01546","snapshot_observed_at":"2026-08-01T17:47:12.457927Z","title":"MusicLDM: Enhancing novelty in text-to-music generation using beat-synchronous mixup strategies,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.17526","last_updated":"2026-07-20T04:00:16Z","snapshot_observed_at":"2026-08-16T06:04:29.231090Z","submitted_at":"2026-07-20T04:00:16Z","title":"FlowSonic: Stable Zero-Shot Music Editing via High-Order Trajectory Integration","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-01T17:47:12.457927Z"},"links":{"cited_paper":"/paper/2308.01546","citing_paper":"/paper/2607.17526"},"observation_digest":"sha256:649d573a719f2f46f0549e0130f30e8b0cc8ee06b0fdeac1303ff6bc7353d4a4","observation_id":"a9bbb88a-f87c-4b50-ba1e-961ef839e953","resolution":{"observed_at":"2026-08-01T17:47:12.457927Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.00587","last_updated":"2024-12-20T11:22:01Z","snapshot_observed_at":"2026-08-16T13:22:22.991987Z","submitted_at":"2024-09-01T02:43:33Z","title":"FLUX that Plays Music","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.00587","snapshot_observed_at":"2026-08-01T17:47:12.611446Z","title":"Flux that plays music,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.17526","last_updated":"2026-07-20T04:00:16Z","snapshot_observed_at":"2026-08-16T06:04:29.231090Z","submitted_at":"2026-07-20T04:00:16Z","title":"FlowSonic: Stable Zero-Shot Music Editing via High-Order Trajectory Integration","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-01T17:47:12.611446Z"},"links":{"cited_paper":"/paper/2409.00587","citing_paper":"/paper/2607.17526"},"observation_digest":"sha256:297fe7b2d705399f43c8b28df360c4e2d64fa608433f7e9babf554729e14368b","observation_id":"e9fbfa10-06bc-4871-9960-e318320be05f","resolution":{"observed_at":"2026-08-01T17:47:12.611446Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T17:47:12.825997Z","title":"AudioLDM: Text-to-audio generation with latent dif- fusion models,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.17526","last_updated":"2026-07-20T04:00:16Z","snapshot_observed_at":"2026-08-16T06:04:29.231090Z","submitted_at":"2026-07-20T04:00:16Z","title":"FlowSonic: Stable Zero-Shot Music Editing via High-Order Trajectory Integration","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-01T17:47:12.825997Z"},"links":{"citing_paper":"/paper/2607.17526"},"observation_digest":"sha256:e433f132098a7568e2b668a62886fde6b0783fae6b102d5bb60ec62e86ef13fb","observation_id":"8e12c167-5fd8-44aa-bd58-521a440971d3","resolution":{"observed_at":"2026-08-01T17:47:12.825997Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T17:47:12.956687Z","title":"Accomontage: Accompaniment arrangement via phrase selection and style transfer,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2607.17526","last_updated":"2026-07-20T04:00:16Z","snapshot_observed_at":"2026-08-16T06:04:29.231090Z","submitted_at":"2026-07-20T04:00:16Z","title":"FlowSonic: Stable Zero-Shot Music Editing via High-Order Trajectory Integration","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-01T17:47:12.956687Z"},"links":{"citing_paper":"/paper/2607.17526"},"observation_digest":"sha256:83994c02b48b1ca86d795e08b2edda8c3b3c969284f7196a40f39feaf3381ed7","observation_id":"16fcae63-2954-423e-b26e-fc7d51a0cc0e","resolution":{"observed_at":"2026-08-01T17:47:12.956687Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2306.00110","last_updated":"2023-05-31T18:34:16Z","snapshot_observed_at":"2026-08-16T15:27:47.225337Z","submitted_at":"2023-05-31T18:34:16Z","title":"MuseCoco: Generating Symbolic Music from Text","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.00110","snapshot_observed_at":"2026-08-01T17:47:13.188957Z","title":"MuseCoco: Generating symbolic music from text,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.17526","last_updated":"2026-07-20T04:00:16Z","snapshot_observed_at":"2026-08-16T06:04:29.231090Z","submitted_at":"2026-07-20T04:00:16Z","title":"FlowSonic: Stable Zero-Shot Music Editing via High-Order Trajectory Integration","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-01T17:47:13.188957Z"},"links":{"cited_paper":"/paper/2306.00110","citing_paper":"/paper/2607.17526"},"observation_digest":"sha256:0f9e7bd3208385db04434eb0ecd875722a42a614662a509daf034bf62acca758","observation_id":"c7a66152-41a3-469b-89eb-ee39d28b4420","resolution":{"observed_at":"2026-08-01T17:47:13.188957Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T17:47:13.293229Z","title":"Simple and controllable music generation,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.17526","last_updated":"2026-07-20T04:00:16Z","snapshot_observed_at":"2026-08-16T06:04:29.231090Z","submitted_at":"2026-07-20T04:00:16Z","title":"FlowSonic: Stable Zero-Shot Music Editing via High-Order Trajectory Integration","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-01T17:47:13.293229Z"},"links":{"citing_paper":"/paper/2607.17526"},"observation_digest":"sha256:0b58aa7ab66eb48f0c994dab14b26ea5cd0ba5754d8e48d6061d7344547610e9","observation_id":"64a31e10-61e0-41da-b1e1-96fb8837ea19","resolution":{"observed_at":"2026-08-01T17:47:13.293229Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T17:47:13.365419Z","title":"Mustango: Toward controllable text-to-music generation,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.17526","last_updated":"2026-07-20T04:00:16Z","snapshot_observed_at":"2026-08-16T06:04:29.231090Z","submitted_at":"2026-07-20T04:00:16Z","title":"FlowSonic: Stable Zero-Shot Music Editing via High-Order Trajectory Integration","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-01T17:47:13.365419Z"},"links":{"citing_paper":"/paper/2607.17526"},"observation_digest":"sha256:45870674951b261972a51ebac3c0028b349507bb0a7f379913d6b9cfc2c6a3a3","observation_id":"0109723c-c48d-43c9-a91c-11d463f45f46","resolution":{"observed_at":"2026-08-01T17:47:13.365419Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T17:47:13.421917Z","title":"Diffusion based text-to-music generation with global and local text based conditioning,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.17526","last_updated":"2026-07-20T04:00:16Z","snapshot_observed_at":"2026-08-16T06:04:29.231090Z","submitted_at":"2026-07-20T04:00:16Z","title":"FlowSonic: Stable Zero-Shot Music Editing via High-Order Trajectory Integration","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-01T17:47:13.421917Z"},"links":{"citing_paper":"/paper/2607.17526"},"observation_digest":"sha256:b16c602e0dbe9fa6016f252677842a40df6196f30267f95cdf2e58b3032e994d","observation_id":"2e38aa94-a898-4f3a-8f89-2492ca5dd97d","resolution":{"observed_at":"2026-08-01T17:47:13.421917Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.11255","last_updated":"2024-12-09T16:15:07Z","snapshot_observed_at":"2026-08-16T14:42:06.397804Z","submitted_at":"2023-11-19T06:50:52Z","title":"M$^{2}$UGen: Multi-modal Music Understanding and Generation with the Power of Large Language Models","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.11255","snapshot_observed_at":"2026-08-01T17:47:13.478472Z","title":"M 2UGen: Multi-modal music understanding and generation with the power of large language models,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.17526","last_updated":"2026-07-20T04:00:16Z","snapshot_observed_at":"2026-08-16T06:04:29.231090Z","submitted_at":"2026-07-20T04:00:16Z","title":"FlowSonic: Stable Zero-Shot Music Editing via High-Order Trajectory Integration","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-01T17:47:13.478472Z"},"links":{"cited_paper":"/paper/2311.11255","citing_paper":"/paper/2607.17526"},"observation_digest":"sha256:8d611c0f5985f6f1262344eea33917ff2aefb643af39902a08789c07bb163a57","observation_id":"d78c0bdd-9ddd-4138-af4f-b54a2c52f83e","resolution":{"observed_at":"2026-08-01T17:47:13.478472Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2308.14360","last_updated":"2023-12-12T06:55:08Z","snapshot_observed_at":"2026-08-17T14:11:32.083206Z","submitted_at":"2023-08-28T07:11:42Z","title":"InstructME: An Instruction Guided Music Edit And Remix Framework with Latent Diffusion Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2308.14360","snapshot_observed_at":"2026-08-01T17:47:13.540144Z","title":"InstructME: An instruction guided music edit and remix frame- work with latent diffusion models,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.17526","last_updated":"2026-07-20T04:00:16Z","snapshot_observed_at":"2026-08-16T06:04:29.231090Z","submitted_at":"2026-07-20T04:00:16Z","title":"FlowSonic: Stable Zero-Shot Music Editing via High-Order Trajectory Integration","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-01T17:47:13.540144Z"},"links":{"cited_paper":"/paper/2308.14360","citing_paper":"/paper/2607.17526"},"observation_digest":"sha256:03b5c8d07cef52527515e214b3e660abf448e210ca43c5c2391ebfb62075531d","observation_id":"d6b35825-b6eb-4540-94b8-d654fde6eeef","resolution":{"observed_at":"2026-08-01T17:47:13.540144Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2304.00830","last_updated":"2023-04-05T12:13:48Z","snapshot_observed_at":"2026-08-16T15:43:16.986495Z","submitted_at":"2023-04-03T09:15:51Z","title":"AUDIT: Audio Editing by Following Instructions with Latent Diffusion Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2304.00830","snapshot_observed_at":"2026-08-01T17:47:13.598010Z","title":"AUDIT: Audio editing by following instructions with latent diffusion models,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.17526","last_updated":"2026-07-20T04:00:16Z","snapshot_observed_at":"2026-08-16T06:04:29.231090Z","submitted_at":"2026-07-20T04:00:16Z","title":"FlowSonic: Stable Zero-Shot Music Editing via High-Order Trajectory Integration","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-01T17:47:13.598010Z"},"links":{"cited_paper":"/paper/2304.00830","citing_paper":"/paper/2607.17526"},"observation_digest":"sha256:757dc14ac2b4c460f6ca1c3f687338db1ef548c45741b61604ebfde38ffdb952","observation_id":"47bf135f-54f0-462f-9cdd-46d1be3d8d9d","resolution":{"observed_at":"2026-08-01T17:47:13.598010Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.06178","last_updated":"2024-05-28T16:47:25Z","snapshot_observed_at":"2026-08-16T14:20:00.740660Z","submitted_at":"2024-02-09T04:34:08Z","title":"MusicMagus: Zero-Shot Text-to-Music Editing via Diffusion Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.06178","snapshot_observed_at":"2026-08-01T17:47:13.651836Z","title":"Musicmagus: Zero-shot text-to-music editing via diffusion models,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.17526","last_updated":"2026-07-20T04:00:16Z","snapshot_observed_at":"2026-08-16T06:04:29.231090Z","submitted_at":"2026-07-20T04:00:16Z","title":"FlowSonic: Stable Zero-Shot Music Editing via High-Order Trajectory Integration","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-01T17:47:13.651836Z"},"links":{"cited_paper":"/paper/2402.06178","citing_paper":"/paper/2607.17526"},"observation_digest":"sha256:f52371e77291c4e9afa9f12fa4104cc053bfd3b5a0066503a69217c23067a0a7","observation_id":"4c389b3f-9c3e-4f69-ae11-3814a8d8c50a","resolution":{"observed_at":"2026-08-01T17:47:13.651836Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.10009","last_updated":"2024-05-29T11:27:24Z","snapshot_observed_at":"2026-08-16T14:18:17.173288Z","submitted_at":"2024-02-15T15:17:26Z","title":"Zero-Shot Unsupervised and Text-Based Audio Editing Using DDPM Inversion","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.10009","snapshot_observed_at":"2026-08-01T17:47:13.750254Z","title":"Zero-shot unsupervised and text-based audio editing using ddpm inversion,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.17526","last_updated":"2026-07-20T04:00:16Z","snapshot_observed_at":"2026-08-16T06:04:29.231090Z","submitted_at":"2026-07-20T04:00:16Z","title":"FlowSonic: Stable Zero-Shot Music Editing via High-Order Trajectory Integration","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-01T17:47:13.750254Z"},"links":{"cited_paper":"/paper/2402.10009","citing_paper":"/paper/2607.17526"},"observation_digest":"sha256:fb5aed07967395d593ac45bf3debf011e7bcb46513befadc0fe39363ab0d7ec2","observation_id":"b54e1233-3ed4-4356-83bc-22ebbe9ff9b6","resolution":{"observed_at":"2026-08-01T17:47:13.750254Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T17:47:13.884958Z","title":"Transplayer: Timbre style transfer with flexible timbre control,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.17526","last_updated":"2026-07-20T04:00:16Z","snapshot_observed_at":"2026-08-16T06:04:29.231090Z","submitted_at":"2026-07-20T04:00:16Z","title":"FlowSonic: Stable Zero-Shot Music Editing via High-Order Trajectory Integration","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-01T17:47:13.884958Z"},"links":{"citing_paper":"/paper/2607.17526"},"observation_digest":"sha256:ae867b8cab3cb2205e9a49739e8304037ffc533b8d83429303786a981123173e","observation_id":"2d763c4e-8308-44d6-afd4-fa32fe4707fe","resolution":{"observed_at":"2026-08-01T17:47:13.884958Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.18636","last_updated":"2025-03-13T14:37:25Z","snapshot_observed_at":"2026-08-16T14:05:52.203538Z","submitted_at":"2024-03-27T14:41:39Z","title":"A Diffusion-Based Generative Equalizer for Music Restoration","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.18636","snapshot_observed_at":"2026-08-01T17:47:13.981746Z","title":"A diffusion- based generative equalizer for music restoration,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.17526","last_updated":"2026-07-20T04:00:16Z","snapshot_observed_at":"2026-08-16T06:04:29.231090Z","submitted_at":"2026-07-20T04:00:16Z","title":"FlowSonic: Stable Zero-Shot Music Editing via High-Order Trajectory Integration","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-01T17:47:13.981746Z"},"links":{"cited_paper":"/paper/2403.18636","citing_paper":"/paper/2607.17526"},"observation_digest":"sha256:2d90adf89c5a4271e304eebd5d2c1702e6f3d1de0ce1a7b984edc29c3d3d4e2e","observation_id":"e7ab3594-8e20-407f-9008-a9cd61497e1b","resolution":{"observed_at":"2026-08-01T17:47:13.981746Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.20320","last_updated":"2024-10-08T21:40:13Z","snapshot_observed_at":"2026-08-16T13:47:38.568076Z","submitted_at":"2024-05-30T17:56:04Z","title":"Improving the Training of Rectified Flows","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.20320","snapshot_observed_at":"2026-08-01T17:47:14.106850Z","title":"Improving the training of rectified flows,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.17526","last_updated":"2026-07-20T04:00:16Z","snapshot_observed_at":"2026-08-16T06:04:29.231090Z","submitted_at":"2026-07-20T04:00:16Z","title":"FlowSonic: Stable Zero-Shot Music Editing via High-Order Trajectory Integration","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-01T17:47:14.106850Z"},"links":{"cited_paper":"/paper/2405.20320","citing_paper":"/paper/2607.17526"},"observation_digest":"sha256:5ad66921bf41d997553d636284ad51401e132a4aa034f9edf33afb0680c65dbd","observation_id":"88d29bb9-b653-4025-9e41-f5a74d2e47a6","resolution":{"observed_at":"2026-08-01T17:47:14.106850Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2209.03003","last_updated":"2022-09-07T08:59:55Z","snapshot_observed_at":"2026-07-06T13:49:40.974495Z","submitted_at":"2022-09-07T08:59:55Z","title":"Flow Straight and Fast: Learning to Generate and Transfer Data with Rectified Flow","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2209.03003","snapshot_observed_at":"2026-08-01T17:47:14.253106Z","title":"Flow straight and fast: Learning to generate and transfer data with rectified flow,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2607.17526","last_updated":"2026-07-20T04:00:16Z","snapshot_observed_at":"2026-08-16T06:04:29.231090Z","submitted_at":"2026-07-20T04:00:16Z","title":"FlowSonic: Stable Zero-Shot Music Editing via High-Order Trajectory Integration","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-01T17:47:14.253106Z"},"links":{"cited_paper":"/paper/2209.03003","citing_paper":"/paper/2607.17526"},"observation_digest":"sha256:99b6f436f948df797db25278c1c9e96cd6030d3c5563c9f3cf6da1beb50c4ff7","observation_id":"a8cfcdb6-9565-4ebd-8cd9-326b20fc0a19","resolution":{"observed_at":"2026-08-01T17:47:14.253106Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.10812","last_updated":"2024-10-14T17:59:42Z","snapshot_observed_at":"2026-08-16T13:09:29.086289Z","submitted_at":"2024-10-14T17:59:42Z","title":"HART: Efficient Visual Generation with Hybrid Autoregressive Transformer","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.10812","snapshot_observed_at":"2026-08-01T17:47:14.385334Z","title":"Hart: Efficient visual generation with hybrid autoregressive transformer,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.17526","last_updated":"2026-07-20T04:00:16Z","snapshot_observed_at":"2026-08-16T06:04:29.231090Z","submitted_at":"2026-07-20T04:00:16Z","title":"FlowSonic: Stable Zero-Shot Music Editing via High-Order Trajectory Integration","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-01T17:47:14.385334Z"},"links":{"cited_paper":"/paper/2410.10812","citing_paper":"/paper/2607.17526"},"observation_digest":"sha256:cff09e0faf0b5ea4f8b5407f328008891064021d20481b661f4a99a1e0cb83d2","observation_id":"f6d8dcb1-ae29-444a-afa9-3736987a1ffa","resolution":{"observed_at":"2026-08-01T17:47:14.385334Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.10629","last_updated":"2024-10-20T14:35:31Z","snapshot_observed_at":"2026-08-16T01:17:28.297637Z","submitted_at":"2024-10-14T15:36:42Z","title":"SANA: Efficient High-Resolution Image Synthesis with Linear Diffusion Transformers","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.10629","snapshot_observed_at":"2026-08-01T17:47:14.491119Z","title":"Sana: Efficient high-resolution image synthesis with linear diffusion transformers,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.17526","last_updated":"2026-07-20T04:00:16Z","snapshot_observed_at":"2026-08-16T06:04:29.231090Z","submitted_at":"2026-07-20T04:00:16Z","title":"FlowSonic: Stable Zero-Shot Music Editing via High-Order Trajectory Integration","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-01T17:47:14.491119Z"},"links":{"cited_paper":"/paper/2410.10629","citing_paper":"/paper/2607.17526"},"observation_digest":"sha256:122805115be56da0eaf429a2717a3f32fcdc275ec53999edbb14007399555bac","observation_id":"27f12a4c-d80e-4d11-b4b2-2b5c46d9315f","resolution":{"observed_at":"2026-08-01T17:47:14.491119Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.06072","last_updated":"2025-03-26T08:33:10Z","snapshot_observed_at":"2026-08-15T19:52:28.153954Z","submitted_at":"2024-08-12T11:47:11Z","title":"CogVideoX: Text-to-Video Diffusion Models with An Expert Transformer","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.06072","snapshot_observed_at":"2026-08-01T17:47:14.679080Z","title":"Cogvideox: Text-to-video diffusion models with an expert transformer,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.17526","last_updated":"2026-07-20T04:00:16Z","snapshot_observed_at":"2026-08-16T06:04:29.231090Z","submitted_at":"2026-07-20T04:00:16Z","title":"FlowSonic: Stable Zero-Shot Music Editing via High-Order Trajectory Integration","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-01T17:47:14.679080Z"},"links":{"cited_paper":"/paper/2408.06072","citing_paper":"/paper/2607.17526"},"observation_digest":"sha256:8f3aabbb50acd838f41278b1ce690f39f2c4b5c410c9c4d20516c8848f665225","observation_id":"6923d286-6ebd-4023-aa9f-671adc8726fe","resolution":{"observed_at":"2026-08-01T17:47:14.679080Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T17:47:14.810418Z","title":"Scalable diffusion models with transformers,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.17526","last_updated":"2026-07-20T04:00:16Z","snapshot_observed_at":"2026-08-16T06:04:29.231090Z","submitted_at":"2026-07-20T04:00:16Z","title":"FlowSonic: Stable Zero-Shot Music Editing via High-Order Trajectory Integration","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-01T17:47:14.810418Z"},"links":{"citing_paper":"/paper/2607.17526"},"observation_digest":"sha256:c73d9bee9a4d824ab8d56bc434a68a517f0467d35a07f5dd874fb819083c6768","observation_id":"fa336624-db39-42f3-bf08-794fffd83ee2","resolution":{"observed_at":"2026-08-01T17:47:14.810418Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2301.11325","last_updated":"2023-01-26T18:58:53Z","snapshot_observed_at":"2026-08-17T00:33:41.369960Z","submitted_at":"2023-01-26T18:58:53Z","title":"MusicLM: Generating Music From Text","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2301.11325","snapshot_observed_at":"2026-08-01T17:47:14.941071Z","title":"MusicLM: Generating music from text,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.17526","last_updated":"2026-07-20T04:00:16Z","snapshot_observed_at":"2026-08-16T06:04:29.231090Z","submitted_at":"2026-07-20T04:00:16Z","title":"FlowSonic: Stable Zero-Shot Music Editing via High-Order Trajectory Integration","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-01T17:47:14.941071Z"},"links":{"cited_paper":"/paper/2301.11325","citing_paper":"/paper/2607.17526"},"observation_digest":"sha256:392494d6e8e2576a9ecab2326db9ab9babfc8f5db66cf13c473df7c35d0ad317","observation_id":"acebb266-a8d3-4d9e-9fd2-f19af5bac1dd","resolution":{"observed_at":"2026-08-01T17:47:14.941071Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T17:47:15.075704Z","title":"Musicgen-stem: Multi- stem music generation and edition through autoregressive modeling,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.17526","last_updated":"2026-07-20T04:00:16Z","snapshot_observed_at":"2026-08-16T06:04:29.231090Z","submitted_at":"2026-07-20T04:00:16Z","title":"FlowSonic: Stable Zero-Shot Music Editing via High-Order Trajectory Integration","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-01T17:47:15.075704Z"},"links":{"citing_paper":"/paper/2607.17526"},"observation_digest":"sha256:478a083b521edcee8d06225307bc2c358c73076eadc5e2f11d70c3c1a38792d8","observation_id":"9e9c79b4-51ac-4845-9b63-7d82f7d1c0ea","resolution":{"observed_at":"2026-08-01T17:47:15.075704Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.00084","last_updated":"2025-02-28T09:58:25Z","snapshot_observed_at":"2026-08-16T12:54:20.238906Z","submitted_at":"2025-02-28T09:58:25Z","title":"InspireMusic: Integrating Super Resolution and Large Language Model for High-Fidelity Long-Form Music Generation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.00084","snapshot_observed_at":"2026-08-01T17:47:15.211793Z","title":"Inspiremusic: Integrating super resolution and large language model for high-fidelity long-form music generation,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.17526","last_updated":"2026-07-20T04:00:16Z","snapshot_observed_at":"2026-08-16T06:04:29.231090Z","submitted_at":"2026-07-20T04:00:16Z","title":"FlowSonic: Stable Zero-Shot Music Editing via High-Order Trajectory Integration","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-01T17:47:15.211793Z"},"links":{"cited_paper":"/paper/2503.00084","citing_paper":"/paper/2607.17526"},"observation_digest":"sha256:0db278f438f9d4dcc07be83dc42efa4728cec86d0024c19098d11a80acbc5bc5","observation_id":"dc7ddd6e-43c2-4575-b22b-2d1ecf3bb1aa","resolution":{"observed_at":"2026-08-01T17:47:15.211793Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.01183","last_updated":"2025-03-03T05:15:34Z","snapshot_observed_at":"2026-08-16T12:53:44.442537Z","submitted_at":"2025-03-03T05:15:34Z","title":"DiffRhythm: Blazingly Fast and Embarrassingly Simple End-to-End Full-Length Song Generation with Latent Diffusion","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.01183","snapshot_observed_at":"2026-08-01T17:47:15.317450Z","title":"Diffrhythm: Blazingly fast and embarrassingly simple end-to-end full-length song generation with latent diffusion,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.17526","last_updated":"2026-07-20T04:00:16Z","snapshot_observed_at":"2026-08-16T06:04:29.231090Z","submitted_at":"2026-07-20T04:00:16Z","title":"FlowSonic: Stable Zero-Shot Music Editing via High-Order Trajectory Integration","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-01T17:47:15.317450Z"},"links":{"cited_paper":"/paper/2503.01183","citing_paper":"/paper/2607.17526"},"observation_digest":"sha256:794d8b26285712e5c472d20b5c9587ed04b335160c6160ef9a62efa354338bf2","observation_id":"e51c53f2-17db-40a4-a4e3-4ba327b686c8","resolution":{"observed_at":"2026-08-01T17:47:15.317450Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2301.11757","last_updated":"2023-10-23T20:47:30Z","snapshot_observed_at":"2026-08-16T15:59:41.947516Z","submitted_at":"2023-01-27T14:52:53Z","title":"Mo\\^usai: Text-to-Music Generation with Long-Context Latent Diffusion","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2301.11757","snapshot_observed_at":"2026-08-01T17:47:15.455231Z","title":"M ¨ousai: Text-to-music generation with long-context latent diffusion,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.17526","last_updated":"2026-07-20T04:00:16Z","snapshot_observed_at":"2026-08-16T06:04:29.231090Z","submitted_at":"2026-07-20T04:00:16Z","title":"FlowSonic: Stable Zero-Shot Music Editing via High-Order Trajectory Integration","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-01T17:47:15.455231Z"},"links":{"cited_paper":"/paper/2301.11757","citing_paper":"/paper/2607.17526"},"observation_digest":"sha256:ecc85cdad37d6dd407bfb7714643ec230caa195c24493d32dcd645463199b4ee","observation_id":"16103bf3-c5ab-4746-83a6-8cbac2672385","resolution":{"observed_at":"2026-08-01T17:47:15.455231Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2304.13731","last_updated":"2023-05-29T12:09:08Z","snapshot_observed_at":"2026-08-16T15:38:16.919337Z","submitted_at":"2023-04-24T07:45:28Z","title":"Text-to-Audio Generation using Instruction-Tuned LLM and Latent Diffusion Model","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2304.13731","snapshot_observed_at":"2026-08-01T17:47:15.593693Z","title":"Text-to-audio generation using instruction-tuned LLM and latent diffusion model,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.17526","last_updated":"2026-07-20T04:00:16Z","snapshot_observed_at":"2026-08-16T06:04:29.231090Z","submitted_at":"2026-07-20T04:00:16Z","title":"FlowSonic: Stable Zero-Shot Music Editing via High-Order Trajectory Integration","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-01T17:47:15.593693Z"},"links":{"cited_paper":"/paper/2304.13731","citing_paper":"/paper/2607.17526"},"observation_digest":"sha256:ec8cc091f045256a469450b5fe50c65f44ae347cb455e1ef2be3319da5560760","observation_id":"a07c5b1f-b16c-444f-af20-39dc2fe7e313","resolution":{"observed_at":"2026-08-01T17:47:15.593693Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2401.01099","last_updated":"2024-01-02T08:42:48Z","snapshot_observed_at":"2026-08-16T14:30:22.898916Z","submitted_at":"2024-01-02T08:42:48Z","title":"Efficient Parallel Audio Generation using Group Masked Language Modeling","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.01099","snapshot_observed_at":"2026-08-01T17:47:15.741291Z","title":"Efficient parallel audio generation using group masked language modeling,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.17526","last_updated":"2026-07-20T04:00:16Z","snapshot_observed_at":"2026-08-16T06:04:29.231090Z","submitted_at":"2026-07-20T04:00:16Z","title":"FlowSonic: Stable Zero-Shot Music Editing via High-Order Trajectory Integration","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-01T17:47:15.741291Z"},"links":{"cited_paper":"/paper/2401.01099","citing_paper":"/paper/2607.17526"},"observation_digest":"sha256:1edc063d5e250a377e71788de8bca9fe601d05b47e42b2b1d1a8573c0595583a","observation_id":"25cc1eda-dce8-4051-aac9-5240708f8fe9","resolution":{"observed_at":"2026-08-01T17:47:15.741291Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T17:47:15.866234Z","title":"Ditto: Diffusion inference-time t-optimization for music generation,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.17526","last_updated":"2026-07-20T04:00:16Z","snapshot_observed_at":"2026-08-16T06:04:29.231090Z","submitted_at":"2026-07-20T04:00:16Z","title":"FlowSonic: Stable Zero-Shot Music Editing via High-Order Trajectory Integration","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-01T17:47:15.866234Z"},"links":{"citing_paper":"/paper/2607.17526"},"observation_digest":"sha256:a983829acacc2a2e75932cfb8112b3c1d355aeb58288b1d29f385681ff90e29b","observation_id":"af4a2fc5-d809-4d70-b97e-75cb9d488cb7","resolution":{"observed_at":"2026-08-01T17:47:15.866234Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.07069","last_updated":"2023-11-13T04:24:14Z","snapshot_observed_at":"2026-08-16T14:43:55.250464Z","submitted_at":"2023-11-13T04:24:14Z","title":"Music ControlNet: Multiple Time-varying Controls for Music Generation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.07069","snapshot_observed_at":"2026-08-01T17:47:15.984576Z","title":"Music Con- trolNet: Multiple time-varying controls for music generation,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.17526","last_updated":"2026-07-20T04:00:16Z","snapshot_observed_at":"2026-08-16T06:04:29.231090Z","submitted_at":"2026-07-20T04:00:16Z","title":"FlowSonic: Stable Zero-Shot Music Editing via High-Order Trajectory Integration","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-01T17:47:15.984576Z"},"links":{"cited_paper":"/paper/2311.07069","citing_paper":"/paper/2607.17526"},"observation_digest":"sha256:950ebd62882f29c2eae3d0cf374f582411ac455e743129b9be9efe52a87ace02","observation_id":"28f510ee-f896-49e8-8097-6db09a42ab01","resolution":{"observed_at":"2026-08-01T17:47:15.984576Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.17162","last_updated":"2024-10-06T21:36:20Z","snapshot_observed_at":"2026-08-16T14:48:44.668196Z","submitted_at":"2023-10-26T05:24:38Z","title":"Content-based Controls For Music Large Language Modeling","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.17162","snapshot_observed_at":"2026-08-01T17:47:16.066698Z","title":"Content-based controls for music large language modeling,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.17526","last_updated":"2026-07-20T04:00:16Z","snapshot_observed_at":"2026-08-16T06:04:29.231090Z","submitted_at":"2026-07-20T04:00:16Z","title":"FlowSonic: Stable Zero-Shot Music Editing via High-Order Trajectory Integration","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-01T17:47:16.066698Z"},"links":{"cited_paper":"/paper/2310.17162","citing_paper":"/paper/2607.17526"},"observation_digest":"sha256:3e452af24039836967d7c54f0dcd4b2738c6c5e82ed8f2d429b765228bef89ad","observation_id":"8b860710-7951-4c6c-b652-2906960e0871","resolution":{"observed_at":"2026-08-01T17:47:16.066698Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.13535","last_updated":"2025-04-18T07:59:35Z","snapshot_observed_at":"2026-08-16T18:21:23.600019Z","submitted_at":"2025-04-18T07:59:35Z","title":"MusFlow: Multimodal Music Generation via Conditional Flow Matching","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.13535","snapshot_observed_at":"2026-08-01T17:47:16.261408Z","title":"Musflow: Multimodal music generation via conditional flow matching,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.17526","last_updated":"2026-07-20T04:00:16Z","snapshot_observed_at":"2026-08-16T06:04:29.231090Z","submitted_at":"2026-07-20T04:00:16Z","title":"FlowSonic: Stable Zero-Shot Music Editing via High-Order Trajectory Integration","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-01T17:47:16.261408Z"},"links":{"cited_paper":"/paper/2504.13535","citing_paper":"/paper/2607.17526"},"observation_digest":"sha256:3dcd0e948d267489736710defe6d8f436a85366f11c7e5122ae9bbff603f45eb","observation_id":"ca7e1a6e-c0c6-48aa-822c-4ee85ac8c138","resolution":{"observed_at":"2026-08-01T17:47:16.261408Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.03648","last_updated":"2024-10-16T14:24:53Z","snapshot_observed_at":"2026-08-16T14:15:31.715199Z","submitted_at":"2024-07-04T05:38:49Z","title":"High Fidelity Text-Guided Music Editing via Single-Stage Flow Matching","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.03648","snapshot_observed_at":"2026-08-01T17:47:16.435040Z","title":"High fidelity text-guided music editing via single-stage flow matching,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.17526","last_updated":"2026-07-20T04:00:16Z","snapshot_observed_at":"2026-08-16T06:04:29.231090Z","submitted_at":"2026-07-20T04:00:16Z","title":"FlowSonic: Stable Zero-Shot Music Editing via High-Order Trajectory Integration","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-01T17:47:16.435040Z"},"links":{"cited_paper":"/paper/2407.03648","citing_paper":"/paper/2607.17526"},"observation_digest":"sha256:3473edf605e90190054c36e38a263df7a6d486d2d4cfc1501e3dac2cdec4cf4f","observation_id":"7a7537b9-ce7a-4423-9aee-7a68eba3af0f","resolution":{"observed_at":"2026-08-01T17:47:16.435040Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.16564","last_updated":"2024-07-24T11:12:15Z","snapshot_observed_at":"2026-08-16T13:31:43.862830Z","submitted_at":"2024-07-23T15:16:18Z","title":"Audio Prompt Adapter: Unleashing Music Editing Abilities for Text-to-Music with Lightweight Finetuning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.16564","snapshot_observed_at":"2026-08-01T17:47:16.601889Z","title":"Audio prompt adapter: Unleashing music editing abilities for text-to-music with lightweight finetuning,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.17526","last_updated":"2026-07-20T04:00:16Z","snapshot_observed_at":"2026-08-16T06:04:29.231090Z","submitted_at":"2026-07-20T04:00:16Z","title":"FlowSonic: Stable Zero-Shot Music Editing via High-Order Trajectory Integration","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-01T17:47:16.601889Z"},"links":{"cited_paper":"/paper/2407.16564","citing_paper":"/paper/2607.17526"},"observation_digest":"sha256:c4bd4d0ec2079eab739a8c9c0c63c6f3df7d67e3e7cc03d93459cec254cd413d","observation_id":"db9b32ef-067c-4b8b-94ea-8c8d05223f59","resolution":{"observed_at":"2026-08-01T17:47:16.601889Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T17:47:16.677524Z","title":"Score-based generative modeling through stochastic differential equations,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2607.17526","last_updated":"2026-07-20T04:00:16Z","snapshot_observed_at":"2026-08-16T06:04:29.231090Z","submitted_at":"2026-07-20T04:00:16Z","title":"FlowSonic: Stable Zero-Shot Music Editing via High-Order Trajectory Integration","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-01T17:47:16.677524Z"},"links":{"citing_paper":"/paper/2607.17526"},"observation_digest":"sha256:ff32bd38cb7fc324604dae745ebb9cee602e96f70e1156ea62d3eeaffef2a768","observation_id":"55607868-5019-4288-8c44-584ee54cb028","resolution":{"observed_at":"2026-08-01T17:47:16.677524Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T17:47:16.821748Z","title":"Denoising diffusion implicit models,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2607.17526","last_updated":"2026-07-20T04:00:16Z","snapshot_observed_at":"2026-08-16T06:04:29.231090Z","submitted_at":"2026-07-20T04:00:16Z","title":"FlowSonic: Stable Zero-Shot Music Editing via High-Order Trajectory Integration","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-01T17:47:16.821748Z"},"links":{"citing_paper":"/paper/2607.17526"},"observation_digest":"sha256:a3814f0b9ad94f1b1b9cc3960436e91fbcca0d2df19c45d086d277138d5fc025","observation_id":"408f8097-32f8-4a9d-9562-b81e393240ce","resolution":{"observed_at":"2026-08-01T17:47:16.821748Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T17:47:17.001964Z","title":"Null- text inversion for editing real images using guided diffusion models,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.17526","last_updated":"2026-07-20T04:00:16Z","snapshot_observed_at":"2026-08-16T06:04:29.231090Z","submitted_at":"2026-07-20T04:00:16Z","title":"FlowSonic: Stable Zero-Shot Music Editing via High-Order Trajectory Integration","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-01T17:47:17.001964Z"},"links":{"citing_paper":"/paper/2607.17526"},"observation_digest":"sha256:59b5d4a8044efd1b3075d200ad9699e81513369311cf1359a023b7bf78ff0d26","observation_id":"3175f39f-db38-4e48-9d5e-ab75928214c3","resolution":{"observed_at":"2026-08-01T17:47:17.001964Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T17:47:17.123650Z","title":"Beyond first-order tweedie: Solving inverse problems using latent diffusion,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.17526","last_updated":"2026-07-20T04:00:16Z","snapshot_observed_at":"2026-08-16T06:04:29.231090Z","submitted_at":"2026-07-20T04:00:16Z","title":"FlowSonic: Stable Zero-Shot Music Editing via High-Order Trajectory Integration","version":1},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-01T17:47:17.123650Z"},"links":{"citing_paper":"/paper/2607.17526"},"observation_digest":"sha256:a1696161384f70330df99c68273ab2200bb026b9e0773141eae829cdb9d823e9","observation_id":"bc5d934d-72f3-4268-8304-55a69a24eb43","resolution":{"observed_at":"2026-08-01T17:47:17.123650Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2211.07825","last_updated":"2022-11-15T01:07:38Z","snapshot_observed_at":"2026-08-16T16:16:12.187702Z","submitted_at":"2022-11-15T01:07:38Z","title":"Direct Inversion: Optimization-Free Text-Driven Real Image Editing with Diffusion Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2211.07825","snapshot_observed_at":"2026-08-01T17:47:17.241047Z","title":"Direct inversion: Optimization-free text-driven real image editing with diffusion models,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2607.17526","last_updated":"2026-07-20T04:00:16Z","snapshot_observed_at":"2026-08-16T06:04:29.231090Z","submitted_at":"2026-07-20T04:00:16Z","title":"FlowSonic: Stable Zero-Shot Music Editing via High-Order Trajectory Integration","version":1},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-01T17:47:17.241047Z"},"links":{"cited_paper":"/paper/2211.07825","citing_paper":"/paper/2607.17526"},"observation_digest":"sha256:77c539b24043a21d31cc6e50c6b3f15c77bf047aa247d97cf8d8940c60fc1860","observation_id":"1408ae97-a795-48d7-84f5-8c071d1c4b0b","resolution":{"observed_at":"2026-08-01T17:47:17.241047Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.16807","last_updated":"2024-12-10T14:52:10Z","snapshot_observed_at":"2026-08-16T15:29:22.895377Z","submitted_at":"2023-05-26T10:41:08Z","title":"Negative-prompt Inversion: Fast Image Inversion for Editing with Text-guided Diffusion Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.16807","snapshot_observed_at":"2026-08-01T17:47:17.351692Z","title":"Negative-prompt inversion: Fast image inversion for editing with text-guided diffusion models,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.17526","last_updated":"2026-07-20T04:00:16Z","snapshot_observed_at":"2026-08-16T06:04:29.231090Z","submitted_at":"2026-07-20T04:00:16Z","title":"FlowSonic: Stable Zero-Shot Music Editing via High-Order Trajectory Integration","version":1},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-01T17:47:17.351692Z"},"links":{"cited_paper":"/paper/2305.16807","citing_paper":"/paper/2607.17526"},"observation_digest":"sha256:914d0933a7f8607f0b6560cd9f20e379478d1ce869401508bc68a89ff7de955a","observation_id":"b9d7b08a-3ffb-44e7-b0e9-eb50841ff473","resolution":{"observed_at":"2026-08-01T17:47:17.351692Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.03293","last_updated":"2025-02-20T13:17:01Z","snapshot_observed_at":"2026-08-16T13:45:52.813159Z","submitted_at":"2024-06-05T14:02:31Z","title":"Text-to-Image Rectified Flow as Plug-and-Play Priors","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.03293","snapshot_observed_at":"2026-08-01T17:47:17.478589Z","title":"Text-to-image rectified flow as plug-and-play priors,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.17526","last_updated":"2026-07-20T04:00:16Z","snapshot_observed_at":"2026-08-16T06:04:29.231090Z","submitted_at":"2026-07-20T04:00:16Z","title":"FlowSonic: Stable Zero-Shot Music Editing via High-Order Trajectory Integration","version":1},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-01T17:47:17.478589Z"},"links":{"cited_paper":"/paper/2406.03293","citing_paper":"/paper/2607.17526"},"observation_digest":"sha256:69bd62ba736eca6df8d4fb8509e12f856400d5d404dc9331befad9e12bcf262c","observation_id":"0fb43372-5757-4fe7-9170-e3eb907dabc5","resolution":{"observed_at":"2026-08-01T17:47:17.478589Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T17:47:17.591016Z","title":"Semantic image inversion and editing using rectified stochastic differ- ential equations,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.17526","last_updated":"2026-07-20T04:00:16Z","snapshot_observed_at":"2026-08-16T06:04:29.231090Z","submitted_at":"2026-07-20T04:00:16Z","title":"FlowSonic: Stable Zero-Shot Music Editing via High-Order Trajectory Integration","version":1},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-01T17:47:17.591016Z"},"links":{"citing_paper":"/paper/2607.17526"},"observation_digest":"sha256:5ad5a1dc8928bed0224bb8fb4402969467ed45ce1d7d8e1c51221a399ca96b3e","observation_id":"c8e81b2c-51e7-44ac-b676-76f6f6a17f4b","resolution":{"observed_at":"2026-08-01T17:47:17.591016Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T17:47:17.695357Z","title":"Scaling instruction-finetuned language models,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.17526","last_updated":"2026-07-20T04:00:16Z","snapshot_observed_at":"2026-08-16T06:04:29.231090Z","submitted_at":"2026-07-20T04:00:16Z","title":"FlowSonic: Stable Zero-Shot Music Editing via High-Order Trajectory Integration","version":1},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-08-01T17:47:17.695357Z"},"links":{"citing_paper":"/paper/2607.17526"},"observation_digest":"sha256:1c99d6b71f88e9c2bdaa29cc173be6932f852422ee2fae7a389c2b2ced017bd8","observation_id":"148b379e-caef-4f35-8cc9-92b3a0e5daea","resolution":{"observed_at":"2026-08-01T17:47:17.695357Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T17:47:17.777868Z","title":"Large-scale contrastive language-audio pretraining with feature fusion and keyword-to-caption augmentation,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.17526","last_updated":"2026-07-20T04:00:16Z","snapshot_observed_at":"2026-08-16T06:04:29.231090Z","submitted_at":"2026-07-20T04:00:16Z","title":"FlowSonic: Stable Zero-Shot Music Editing via High-Order Trajectory Integration","version":1},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-08-01T17:47:17.777868Z"},"links":{"citing_paper":"/paper/2607.17526"},"observation_digest":"sha256:9fd90431a16956387d3bdba5320ca2eccf99911e97d9d6d30400f1bb76564806","observation_id":"090c03f9-4859-49ac-ad3b-c04d6a249c2a","resolution":{"observed_at":"2026-08-01T17:47:17.777868Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2208.01626","last_updated":"2022-08-02T17:55:41Z","snapshot_observed_at":"2026-08-17T00:44:11.103098Z","submitted_at":"2022-08-02T17:55:41Z","title":"Prompt-to-Prompt Image Editing with Cross Attention Control","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2208.01626","snapshot_observed_at":"2026-08-01T17:47:17.898155Z","title":"Prompt-to-prompt image editing with cross attention control,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2607.17526","last_updated":"2026-07-20T04:00:16Z","snapshot_observed_at":"2026-08-16T06:04:29.231090Z","submitted_at":"2026-07-20T04:00:16Z","title":"FlowSonic: Stable Zero-Shot Music Editing via High-Order Trajectory Integration","version":1},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-08-01T17:47:17.898155Z"},"links":{"cited_paper":"/paper/2208.01626","citing_paper":"/paper/2607.17526"},"observation_digest":"sha256:e9f9cd119a3dcce4beffc089404f9460019d459876efa92f25c3667890b789f1","observation_id":"eb49e47c-04a0-420a-97f5-f7f1c7b76e55","resolution":{"observed_at":"2026-08-01T17:47:17.898155Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2211.12572","last_updated":"2022-11-22T20:39:18Z","snapshot_observed_at":"2026-08-16T16:14:03.998741Z","submitted_at":"2022-11-22T20:39:18Z","title":"Plug-and-Play Diffusion Features for Text-Driven Image-to-Image Translation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2211.12572","snapshot_observed_at":"2026-08-01T17:47:18.002095Z","title":"Plug-and-play diffusion features for text-driven image-to-image translation,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2607.17526","last_updated":"2026-07-20T04:00:16Z","snapshot_observed_at":"2026-08-16T06:04:29.231090Z","submitted_at":"2026-07-20T04:00:16Z","title":"FlowSonic: Stable Zero-Shot Music Editing via High-Order Trajectory Integration","version":1},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-08-01T17:47:18.002095Z"},"links":{"cited_paper":"/paper/2211.12572","citing_paper":"/paper/2607.17526"},"observation_digest":"sha256:5dff24c7de0231bbf6cd77db199ee95436fc84df0ed42363d80f71a00761317d","observation_id":"6f662bce-68b9-4139-83da-47febd334197","resolution":{"observed_at":"2026-08-01T17:47:18.002095Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.00534","last_updated":"2024-06-07T10:41:05Z","snapshot_observed_at":"2026-08-16T14:22:32.926258Z","submitted_at":"2024-02-01T12:01:43Z","title":"A Manifold Representation of the Key in Vision Transformers","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.00534","snapshot_observed_at":"2026-08-01T17:47:18.104323Z","title":"A manifold representation of the key in vision transformers,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.17526","last_updated":"2026-07-20T04:00:16Z","snapshot_observed_at":"2026-08-16T06:04:29.231090Z","submitted_at":"2026-07-20T04:00:16Z","title":"FlowSonic: Stable Zero-Shot Music Editing via High-Order Trajectory Integration","version":1},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-08-01T17:47:18.104323Z"},"links":{"cited_paper":"/paper/2402.00534","citing_paper":"/paper/2607.17526"},"observation_digest":"sha256:d4f3c825d59c53456b79ae57517ed07bb939890e43228f2dac94bce33b10b11f","observation_id":"2e9019d7-754b-4b29-a4aa-393bc1339269","resolution":{"observed_at":"2026-08-01T17:47:18.104323Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T17:47:18.213351Z","title":"SDEdit: Guided image synthesis and editing with stochastic differential equations,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2607.17526","last_updated":"2026-07-20T04:00:16Z","snapshot_observed_at":"2026-08-16T06:04:29.231090Z","submitted_at":"2026-07-20T04:00:16Z","title":"FlowSonic: Stable Zero-Shot Music Editing via High-Order Trajectory Integration","version":1},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-08-01T17:47:18.213351Z"},"links":{"citing_paper":"/paper/2607.17526"},"observation_digest":"sha256:6a6283ad43367ef06865d7923f0854d6cdeb88fcadeadfc226c4deba807a9e13","observation_id":"91666495-f696-49f1-baf3-d89a9166517c","resolution":{"observed_at":"2026-08-01T17:47:18.213351Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T17:47:18.332117Z","title":"Steermusic: Enhanced musical consistency for zero-shot text- guided and personalized music editing,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.17526","last_updated":"2026-07-20T04:00:16Z","snapshot_observed_at":"2026-08-16T06:04:29.231090Z","submitted_at":"2026-07-20T04:00:16Z","title":"FlowSonic: Stable Zero-Shot Music Editing via High-Order Trajectory Integration","version":1},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-08-01T17:47:18.332117Z"},"links":{"citing_paper":"/paper/2607.17526"},"observation_digest":"sha256:c196eddd8c668e890eb94b933b3111605db58bb4a8777cafd3eb0ddabda14735","observation_id":"e2af5de2-a1b4-43fb-9c3c-7ba8f6967c9f","resolution":{"observed_at":"2026-08-01T17:47:18.332117Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T17:47:18.487704Z","title":"librosa: Audio and music signal analysis in python","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2607.17526","last_updated":"2026-07-20T04:00:16Z","snapshot_observed_at":"2026-08-16T06:04:29.231090Z","submitted_at":"2026-07-20T04:00:16Z","title":"FlowSonic: Stable Zero-Shot Music Editing via High-Order Trajectory Integration","version":1},"reference_index":61,"source":"pdf_text","source_observed_at":"2026-08-01T17:47:18.487704Z"},"links":{"citing_paper":"/paper/2607.17526"},"observation_digest":"sha256:a47dbab22f30b8e42ef4fce3073f58fb4cddd221c94b28cb80f7b182b66688e7","observation_id":"3bfad9ac-428a-41bd-be64-70389a69966b","resolution":{"observed_at":"2026-08-01T17:47:18.487704Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T17:47:18.627988Z","title":"Calculation of a constant q spectral transform,","venue":null,"work_id":null,"year":1991},"citing_paper":{"arxiv_id":"2607.17526","last_updated":"2026-07-20T04:00:16Z","snapshot_observed_at":"2026-08-16T06:04:29.231090Z","submitted_at":"2026-07-20T04:00:16Z","title":"FlowSonic: Stable Zero-Shot Music Editing via High-Order Trajectory Integration","version":1},"reference_index":62,"source":"pdf_text","source_observed_at":"2026-08-01T17:47:18.627988Z"},"links":{"citing_paper":"/paper/2607.17526"},"observation_digest":"sha256:7c2870bfb42619240c1d1deaf04997cad1a366de00c4416c2fbdf1aa806a927a","observation_id":"b16ebd1a-f106-481f-a7de-488c5edde7e2","resolution":{"observed_at":"2026-08-01T17:47:18.627988Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T17:47:18.766875Z","title":"Subjective video quality assessment methods for multimedia applications,","venue":null,"work_id":null,"year":1999},"citing_paper":{"arxiv_id":"2607.17526","last_updated":"2026-07-20T04:00:16Z","snapshot_observed_at":"2026-08-16T06:04:29.231090Z","submitted_at":"2026-07-20T04:00:16Z","title":"FlowSonic: Stable Zero-Shot Music Editing via High-Order Trajectory Integration","version":1},"reference_index":63,"source":"pdf_text","source_observed_at":"2026-08-01T17:47:18.766875Z"},"links":{"citing_paper":"/paper/2607.17526"},"observation_digest":"sha256:840113f4af46aabfb4130ff8145702c9870e0aa070483c0e1d865b90ebe60e0d","observation_id":"192c1f08-08dd-4bff-96ca-596168645726","resolution":{"observed_at":"2026-08-01T17:47:18.766875Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T17:47:18.852570Z","title":"Methods for subjective determination of transmission quality,","venue":null,"work_id":null,"year":1996},"citing_paper":{"arxiv_id":"2607.17526","last_updated":"2026-07-20T04:00:16Z","snapshot_observed_at":"2026-08-16T06:04:29.231090Z","submitted_at":"2026-07-20T04:00:16Z","title":"FlowSonic: Stable Zero-Shot Music Editing via High-Order Trajectory Integration","version":1},"reference_index":64,"source":"pdf_text","source_observed_at":"2026-08-01T17:47:18.852570Z"},"links":{"citing_paper":"/paper/2607.17526"},"observation_digest":"sha256:7a4ea26c1a85336781a62b6343f821081eba47b36568b218832c043693a9ab0b","observation_id":"26bf2fc0-7f33-4317-8d74-2c640be2c96a","resolution":{"observed_at":"2026-08-01T17:47:18.852570Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2607.17526","last_updated":"2026-07-20T04:00:16Z","latest_version":1,"primary_category":"cs.SD","snapshot_observed_at":"2026-08-16T06:04:29.231090Z","submitted_at":"2026-07-20T04:00:16Z","title":"FlowSonic: Stable Zero-Shot Music Editing via High-Order Trajectory Integration"},"reference_resolution":{"displayed":63,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":63,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":63},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"thesis":"As of 18 August 2026, this Paper Citation Record lists 63 of 63 outbound references and 0 inbound Pith citation observations for arXiv:2607.17526."}