{"as_of":"2026-08-15T23:38:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:7ae31a5a12c5bcdd56d59f391ff41e18f9da93078e8c23e0125a17893951436c","coverage":[{"denominator":51,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":51,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-06T23:58:36.914906Z","state":"measured"},{"denominator":51,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":51,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-15T06:32:42.880941+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2506.15530/citation-record","integrity":"/paper/2506.15530/integrity","json":"/paper/2506.15530/citation-record.json","paper":"/paper/2506.15530"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2301.11325","last_updated":"2023-01-26T18:58:53Z","snapshot_observed_at":"2026-08-14T02:16:19.922733Z","submitted_at":"2023-01-26T18:58:53Z","title":"MusicLM: Generating Music From Text","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2301.11325","snapshot_observed_at":"2026-08-06T23:58:30.489452Z","title":"Musiclm: Generating music from text","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.15530","last_updated":"2025-06-18T15:01:25Z","snapshot_observed_at":"2026-08-14T08:58:25.065231Z","submitted_at":"2025-06-18T15:01:25Z","title":"Diff-TONE: Timestep Optimization for iNstrument Editing in Text-to-Music Diffusion Models","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-06T23:58:30.489452Z"},"links":{"cited_paper":"/paper/2301.11325","citing_paper":"/paper/2506.15530"},"observation_digest":"sha256:63a0f37598b686a2c0cf66dc51db437085787d84ccde697395fcafaa06873979","observation_id":"11aab689-74b2-4224-9ea0-28c8cf0fee8b","resolution":{"observed_at":"2026-08-06T23:58:30.489452Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:58:46.842941Z","title":"Music- STAR: a Style Translation system for Audio-based Re- instrumentation","venue":null,"work_id":"6820b2ee-75f3-4630-98e7-35a5c36728ef","year":2022},"citing_paper":{"arxiv_id":"2506.15530","last_updated":"2025-06-18T15:01:25Z","snapshot_observed_at":"2026-08-14T08:58:25.065231Z","submitted_at":"2025-06-18T15:01:25Z","title":"Diff-TONE: Timestep Optimization for iNstrument Editing in Text-to-Music Diffusion Models","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-06T23:58:30.685094Z"},"links":{"citing_paper":"/paper/2506.15530"},"observation_digest":"sha256:b885e2694a3e5851188fac3d053c343c1929e674dfe42e5446e215bff6cfbe16","observation_id":"7d19c5b3-1780-4622-8a78-38d9dff76775","resolution":{"observed_at":"2026-08-06T23:58:46.949846Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2211.01324","last_updated":"2023-03-14T00:22:14Z","snapshot_observed_at":"2026-08-14T15:56:28.920461Z","submitted_at":"2022-11-02T17:43:04Z","title":"eDiff-I: Text-to-Image Diffusion Models with an Ensemble of Expert Denoisers","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2211.01324","snapshot_observed_at":"2026-08-06T23:58:30.815789Z","title":"ediffi: Text-to-image diffusion models with an ensemble of expert denoisers","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.15530","last_updated":"2025-06-18T15:01:25Z","snapshot_observed_at":"2026-08-14T08:58:25.065231Z","submitted_at":"2025-06-18T15:01:25Z","title":"Diff-TONE: Timestep Optimization for iNstrument Editing in Text-to-Music Diffusion Models","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-06T23:58:30.815789Z"},"links":{"cited_paper":"/paper/2211.01324","citing_paper":"/paper/2506.15530"},"observation_digest":"sha256:6432d4cefeb133b8252565fa35227b15290c081c58bac54617a7c3db8ecb8a42","observation_id":"111bc253-d5c9-41d7-9272-575b3dd794ce","resolution":{"observed_at":"2026-08-06T23:58:30.815789Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:58:46.660457Z","title":"Universal guidance for diffusion models","venue":null,"work_id":"72197345-7947-41bb-a2e4-63fcebabbb76","year":2023},"citing_paper":{"arxiv_id":"2506.15530","last_updated":"2025-06-18T15:01:25Z","snapshot_observed_at":"2026-08-14T08:58:25.065231Z","submitted_at":"2025-06-18T15:01:25Z","title":"Diff-TONE: Timestep Optimization for iNstrument Editing in Text-to-Music Diffusion Models","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-06T23:58:30.954288Z"},"links":{"citing_paper":"/paper/2506.15530"},"observation_digest":"sha256:6c6775192f52fb9a460e2c6222c18f9674d897f5055a12ef13098b162a66ba91","observation_id":"92498859-f109-43be-8cee-ad6627c4ffbb","resolution":{"observed_at":"2026-08-06T23:58:46.768124Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:58:46.508097Z","title":"WaveTransfer: A Flexible End-to- end Multi-instrument Timbre Transfer with Diffusion","venue":null,"work_id":"7526521a-18cb-4fc3-9fbe-5e9a25a81189","year":2024},"citing_paper":{"arxiv_id":"2506.15530","last_updated":"2025-06-18T15:01:25Z","snapshot_observed_at":"2026-08-14T08:58:25.065231Z","submitted_at":"2025-06-18T15:01:25Z","title":"Diff-TONE: Timestep Optimization for iNstrument Editing in Text-to-Music Diffusion Models","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-06T23:58:31.129261Z"},"links":{"citing_paper":"/paper/2506.15530"},"observation_digest":"sha256:3be8f1dc33c592b07bc11a865fc28db6a2390688bb293bced4367720a98485ff","observation_id":"dba32e94-8f40-4d49-b50a-76a66012f25a","resolution":{"observed_at":"2026-08-06T23:58:46.569636Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2311.15127","last_updated":"2023-11-25T22:28:38Z","snapshot_observed_at":"2026-08-07T21:47:08.589400Z","submitted_at":"2023-11-25T22:28:38Z","title":"Stable Video Diffusion: Scaling Latent Video Diffusion Models to Large Datasets","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.15127","snapshot_observed_at":"2026-08-06T23:58:31.255617Z","title":"Stable video diffusion: Scal- ing latent video diffusion models to large datasets","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.15530","last_updated":"2025-06-18T15:01:25Z","snapshot_observed_at":"2026-08-14T08:58:25.065231Z","submitted_at":"2025-06-18T15:01:25Z","title":"Diff-TONE: Timestep Optimization for iNstrument Editing in Text-to-Music Diffusion Models","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-06T23:58:31.255617Z"},"links":{"cited_paper":"/paper/2311.15127","citing_paper":"/paper/2506.15530"},"observation_digest":"sha256:68f712cc5fcc62966e4fe2a09c76c62c6a514154b821fef90836b94293ee7924","observation_id":"ef1e85f9-9705-4dbd-b54c-8f83e63debda","resolution":{"observed_at":"2026-08-06T23:58:31.255617Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:58:46.346956Z","title":"A Comparison of Sound Segrega- tion Techniques for Predominant Instrument Recogni- tion in Musical Audio Signals","venue":null,"work_id":"f91a0df6-686f-4834-a50e-ba568a3c1301","year":2012},"citing_paper":{"arxiv_id":"2506.15530","last_updated":"2025-06-18T15:01:25Z","snapshot_observed_at":"2026-08-14T08:58:25.065231Z","submitted_at":"2025-06-18T15:01:25Z","title":"Diff-TONE: Timestep Optimization for iNstrument Editing in Text-to-Music Diffusion Models","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-06T23:58:31.431592Z"},"links":{"citing_paper":"/paper/2506.15530"},"observation_digest":"sha256:b744e88283910392ce821b9f5723c1f6ebde3d6679e72d2c636a5345781efe78","observation_id":"3af0783e-e523-4e9d-832c-4cb06a3b4c99","resolution":{"observed_at":"2026-08-06T23:58:46.422351Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:58:46.034744Z","title":"Instructpix2pix: Learning to follow image editing in- structions","venue":null,"work_id":"50a6e9a4-35e4-4ce6-9796-84b9b1f5d81f","year":2023},"citing_paper":{"arxiv_id":"2506.15530","last_updated":"2025-06-18T15:01:25Z","snapshot_observed_at":"2026-08-14T08:58:25.065231Z","submitted_at":"2025-06-18T15:01:25Z","title":"Diff-TONE: Timestep Optimization for iNstrument Editing in Text-to-Music Diffusion Models","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-06T23:58:31.574999Z"},"links":{"citing_paper":"/paper/2506.15530"},"observation_digest":"sha256:742d042db71e496536537cafcc841d7f0b1695202f1edbcfe9636dc10613525c","observation_id":"652083c2-1762-4465-9934-bd57834ad742","resolution":{"observed_at":"2026-08-06T23:58:46.236395Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:58:45.866272Z","title":"Musicldm: Enhancing novelty in text-to- music generation using beat-synchronous mixup strate- gies","venue":null,"work_id":"f887ee53-703c-457c-a7a9-983dd7448999","year":2024},"citing_paper":{"arxiv_id":"2506.15530","last_updated":"2025-06-18T15:01:25Z","snapshot_observed_at":"2026-08-14T08:58:25.065231Z","submitted_at":"2025-06-18T15:01:25Z","title":"Diff-TONE: Timestep Optimization for iNstrument Editing in Text-to-Music Diffusion Models","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-06T23:58:31.678291Z"},"links":{"citing_paper":"/paper/2506.15530"},"observation_digest":"sha256:6cb0f27f9e1e101ad4961a7ce7a59a62c7a63ae0f9c1a5f0f7fd175d62353f17","observation_id":"fa29a46b-c199-40e7-8f70-2b863ee205f3","resolution":{"observed_at":"2026-08-06T23:58:45.947683Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:58:45.713993Z","title":"Executing your Commands via Motion Diffusion in Latent Space","venue":null,"work_id":"173addce-618c-4290-ac60-376176e5accf","year":2023},"citing_paper":{"arxiv_id":"2506.15530","last_updated":"2025-06-18T15:01:25Z","snapshot_observed_at":"2026-08-14T08:58:25.065231Z","submitted_at":"2025-06-18T15:01:25Z","title":"Diff-TONE: Timestep Optimization for iNstrument Editing in Text-to-Music Diffusion Models","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-06T23:58:31.830004Z"},"links":{"citing_paper":"/paper/2506.15530"},"observation_digest":"sha256:ae44e09914ef766affc66ae2dd9a39159fbaa9e9d6e6bd086144a70d43d1bffd","observation_id":"e783c59e-82c8-4c45-bf8a-d2066bb4fb1e","resolution":{"observed_at":"2026-08-06T23:58:45.793227Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:58:45.558950Z","title":"Scaling instruction-finetuned language models","venue":null,"work_id":"41ae13c9-f78f-4f05-83ac-138006450b0d","year":2024},"citing_paper":{"arxiv_id":"2506.15530","last_updated":"2025-06-18T15:01:25Z","snapshot_observed_at":"2026-08-14T08:58:25.065231Z","submitted_at":"2025-06-18T15:01:25Z","title":"Diff-TONE: Timestep Optimization for iNstrument Editing in Text-to-Music Diffusion Models","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-06T23:58:31.945566Z"},"links":{"citing_paper":"/paper/2506.15530"},"observation_digest":"sha256:6bb5fa99f8935690555045c37ec3c8408bca2fb2f1db27fe711c06cff9715f9e","observation_id":"5ad41fe9-177e-44f6-9f28-43b2a59c1508","resolution":{"observed_at":"2026-08-06T23:58:45.635696Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.15602","last_updated":"2025-03-09T06:46:13Z","snapshot_observed_at":"2026-08-15T05:53:33.793608Z","submitted_at":"2025-02-21T17:19:15Z","title":"KAD: No More FAD! An Effective and Efficient Evaluation Metric for Audio Generation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.15602","snapshot_observed_at":"2026-08-06T23:58:32.003843Z","title":"KAD: No More FAD! An Effec- tive and Efficient Evaluation Metric for Audio Genera- tion","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.15530","last_updated":"2025-06-18T15:01:25Z","snapshot_observed_at":"2026-08-14T08:58:25.065231Z","submitted_at":"2025-06-18T15:01:25Z","title":"Diff-TONE: Timestep Optimization for iNstrument Editing in Text-to-Music Diffusion Models","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-06T23:58:32.003843Z"},"links":{"cited_paper":"/paper/2502.15602","citing_paper":"/paper/2506.15530"},"observation_digest":"sha256:ef31e808dfcdde76a7f4f12dec25abc5d120bc427b5465b5297d0d692f31d3f1","observation_id":"92eb78a9-b5ea-4297-b443-83b7927adf64","resolution":{"observed_at":"2026-08-06T23:58:32.003843Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:58:45.398099Z","title":"Self-Supervised VQ-V AE for One- Shot Music Style Transfer","venue":null,"work_id":"021d2cfe-d4e8-4962-998c-e09bd04dc8b2","year":2021},"citing_paper":{"arxiv_id":"2506.15530","last_updated":"2025-06-18T15:01:25Z","snapshot_observed_at":"2026-08-14T08:58:25.065231Z","submitted_at":"2025-06-18T15:01:25Z","title":"Diff-TONE: Timestep Optimization for iNstrument Editing in Text-to-Music Diffusion Models","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-06T23:58:32.073327Z"},"links":{"citing_paper":"/paper/2506.15530"},"observation_digest":"sha256:f28c5b327d39a2a924277b3d27a5308a92485a67b7db9c75c291b6bf1d738e80","observation_id":"d00fd673-5e54-4dd9-a5d0-fa7080b32990","resolution":{"observed_at":"2026-08-06T23:58:45.476120Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:58:45.222908Z","title":"Timbre transfer using image-to-image denoising diffu- sion implicit models","venue":null,"work_id":"8ac69966-9744-4522-bcb2-86f2052b3006","year":2023},"citing_paper":{"arxiv_id":"2506.15530","last_updated":"2025-06-18T15:01:25Z","snapshot_observed_at":"2026-08-14T08:58:25.065231Z","submitted_at":"2025-06-18T15:01:25Z","title":"Diff-TONE: Timestep Optimization for iNstrument Editing in Text-to-Music Diffusion Models","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-06T23:58:32.136287Z"},"links":{"citing_paper":"/paper/2506.15530"},"observation_digest":"sha256:c37e475959f64621a29cde7c54fde654b54cf7f8197e8cd5bec79bad85ad07c6","observation_id":"b324b715-925b-4cb8-87f3-8cfa7ee425a1","resolution":{"observed_at":"2026-08-06T23:58:45.312507Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:58:44.004514Z","title":"Simple and controllable music gen- eration","venue":null,"work_id":"2f72988b-effb-4cf1-8921-a986b3787e56","year":2023},"citing_paper":{"arxiv_id":"2506.15530","last_updated":"2025-06-18T15:01:25Z","snapshot_observed_at":"2026-08-14T08:58:25.065231Z","submitted_at":"2025-06-18T15:01:25Z","title":"Diff-TONE: Timestep Optimization for iNstrument Editing in Text-to-Music Diffusion Models","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-06T23:58:32.204839Z"},"links":{"citing_paper":"/paper/2506.15530"},"observation_digest":"sha256:0765c9475fb98aa3ff09cbbc7a3eeb55673d4b983484c674dbbf1a010e54868c","observation_id":"1a99802a-50c3-416f-a2cf-24959bb96910","resolution":{"observed_at":"2026-08-06T23:58:44.469027Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.00037","last_updated":"2024-10-02T09:11:45Z","snapshot_observed_at":"2026-07-30T10:21:14.474746Z","submitted_at":"2024-09-17T17:55:39Z","title":"Moshi: a speech-text foundation model for real-time dialogue","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.00037","snapshot_observed_at":"2026-08-06T23:58:32.284021Z","title":"Moshi: a speech-text foun- dation model for real-time dialogue","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.15530","last_updated":"2025-06-18T15:01:25Z","snapshot_observed_at":"2026-08-14T08:58:25.065231Z","submitted_at":"2025-06-18T15:01:25Z","title":"Diff-TONE: Timestep Optimization for iNstrument Editing in Text-to-Music Diffusion Models","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-06T23:58:32.284021Z"},"links":{"cited_paper":"/paper/2410.00037","citing_paper":"/paper/2506.15530"},"observation_digest":"sha256:d1e2533fe80d552ed50d1288ca449de92a2f2418d486a8d9809c8d262ca91b42","observation_id":"6e6d0a0b-f46f-4c3f-b2fb-9c8662ee8d5a","resolution":{"observed_at":"2026-08-06T23:58:32.284021Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:58:43.835507Z","title":"Diffusion models beat gans on image synthesis","venue":null,"work_id":"f3f77fef-435c-440e-8752-04ab1d70df7d","year":2021},"citing_paper":{"arxiv_id":"2506.15530","last_updated":"2025-06-18T15:01:25Z","snapshot_observed_at":"2026-08-14T08:58:25.065231Z","submitted_at":"2025-06-18T15:01:25Z","title":"Diff-TONE: Timestep Optimization for iNstrument Editing in Text-to-Music Diffusion Models","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-06T23:58:32.418751Z"},"links":{"citing_paper":"/paper/2506.15530"},"observation_digest":"sha256:5d30a065866a64f5bd92a0118f922db236d5c78d7c116b4cf515dae991e34a3d","observation_id":"1863b053-0ba3-4294-9e8b-5b7da8c74d1c","resolution":{"observed_at":"2026-08-06T23:58:43.894733Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:58:43.620369Z","title":"Stable audio open","venue":null,"work_id":"7478b617-ab04-4974-a6df-a4db879ceb35","year":2025},"citing_paper":{"arxiv_id":"2506.15530","last_updated":"2025-06-18T15:01:25Z","snapshot_observed_at":"2026-08-14T08:58:25.065231Z","submitted_at":"2025-06-18T15:01:25Z","title":"Diff-TONE: Timestep Optimization for iNstrument Editing in Text-to-Music Diffusion Models","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-06T23:58:32.572609Z"},"links":{"citing_paper":"/paper/2506.15530"},"observation_digest":"sha256:a0000068df4ee85deac906670d66a880251dbdffb9dfcba4c2e126c94ddc46e8","observation_id":"a74a6ee7-f61b-4f65-b331-2e4f23bfcd79","resolution":{"observed_at":"2026-08-06T23:58:43.712753Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:58:43.457564Z","title":"Text-to-audio generation using instruction guided latent diffusion model","venue":null,"work_id":"988368d0-b985-4d3e-b6b7-546859908cc8","year":2023},"citing_paper":{"arxiv_id":"2506.15530","last_updated":"2025-06-18T15:01:25Z","snapshot_observed_at":"2026-08-14T08:58:25.065231Z","submitted_at":"2025-06-18T15:01:25Z","title":"Diff-TONE: Timestep Optimization for iNstrument Editing in Text-to-Music Diffusion Models","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-06T23:58:32.745668Z"},"links":{"citing_paper":"/paper/2506.15530"},"observation_digest":"sha256:cc8090152685cdabeee57e8c7db7d5b481e314a3ea5e90d91a52e6df1ab99397","observation_id":"c056775a-56cc-40e9-a818-e20888020d77","resolution":{"observed_at":"2026-08-06T23:58:43.510116Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:58:43.303067Z","title":"Generative adversarial net- works","venue":null,"work_id":"c1348395-cbf2-443b-b221-d65f082b2d62","year":2020},"citing_paper":{"arxiv_id":"2506.15530","last_updated":"2025-06-18T15:01:25Z","snapshot_observed_at":"2026-08-14T08:58:25.065231Z","submitted_at":"2025-06-18T15:01:25Z","title":"Diff-TONE: Timestep Optimization for iNstrument Editing in Text-to-Music Diffusion Models","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-06T23:58:32.904784Z"},"links":{"citing_paper":"/paper/2506.15530"},"observation_digest":"sha256:13b5f9152ec6c8f281e9915dc34d8cee18108e06d735730e1ab9be32988f1f13","observation_id":"22abec83-d2c1-45c2-9d9c-778244217077","resolution":{"observed_at":"2026-08-06T23:58:43.378800Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:58:43.186318Z","title":"Animatediff: Animate your person- alized text-to-image diffusion models without specific tuning","venue":null,"work_id":"29dedf35-6341-413f-8e9b-2265580a27a5","year":2024},"citing_paper":{"arxiv_id":"2506.15530","last_updated":"2025-06-18T15:01:25Z","snapshot_observed_at":"2026-08-14T08:58:25.065231Z","submitted_at":"2025-06-18T15:01:25Z","title":"Diff-TONE: Timestep Optimization for iNstrument Editing in Text-to-Music Diffusion Models","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-06T23:58:32.984784Z"},"links":{"citing_paper":"/paper/2506.15530"},"observation_digest":"sha256:d8f83e222158b883bdc6f3e97383c8ffa6f59f2a7fd065ee51af05c61fadcbcd","observation_id":"c2a46e27-140f-4741-85ee-83bb81d7c886","resolution":{"observed_at":"2026-08-06T23:58:43.243998Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:58:42.993381Z","title":"InstructME: An Instruction Guided Music Edit And Remix Framework with Latent Diffu- sion Models","venue":null,"work_id":"5fc0ba8b-0527-47b8-981f-3a533d99eafe","year":2024},"citing_paper":{"arxiv_id":"2506.15530","last_updated":"2025-06-18T15:01:25Z","snapshot_observed_at":"2026-08-14T08:58:25.065231Z","submitted_at":"2025-06-18T15:01:25Z","title":"Diff-TONE: Timestep Optimization for iNstrument Editing in Text-to-Music Diffusion Models","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-06T23:58:33.085543Z"},"links":{"citing_paper":"/paper/2506.15530"},"observation_digest":"sha256:c91c3d362ebf81860849a345900802c86df4da8d9dbcb734483084164b88b14d","observation_id":"a23bd7ff-b5ca-46ec-bd1d-57d9faf85644","resolution":{"observed_at":"2026-08-06T23:58:43.117132Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:58:42.747026Z","title":"Denois- ing diffusion probabilistic models","venue":null,"work_id":"21fa03be-b5e9-47b9-9dde-e581ea7ab4ff","year":2020},"citing_paper":{"arxiv_id":"2506.15530","last_updated":"2025-06-18T15:01:25Z","snapshot_observed_at":"2026-08-14T08:58:25.065231Z","submitted_at":"2025-06-18T15:01:25Z","title":"Diff-TONE: Timestep Optimization for iNstrument Editing in Text-to-Music Diffusion Models","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-06T23:58:33.223126Z"},"links":{"citing_paper":"/paper/2506.15530"},"observation_digest":"sha256:a2aabd40af266947c623f8d67e8d26c5c55377fec0dbb75da2b1e97be30a9c5f","observation_id":"97366a0f-f56a-4906-b261-53bbe6ecaba2","resolution":{"observed_at":"2026-08-06T23:58:42.858603Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:58:42.525093Z","title":"Classifier-Free Diffu- sion Guidance","venue":null,"work_id":"e00b27f7-6fac-43fb-991a-c95810441b04","year":2021},"citing_paper":{"arxiv_id":"2506.15530","last_updated":"2025-06-18T15:01:25Z","snapshot_observed_at":"2026-08-14T08:58:25.065231Z","submitted_at":"2025-06-18T15:01:25Z","title":"Diff-TONE: Timestep Optimization for iNstrument Editing in Text-to-Music Diffusion Models","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-06T23:58:33.367335Z"},"links":{"citing_paper":"/paper/2506.15530"},"observation_digest":"sha256:bd2e8e4afeb181bcccd8c7473cc82890134fdaa666129efc4ed04a8341c5dca0","observation_id":"203e3afc-8463-456f-84da-4f7253608249","resolution":{"observed_at":"2026-08-06T23:58:42.618816Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2302.03917","last_updated":"2023-03-06T18:09:56Z","snapshot_observed_at":"2026-08-14T07:31:45.753439Z","submitted_at":"2023-02-08T07:27:27Z","title":"Noise2Music: Text-conditioned Music Generation with Diffusion Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2302.03917","snapshot_observed_at":"2026-08-06T23:58:33.511112Z","title":"Noise2music: Text-conditioned music generation with diffusion models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.15530","last_updated":"2025-06-18T15:01:25Z","snapshot_observed_at":"2026-08-14T08:58:25.065231Z","submitted_at":"2025-06-18T15:01:25Z","title":"Diff-TONE: Timestep Optimization for iNstrument Editing in Text-to-Music Diffusion Models","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-06T23:58:33.511112Z"},"links":{"cited_paper":"/paper/2302.03917","citing_paper":"/paper/2506.15530"},"observation_digest":"sha256:0be9637b0793f3d49b6e5da1ec2e3fffa7ab6f27125a9657474fcfa3fa57f6a8","observation_id":"5f4478ee-a3e7-4058-8c70-4eea61bc3156","resolution":{"observed_at":"2026-08-06T23:58:33.511112Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:58:42.289272Z","title":"Make-an-audio: Text-to-audio generation with prompt-enhanced diffusion models","venue":null,"work_id":"daf80d6e-788f-4825-96ca-26a02cb6725b","year":2023},"citing_paper":{"arxiv_id":"2506.15530","last_updated":"2025-06-18T15:01:25Z","snapshot_observed_at":"2026-08-14T08:58:25.065231Z","submitted_at":"2025-06-18T15:01:25Z","title":"Diff-TONE: Timestep Optimization for iNstrument Editing in Text-to-Music Diffusion Models","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-06T23:58:33.645437Z"},"links":{"citing_paper":"/paper/2506.15530"},"observation_digest":"sha256:d6c5bf1d49487cc278eae328ab79c455c30eeb7062f1d706cd8226581302dd4e","observation_id":"115f50e7-6d15-4372-bf56-61226877d3ff","resolution":{"observed_at":"2026-08-06T23:58:42.414409Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:58:42.100004Z","title":"Auto-encoding variational bayes","venue":null,"work_id":"df864a56-7a94-4a5d-ac7e-1954b75442dd","year":2014},"citing_paper":{"arxiv_id":"2506.15530","last_updated":"2025-06-18T15:01:25Z","snapshot_observed_at":"2026-08-14T08:58:25.065231Z","submitted_at":"2025-06-18T15:01:25Z","title":"Diff-TONE: Timestep Optimization for iNstrument Editing in Text-to-Music Diffusion Models","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-06T23:58:33.755079Z"},"links":{"citing_paper":"/paper/2506.15530"},"observation_digest":"sha256:15bd03b0a8f462388487358f90d8b66cc78edd131d5866a184003e499760d9de","observation_id":"8d29882e-605b-44e7-a973-99da11026f7c","resolution":{"observed_at":"2026-08-06T23:58:42.147352Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:58:41.852916Z","title":"Applying guidance in a limited interval improves sample and distribution quality in diffusion models","venue":null,"work_id":"a21c5512-5f20-4e86-8777-81f4b1d1115d","year":2024},"citing_paper":{"arxiv_id":"2506.15530","last_updated":"2025-06-18T15:01:25Z","snapshot_observed_at":"2026-08-14T08:58:25.065231Z","submitted_at":"2025-06-18T15:01:25Z","title":"Diff-TONE: Timestep Optimization for iNstrument Editing in Text-to-Music Diffusion Models","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-06T23:58:33.862316Z"},"links":{"citing_paper":"/paper/2506.15530"},"observation_digest":"sha256:e8d8c81049d4e1c898490ba65e9cbd9f30678497e026702ef81c2ffa0a3a23f0","observation_id":"b9fa412f-8d12-4043-8f86-1580fe4e0336","resolution":{"observed_at":"2026-08-06T23:58:41.948591Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:58:41.664953Z","title":"Efficient neural music generation","venue":null,"work_id":"598bbcad-4a35-4937-83cd-120e2b3832c8","year":2023},"citing_paper":{"arxiv_id":"2506.15530","last_updated":"2025-06-18T15:01:25Z","snapshot_observed_at":"2026-08-14T08:58:25.065231Z","submitted_at":"2025-06-18T15:01:25Z","title":"Diff-TONE: Timestep Optimization for iNstrument Editing in Text-to-Music Diffusion Models","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-06T23:58:33.965658Z"},"links":{"citing_paper":"/paper/2506.15530"},"observation_digest":"sha256:4994e34bc56c5cdaa8fa86eb02cc4d7da22a3edffee9959caa5918730f5f0af7","observation_id":"337bdfa9-c019-4576-9b28-343f45228988","resolution":{"observed_at":"2026-08-06T23:58:41.759860Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:58:41.435753Z","title":"Music style transfer with time-varying inversion of diffusion models","venue":null,"work_id":"0f5b4541-92d0-4515-80f0-2906f0fc425f","year":2024},"citing_paper":{"arxiv_id":"2506.15530","last_updated":"2025-06-18T15:01:25Z","snapshot_observed_at":"2026-08-14T08:58:25.065231Z","submitted_at":"2025-06-18T15:01:25Z","title":"Diff-TONE: Timestep Optimization for iNstrument Editing in Text-to-Music Diffusion Models","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-06T23:58:34.033833Z"},"links":{"citing_paper":"/paper/2506.15530"},"observation_digest":"sha256:a6b0f2bf370808e385a02c2cbb8926c51b7e3a8fa4a1c32b949bd926daaeb099","observation_id":"b1e10ba8-5d71-4099-b81d-17d261d0f7bc","resolution":{"observed_at":"2026-08-06T23:58:41.555479Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:58:41.121302Z","title":"MERT: Acoustic Music Understanding Model with Large-Scale Self-supervised Training","venue":null,"work_id":"df149642-1b45-483d-a4e1-8352201beb5b","year":2024},"citing_paper":{"arxiv_id":"2506.15530","last_updated":"2025-06-18T15:01:25Z","snapshot_observed_at":"2026-08-14T08:58:25.065231Z","submitted_at":"2025-06-18T15:01:25Z","title":"Diff-TONE: Timestep Optimization for iNstrument Editing in Text-to-Music Diffusion Models","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-06T23:58:34.177555Z"},"links":{"citing_paper":"/paper/2506.15530"},"observation_digest":"sha256:d4ee525f6d37aa6e1bc86088ac396684470256911d6430042651547cc9b80d75","observation_id":"30b09d43-a7a8-4958-8e4b-f4dbdbb25349","resolution":{"observed_at":"2026-08-06T23:58:41.281258Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:58:40.762248Z","title":"Content-based controls for music large language modeling","venue":null,"work_id":"59329e8e-5456-4a52-8ae1-822cc68fb896","year":2024},"citing_paper":{"arxiv_id":"2506.15530","last_updated":"2025-06-18T15:01:25Z","snapshot_observed_at":"2026-08-14T08:58:25.065231Z","submitted_at":"2025-06-18T15:01:25Z","title":"Diff-TONE: Timestep Optimization for iNstrument Editing in Text-to-Music Diffusion Models","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-06T23:58:34.308090Z"},"links":{"citing_paper":"/paper/2506.15530"},"observation_digest":"sha256:6addbad20b6018b595ff7d439537a082dad1590d4c90fb86c535e1e6f63b699a","observation_id":"4ef7958b-6efa-453d-a721-e210369012db","resolution":{"observed_at":"2026-08-06T23:58:40.937049Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:58:40.392548Z","title":"Audioldm 2: Learning holistic au- dio generation with self-supervised pretraining","venue":null,"work_id":"2cc4fab9-c247-402f-94ce-f8db7cc3189f","year":2024},"citing_paper":{"arxiv_id":"2506.15530","last_updated":"2025-06-18T15:01:25Z","snapshot_observed_at":"2026-08-14T08:58:25.065231Z","submitted_at":"2025-06-18T15:01:25Z","title":"Diff-TONE: Timestep Optimization for iNstrument Editing in Text-to-Music Diffusion Models","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-06T23:58:34.424028Z"},"links":{"citing_paper":"/paper/2506.15530"},"observation_digest":"sha256:29cfb96761d81170398f24143706f3e49cc0b2b30f2fca13adde530772e2d158","observation_id":"607ee2df-d2ba-40f0-b1f5-c21cf9dea68e","resolution":{"observed_at":"2026-08-06T23:58:40.585910Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2301.12503","last_updated":"2023-09-09T15:27:58Z","snapshot_observed_at":"2026-08-13T12:55:40.566213Z","submitted_at":"2023-01-29T17:48:17Z","title":"AudioLDM: Text-to-Audio Generation with Latent Diffusion Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2301.12503","snapshot_observed_at":"2026-08-06T23:58:34.577052Z","title":"Audioldm: Text-to-audio genera- tion with latent diffusion models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.15530","last_updated":"2025-06-18T15:01:25Z","snapshot_observed_at":"2026-08-14T08:58:25.065231Z","submitted_at":"2025-06-18T15:01:25Z","title":"Diff-TONE: Timestep Optimization for iNstrument Editing in Text-to-Music Diffusion Models","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-06T23:58:34.577052Z"},"links":{"cited_paper":"/paper/2301.12503","citing_paper":"/paper/2506.15530"},"observation_digest":"sha256:fecc25b84d5549f8cefd4cbe761b8f12575ef7aa0556c96960b9d82fa610f7de","observation_id":"401ae98b-4024-41b3-ad2e-c5b3acd1d977","resolution":{"observed_at":"2026-08-06T23:58:34.577052Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:58:40.014370Z","title":"Music understanding llama: Ad- vancing text-to-music generation with question answer- ing and captioning","venue":null,"work_id":"4be3d8ed-6561-4b54-b773-be164d33f73b","year":2024},"citing_paper":{"arxiv_id":"2506.15530","last_updated":"2025-06-18T15:01:25Z","snapshot_observed_at":"2026-08-14T08:58:25.065231Z","submitted_at":"2025-06-18T15:01:25Z","title":"Diff-TONE: Timestep Optimization for iNstrument Editing in Text-to-Music Diffusion Models","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-06T23:58:34.684598Z"},"links":{"citing_paper":"/paper/2506.15530"},"observation_digest":"sha256:058804f44708ebece89c7d8b5dcf37a14c85da7b7d1d002e8fe7e50aeefb7257","observation_id":"ab28cd9d-6f4c-4230-afa1-ed2e6c8e7c40","resolution":{"observed_at":"2026-08-06T23:58:40.225706Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2408.14340","last_updated":"2024-09-03T14:53:34Z","snapshot_observed_at":"2026-08-12T22:57:19.681507Z","submitted_at":"2024-08-26T15:13:14Z","title":"Foundation Models for Music: A Survey","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.14340","snapshot_observed_at":"2026-08-06T23:58:34.878811Z","title":"Foundation models for music: A survey","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.15530","last_updated":"2025-06-18T15:01:25Z","snapshot_observed_at":"2026-08-14T08:58:25.065231Z","submitted_at":"2025-06-18T15:01:25Z","title":"Diff-TONE: Timestep Optimization for iNstrument Editing in Text-to-Music Diffusion Models","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-06T23:58:34.878811Z"},"links":{"cited_paper":"/paper/2408.14340","citing_paper":"/paper/2506.15530"},"observation_digest":"sha256:fc253977c006d6dfd345e31dd0fe3a68edb6c81e8e5802710df4942c22d5499f","observation_id":"ab151a50-da97-4c30-99f4-2d050f9148e2","resolution":{"observed_at":"2026-08-06T23:58:34.878811Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:58:39.725123Z","title":"Zero-shot unsuper- vised and text-based audio editing using DDPM inver- sion","venue":null,"work_id":"ec09afc1-a02e-492d-af2c-b87b96505772","year":2024},"citing_paper":{"arxiv_id":"2506.15530","last_updated":"2025-06-18T15:01:25Z","snapshot_observed_at":"2026-08-14T08:58:25.065231Z","submitted_at":"2025-06-18T15:01:25Z","title":"Diff-TONE: Timestep Optimization for iNstrument Editing in Text-to-Music Diffusion Models","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-06T23:58:35.034235Z"},"links":{"citing_paper":"/paper/2506.15530"},"observation_digest":"sha256:93dfa6f324fc60b16beb4c569fa2c28b9b69ed4fbdd7bbb9ea28cd47f615f37a","observation_id":"46c08188-1cfd-43cb-8fbc-81c5a355f036","resolution":{"observed_at":"2026-08-06T23:58:39.877759Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:58:39.477759Z","title":"Mustango: Toward controllable text-to-music generation","venue":null,"work_id":"4f228494-e0f9-46bb-a1b8-e1852cc1724a","year":2024},"citing_paper":{"arxiv_id":"2506.15530","last_updated":"2025-06-18T15:01:25Z","snapshot_observed_at":"2026-08-14T08:58:25.065231Z","submitted_at":"2025-06-18T15:01:25Z","title":"Diff-TONE: Timestep Optimization for iNstrument Editing in Text-to-Music Diffusion Models","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-06T23:58:35.207845Z"},"links":{"citing_paper":"/paper/2506.15530"},"observation_digest":"sha256:3d97ef319e7f854a0819c35eaa023817c54f26d11508e02fbe3483c0ca8f58a4","observation_id":"b265f498-3b7d-4ec2-ae71-1a42532190f4","resolution":{"observed_at":"2026-08-06T23:58:39.566671Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:58:39.309931Z","title":"Null-text inversion for editing real images using guided diffusion models","venue":null,"work_id":"fc488cf4-01c8-4e7b-9f95-75f3863ab2e8","year":2023},"citing_paper":{"arxiv_id":"2506.15530","last_updated":"2025-06-18T15:01:25Z","snapshot_observed_at":"2026-08-14T08:58:25.065231Z","submitted_at":"2025-06-18T15:01:25Z","title":"Diff-TONE: Timestep Optimization for iNstrument Editing in Text-to-Music Diffusion Models","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-06T23:58:35.361850Z"},"links":{"citing_paper":"/paper/2506.15530"},"observation_digest":"sha256:6f3caa3d0951e415a060d378d43fe2ce8c4424b57cf0c85b58c65d6f15dc3ba8","observation_id":"21a518dd-2af4-4f15-abe2-16f351c14d91","resolution":{"observed_at":"2026-08-06T23:58:39.388200Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:58:39.117748Z","title":"Ditto: Diffusion inference-time t-optimization for music generation","venue":null,"work_id":"a451f75a-654f-4333-bcd9-9fa63bcd60ac","year":2024},"citing_paper":{"arxiv_id":"2506.15530","last_updated":"2025-06-18T15:01:25Z","snapshot_observed_at":"2026-08-14T08:58:25.065231Z","submitted_at":"2025-06-18T15:01:25Z","title":"Diff-TONE: Timestep Optimization for iNstrument Editing in Text-to-Music Diffusion Models","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-06T23:58:35.576228Z"},"links":{"citing_paper":"/paper/2506.15530"},"observation_digest":"sha256:14fe6ed777a81ccb4c62caff187adf686b7de61979371e26522db1f8aff761b5","observation_id":"507d03a5-dfe2-48a2-867a-113eac491011","resolution":{"observed_at":"2026-08-06T23:58:39.208586Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:58:38.981556Z","title":"High-resolution image synthesis with latent diffusion models","venue":null,"work_id":"3aa4c820-b904-40db-992e-e4beca74ea9c","year":2022},"citing_paper":{"arxiv_id":"2506.15530","last_updated":"2025-06-18T15:01:25Z","snapshot_observed_at":"2026-08-14T08:58:25.065231Z","submitted_at":"2025-06-18T15:01:25Z","title":"Diff-TONE: Timestep Optimization for iNstrument Editing in Text-to-Music Diffusion Models","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-06T23:58:35.755468Z"},"links":{"citing_paper":"/paper/2506.15530"},"observation_digest":"sha256:280ab29ce4a9b28a4f8d864c09b45931fcf4b09d5af23b1ce6333171f4e4b2fe","observation_id":"cd6e08a9-64d1-4b57-a6a2-768ab527e600","resolution":{"observed_at":"2026-08-06T23:58:39.036789Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:58:38.796342Z","title":"Audio Conditioning for Music Generation via Discrete Bottleneck Features","venue":null,"work_id":"9fb6d48a-4e1e-46a1-a098-443af555fdf8","year":2024},"citing_paper":{"arxiv_id":"2506.15530","last_updated":"2025-06-18T15:01:25Z","snapshot_observed_at":"2026-08-14T08:58:25.065231Z","submitted_at":"2025-06-18T15:01:25Z","title":"Diff-TONE: Timestep Optimization for iNstrument Editing in Text-to-Music Diffusion Models","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-06T23:58:35.918453Z"},"links":{"citing_paper":"/paper/2506.15530"},"observation_digest":"sha256:84d4099c8768398229e8a8fdba17efbffff6c92d6acd9aaf4ed3e8695024cb8d","observation_id":"86369a14-5273-405f-83de-5421beae79d2","resolution":{"observed_at":"2026-08-06T23:58:38.883524Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:58:38.597343Z","title":"Dreambooth: Fine tuning text-to- image diffusion models for subject-driven generation","venue":null,"work_id":"6b872b86-5b9f-4c4b-9fc2-225cd2b5ba25","year":2023},"citing_paper":{"arxiv_id":"2506.15530","last_updated":"2025-06-18T15:01:25Z","snapshot_observed_at":"2026-08-14T08:58:25.065231Z","submitted_at":"2025-06-18T15:01:25Z","title":"Diff-TONE: Timestep Optimization for iNstrument Editing in Text-to-Music Diffusion Models","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-06T23:58:36.147382Z"},"links":{"citing_paper":"/paper/2506.15530"},"observation_digest":"sha256:76cf496a47cad31cd2e17edaf30733e4fc10028c23abce379c37da8eceb275a2","observation_id":"4d15ac2d-9730-4d1a-8eec-8f438333caae","resolution":{"observed_at":"2026-08-06T23:58:38.688799Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:58:38.398328Z","title":"Photorealistic text-to-image diffusion models with deep language understanding","venue":null,"work_id":"e59fe517-5d3c-4c09-861f-e9efe013c307","year":2022},"citing_paper":{"arxiv_id":"2506.15530","last_updated":"2025-06-18T15:01:25Z","snapshot_observed_at":"2026-08-14T08:58:25.065231Z","submitted_at":"2025-06-18T15:01:25Z","title":"Diff-TONE: Timestep Optimization for iNstrument Editing in Text-to-Music Diffusion Models","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-06T23:58:36.358738Z"},"links":{"citing_paper":"/paper/2506.15530"},"observation_digest":"sha256:c4614c0c85cf9bcbc401c95f1fd765c636e03a6c3fd1554c43443027cb897f4e","observation_id":"6e2e8fb0-d8cb-4922-8e3b-e0134b5442f5","resolution":{"observed_at":"2026-08-06T23:58:38.492129Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:58:38.167197Z","title":"Denoising Diffusion Implicit Models","venue":null,"work_id":"1f877ad2-1df8-4ac5-8edd-848b64ed15c0","year":2021},"citing_paper":{"arxiv_id":"2506.15530","last_updated":"2025-06-18T15:01:25Z","snapshot_observed_at":"2026-08-14T08:58:25.065231Z","submitted_at":"2025-06-18T15:01:25Z","title":"Diff-TONE: Timestep Optimization for iNstrument Editing in Text-to-Music Diffusion Models","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-06T23:58:36.424461Z"},"links":{"citing_paper":"/paper/2506.15530"},"observation_digest":"sha256:688f3c2388d2fa10f6f3969dab5e88f0f15af561b2620148a437794aaa1f6805","observation_id":"9a9127ec-3e77-4524-b020-18041f431967","resolution":{"observed_at":"2026-08-06T23:58:38.253052Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:58:38.027282Z","title":"Human motion diffusion model","venue":null,"work_id":"4c63af88-bb0b-4bad-b2ba-3227f82ed588","year":2023},"citing_paper":{"arxiv_id":"2506.15530","last_updated":"2025-06-18T15:01:25Z","snapshot_observed_at":"2026-08-14T08:58:25.065231Z","submitted_at":"2025-06-18T15:01:25Z","title":"Diff-TONE: Timestep Optimization for iNstrument Editing in Text-to-Music Diffusion Models","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-06T23:58:36.502635Z"},"links":{"citing_paper":"/paper/2506.15530"},"observation_digest":"sha256:bd5a0274ebff3774a319cf8c8dbede73bf94fc43868948f7c20deb0a5bcecd61","observation_id":"88af383a-4927-44a5-937d-f46baf30f0d8","resolution":{"observed_at":"2026-08-06T23:58:38.073262Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:58:36.608024Z","title":"Towards Music Instrument Classification using Convolutional Neural Networks","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.15530","last_updated":"2025-06-18T15:01:25Z","snapshot_observed_at":"2026-08-14T08:58:25.065231Z","submitted_at":"2025-06-18T15:01:25Z","title":"Diff-TONE: Timestep Optimization for iNstrument Editing in Text-to-Music Diffusion Models","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-06T23:58:36.608024Z"},"links":{"citing_paper":"/paper/2506.15530"},"observation_digest":"sha256:db5b8c72ac06284f031bd1fc6e1f1607475152e8c124e05d5074e27c255b64f2","observation_id":"542c46d9-a1c0-4ef5-8cfe-435a66e0afdb","resolution":{"observed_at":"2026-08-06T23:58:36.608024Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:58:37.852823Z","title":"Audio Prompt Adapter: Un- leashing Music Editing Abilities for Text-to-Music with Lightweight Finetuning","venue":null,"work_id":"cea947fc-09b1-4885-87f5-10ec0c05a320","year":2024},"citing_paper":{"arxiv_id":"2506.15530","last_updated":"2025-06-18T15:01:25Z","snapshot_observed_at":"2026-08-14T08:58:25.065231Z","submitted_at":"2025-06-18T15:01:25Z","title":"Diff-TONE: Timestep Optimization for iNstrument Editing in Text-to-Music Diffusion Models","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-06T23:58:36.685070Z"},"links":{"citing_paper":"/paper/2506.15530"},"observation_digest":"sha256:b4c609b3e37e67ab25f24e74ea57490ad2eae0ea215b0f7ee8fd1fdbd70e0b42","observation_id":"e609a76e-3c17-4c1f-9c62-2beb659d7d4f","resolution":{"observed_at":"2026-08-06T23:58:37.944209Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:58:37.689379Z","title":"Analysis of Classifier-Free Guidance Weight Schedulers","venue":null,"work_id":"94b323b2-bb79-4ba3-a4d3-30f4db75f9f5","year":2024},"citing_paper":{"arxiv_id":"2506.15530","last_updated":"2025-06-18T15:01:25Z","snapshot_observed_at":"2026-08-14T08:58:25.065231Z","submitted_at":"2025-06-18T15:01:25Z","title":"Diff-TONE: Timestep Optimization for iNstrument Editing in Text-to-Music Diffusion Models","version":1},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-06T23:58:36.752521Z"},"links":{"citing_paper":"/paper/2506.15530"},"observation_digest":"sha256:3641b1df4382a9c5765d7813d76e3b03644d22893297ebc8f18ee5e5ac080bcc","observation_id":"e1d3f23c-90c9-40cb-bc6d-953f10e1a330","resolution":{"observed_at":"2026-08-06T23:58:37.752149Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:58:37.472390Z","title":"Transplayer: Timbre Style Transfer with Flexible Timbre Control","venue":null,"work_id":"8d632eb2-0696-4e11-9a1e-15a2b1a28cfe","year":2023},"citing_paper":{"arxiv_id":"2506.15530","last_updated":"2025-06-18T15:01:25Z","snapshot_observed_at":"2026-08-14T08:58:25.065231Z","submitted_at":"2025-06-18T15:01:25Z","title":"Diff-TONE: Timestep Optimization for iNstrument Editing in Text-to-Music Diffusion Models","version":1},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-06T23:58:36.846649Z"},"links":{"citing_paper":"/paper/2506.15530"},"observation_digest":"sha256:e039fd0c767cf4267a79a40d24d7ce617337cd0a4f74f13893651e82bd5847df","observation_id":"404c93e1-d215-42fc-bad4-8dd90f2511ea","resolution":{"observed_at":"2026-08-06T23:58:37.552612Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:58:37.286181Z","title":"Musicmagus: Zero-shot text-to- music editing via diffusion models","venue":null,"work_id":"21077b4b-a483-460a-932f-68fd5624ec2c","year":2024},"citing_paper":{"arxiv_id":"2506.15530","last_updated":"2025-06-18T15:01:25Z","snapshot_observed_at":"2026-08-14T08:58:25.065231Z","submitted_at":"2025-06-18T15:01:25Z","title":"Diff-TONE: Timestep Optimization for iNstrument Editing in Text-to-Music Diffusion Models","version":1},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-06T23:58:36.914906Z"},"links":{"citing_paper":"/paper/2506.15530"},"observation_digest":"sha256:b424893a3ce847a05f7fff81a0f1bd13fe7024731600ca4b3df489c15a7659a5","observation_id":"15c64e1a-40c9-4bce-9f68-6835232bc2ec","resolution":{"observed_at":"2026-08-06T23:58:37.372455Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2506.15530","last_updated":"2025-06-18T15:01:25Z","latest_version":1,"primary_category":"cs.SD","snapshot_observed_at":"2026-08-14T08:58:25.065231Z","submitted_at":"2025-06-18T15:01:25Z","title":"Diff-TONE: Timestep Optimization for iNstrument Editing in Text-to-Music Diffusion Models"},"reference_resolution":{"displayed":51,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":9,"verified_exact":0,"verified_fuzzy":42},"total_outbound_references":51},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"thesis":"As of 15 August 2026, this Paper Citation Record lists 51 of 51 outbound references and 0 inbound Pith citation observations for arXiv:2506.15530."}