{"as_of":"2026-08-11T03:45:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:0279ff8553316bc6a10bc66e51d80ebec7a3037ebfda898174c2437cf97c58f3","coverage":[{"denominator":35,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":35,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-05T05:32:33.761298Z","state":"measured"},{"denominator":37,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":37,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-10T06:31:04.303077+00:00","state":"measured"},{"denominator":2,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":2,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-01T12:18:17.950810Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-07-02T20:07:21.617859Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2509.05256","last_updated":"2025-09-05T17:14:29Z","snapshot_observed_at":"2026-08-10T07:58:31.345121Z","submitted_at":"2025-09-05T17:14:29Z","title":"Recomposer: Event-roll-guided generative audio editing","version":1},"cited_work":{"arxiv_id":"2509.05256","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2509.05256","snapshot_observed_at":"2026-07-02T20:07:21.617859Z","title":"Recomposer: Event-roll-guided generative audio editing","venue":null,"work_id":"d2046684-1e81-4f75-8447-ef12a90871a4","year":2025},"citing_paper":{"arxiv_id":"2606.07229","last_updated":"2026-06-05T12:52:41Z","snapshot_observed_at":"2026-07-06T23:46:55.970997Z","submitted_at":"2026-06-05T12:52:41Z","title":"MMAE: A Massive Multitask Audio Editing Benchmark","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-06-27T21:02:04.021977Z"},"links":{"cited_paper":"/paper/2509.05256","citing_paper":"/paper/2606.07229"},"observation_digest":"sha256:f1e18a3dc35e4b0f2f751d5cf8ef39dae01fb2f116c45f315449839736396c22","observation_id":"e49812c5-c163-4796-881b-ab1cb714c36c","resolution":{"observed_at":"2026-07-02T20:07:21.619554Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2509.05256","last_updated":"2025-09-05T17:14:29Z","snapshot_observed_at":"2026-08-10T07:58:31.345121Z","submitted_at":"2025-09-05T17:14:29Z","title":"Recomposer: Event-roll-guided generative audio editing","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2509.05256","snapshot_observed_at":"2026-08-01T12:18:17.950810Z","title":"Recomposer: Event-roll- guided generative audio editing.arXiv preprint arXiv:2509.05256, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.19605","last_updated":"2026-07-23T11:52:28Z","snapshot_observed_at":"2026-08-09T05:36:41.372691Z","submitted_at":"2026-07-21T22:12:12Z","title":"RIME: Enabling Large-Scale Agentic Music Post-Production","version":2},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-01T12:18:17.950810Z"},"links":{"cited_paper":"/paper/2509.05256","citing_paper":"/paper/2607.19605"},"observation_digest":"sha256:bb99a09abba893f41dccf340ee2a1fb35eee33efa8083140f7d814f70c6a26cd","observation_id":"fc55a138-3b0f-493b-8f2f-56f192e94180","resolution":{"observed_at":"2026-08-01T12:18:17.950810Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2509.05256/citation-record","integrity":"/paper/2509.05256/integrity","json":"/paper/2509.05256/citation-record.json","paper":"/paper/2509.05256"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T05:32:34.276213Z","title":"Listen, think, and understand,","venue":null,"work_id":"dca14b78-f3ca-447c-94db-390d55794594","year":2024},"citing_paper":{"arxiv_id":"2509.05256","last_updated":"2025-09-05T17:14:29Z","snapshot_observed_at":"2026-08-10T07:58:31.345121Z","submitted_at":"2025-09-05T17:14:29Z","title":"Recomposer: Event-roll-guided generative audio editing","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-05T05:32:33.616656Z"},"links":{"citing_paper":"/paper/2509.05256"},"observation_digest":"sha256:5f748487f1cb4343ca6abf1d52f773595b82e39e3badb7329e7767d404b93486","observation_id":"a42aa3a9-7821-4b24-a49b-4d6281f28b9c","resolution":{"observed_at":"2026-08-05T05:32:34.280732Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T05:32:34.262068Z","title":"Text-driven separation of arbitrary sounds,","venue":null,"work_id":"835f3abb-d94e-4ac9-b23a-3542adecbbbb","year":2022},"citing_paper":{"arxiv_id":"2509.05256","last_updated":"2025-09-05T17:14:29Z","snapshot_observed_at":"2026-08-10T07:58:31.345121Z","submitted_at":"2025-09-05T17:14:29Z","title":"Recomposer: Event-roll-guided generative audio editing","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-05T05:32:33.621645Z"},"links":{"citing_paper":"/paper/2509.05256"},"observation_digest":"sha256:dfb8dabd2626552bbbe154c25e99b0850b3246d2997a33e76c6b4df65990abe7","observation_id":"7495a408-be9e-4f8e-80ec-244160261353","resolution":{"observed_at":"2026-08-05T05:32:34.266795Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T05:32:34.248988Z","title":"AudioGen: Textually guided audio generation,","venue":null,"work_id":"6b7c55ea-fdfe-44e8-bf50-1b860bb1a91e","year":2023},"citing_paper":{"arxiv_id":"2509.05256","last_updated":"2025-09-05T17:14:29Z","snapshot_observed_at":"2026-08-10T07:58:31.345121Z","submitted_at":"2025-09-05T17:14:29Z","title":"Recomposer: Event-roll-guided generative audio editing","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-05T05:32:33.625970Z"},"links":{"citing_paper":"/paper/2509.05256"},"observation_digest":"sha256:50773a4da59cc257067713860ca49a97a1bd385347e1660680ce376f76054a06","observation_id":"9255ccf1-9525-456b-b805-e02abe2fbcd5","resolution":{"observed_at":"2026-08-05T05:32:34.253217Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T05:32:34.235837Z","title":"AudioLDM: Text-to-audio generation with latent diffusion models,","venue":null,"work_id":"5bd03cff-aef6-4c99-aa76-d8b6a93c85b7","year":2023},"citing_paper":{"arxiv_id":"2509.05256","last_updated":"2025-09-05T17:14:29Z","snapshot_observed_at":"2026-08-10T07:58:31.345121Z","submitted_at":"2025-09-05T17:14:29Z","title":"Recomposer: Event-roll-guided generative audio editing","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-05T05:32:33.630349Z"},"links":{"citing_paper":"/paper/2509.05256"},"observation_digest":"sha256:8ae6621b9689704d35e44a9e1482ae601f3ef03d2278eb55a3983a2ee190a437","observation_id":"bee84d90-8800-4441-bb63-4eeda2dd8623","resolution":{"observed_at":"2026-08-05T05:32:34.240263Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T05:32:34.222504Z","title":"Text-to-audio generation using instruction guided latent diffusion model,","venue":null,"work_id":"dffe2c7d-eeba-4a42-830d-7daf6d2bcab8","year":2023},"citing_paper":{"arxiv_id":"2509.05256","last_updated":"2025-09-05T17:14:29Z","snapshot_observed_at":"2026-08-10T07:58:31.345121Z","submitted_at":"2025-09-05T17:14:29Z","title":"Recomposer: Event-roll-guided generative audio editing","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-05T05:32:33.634609Z"},"links":{"citing_paper":"/paper/2509.05256"},"observation_digest":"sha256:e2fe7e3b706ec7a40e23dd16a9592fb65a4b4ed1f8fe259de7d335b00a8f3de3","observation_id":"398ad15c-2169-483a-9805-5a539235d454","resolution":{"observed_at":"2026-08-05T05:32:34.226823Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T05:32:34.208923Z","title":"AudioLDM 2: Learning holistic audio generation with self-supervised pretraining,","venue":null,"work_id":"e32bb62a-f3bb-47c4-8fe3-68b76951b51a","year":2024},"citing_paper":{"arxiv_id":"2509.05256","last_updated":"2025-09-05T17:14:29Z","snapshot_observed_at":"2026-08-10T07:58:31.345121Z","submitted_at":"2025-09-05T17:14:29Z","title":"Recomposer: Event-roll-guided generative audio editing","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-05T05:32:33.639157Z"},"links":{"citing_paper":"/paper/2509.05256"},"observation_digest":"sha256:c18be1cbbb77444e5167d719cfd84c44f86d52ed32fce89e4eb4fb7e2e2616fd","observation_id":"ec5a9522-6699-4df5-8004-60e0d25d6686","resolution":{"observed_at":"2026-08-05T05:32:34.213262Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T05:32:34.194717Z","title":"Adding conditional control to text-to-image diffusion models,","venue":null,"work_id":"344272b9-17d0-41fb-91c3-22675d714794","year":2023},"citing_paper":{"arxiv_id":"2509.05256","last_updated":"2025-09-05T17:14:29Z","snapshot_observed_at":"2026-08-10T07:58:31.345121Z","submitted_at":"2025-09-05T17:14:29Z","title":"Recomposer: Event-roll-guided generative audio editing","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-05T05:32:33.644021Z"},"links":{"citing_paper":"/paper/2509.05256"},"observation_digest":"sha256:bcda1625c97c6673150996952a8302adaf8447232031f85d836002484268d8c2","observation_id":"d17e5bbd-84d1-433a-ac45-e34c305e5a0f","resolution":{"observed_at":"2026-08-05T05:32:34.199360Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T05:32:34.180938Z","title":"Uni-ControlNet: All-in-one control to text-to-image diffusion models,","venue":null,"work_id":"1b9630ec-b977-45f5-88e9-1b5ef6de36ee","year":2023},"citing_paper":{"arxiv_id":"2509.05256","last_updated":"2025-09-05T17:14:29Z","snapshot_observed_at":"2026-08-10T07:58:31.345121Z","submitted_at":"2025-09-05T17:14:29Z","title":"Recomposer: Event-roll-guided generative audio editing","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-05T05:32:33.648286Z"},"links":{"citing_paper":"/paper/2509.05256"},"observation_digest":"sha256:0fb345031a59692d1008bd1f93cf645b50699c247cc6cac02d34df142c9994e1","observation_id":"6daed0e6-09b3-46e8-a3a0-1d9e01af5c72","resolution":{"observed_at":"2026-08-05T05:32:34.185460Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T05:32:34.166277Z","title":"Emu Edit: Precise image editing via recognition and generation tasks,","venue":null,"work_id":"7023b168-9784-4546-b2c1-bf9ae9663f88","year":2024},"citing_paper":{"arxiv_id":"2509.05256","last_updated":"2025-09-05T17:14:29Z","snapshot_observed_at":"2026-08-10T07:58:31.345121Z","submitted_at":"2025-09-05T17:14:29Z","title":"Recomposer: Event-roll-guided generative audio editing","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-05T05:32:33.652545Z"},"links":{"citing_paper":"/paper/2509.05256"},"observation_digest":"sha256:f319274c269eb1b991bc28c2e92648fc42d2ad0cf668229abb7f543dd31afe20","observation_id":"862b467a-9599-4b14-9139-f5f7873916cc","resolution":{"observed_at":"2026-08-05T05:32:34.171318Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T05:32:34.151150Z","title":"AUDIT: Audio editing by following instructions with latent diffusion models,","venue":null,"work_id":"d963e662-6e1e-418e-a118-2a308242a42b","year":2023},"citing_paper":{"arxiv_id":"2509.05256","last_updated":"2025-09-05T17:14:29Z","snapshot_observed_at":"2026-08-10T07:58:31.345121Z","submitted_at":"2025-09-05T17:14:29Z","title":"Recomposer: Event-roll-guided generative audio editing","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-05T05:32:33.656487Z"},"links":{"citing_paper":"/paper/2509.05256"},"observation_digest":"sha256:bc235799796b8b0806b543481a94bc4d65a5cc4a835897863e80e82fbb18a12d","observation_id":"6220212e-3aa5-4dcc-9e51-24385a1c249b","resolution":{"observed_at":"2026-08-05T05:32:34.155698Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T05:32:34.136976Z","title":"Music ControlNet: Multiple time-varying controls for music generation,","venue":null,"work_id":"c7f3f5f9-df87-4771-a863-bf1e575e252e","year":2024},"citing_paper":{"arxiv_id":"2509.05256","last_updated":"2025-09-05T17:14:29Z","snapshot_observed_at":"2026-08-10T07:58:31.345121Z","submitted_at":"2025-09-05T17:14:29Z","title":"Recomposer: Event-roll-guided generative audio editing","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-05T05:32:33.660544Z"},"links":{"citing_paper":"/paper/2509.05256"},"observation_digest":"sha256:3d708af9e52f486d160afb1b265fbb06f0f01fdfdbf9b3b52cf8c4b8f762d7ac","observation_id":"d98e338c-2485-4933-8ce8-45fc17728dad","resolution":{"observed_at":"2026-08-05T05:32:34.141426Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2405.18386","last_updated":"2025-07-17T21:29:13Z","snapshot_observed_at":"2026-07-06T18:21:26.195207Z","submitted_at":"2024-05-28T17:27:20Z","title":"Instruct-MusicGen: Unlocking Text-to-Music Editing for Music Language Models via Instruction Tuning","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.18386","snapshot_observed_at":"2026-08-05T05:32:33.664662Z","title":"Instruct- MusicGen: Unlocking text-to-music editing for music language models via instruction tuning,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.05256","last_updated":"2025-09-05T17:14:29Z","snapshot_observed_at":"2026-08-10T07:58:31.345121Z","submitted_at":"2025-09-05T17:14:29Z","title":"Recomposer: Event-roll-guided generative audio editing","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-05T05:32:33.664662Z"},"links":{"cited_paper":"/paper/2405.18386","citing_paper":"/paper/2509.05256"},"observation_digest":"sha256:e7cb77b5f6090700049d459fde4827f78ea7a91732980f1d942862557235fb7b","observation_id":"663fdd3e-1b49-4d44-8146-a8fdd5e7a604","resolution":{"observed_at":"2026-08-05T05:32:33.664662Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.08550","last_updated":"2025-04-14T14:16:41Z","snapshot_observed_at":"2026-07-06T20:05:23.685854Z","submitted_at":"2024-12-11T17:11:21Z","title":"Sketch2Sound: Controllable Audio Generation via Time-Varying Signals and Sonic Imitations","version":2},"cited_work":{"arxiv_id":"2412.08550","doi":null,"metadata_source":"pith","pith_arxiv_id":"2412.08550","snapshot_observed_at":"2026-08-05T05:32:33.834298Z","title":"Sketch2Sound: Controllable Audio Generation via Time-Varying Signals and Sonic Imitations","venue":"cs.SD","work_id":"b10c4a13-71c4-4fc1-9c96-5e089da714b0","year":2024},"citing_paper":{"arxiv_id":"2509.05256","last_updated":"2025-09-05T17:14:29Z","snapshot_observed_at":"2026-08-10T07:58:31.345121Z","submitted_at":"2025-09-05T17:14:29Z","title":"Recomposer: Event-roll-guided generative audio editing","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-05T05:32:33.669434Z"},"links":{"cited_paper":"/paper/2412.08550","citing_paper":"/paper/2509.05256"},"observation_digest":"sha256:f4ac80e214f5bf7ffab967ec041521912734a8f1ebe799e470b0f8515fc614ba","observation_id":"61f9ceaf-ae69-4965-a99f-93d782e08ae8","resolution":{"observed_at":"2026-08-05T05:32:33.839237Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T05:32:34.122947Z","title":"Audio- Composer: Towards fine-grained audio generation with natural language descriptions,","venue":null,"work_id":"d7e0f9cc-b337-46de-bd93-734c44f08b8d","year":2025},"citing_paper":{"arxiv_id":"2509.05256","last_updated":"2025-09-05T17:14:29Z","snapshot_observed_at":"2026-08-10T07:58:31.345121Z","submitted_at":"2025-09-05T17:14:29Z","title":"Recomposer: Event-roll-guided generative audio editing","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-05T05:32:33.674616Z"},"links":{"citing_paper":"/paper/2509.05256"},"observation_digest":"sha256:62ccc4de8abf3a1216237e63fbb790c70dd31a3ff408125479d1dd3fd774d538","observation_id":"639a913f-959b-48e4-9f29-7c470e1b45fb","resolution":{"observed_at":"2026-08-05T05:32:34.127624Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.02869","last_updated":"2024-07-17T09:50:57Z","snapshot_observed_at":"2026-08-05T21:18:47.882543Z","submitted_at":"2024-07-03T07:33:14Z","title":"PicoAudio: Enabling Precise Timestamp and Frequency Controllability of Audio Events in Text-to-audio Generation","version":2},"cited_work":{"arxiv_id":"2407.02869","doi":null,"metadata_source":"pith","pith_arxiv_id":"2407.02869","snapshot_observed_at":"2026-08-05T05:32:33.811406Z","title":"PicoAudio: Enabling Precise Timestamp and Frequency Controllability of Audio Events in Text-to-audio Generation","venue":"cs.SD","work_id":"b6cf07a4-172d-4450-ad89-d00d64367e32","year":2024},"citing_paper":{"arxiv_id":"2509.05256","last_updated":"2025-09-05T17:14:29Z","snapshot_observed_at":"2026-08-10T07:58:31.345121Z","submitted_at":"2025-09-05T17:14:29Z","title":"Recomposer: Event-roll-guided generative audio editing","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-05T05:32:33.678675Z"},"links":{"cited_paper":"/paper/2407.02869","citing_paper":"/paper/2509.05256"},"observation_digest":"sha256:34ca0510dfb24afa35e050d7f19cae027de54385df5b2e804f8260ba30f639a3","observation_id":"8aaf6312-616e-433b-9ffb-578811d8e898","resolution":{"observed_at":"2026-08-05T05:32:33.818520Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T05:32:34.109112Z","title":"AudioLM: a language modeling approach to audio generation,","venue":null,"work_id":"1f38cd83-e8f3-4053-8da0-e387b2a715b3","year":2023},"citing_paper":{"arxiv_id":"2509.05256","last_updated":"2025-09-05T17:14:29Z","snapshot_observed_at":"2026-08-10T07:58:31.345121Z","submitted_at":"2025-09-05T17:14:29Z","title":"Recomposer: Event-roll-guided generative audio editing","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-05T05:32:33.683329Z"},"links":{"citing_paper":"/paper/2509.05256"},"observation_digest":"sha256:25284b119e750d0042ec50734242bc6c0fb6ff36a2add32ce20df68ed95619b3","observation_id":"e2dda31f-d73b-4480-ae0c-7e94fbec2f39","resolution":{"observed_at":"2026-08-05T05:32:34.113720Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T05:32:34.095067Z","title":"SoundStream: An end-to-end neural audio codec,","venue":null,"work_id":"05c36a4b-30b4-448b-bb40-0c35df9822f4","year":2021},"citing_paper":{"arxiv_id":"2509.05256","last_updated":"2025-09-05T17:14:29Z","snapshot_observed_at":"2026-08-10T07:58:31.345121Z","submitted_at":"2025-09-05T17:14:29Z","title":"Recomposer: Event-roll-guided generative audio editing","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-05T05:32:33.687573Z"},"links":{"citing_paper":"/paper/2509.05256"},"observation_digest":"sha256:28d4c5a91b5967a948c8e105ea411385b12513df6cfa0be691eac9ff7cdd3aba","observation_id":"a3520dae-36d6-4ef5-a387-574be102d4b5","resolution":{"observed_at":"2026-08-05T05:32:34.099548Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T05:32:33.691930Z","title":"Neural machine translation by jointly learning to align and translate,","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2509.05256","last_updated":"2025-09-05T17:14:29Z","snapshot_observed_at":"2026-08-10T07:58:31.345121Z","submitted_at":"2025-09-05T17:14:29Z","title":"Recomposer: Event-roll-guided generative audio editing","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-05T05:32:33.691930Z"},"links":{"citing_paper":"/paper/2509.05256"},"observation_digest":"sha256:5eb443bbb46915067b9778fb8ce9b2da4733529a2bbcdfe2286aece700ebced9","observation_id":"a261696b-5ff1-4a2b-b920-7ef2cbf2ec38","resolution":{"observed_at":"2026-08-05T05:32:33.691930Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T05:32:33.695957Z","title":"Attention is all you need,","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2509.05256","last_updated":"2025-09-05T17:14:29Z","snapshot_observed_at":"2026-08-10T07:58:31.345121Z","submitted_at":"2025-09-05T17:14:29Z","title":"Recomposer: Event-roll-guided generative audio editing","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-05T05:32:33.695957Z"},"links":{"citing_paper":"/paper/2509.05256"},"observation_digest":"sha256:003ea6b95acff633db184e87c44463ac54b230783aa55a436e75437be8bafed5","observation_id":"9488dbe5-9f4d-4fa8-83f3-4f281a055b1f","resolution":{"observed_at":"2026-08-05T05:32:33.695957Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T05:32:34.063016Z","title":"Sentence-T5: Scalable sentence encoders from pre-trained text-to-text models,","venue":null,"work_id":"c1ced8a5-7624-4d14-add3-1d2d9d9b4b37","year":2022},"citing_paper":{"arxiv_id":"2509.05256","last_updated":"2025-09-05T17:14:29Z","snapshot_observed_at":"2026-08-10T07:58:31.345121Z","submitted_at":"2025-09-05T17:14:29Z","title":"Recomposer: Event-roll-guided generative audio editing","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-05T05:32:33.700126Z"},"links":{"citing_paper":"/paper/2509.05256"},"observation_digest":"sha256:439e0a038e4745400efbbf601f501b745db4412db6864fcc754adc414542f633","observation_id":"38477326-f681-4adb-95d1-ebcfb9f2948e","resolution":{"observed_at":"2026-08-05T05:32:34.067426Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T05:32:34.049385Z","title":"Autoregressive image generation using residual quantization,","venue":null,"work_id":"6a360186-1812-41cb-93af-67ff2e0d7b3c","year":2022},"citing_paper":{"arxiv_id":"2509.05256","last_updated":"2025-09-05T17:14:29Z","snapshot_observed_at":"2026-08-10T07:58:31.345121Z","submitted_at":"2025-09-05T17:14:29Z","title":"Recomposer: Event-roll-guided generative audio editing","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-05T05:32:33.704230Z"},"links":{"citing_paper":"/paper/2509.05256"},"observation_digest":"sha256:43c2ad3d79a21e09f2468f3f6a0032d07d52faa505f9d7583aa5fcae815c58b2","observation_id":"f8271f57-1855-41a7-b370-51dc2b92bc19","resolution":{"observed_at":"2026-08-05T05:32:34.053783Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.00037","last_updated":"2024-10-02T09:11:45Z","snapshot_observed_at":"2026-07-30T10:21:14.474746Z","submitted_at":"2024-09-17T17:55:39Z","title":"Moshi: a speech-text foundation model for real-time dialogue","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.00037","snapshot_observed_at":"2026-08-05T05:32:33.708489Z","title":"Moshi: a speech-text foundation model for real-time dialogue,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.05256","last_updated":"2025-09-05T17:14:29Z","snapshot_observed_at":"2026-08-10T07:58:31.345121Z","submitted_at":"2025-09-05T17:14:29Z","title":"Recomposer: Event-roll-guided generative audio editing","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-05T05:32:33.708489Z"},"links":{"cited_paper":"/paper/2410.00037","citing_paper":"/paper/2509.05256"},"observation_digest":"sha256:4b3ae0386cb539a31279d4e71a38a69e58bdac4e9b42efefedd5239acf7ff758","observation_id":"9e62e05c-d10f-4c46-a55a-c1ee77179051","resolution":{"observed_at":"2026-08-05T05:32:33.708489Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T05:32:34.036115Z","title":"Freesound technical demo,","venue":null,"work_id":"ee3e4833-55fc-4578-a881-9e3aec2b3b58","year":2013},"citing_paper":{"arxiv_id":"2509.05256","last_updated":"2025-09-05T17:14:29Z","snapshot_observed_at":"2026-08-10T07:58:31.345121Z","submitted_at":"2025-09-05T17:14:29Z","title":"Recomposer: Event-roll-guided generative audio editing","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-05T05:32:33.712985Z"},"links":{"citing_paper":"/paper/2509.05256"},"observation_digest":"sha256:8eb709569610ecaa5b93e4ea9b5d5536b5720ab48c81819fb22cd0d56f01272c","observation_id":"27671ccd-b904-4269-b7e4-4567e5c9d0a0","resolution":{"observed_at":"2026-08-05T05:32:34.040442Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T05:32:34.022010Z","title":"Unsupervised sound separation using mixture invariant training,","venue":null,"work_id":"c881d53c-8a5c-4249-b6b8-9f228be144ad","year":2020},"citing_paper":{"arxiv_id":"2509.05256","last_updated":"2025-09-05T17:14:29Z","snapshot_observed_at":"2026-08-10T07:58:31.345121Z","submitted_at":"2025-09-05T17:14:29Z","title":"Recomposer: Event-roll-guided generative audio editing","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-05T05:32:33.716937Z"},"links":{"citing_paper":"/paper/2509.05256"},"observation_digest":"sha256:03710f41621bcfb4a3b71faed1e1509cfc75664d7eddb401ade2ea971de3d65f","observation_id":"afe5d0cb-10e1-4103-a8cf-780bfc7eb7fe","resolution":{"observed_at":"2026-08-05T05:32:34.026602Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T05:32:34.008006Z","title":"Evaluation of algorithms using games: the case of music annotation,","venue":null,"work_id":"5e6f45cb-32ae-4dbb-9785-21738cf3603b","year":2010},"citing_paper":{"arxiv_id":"2509.05256","last_updated":"2025-09-05T17:14:29Z","snapshot_observed_at":"2026-08-10T07:58:31.345121Z","submitted_at":"2025-09-05T17:14:29Z","title":"Recomposer: Event-roll-guided generative audio editing","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-05T05:32:33.720905Z"},"links":{"citing_paper":"/paper/2509.05256"},"observation_digest":"sha256:92822fe3469fb22bd7b56b4a2cacc65cc2e55bba636cec4a281d199ca307d8b1","observation_id":"6ca11ffc-cb85-47c7-93bf-eb127c6656a4","resolution":{"observed_at":"2026-08-05T05:32:34.012561Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T05:32:33.993739Z","title":"BERT: Pre-training of deep bidirectional transformers for language understanding,","venue":null,"work_id":"3ba78243-3772-4450-9888-03c4a53d1204","year":2019},"citing_paper":{"arxiv_id":"2509.05256","last_updated":"2025-09-05T17:14:29Z","snapshot_observed_at":"2026-08-10T07:58:31.345121Z","submitted_at":"2025-09-05T17:14:29Z","title":"Recomposer: Event-roll-guided generative audio editing","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-05T05:32:33.724937Z"},"links":{"citing_paper":"/paper/2509.05256"},"observation_digest":"sha256:a6a37c0102437bb41b355f4fe1e5bf6bad15e62f84187d7c1f707da1a89724f9","observation_id":"5a0930af-89f9-4956-a492-de499d824c68","resolution":{"observed_at":"2026-08-05T05:32:33.998452Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T05:32:33.979306Z","title":"The benefit of temporally-strong labels in audio event classification,","venue":null,"work_id":"b9e428bf-70dc-487f-ae4b-75a06aad3dac","year":2021},"citing_paper":{"arxiv_id":"2509.05256","last_updated":"2025-09-05T17:14:29Z","snapshot_observed_at":"2026-08-10T07:58:31.345121Z","submitted_at":"2025-09-05T17:14:29Z","title":"Recomposer: Event-roll-guided generative audio editing","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-05T05:32:33.728939Z"},"links":{"citing_paper":"/paper/2509.05256"},"observation_digest":"sha256:3eae17c1d0e8cc330a79dbde6e3123d5640b06d801ce46ccff97c1bc8b72d66a","observation_id":"5975b4e4-7fe5-4bbc-8441-0c3551eb273f","resolution":{"observed_at":"2026-08-05T05:32:33.984097Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T05:32:33.965157Z","title":"Sound classification with Y AMNet,","venue":null,"work_id":"8e18c5d2-abd5-4d0b-9d0f-64f080c1ec7b","year":2020},"citing_paper":{"arxiv_id":"2509.05256","last_updated":"2025-09-05T17:14:29Z","snapshot_observed_at":"2026-08-10T07:58:31.345121Z","submitted_at":"2025-09-05T17:14:29Z","title":"Recomposer: Event-roll-guided generative audio editing","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-05T05:32:33.732879Z"},"links":{"citing_paper":"/paper/2509.05256"},"observation_digest":"sha256:ef8ad9d215ac3afbe8e191463f8407a4bcfcdeee072cc4e1e0899048b0805ca3","observation_id":"13031998-eb7d-42ce-b2a4-b408499e0aea","resolution":{"observed_at":"2026-08-05T05:32:33.969734Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T05:32:33.951222Z","title":"FSD50K: an open dataset of human-labeled sound events,","venue":null,"work_id":"8559197f-4fa2-4709-aef0-1b4b43df8100","year":2022},"citing_paper":{"arxiv_id":"2509.05256","last_updated":"2025-09-05T17:14:29Z","snapshot_observed_at":"2026-08-10T07:58:31.345121Z","submitted_at":"2025-09-05T17:14:29Z","title":"Recomposer: Event-roll-guided generative audio editing","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-05T05:32:33.736855Z"},"links":{"citing_paper":"/paper/2509.05256"},"observation_digest":"sha256:af3190d9ee7fa38cfd1c62631eddf825c93b58c2a5bdef2f973e5bb6b876ecaf","observation_id":"a7429c27-a626-4d34-ab3a-e790d6e24de1","resolution":{"observed_at":"2026-08-05T05:32:33.955733Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T05:32:33.936288Z","title":"Neural source-filter waveform models for statistical parametric speech synthesis,","venue":null,"work_id":"1ab905ad-3e8a-4aa0-8a9d-fdede8b08f64","year":2019},"citing_paper":{"arxiv_id":"2509.05256","last_updated":"2025-09-05T17:14:29Z","snapshot_observed_at":"2026-08-10T07:58:31.345121Z","submitted_at":"2025-09-05T17:14:29Z","title":"Recomposer: Event-roll-guided generative audio editing","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-05T05:32:33.741081Z"},"links":{"citing_paper":"/paper/2509.05256"},"observation_digest":"sha256:551d44f24d41ed65de5cea1b20ccef4ce07a63e244785888ff3b9c2b30fe9785","observation_id":"1ce18887-7738-4fb6-b549-710f87d82507","resolution":{"observed_at":"2026-08-05T05:32:33.941214Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T05:32:33.921224Z","title":"DDSP: Differentiable digital signal processing,","venue":null,"work_id":"5b74a9fa-552f-4d28-ba0d-1728d421533f","year":2020},"citing_paper":{"arxiv_id":"2509.05256","last_updated":"2025-09-05T17:14:29Z","snapshot_observed_at":"2026-08-10T07:58:31.345121Z","submitted_at":"2025-09-05T17:14:29Z","title":"Recomposer: Event-roll-guided generative audio editing","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-05T05:32:33.745141Z"},"links":{"citing_paper":"/paper/2509.05256"},"observation_digest":"sha256:b68344fe5fd292f4d47be6465f703a47176a36e93e05b52e0dc89e0c680282f3","observation_id":"5f96546f-e018-453a-930c-d1edffbce357","resolution":{"observed_at":"2026-08-05T05:32:33.925841Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T05:32:33.907166Z","title":"Diffsound: Discrete diffusion model for text-to-sound generation,","venue":null,"work_id":"4d1ccf0b-6ad3-4746-b67b-e1fa885e315d","year":2023},"citing_paper":{"arxiv_id":"2509.05256","last_updated":"2025-09-05T17:14:29Z","snapshot_observed_at":"2026-08-10T07:58:31.345121Z","submitted_at":"2025-09-05T17:14:29Z","title":"Recomposer: Event-roll-guided generative audio editing","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-05T05:32:33.749190Z"},"links":{"citing_paper":"/paper/2509.05256"},"observation_digest":"sha256:63f15aca40dd34714973b9f288f9ae2fcf4092ba4869d8f681504123d326e0a5","observation_id":"c5e36e78-62c6-4984-983c-777e99696164","resolution":{"observed_at":"2026-08-05T05:32:33.911670Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T05:32:33.892460Z","title":"Fr ´echet audio distance: A metric for evaluating music enhancement algorithms,","venue":null,"work_id":"6a0b7f22-156b-48be-8461-a3c24ed321fc","year":2019},"citing_paper":{"arxiv_id":"2509.05256","last_updated":"2025-09-05T17:14:29Z","snapshot_observed_at":"2026-08-10T07:58:31.345121Z","submitted_at":"2025-09-05T17:14:29Z","title":"Recomposer: Event-roll-guided generative audio editing","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-05T05:32:33.753098Z"},"links":{"citing_paper":"/paper/2509.05256"},"observation_digest":"sha256:0ff272066d66994455ff8d4d317968b58c3ff92bf561d67fc83340ea45eacfad","observation_id":"9901077a-0838-4ed8-91b9-99b259d46523","resolution":{"observed_at":"2026-08-05T05:32:33.896931Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T05:32:33.878500Z","title":"Adapting Fr ´echet audio distance for generative music evaluation,","venue":null,"work_id":"35307327-4393-4bc3-af29-30b13949fbd0","year":2024},"citing_paper":{"arxiv_id":"2509.05256","last_updated":"2025-09-05T17:14:29Z","snapshot_observed_at":"2026-08-10T07:58:31.345121Z","submitted_at":"2025-09-05T17:14:29Z","title":"Recomposer: Event-roll-guided generative audio editing","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-05T05:32:33.757206Z"},"links":{"citing_paper":"/paper/2509.05256"},"observation_digest":"sha256:a0a5aeafe9f369886e52fa54da5ba6a0eb8e5162ca7f4bef505728212aacaa24","observation_id":"3be47c5d-004a-4bc6-9fcb-7b1518a8248e","resolution":{"observed_at":"2026-08-05T05:32:33.883079Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T05:32:33.863404Z","title":"Correlation of Fr ´echet audio distance with human perception of environmental audio is embedding dependent,","venue":null,"work_id":"4a6c898d-98a4-48c5-b21f-cab9e32948a0","year":2024},"citing_paper":{"arxiv_id":"2509.05256","last_updated":"2025-09-05T17:14:29Z","snapshot_observed_at":"2026-08-10T07:58:31.345121Z","submitted_at":"2025-09-05T17:14:29Z","title":"Recomposer: Event-roll-guided generative audio editing","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-05T05:32:33.761298Z"},"links":{"citing_paper":"/paper/2509.05256"},"observation_digest":"sha256:5c113b0936835f4e7470d8ea5959d911200d0bd824a449e2eb63e436329f4e80","observation_id":"b229e865-e96e-4a8d-9ae5-5aee982029ba","resolution":{"observed_at":"2026-08-05T05:32:33.868695Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2509.05256","last_updated":"2025-09-05T17:14:29Z","latest_version":1,"primary_category":"cs.SD","snapshot_observed_at":"2026-08-10T07:58:31.345121Z","submitted_at":"2025-09-05T17:14:29Z","title":"Recomposer: Event-roll-guided generative audio editing"},"reference_resolution":{"displayed":35,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":4,"verified_exact":2,"verified_fuzzy":29},"total_outbound_references":35},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"thesis":"As of 11 August 2026, this Paper Citation Record lists 35 of 35 outbound references and 2 inbound Pith citation observations for arXiv:2509.05256."}