{"as_of":"2026-08-10T05:41:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:393ed74454d8a1221af521b921f0f02b963574268b878c4f40823cb9f175219a","coverage":[{"denominator":53,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":53,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-06T17:21:31.637571Z","state":"measured"},{"denominator":55,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":55,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-09T06:31:02.800959+00:00","state":"measured"},{"denominator":2,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":2,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-06T17:21:31.422666Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-07-04T07:39:38.492700Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2507.11096","last_updated":"2025-07-15T08:44:11Z","snapshot_observed_at":"2026-08-10T02:52:02.515859Z","submitted_at":"2025-07-15T08:44:11Z","title":"EditGen: Harnessing Cross-Attention Control for Instruction-Based Auto-Regressive Audio Editing","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2507.11096","snapshot_observed_at":"2026-08-06T17:21:31.422666Z","title":"arXiv:2507.11096v1 [cs.SD] 15 Jul 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.11096","last_updated":"2025-07-15T08:44:11Z","snapshot_observed_at":"2026-08-10T02:52:02.515859Z","submitted_at":"2025-07-15T08:44:11Z","title":"EditGen: Harnessing Cross-Attention Control for Instruction-Based Auto-Regressive Audio Editing","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-06T17:21:31.422666Z"},"links":{"cited_paper":"/paper/2507.11096","citing_paper":"/paper/2507.11096"},"observation_digest":"sha256:ec7c00385796a0ed8a3ca176813f2c9d0ba9748fbfc58526dfdcb162c94b0fa2","observation_id":"1af8fecf-7da0-47ff-a5d9-9cb2350948dd","resolution":{"observed_at":"2026-08-06T17:21:31.422666Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2507.11096","last_updated":"2025-07-15T08:44:11Z","snapshot_observed_at":"2026-08-10T02:52:02.515859Z","submitted_at":"2025-07-15T08:44:11Z","title":"EditGen: Harnessing Cross-Attention Control for Instruction-Based Auto-Regressive Audio Editing","version":1},"cited_work":{"arxiv_id":"2507.11096","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2507.11096","snapshot_observed_at":"2026-07-04T07:39:38.492700Z","title":"Editgen: Harnessing cross-attention control for instruction-based auto- regressive audio editing,","venue":null,"work_id":"5d25b4ff-7821-464f-846b-5f33a0cdeaab","year":2025},"citing_paper":{"arxiv_id":"2606.21227","last_updated":"2026-06-19T08:47:05Z","snapshot_observed_at":"2026-08-05T17:22:44.002469Z","submitted_at":"2026-06-19T08:47:05Z","title":"Bagpiper-Edit: Zero-Shot Open-Ended Audio Editing via Rich-Caption","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-06-26T13:17:40.718000Z"},"links":{"cited_paper":"/paper/2507.11096","citing_paper":"/paper/2606.21227"},"observation_digest":"sha256:7601eb8c30a0b2acf0624315ce2e2f47f73ab6540c9bd8d1079dcd189d8773a7","observation_id":"0615c238-6ed3-4616-b1d8-e7d03f23a4a6","resolution":{"observed_at":"2026-07-04T07:39:38.494215Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2507.11096/citation-record","integrity":"/paper/2507.11096/integrity","json":"/paper/2507.11096/citation-record.json","paper":"/paper/2507.11096"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:21:32.368376Z","title":"EditGen: Harness- ing Cross Attention Control for Instruction-Based auto-regressive Audio Editing","venue":null,"work_id":"a2a2979f-8fc4-454c-8b93-d9bb59a40239","year":2024},"citing_paper":{"arxiv_id":"2507.11096","last_updated":"2025-07-15T08:44:11Z","snapshot_observed_at":"2026-08-10T02:52:02.515859Z","submitted_at":"2025-07-15T08:44:11Z","title":"EditGen: Harnessing Cross-Attention Control for Instruction-Based Auto-Regressive Audio Editing","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-06T17:21:31.410643Z"},"links":{"citing_paper":"/paper/2507.11096"},"observation_digest":"sha256:72a44f24aa20bcf9d605e01c89bfba4bc03e6f2e83ea03466e7c8ab2da954781","observation_id":"f1836cb7-56b4-40b5-8a95-1dd7398a3814","resolution":{"observed_at":"2026-08-06T17:21:32.371790Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:21:32.359046Z","title":null,"venue":null,"work_id":"95b84ab7-b603-48cb-990b-96056bd2f9c1","year":null},"citing_paper":{"arxiv_id":"2507.11096","last_updated":"2025-07-15T08:44:11Z","snapshot_observed_at":"2026-08-10T02:52:02.515859Z","submitted_at":"2025-07-15T08:44:11Z","title":"EditGen: Harnessing Cross-Attention Control for Instruction-Based Auto-Regressive Audio Editing","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-06T17:21:31.418748Z"},"links":{"citing_paper":"/paper/2507.11096"},"observation_digest":"sha256:10e9b2b309acb59566c5cd5d3d7b9fa8a07bfc3fcde18cf73540699fc66638b2","observation_id":"39fb741f-b162-410a-847e-7ee8294c203f","resolution":{"observed_at":"2026-08-06T17:21:32.362693Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2507.11096","last_updated":"2025-07-15T08:44:11Z","snapshot_observed_at":"2026-08-10T02:52:02.515859Z","submitted_at":"2025-07-15T08:44:11Z","title":"EditGen: Harnessing Cross-Attention Control for Instruction-Based Auto-Regressive Audio Editing","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2507.11096","snapshot_observed_at":"2026-08-06T17:21:31.422666Z","title":"arXiv:2507.11096v1 [cs.SD] 15 Jul 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.11096","last_updated":"2025-07-15T08:44:11Z","snapshot_observed_at":"2026-08-10T02:52:02.515859Z","submitted_at":"2025-07-15T08:44:11Z","title":"EditGen: Harnessing Cross-Attention Control for Instruction-Based Auto-Regressive Audio Editing","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-06T17:21:31.422666Z"},"links":{"cited_paper":"/paper/2507.11096","citing_paper":"/paper/2507.11096"},"observation_digest":"sha256:ec7c00385796a0ed8a3ca176813f2c9d0ba9748fbfc58526dfdcb162c94b0fa2","observation_id":"1af8fecf-7da0-47ff-a5d9-9cb2350948dd","resolution":{"observed_at":"2026-08-06T17:21:31.422666Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:21:32.349043Z","title":null,"venue":null,"work_id":"bb5794d8-4ab0-438a-a361-59ca9110bd02","year":null},"citing_paper":{"arxiv_id":"2507.11096","last_updated":"2025-07-15T08:44:11Z","snapshot_observed_at":"2026-08-10T02:52:02.515859Z","submitted_at":"2025-07-15T08:44:11Z","title":"EditGen: Harnessing Cross-Attention Control for Instruction-Based Auto-Regressive Audio Editing","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-06T17:21:31.427018Z"},"links":{"citing_paper":"/paper/2507.11096"},"observation_digest":"sha256:4bd8d2a5d0bd12ef58d625721fee89bb3d1b66bc8a0dff7964c0c55690add30b","observation_id":"62c952b9-1fb4-4883-81ca-5f8d0c33861e","resolution":{"observed_at":"2026-08-06T17:21:32.352291Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:21:32.339331Z","title":"Yang et al","venue":null,"work_id":"05e8b188-4d62-458e-b666-04193b3fc440","year":null},"citing_paper":{"arxiv_id":"2507.11096","last_updated":"2025-07-15T08:44:11Z","snapshot_observed_at":"2026-08-10T02:52:02.515859Z","submitted_at":"2025-07-15T08:44:11Z","title":"EditGen: Harnessing Cross-Attention Control for Instruction-Based Auto-Regressive Audio Editing","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-06T17:21:31.438096Z"},"links":{"citing_paper":"/paper/2507.11096"},"observation_digest":"sha256:c402512e65b521208be996b5e5d124ce1a4bff4f0e83efa884906235d1dff129","observation_id":"cd8834d9-09b7-4c01-aebb-3e43448982ef","resolution":{"observed_at":"2026-08-06T17:21:32.342500Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:21:32.266065Z","title":"We began with Auffusion, leveraging its existing capabilities for prompt- based editing","venue":null,"work_id":"e44b8bf7-f4bc-4857-a377-6645aaf60183","year":null},"citing_paper":{"arxiv_id":"2507.11096","last_updated":"2025-07-15T08:44:11Z","snapshot_observed_at":"2026-08-10T02:52:02.515859Z","submitted_at":"2025-07-15T08:44:11Z","title":"EditGen: Harnessing Cross-Attention Control for Instruction-Based Auto-Regressive Audio Editing","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-06T17:21:31.468785Z"},"links":{"citing_paper":"/paper/2507.11096"},"observation_digest":"sha256:69089eb75583e10d93810051cf73eab3e93178e63e58a7fa5c0aed5f477d6815","observation_id":"14ee1a2e-467a-4ef6-b21b-050c29796121","resolution":{"observed_at":"2026-08-06T17:21:32.269463Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:21:32.193678Z","title":"Masked autoencoders that listen,","venue":null,"work_id":"f8ce39d3-f847-4789-a207-f62f261d7cc9","year":2022},"citing_paper":{"arxiv_id":"2507.11096","last_updated":"2025-07-15T08:44:11Z","snapshot_observed_at":"2026-08-10T02:52:02.515859Z","submitted_at":"2025-07-15T08:44:11Z","title":"EditGen: Harnessing Cross-Attention Control for Instruction-Based Auto-Regressive Audio Editing","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-06T17:21:31.499750Z"},"links":{"citing_paper":"/paper/2507.11096"},"observation_digest":"sha256:2653a713e1552a76d1fe3076808400d3b8d53c8ea540715cb8e58459f1deb99b","observation_id":"74e85710-6cef-4bc2-8fa4-66c6473c4f52","resolution":{"observed_at":"2026-08-06T17:21:32.197286Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:21:32.305016Z","title":"The input, a reference audio random variableX, is encoded into a continuous ten- sor with a lower frame rate ( fr) compared to the sample rate (fs)","venue":null,"work_id":"0163447c-686e-42d9-8ada-9b494ee5bc8c","year":null},"citing_paper":{"arxiv_id":"2507.11096","last_updated":"2025-07-15T08:44:11Z","snapshot_observed_at":"2026-08-10T02:52:02.515859Z","submitted_at":"2025-07-15T08:44:11Z","title":"EditGen: Harnessing Cross-Attention Control for Instruction-Based Auto-Regressive Audio Editing","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-06T17:21:31.455289Z"},"links":{"citing_paper":"/paper/2507.11096"},"observation_digest":"sha256:6cfd27c4b99c69306100c83a336eb4ae9ae81827e83c2c0e5edc0318791e9c8e","observation_id":"8f6c65de-b84c-44fb-be5b-9f5ef05bc44e","resolution":{"observed_at":"2026-08-06T17:21:32.309637Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:21:32.286209Z","title":"prompt strength","venue":null,"work_id":"25f6c668-c3ed-4f5c-bba2-b8aef55ef519","year":null},"citing_paper":{"arxiv_id":"2507.11096","last_updated":"2025-07-15T08:44:11Z","snapshot_observed_at":"2026-08-10T02:52:02.515859Z","submitted_at":"2025-07-15T08:44:11Z","title":"EditGen: Harnessing Cross-Attention Control for Instruction-Based Auto-Regressive Audio Editing","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-06T17:21:31.459793Z"},"links":{"citing_paper":"/paper/2507.11096"},"observation_digest":"sha256:5001537a5ef17021789a0485e04f0eb9206a71d25ccfc0dca970528b65573305","observation_id":"d2e3bb99-8b24-4daa-9251-504a96eea1a2","resolution":{"observed_at":"2026-08-06T17:21:32.289769Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:21:32.276261Z","title":"prompt strength","venue":null,"work_id":"b36b0bed-648a-4066-897b-ad1a9976fac6","year":null},"citing_paper":{"arxiv_id":"2507.11096","last_updated":"2025-07-15T08:44:11Z","snapshot_observed_at":"2026-08-10T02:52:02.515859Z","submitted_at":"2025-07-15T08:44:11Z","title":"EditGen: Harnessing Cross-Attention Control for Instruction-Based Auto-Regressive Audio Editing","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-06T17:21:31.463949Z"},"links":{"citing_paper":"/paper/2507.11096"},"observation_digest":"sha256:fead483eb2f7988ca94014ee0d29837a8d3bf590befd04cde55229077fff11aa","observation_id":"7ffbaf05-ae58-446b-8e7f-cfb9a91a1885","resolution":{"observed_at":"2026-08-06T17:21:32.279470Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:21:32.171769Z","title":"HiFi-GAN: Generative adversarial networks for efficient and high fidelity speech synthesis,","venue":null,"work_id":"8da7c4fb-cc4a-4c3e-8b7e-cba4f36ac957","year":2020},"citing_paper":{"arxiv_id":"2507.11096","last_updated":"2025-07-15T08:44:11Z","snapshot_observed_at":"2026-08-10T02:52:02.515859Z","submitted_at":"2025-07-15T08:44:11Z","title":"EditGen: Harnessing Cross-Attention Control for Instruction-Based Auto-Regressive Audio Editing","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-06T17:21:31.520183Z"},"links":{"citing_paper":"/paper/2507.11096"},"observation_digest":"sha256:21caca4ef58560af63b14a76fb4a3f434f37cd1293e474e44243bb596797dd72","observation_id":"5ea41673-d7c3-4a12-95d4-bf4abbf531ea","resolution":{"observed_at":"2026-08-06T17:21:32.175498Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:21:32.255990Z","title":"Prompt-to- prompt image editing with cross-attention con- trol,","venue":null,"work_id":"4e4b81b1-f87d-4143-9ee5-044f5e0626fa","year":2023},"citing_paper":{"arxiv_id":"2507.11096","last_updated":"2025-07-15T08:44:11Z","snapshot_observed_at":"2026-08-10T02:52:02.515859Z","submitted_at":"2025-07-15T08:44:11Z","title":"EditGen: Harnessing Cross-Attention Control for Instruction-Based Auto-Regressive Audio Editing","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-06T17:21:31.473034Z"},"links":{"citing_paper":"/paper/2507.11096"},"observation_digest":"sha256:0ce1ed20d56083c98b657adc187101ddc1041a93f63b65c8902c306bb26770a9","observation_id":"dfbc75aa-9c63-4334-925d-661392fa34f9","resolution":{"observed_at":"2026-08-06T17:21:32.259659Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:21:32.329673Z","title":"Auto-regressive audio generation: As an alternative to diffusion-based models for audio and music generation, autoregressive models have shown promise in recent years","venue":null,"work_id":"5df8f23c-8ea3-4d80-b6d0-ab9e0b5fae5b","year":null},"citing_paper":{"arxiv_id":"2507.11096","last_updated":"2025-07-15T08:44:11Z","snapshot_observed_at":"2026-08-10T02:52:02.515859Z","submitted_at":"2025-07-15T08:44:11Z","title":"EditGen: Harnessing Cross-Attention Control for Instruction-Based Auto-Regressive Audio Editing","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-06T17:21:31.444796Z"},"links":{"citing_paper":"/paper/2507.11096"},"observation_digest":"sha256:75c49024776af2b159dfb2d579eae0bdd5c7170091f2020def78c94dd26ddefd","observation_id":"51391606-a24e-44bd-a28a-3088e7a2d9f7","resolution":{"observed_at":"2026-08-06T17:21:32.333086Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:21:32.246321Z","title":"Diffsound: Discrete diffusion model for text-to-sound generation,","venue":null,"work_id":"7b01d6f4-9a59-4bd0-ae38-8889b39933b1","year":2023},"citing_paper":{"arxiv_id":"2507.11096","last_updated":"2025-07-15T08:44:11Z","snapshot_observed_at":"2026-08-10T02:52:02.515859Z","submitted_at":"2025-07-15T08:44:11Z","title":"EditGen: Harnessing Cross-Attention Control for Instruction-Based Auto-Regressive Audio Editing","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-06T17:21:31.477277Z"},"links":{"citing_paper":"/paper/2507.11096"},"observation_digest":"sha256:cac07c57df48c4c4973ea1076ade1da0d5be3ff39185d8bd891de0178b9c9f96","observation_id":"13c1e6ef-09d2-4070-974d-b5c4e9ff79cb","resolution":{"observed_at":"2026-08-06T17:21:32.249345Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:21:32.235387Z","title":"Make- an-audio: Text-to-audio generation with prompt- enhanced diffusion models,","venue":null,"work_id":"fb45d6a4-2584-49c7-8cf7-f6c4582545d1","year":2023},"citing_paper":{"arxiv_id":"2507.11096","last_updated":"2025-07-15T08:44:11Z","snapshot_observed_at":"2026-08-10T02:52:02.515859Z","submitted_at":"2025-07-15T08:44:11Z","title":"EditGen: Harnessing Cross-Attention Control for Instruction-Based Auto-Regressive Audio Editing","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-06T17:21:31.481096Z"},"links":{"citing_paper":"/paper/2507.11096"},"observation_digest":"sha256:6a8c88e4c8536fc1ecfd8783d1e2f6a62773f6bc6ff361623dfee06863d11d27","observation_id":"d163a200-2080-4189-81c4-ec27564fde37","resolution":{"observed_at":"2026-08-06T17:21:32.239226Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:21:32.225091Z","title":"CLAP: Learning audio concepts from natural lan- guage supervision,","venue":null,"work_id":"ae891a3b-33b7-4742-a64c-0e0651bf6468","year":2023},"citing_paper":{"arxiv_id":"2507.11096","last_updated":"2025-07-15T08:44:11Z","snapshot_observed_at":"2026-08-10T02:52:02.515859Z","submitted_at":"2025-07-15T08:44:11Z","title":"EditGen: Harnessing Cross-Attention Control for Instruction-Based Auto-Regressive Audio Editing","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-06T17:21:31.484451Z"},"links":{"citing_paper":"/paper/2507.11096"},"observation_digest":"sha256:933941efd6dc985d1db8cdfb9331de8c7c4654b9ca1c09b3cfed9304386e6fe7","observation_id":"0c747d61-fac2-41a2-9f55-67d3490b89d9","resolution":{"observed_at":"2026-08-06T17:21:32.228419Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:21:32.319772Z","title":"Audi- oLM [18] utilizes tokens generated by a SoundStream [19] neural codec [20, 21] as targets for a sequence modeling task","venue":null,"work_id":"3361d6b7-67a2-4c82-b646-7aa624ad4887","year":null},"citing_paper":{"arxiv_id":"2507.11096","last_updated":"2025-07-15T08:44:11Z","snapshot_observed_at":"2026-08-10T02:52:02.515859Z","submitted_at":"2025-07-15T08:44:11Z","title":"EditGen: Harnessing Cross-Attention Control for Instruction-Based Auto-Regressive Audio Editing","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-06T17:21:31.450753Z"},"links":{"citing_paper":"/paper/2507.11096"},"observation_digest":"sha256:f0f91a6732e82007b7993e183a63c7e2a81952512f593258163ee2d511e7da20","observation_id":"05a24ad4-193e-4e78-a85c-39471fa3a39e","resolution":{"observed_at":"2026-08-06T17:21:32.323341Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:21:32.204756Z","title":"AudioLDM: Text- to-audio generation with latent diffusion models,","venue":null,"work_id":"81fd499e-709b-43de-91c3-158183b6a5dd","year":2023},"citing_paper":{"arxiv_id":"2507.11096","last_updated":"2025-07-15T08:44:11Z","snapshot_observed_at":"2026-08-10T02:52:02.515859Z","submitted_at":"2025-07-15T08:44:11Z","title":"EditGen: Harnessing Cross-Attention Control for Instruction-Based Auto-Regressive Audio Editing","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-06T17:21:31.491844Z"},"links":{"citing_paper":"/paper/2507.11096"},"observation_digest":"sha256:ddb894cfd1106d0e8ba9eca71889080fcc002c8dd61704e72821741a99386359","observation_id":"094ae7f7-c06b-4836-970a-c16f3a7d3432","resolution":{"observed_at":"2026-08-06T17:21:32.213796Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2308.05734","last_updated":"2024-05-11T11:24:51Z","snapshot_observed_at":"2026-08-10T02:51:47.132283Z","submitted_at":"2023-08-10T17:55:13Z","title":"AudioLDM 2: Learning Holistic Audio Generation with Self-supervised Pretraining","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2308.05734","snapshot_observed_at":"2026-08-06T17:21:31.495779Z","title":"AudioLDM 2: Learning Holistic Audio Generation with Self-supervised Pretraining,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.11096","last_updated":"2025-07-15T08:44:11Z","snapshot_observed_at":"2026-08-10T02:52:02.515859Z","submitted_at":"2025-07-15T08:44:11Z","title":"EditGen: Harnessing Cross-Attention Control for Instruction-Based Auto-Regressive Audio Editing","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-06T17:21:31.495779Z"},"links":{"cited_paper":"/paper/2308.05734","citing_paper":"/paper/2507.11096"},"observation_digest":"sha256:f9f080d5ef1f5d198baeb6b988a086e896dbf7331855b143da8d37f38eb89805","observation_id":"641e40c4-6c03-4697-812a-0c7803250b6b","resolution":{"observed_at":"2026-08-06T17:21:31.495779Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:21:32.182886Z","title":"AUDIT: Audio editing by following in- structions with latent diffusion models,","venue":null,"work_id":"5c54cd37-d284-4717-b725-b974d043fe53","year":2023},"citing_paper":{"arxiv_id":"2507.11096","last_updated":"2025-07-15T08:44:11Z","snapshot_observed_at":"2026-08-10T02:52:02.515859Z","submitted_at":"2025-07-15T08:44:11Z","title":"EditGen: Harnessing Cross-Attention Control for Instruction-Based Auto-Regressive Audio Editing","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-06T17:21:31.506419Z"},"links":{"citing_paper":"/paper/2507.11096"},"observation_digest":"sha256:5fe5da1352d828fee1b486c31d3b48ffa34bb6f65cf059291bf5075d396f8a92","observation_id":"6f653922-2083-43b9-a3de-f852195c57c6","resolution":{"observed_at":"2026-08-06T17:21:32.186979Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:21:31.510770Z","title":"Text-to-audio generation using instruction guided latent diffusion model,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.11096","last_updated":"2025-07-15T08:44:11Z","snapshot_observed_at":"2026-08-10T02:52:02.515859Z","submitted_at":"2025-07-15T08:44:11Z","title":"EditGen: Harnessing Cross-Attention Control for Instruction-Based Auto-Regressive Audio Editing","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-06T17:21:31.510770Z"},"links":{"citing_paper":"/paper/2507.11096"},"observation_digest":"sha256:db19f932f492f418274769a06cb02bfb877e612ac388f3075e0adbe4a2c16161","observation_id":"b58c729e-353c-4979-b850-2ae52784f25a","resolution":{"observed_at":"2026-08-06T17:21:31.510770Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2401.01044","last_updated":"2024-01-02T05:42:14Z","snapshot_observed_at":"2026-08-09T15:48:23.364963Z","submitted_at":"2024-01-02T05:42:14Z","title":"Auffusion: Leveraging the Power of Diffusion and Large Language Models for Text-to-Audio Generation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.01044","snapshot_observed_at":"2026-08-06T17:21:31.516295Z","title":"Auffusion: Lever- aging the Power of Diffusion and Large Language Models for Text-to-Audio Generation,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.11096","last_updated":"2025-07-15T08:44:11Z","snapshot_observed_at":"2026-08-10T02:52:02.515859Z","submitted_at":"2025-07-15T08:44:11Z","title":"EditGen: Harnessing Cross-Attention Control for Instruction-Based Auto-Regressive Audio Editing","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-06T17:21:31.516295Z"},"links":{"cited_paper":"/paper/2401.01044","citing_paper":"/paper/2507.11096"},"observation_digest":"sha256:395f24066a62ecdf85fb6e0122953e1d967d4c6f7f2e2be251c88dea34c74cec","observation_id":"cb1355dd-1f1a-4735-9bf3-4289fa82414b","resolution":{"observed_at":"2026-08-06T17:21:31.516295Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:21:32.162150Z","title":"MusicLDM: Enhanc- ing novelty in text-to-music generation using beat- synchronous mixup strategies,","venue":null,"work_id":"93ba2f45-0b2b-4ae6-9e31-753f93f7fcfb","year":2024},"citing_paper":{"arxiv_id":"2507.11096","last_updated":"2025-07-15T08:44:11Z","snapshot_observed_at":"2026-08-10T02:52:02.515859Z","submitted_at":"2025-07-15T08:44:11Z","title":"EditGen: Harnessing Cross-Attention Control for Instruction-Based Auto-Regressive Audio Editing","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-06T17:21:31.524168Z"},"links":{"citing_paper":"/paper/2507.11096"},"observation_digest":"sha256:5713dfc6dc42065ee6ce36580cae6704fe7e38d51028af4ae8307230ec8cedff","observation_id":"41414649-1fb4-454d-9aa2-7b702a3ff99c","resolution":{"observed_at":"2026-08-06T17:21:32.165442Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2308.14360","last_updated":"2023-12-12T06:55:08Z","snapshot_observed_at":"2026-07-06T16:11:06.578398Z","submitted_at":"2023-08-28T07:11:42Z","title":"InstructME: An Instruction Guided Music Edit And Remix Framework with Latent Diffusion Models","version":3},"cited_work":{"arxiv_id":"2308.14360","doi":null,"metadata_source":"pith","pith_arxiv_id":"2308.14360","snapshot_observed_at":"2026-08-06T17:21:31.776362Z","title":"InstructME: An Instruction Guided Music Edit And Remix Framework with Latent Diffusion Models","venue":"cs.SD","work_id":"9d41cfdb-58d2-4649-a2db-37489b886337","year":2023},"citing_paper":{"arxiv_id":"2507.11096","last_updated":"2025-07-15T08:44:11Z","snapshot_observed_at":"2026-08-10T02:52:02.515859Z","submitted_at":"2025-07-15T08:44:11Z","title":"EditGen: Harnessing Cross-Attention Control for Instruction-Based Auto-Regressive Audio Editing","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-06T17:21:31.527735Z"},"links":{"cited_paper":"/paper/2308.14360","citing_paper":"/paper/2507.11096"},"observation_digest":"sha256:47fe4ab3dddcb9a7603d1a6669bb542d63f7544ac0babc5a8148d7bdd9725377","observation_id":"96f0f70d-1ed0-4b70-9f00-2f55e8cd2515","resolution":{"observed_at":"2026-08-06T17:21:31.780086Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1609.03499","last_updated":"2016-09-19T18:04:35Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2016-09-12T17:29:40Z","title":"WaveNet: A Generative Model for Raw Audio","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1609.03499","snapshot_observed_at":"2026-08-06T17:21:31.531204Z","title":"WaveNet: A Generative Model for Raw Audio,","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2507.11096","last_updated":"2025-07-15T08:44:11Z","snapshot_observed_at":"2026-08-10T02:52:02.515859Z","submitted_at":"2025-07-15T08:44:11Z","title":"EditGen: Harnessing Cross-Attention Control for Instruction-Based Auto-Regressive Audio Editing","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-06T17:21:31.531204Z"},"links":{"cited_paper":"/paper/1609.03499","citing_paper":"/paper/2507.11096"},"observation_digest":"sha256:a85a439b9e3b2cfe9fabe9e2e9d09040aded32f221298fc07cc15e5dbba81a01","observation_id":"27980d42-36ee-4c10-96a4-2befd82c6f23","resolution":{"observed_at":"2026-08-06T17:21:31.531204Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:21:32.147394Z","title":"Audiogen: Textually guided audio genera- tion,","venue":null,"work_id":"7e78ba59-665d-40f9-8926-3bba8521d99c","year":2023},"citing_paper":{"arxiv_id":"2507.11096","last_updated":"2025-07-15T08:44:11Z","snapshot_observed_at":"2026-08-10T02:52:02.515859Z","submitted_at":"2025-07-15T08:44:11Z","title":"EditGen: Harnessing Cross-Attention Control for Instruction-Based Auto-Regressive Audio Editing","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-06T17:21:31.535045Z"},"links":{"citing_paper":"/paper/2507.11096"},"observation_digest":"sha256:ae455158f71112446ad45d1dc245374994bc92b728acefcfda8a693442e7f34d","observation_id":"1b32fa68-7f95-4f25-8b3f-9db7c204b828","resolution":{"observed_at":"2026-08-06T17:21:32.154915Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2005.00341","last_updated":"2020-04-30T09:02:45Z","snapshot_observed_at":"2026-08-06T03:57:57.420510Z","submitted_at":"2020-04-30T09:02:45Z","title":"Jukebox: A Generative Model for Music","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2005.00341","snapshot_observed_at":"2026-08-06T17:21:31.540076Z","title":"Jukebox: A Generative Model for Music,","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2507.11096","last_updated":"2025-07-15T08:44:11Z","snapshot_observed_at":"2026-08-10T02:52:02.515859Z","submitted_at":"2025-07-15T08:44:11Z","title":"EditGen: Harnessing Cross-Attention Control for Instruction-Based Auto-Regressive Audio Editing","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-06T17:21:31.540076Z"},"links":{"cited_paper":"/paper/2005.00341","citing_paper":"/paper/2507.11096"},"observation_digest":"sha256:401ef7a45b4e94bc4601a79a10e7faf97f13b63cac1054ef2c0958d2cb2adf95","observation_id":"e8084bfe-9e05-4bb0-86ea-71ba8fef237c","resolution":{"observed_at":"2026-08-06T17:21:31.540076Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:21:32.136598Z","title":"Neural discrete representation learning,","venue":null,"work_id":"aaa7e4a5-fdfc-47cb-b72a-e3f92fa02f15","year":2017},"citing_paper":{"arxiv_id":"2507.11096","last_updated":"2025-07-15T08:44:11Z","snapshot_observed_at":"2026-08-10T02:52:02.515859Z","submitted_at":"2025-07-15T08:44:11Z","title":"EditGen: Harnessing Cross-Attention Control for Instruction-Based Auto-Regressive Audio Editing","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-06T17:21:31.543739Z"},"links":{"citing_paper":"/paper/2507.11096"},"observation_digest":"sha256:e21c097112f4637b1c1870291600d8543babc3e1b7288b7e2653222dc69de71d","observation_id":"05075a94-0224-4dae-8a53-2acfa6dd4680","resolution":{"observed_at":"2026-08-06T17:21:32.140555Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2209.03143","last_updated":"2023-07-26T03:52:36Z","snapshot_observed_at":"2026-08-02T01:30:06.675966Z","submitted_at":"2022-09-07T13:40:08Z","title":"AudioLM: a Language Modeling Approach to Audio Generation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2209.03143","snapshot_observed_at":"2026-08-06T17:21:31.547479Z","title":"AudioLM: a Language Modeling Approach to Audio Generation,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.11096","last_updated":"2025-07-15T08:44:11Z","snapshot_observed_at":"2026-08-10T02:52:02.515859Z","submitted_at":"2025-07-15T08:44:11Z","title":"EditGen: Harnessing Cross-Attention Control for Instruction-Based Auto-Regressive Audio Editing","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-06T17:21:31.547479Z"},"links":{"cited_paper":"/paper/2209.03143","citing_paper":"/paper/2507.11096"},"observation_digest":"sha256:66fdb1968358c2faa3e09c9233568fc5776339efd588e2bda33b2575d7e2eca2","observation_id":"0f0f49c6-7193-4135-8835-6f6a1965dd3e","resolution":{"observed_at":"2026-08-06T17:21:31.547479Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:21:32.120398Z","title":"Soundstream: An end-to-end neu- ral audio codec,","venue":null,"work_id":"dc05ee9d-b7ef-4464-810d-bb961f960c5d","year":2022},"citing_paper":{"arxiv_id":"2507.11096","last_updated":"2025-07-15T08:44:11Z","snapshot_observed_at":"2026-08-10T02:52:02.515859Z","submitted_at":"2025-07-15T08:44:11Z","title":"EditGen: Harnessing Cross-Attention Control for Instruction-Based Auto-Regressive Audio Editing","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-06T17:21:31.551187Z"},"links":{"citing_paper":"/paper/2507.11096"},"observation_digest":"sha256:461add4e91f76b359eabb59e615e152259c1141a961b96126a28c9782b590397","observation_id":"757c56d3-8f1f-4fe2-a449-14bc158deee4","resolution":{"observed_at":"2026-08-06T17:21:32.123953Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:21:32.103470Z","title":"End-to-end optimized speech cod- ing with deep neural networks,","venue":null,"work_id":"3768dc7f-d71c-479d-8a6d-96d08773420c","year":2018},"citing_paper":{"arxiv_id":"2507.11096","last_updated":"2025-07-15T08:44:11Z","snapshot_observed_at":"2026-08-10T02:52:02.515859Z","submitted_at":"2025-07-15T08:44:11Z","title":"EditGen: Harnessing Cross-Attention Control for Instruction-Based Auto-Regressive Audio Editing","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-06T17:21:31.554641Z"},"links":{"citing_paper":"/paper/2507.11096"},"observation_digest":"sha256:35e01ecab8f31445904f9b2df214f7fd213749c46d4e7cd79899cb61daa8fbdf","observation_id":"430323d8-6cab-48ee-aeb1-1e38f82c512c","resolution":{"observed_at":"2026-08-06T17:21:32.107018Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:21:32.092628Z","title":"Harp- net: Hyper-autoencoded reconstruction propagation for scalable neural audio coding,","venue":null,"work_id":"3101ab50-d712-4fc5-baec-c7eaa4f6a18e","year":2021},"citing_paper":{"arxiv_id":"2507.11096","last_updated":"2025-07-15T08:44:11Z","snapshot_observed_at":"2026-08-10T02:52:02.515859Z","submitted_at":"2025-07-15T08:44:11Z","title":"EditGen: Harnessing Cross-Attention Control for Instruction-Based Auto-Regressive Audio Editing","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-06T17:21:31.558163Z"},"links":{"citing_paper":"/paper/2507.11096"},"observation_digest":"sha256:671385a3ba199f374c5249f4cc46ab80da0797ec9c35d7c1d18013ad265ee7bc","observation_id":"df02e93d-76c6-4a72-a3b7-d9874ff8e559","resolution":{"observed_at":"2026-08-06T17:21:32.096933Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2301.11325","last_updated":"2023-01-26T18:58:53Z","snapshot_observed_at":"2026-07-06T14:45:00.730733Z","submitted_at":"2023-01-26T18:58:53Z","title":"MusicLM: Generating Music From Text","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2301.11325","snapshot_observed_at":"2026-08-06T17:21:31.562352Z","title":"MusicLM: Generating Music From Text,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.11096","last_updated":"2025-07-15T08:44:11Z","snapshot_observed_at":"2026-08-10T02:52:02.515859Z","submitted_at":"2025-07-15T08:44:11Z","title":"EditGen: Harnessing Cross-Attention Control for Instruction-Based Auto-Regressive Audio Editing","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-06T17:21:31.562352Z"},"links":{"cited_paper":"/paper/2301.11325","citing_paper":"/paper/2507.11096"},"observation_digest":"sha256:84cc1e2fab4420e2f798047bb5c2f5ded9209ccaf4e40d48e024b261b04cd124","observation_id":"7dcc803c-55e9-4d6b-9ea3-99ce39c413ab","resolution":{"observed_at":"2026-08-06T17:21:31.562352Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:21:32.081826Z","title":"Simple and control- lable music generation,","venue":null,"work_id":"5301b8a2-ece8-4b99-86bf-f8f8eae3d850","year":2023},"citing_paper":{"arxiv_id":"2507.11096","last_updated":"2025-07-15T08:44:11Z","snapshot_observed_at":"2026-08-10T02:52:02.515859Z","submitted_at":"2025-07-15T08:44:11Z","title":"EditGen: Harnessing Cross-Attention Control for Instruction-Based Auto-Regressive Audio Editing","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-06T17:21:31.566201Z"},"links":{"citing_paper":"/paper/2507.11096"},"observation_digest":"sha256:55e0d877038b31a61baccf7d195580692c2e686da284a06ac884c3546b0e5b04","observation_id":"8e362c39-afec-48c0-98cf-0b86c0f3a3d8","resolution":{"observed_at":"2026-08-06T17:21:32.085641Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:21:32.066702Z","title":"High fidelity neural audio compression,","venue":null,"work_id":"ba4ea0b4-dcff-480c-98d9-10058096f414","year":2023},"citing_paper":{"arxiv_id":"2507.11096","last_updated":"2025-07-15T08:44:11Z","snapshot_observed_at":"2026-08-10T02:52:02.515859Z","submitted_at":"2025-07-15T08:44:11Z","title":"EditGen: Harnessing Cross-Attention Control for Instruction-Based Auto-Regressive Audio Editing","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-06T17:21:31.569796Z"},"links":{"citing_paper":"/paper/2507.11096"},"observation_digest":"sha256:197eedc5e9cf53596cf1f5545efc56c348c0ff267ce6e651379df5fa6c73d1f2","observation_id":"45e2670d-ef47-403c-b9a5-c0e5e8c579ad","resolution":{"observed_at":"2026-08-06T17:21:32.070692Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:21:32.051612Z","title":"Null-text inversion for editing real im- ages using guided diffusion models,","venue":null,"work_id":"89c541d0-b6cc-4ae0-94dc-d5f122254983","year":2023},"citing_paper":{"arxiv_id":"2507.11096","last_updated":"2025-07-15T08:44:11Z","snapshot_observed_at":"2026-08-10T02:52:02.515859Z","submitted_at":"2025-07-15T08:44:11Z","title":"EditGen: Harnessing Cross-Attention Control for Instruction-Based Auto-Regressive Audio Editing","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-06T17:21:31.573681Z"},"links":{"citing_paper":"/paper/2507.11096"},"observation_digest":"sha256:6262bceef62fc9406d6329f7e0ccf259b8f8830d6e60d5eb53f70c595ef5f3ea","observation_id":"efb8e301-1609-4cef-8345-274ad718c106","resolution":{"observed_at":"2026-08-06T17:21:32.054968Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:21:32.036652Z","title":"Dreambooth: Fine tuning text-to- image diffusion models for subject-driven generation,","venue":null,"work_id":"35885dec-ddc7-436a-9d6e-6e7a20d480e0","year":2023},"citing_paper":{"arxiv_id":"2507.11096","last_updated":"2025-07-15T08:44:11Z","snapshot_observed_at":"2026-08-10T02:52:02.515859Z","submitted_at":"2025-07-15T08:44:11Z","title":"EditGen: Harnessing Cross-Attention Control for Instruction-Based Auto-Regressive Audio Editing","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-06T17:21:31.578547Z"},"links":{"citing_paper":"/paper/2507.11096"},"observation_digest":"sha256:dfc98e765ffeffe85de8ad175c615e077cc81cf5548b8344cdbfec2780db1b69","observation_id":"baaa9fc4-4c3f-49cc-ba3c-acb8cd9b5641","resolution":{"observed_at":"2026-08-06T17:21:32.041200Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:21:32.005517Z","title":"Multi-concept customization of text-to-image diffusion,","venue":null,"work_id":"695c9655-066e-4d41-9e78-3d0953af573a","year":2023},"citing_paper":{"arxiv_id":"2507.11096","last_updated":"2025-07-15T08:44:11Z","snapshot_observed_at":"2026-08-10T02:52:02.515859Z","submitted_at":"2025-07-15T08:44:11Z","title":"EditGen: Harnessing Cross-Attention Control for Instruction-Based Auto-Regressive Audio Editing","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-06T17:21:31.581943Z"},"links":{"citing_paper":"/paper/2507.11096"},"observation_digest":"sha256:fb19aa73510e256a48cc02d29cf86474a27bf016f297b66b82e48b4d7a265544","observation_id":"769f635d-1cac-4d9e-8b60-21c208ca9497","resolution":{"observed_at":"2026-08-06T17:21:32.010492Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:21:31.987787Z","title":"SVDiff: Compact parameter space for dif- fusion fine-tuning,","venue":null,"work_id":"1c23a301-15da-4847-a50b-14c0d9c32de7","year":2023},"citing_paper":{"arxiv_id":"2507.11096","last_updated":"2025-07-15T08:44:11Z","snapshot_observed_at":"2026-08-10T02:52:02.515859Z","submitted_at":"2025-07-15T08:44:11Z","title":"EditGen: Harnessing Cross-Attention Control for Instruction-Based Auto-Regressive Audio Editing","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-06T17:21:31.585641Z"},"links":{"citing_paper":"/paper/2507.11096"},"observation_digest":"sha256:c4dc99ecd6302f19119cfc8e4f69e8decba2e8a3d6ad02b1a7279e795e60acbf","observation_id":"3235656a-5e43-4ab0-b6fa-d678989ffe1c","resolution":{"observed_at":"2026-08-06T17:21:31.992132Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:21:31.976168Z","title":"Countering language drift via visual grounding,","venue":null,"work_id":"c12c6d44-2fcc-494d-bf24-04a462211f87","year":2019},"citing_paper":{"arxiv_id":"2507.11096","last_updated":"2025-07-15T08:44:11Z","snapshot_observed_at":"2026-08-10T02:52:02.515859Z","submitted_at":"2025-07-15T08:44:11Z","title":"EditGen: Harnessing Cross-Attention Control for Instruction-Based Auto-Regressive Audio Editing","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-06T17:21:31.591831Z"},"links":{"citing_paper":"/paper/2507.11096"},"observation_digest":"sha256:bbdc89e9d9f04ed437d990f729a8a0f07c95cc767f23db89da4f8fab03aa6a76","observation_id":"7f52f4b6-2a27-4684-9c18-f4a4979c02b9","resolution":{"observed_at":"2026-08-06T17:21:31.979777Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:21:31.896472Z","title":"Likert scale: Explored and explained,","venue":null,"work_id":"9a0e850e-7dfa-4eb6-88d4-bcfcbe789dfd","year":2015},"citing_paper":{"arxiv_id":"2507.11096","last_updated":"2025-07-15T08:44:11Z","snapshot_observed_at":"2026-08-10T02:52:02.515859Z","submitted_at":"2025-07-15T08:44:11Z","title":"EditGen: Harnessing Cross-Attention Control for Instruction-Based Auto-Regressive Audio Editing","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-06T17:21:31.637571Z"},"links":{"citing_paper":"/paper/2507.11096"},"observation_digest":"sha256:a894e77823c934b247febd97a3bdd86ccd6803248e807a1f42635a827b5c9711","observation_id":"e7739275-b8fb-4c94-bd53-a58cdba6eccd","resolution":{"observed_at":"2026-08-06T17:21:31.899844Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:21:31.955145Z","title":"Investigating personaliza- tion methods in text to music generation,","venue":null,"work_id":"f59678c7-edfd-40fc-9c11-fe5ed7ccd5df","year":2024},"citing_paper":{"arxiv_id":"2507.11096","last_updated":"2025-07-15T08:44:11Z","snapshot_observed_at":"2026-08-10T02:52:02.515859Z","submitted_at":"2025-07-15T08:44:11Z","title":"EditGen: Harnessing Cross-Attention Control for Instruction-Based Auto-Regressive Audio Editing","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-06T17:21:31.599929Z"},"links":{"citing_paper":"/paper/2507.11096"},"observation_digest":"sha256:37438e42e581467e3162b24743ebb7c8d56b9d02905acd963bc750317617d1ae","observation_id":"6f6943c1-c394-47c9-a915-fc26e93bb154","resolution":{"observed_at":"2026-08-06T17:21:31.958897Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.10009","last_updated":"2024-05-29T11:27:24Z","snapshot_observed_at":"2026-07-06T17:30:39.245059Z","submitted_at":"2024-02-15T15:17:26Z","title":"Zero-Shot Unsupervised and Text-Based Audio Editing Using DDPM Inversion","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.10009","snapshot_observed_at":"2026-08-06T17:21:31.603502Z","title":"Zero-Shot Unsuper- vised and Text-Based Audio Editing Using DDPM Inversion,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.11096","last_updated":"2025-07-15T08:44:11Z","snapshot_observed_at":"2026-08-10T02:52:02.515859Z","submitted_at":"2025-07-15T08:44:11Z","title":"EditGen: Harnessing Cross-Attention Control for Instruction-Based Auto-Regressive Audio Editing","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-06T17:21:31.603502Z"},"links":{"cited_paper":"/paper/2402.10009","citing_paper":"/paper/2507.11096"},"observation_digest":"sha256:84a67989527ce2d6f445cbf3d56dd136f03bd15ec0f595faf05c880be74210c9","observation_id":"e13327b7-eb7e-4d5a-8ffa-013c22004306","resolution":{"observed_at":"2026-08-06T17:21:31.603502Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2304.06140","last_updated":"2024-04-09T17:09:03Z","snapshot_observed_at":"2026-07-06T15:15:03.449968Z","submitted_at":"2023-04-12T19:47:13Z","title":"An Edit Friendly DDPM Noise Space: Inversion and Manipulations","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2304.06140","snapshot_observed_at":"2026-08-06T17:21:31.607581Z","title":"An Edit Friendly DDPM Noise Space: Inversion and Manipulations,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.11096","last_updated":"2025-07-15T08:44:11Z","snapshot_observed_at":"2026-08-10T02:52:02.515859Z","submitted_at":"2025-07-15T08:44:11Z","title":"EditGen: Harnessing Cross-Attention Control for Instruction-Based Auto-Regressive Audio Editing","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-06T17:21:31.607581Z"},"links":{"cited_paper":"/paper/2304.06140","citing_paper":"/paper/2507.11096"},"observation_digest":"sha256:edaa69a9ed82812d9850a4548d463c794b3f55cca559570f167b22412c1bf9f5","observation_id":"79b0cdd2-eeb8-4192-88d7-48621f19d2f2","resolution":{"observed_at":"2026-08-06T17:21:31.607581Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:21:31.944873Z","title":"Photorealistic text-to-image diffu- sion models with deep language understanding,","venue":null,"work_id":"16867541-c842-4432-87cd-8f5c66ef4bc8","year":2022},"citing_paper":{"arxiv_id":"2507.11096","last_updated":"2025-07-15T08:44:11Z","snapshot_observed_at":"2026-08-10T02:52:02.515859Z","submitted_at":"2025-07-15T08:44:11Z","title":"EditGen: Harnessing Cross-Attention Control for Instruction-Based Auto-Regressive Audio Editing","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-06T17:21:31.611446Z"},"links":{"citing_paper":"/paper/2507.11096"},"observation_digest":"sha256:5896420df46ecf79af63d13193a72c0fe9bd9e7746512d51875bc398f7c2bfec","observation_id":"e87ace66-a28a-4ddf-a7f4-86419d50b3ce","resolution":{"observed_at":"2026-08-06T17:21:31.948459Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2311.07069","last_updated":"2023-11-13T04:24:14Z","snapshot_observed_at":"2026-08-07T04:08:54.908229Z","submitted_at":"2023-11-13T04:24:14Z","title":"Music ControlNet: Multiple Time-varying Controls for Music Generation","version":1},"cited_work":{"arxiv_id":"2311.07069","doi":null,"metadata_source":"pith","pith_arxiv_id":"2311.07069","snapshot_observed_at":"2026-08-06T17:21:31.693242Z","title":"Music ControlNet: Multiple Time-varying Controls for Music Generation","venue":"cs.SD","work_id":"3b12f633-edfc-419b-a28b-72d8887cc16f","year":2023},"citing_paper":{"arxiv_id":"2507.11096","last_updated":"2025-07-15T08:44:11Z","snapshot_observed_at":"2026-08-10T02:52:02.515859Z","submitted_at":"2025-07-15T08:44:11Z","title":"EditGen: Harnessing Cross-Attention Control for Instruction-Based Auto-Regressive Audio Editing","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-06T17:21:31.615013Z"},"links":{"cited_paper":"/paper/2311.07069","citing_paper":"/paper/2507.11096"},"observation_digest":"sha256:77b23ee897905de9123965f75b44ea5cd19f9fd3620ac19a242f7bc4081752b7","observation_id":"41af34df-31d2-47da-984d-967b6956125f","resolution":{"observed_at":"2026-08-06T17:21:31.697050Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.1080/09298210701653252","metadata_source":"openalex","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T05:30:23.456663Z","title":"Evaluation of Audio Beat Tracking and Music Tempo Extraction Algorithms,","venue":"Journal of New Music Research","work_id":"97ce7c6e-3f62-4fc0-9b1c-1c9f266a3488","year":2007},"citing_paper":{"arxiv_id":"2507.11096","last_updated":"2025-07-15T08:44:11Z","snapshot_observed_at":"2026-08-10T02:52:02.515859Z","submitted_at":"2025-07-15T08:44:11Z","title":"EditGen: Harnessing Cross-Attention Control for Instruction-Based Auto-Regressive Audio Editing","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-06T17:21:31.618387Z"},"links":{"citing_paper":"/paper/2507.11096"},"observation_digest":"sha256:ac1fc69849b9e913c4e5c4efacbe4c9b1876682bd7cadf3d63873c6357cccdee","observation_id":"d1855218-0518-461c-ba1a-da8cc5f7a7b3","resolution":{"observed_at":"2026-08-06T17:21:31.671027Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:21:31.934497Z","title":"mir_eval: A transparent implementation of common mir metrics,","venue":null,"work_id":"8afeec66-8c64-46b2-ac46-052f838cb04f","year":2014},"citing_paper":{"arxiv_id":"2507.11096","last_updated":"2025-07-15T08:44:11Z","snapshot_observed_at":"2026-08-10T02:52:02.515859Z","submitted_at":"2025-07-15T08:44:11Z","title":"EditGen: Harnessing Cross-Attention Control for Instruction-Based Auto-Regressive Audio Editing","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-06T17:21:31.621895Z"},"links":{"citing_paper":"/paper/2507.11096"},"observation_digest":"sha256:8e850b530cf2433f84ca284ce3477f6b2d4ef1e1c1615e2b80306e7e564225fb","observation_id":"1e2e7b21-c867-484f-a509-356a3ea75b37","resolution":{"observed_at":"2026-08-06T17:21:31.938083Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:21:31.625142Z","title":"An efficient state- space model for joint tempo and meter tracking","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2507.11096","last_updated":"2025-07-15T08:44:11Z","snapshot_observed_at":"2026-08-10T02:52:02.515859Z","submitted_at":"2025-07-15T08:44:11Z","title":"EditGen: Harnessing Cross-Attention Control for Instruction-Based Auto-Regressive Audio Editing","version":1},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-06T17:21:31.625142Z"},"links":{"citing_paper":"/paper/2507.11096"},"observation_digest":"sha256:90e848646ed6340ae9de17e775863d9dce874bd31c7901df29889c6964a0d97b","observation_id":"149c2df2-8efe-4795-8e0c-12f93b27d828","resolution":{"observed_at":"2026-08-06T17:21:31.625142Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:21:31.918247Z","title":"Large-scale contrastive language- audio pretraining with feature fusion and keyword-to- caption augmentation,","venue":null,"work_id":"bfa2a5c3-b4d7-4b0f-941c-f17f8ee4e16f","year":2023},"citing_paper":{"arxiv_id":"2507.11096","last_updated":"2025-07-15T08:44:11Z","snapshot_observed_at":"2026-08-10T02:52:02.515859Z","submitted_at":"2025-07-15T08:44:11Z","title":"EditGen: Harnessing Cross-Attention Control for Instruction-Based Auto-Regressive Audio Editing","version":1},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-06T17:21:31.628136Z"},"links":{"citing_paper":"/paper/2507.11096"},"observation_digest":"sha256:0ba887bc5c8c29c210c96ccea1a9e445a53735d7014179e6bbc4549a9c2eb566","observation_id":"7928f099-baf0-4901-8ba7-de10090931ff","resolution":{"observed_at":"2026-08-06T17:21:31.921391Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:21:31.907073Z","title":"HTS-AT: A hierarchical token- semantic audio transformer for sound classification and detection,","venue":null,"work_id":"c0a16174-a28b-4db6-abd0-447570236ecf","year":2022},"citing_paper":{"arxiv_id":"2507.11096","last_updated":"2025-07-15T08:44:11Z","snapshot_observed_at":"2026-08-10T02:52:02.515859Z","submitted_at":"2025-07-15T08:44:11Z","title":"EditGen: Harnessing Cross-Attention Control for Instruction-Based Auto-Regressive Audio Editing","version":1},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-06T17:21:31.631335Z"},"links":{"citing_paper":"/paper/2507.11096"},"observation_digest":"sha256:ee374cca0a60aec72212fd7cc3bb364fed6d034741c6113b97708234994ab12e","observation_id":"983330f6-1d59-42aa-94ef-5bd46daeb1dc","resolution":{"observed_at":"2026-08-06T17:21:31.911114Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1807.03748","last_updated":"2019-01-22T18:47:12Z","snapshot_observed_at":"2026-07-06T06:49:24.960992Z","submitted_at":"2018-07-10T16:52:11Z","title":"Representation Learning with Contrastive Predictive Coding","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1807.03748","snapshot_observed_at":"2026-08-06T17:21:31.634601Z","title":"Representation Learning with Contrastive Predictive Coding,","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2507.11096","last_updated":"2025-07-15T08:44:11Z","snapshot_observed_at":"2026-08-10T02:52:02.515859Z","submitted_at":"2025-07-15T08:44:11Z","title":"EditGen: Harnessing Cross-Attention Control for Instruction-Based Auto-Regressive Audio Editing","version":1},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-06T17:21:31.634601Z"},"links":{"cited_paper":"/paper/1807.03748","citing_paper":"/paper/2507.11096"},"observation_digest":"sha256:fd005eb7760ce4dc821663bb73ba7031b6e8117dad58a81a60c0c52176eca76d","observation_id":"8c76b7c9-5998-4a40-a9ba-417eed918ec9","resolution":{"observed_at":"2026-08-06T17:21:31.634601Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:21:31.966511Z","title":"Available: https://aclanthology.org/ D19-1447","venue":null,"work_id":"f9074379-bca6-418a-ae02-5267cb94f875","year":null},"citing_paper":{"arxiv_id":"2507.11096","last_updated":"2025-07-15T08:44:11Z","snapshot_observed_at":"2026-08-10T02:52:02.515859Z","submitted_at":"2025-07-15T08:44:11Z","title":"EditGen: Harnessing Cross-Attention Control for Instruction-Based Auto-Regressive Audio Editing","version":1},"reference_index":4395,"source":"pdf_text","source_observed_at":"2026-08-06T17:21:31.596119Z"},"links":{"citing_paper":"/paper/2507.11096"},"observation_digest":"sha256:dfb84cbb2ebf97aa49b45ef343d82f5db2c6db43c937359cd2e9d246b23be664","observation_id":"9f26091d-4751-422e-9db3-f3d6d8799954","resolution":{"observed_at":"2026-08-06T17:21:31.969764Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2507.11096","last_updated":"2025-07-15T08:44:11Z","latest_version":1,"primary_category":"cs.SD","snapshot_observed_at":"2026-08-10T02:52:02.515859Z","submitted_at":"2025-07-15T08:44:11Z","title":"EditGen: Harnessing Cross-Attention Control for Instruction-Based Auto-Regressive Audio Editing"},"reference_resolution":{"displayed":53,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":14,"verified_exact":3,"verified_fuzzy":36},"total_outbound_references":53},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"thesis":"As of 10 August 2026, this Paper Citation Record lists 53 of 53 outbound references and 2 inbound Pith citation observations for arXiv:2507.11096."}