{"as_of":"2026-08-17T18:13:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:4bd970430ff6d13a32119ce2b72602f59b4b6d0fa2f98187a0142395ec2cb329","coverage":[{"denominator":57,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":57,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-05T15:10:31.849774Z","state":"measured"},{"denominator":57,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":57,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-17T06:30:58.91139+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2508.20379/citation-record","integrity":"/paper/2508.20379/integrity","json":"/paper/2508.20379/citation-record.json","paper":"/paper/2508.20379"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2303.08774","last_updated":"2024-03-04T06:01:33Z","snapshot_observed_at":"2026-08-17T09:58:46.058102Z","submitted_at":"2023-03-15T17:15:04Z","title":"GPT-4 Technical Report","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.08774","snapshot_observed_at":"2026-08-05T15:10:31.658133Z","title":"Gpt-4 technical report","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2508.20379","last_updated":"2025-08-28T03:00:30Z","snapshot_observed_at":"2026-08-15T18:46:01.736843Z","submitted_at":"2025-08-28T03:00:30Z","title":"Audio-Guided Visual Editing with Complex Multi-Modal Prompts","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-05T15:10:31.658133Z"},"links":{"cited_paper":"/paper/2303.08774","citing_paper":"/paper/2508.20379"},"observation_digest":"sha256:bf8cf9811fc0d25c5a7009370bfc792a6bbc8771eafbfdb6bdd1e2bfe0232fd3","observation_id":"3920ab5b-1b92-456c-babc-9857e328da00","resolution":{"observed_at":"2026-08-05T15:10:31.658133Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T15:10:32.465899Z","title":"Text2live: Text-driven layered image and video editing","venue":null,"work_id":"6c4cbd56-387d-424d-97a8-0d5ffbfb49c6","year":2022},"citing_paper":{"arxiv_id":"2508.20379","last_updated":"2025-08-28T03:00:30Z","snapshot_observed_at":"2026-08-15T18:46:01.736843Z","submitted_at":"2025-08-28T03:00:30Z","title":"Audio-Guided Visual Editing with Complex Multi-Modal Prompts","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-05T15:10:31.662463Z"},"links":{"citing_paper":"/paper/2508.20379"},"observation_digest":"sha256:40c6d45476dd573c0202545562a911e925dfdb682c25fede8720684203dc38ca","observation_id":"adc71368-bcf9-480b-aff4-9589c8e14b6e","resolution":{"observed_at":"2026-08-05T15:10:32.469198Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2405.00878","last_updated":"2024-05-01T21:43:57Z","snapshot_observed_at":"2026-08-17T03:31:45.335086Z","submitted_at":"2024-05-01T21:43:57Z","title":"SonicDiffusion: Audio-Driven Image Generation and Editing with Pretrained Diffusion Models","version":1},"cited_work":{"arxiv_id":"2405.00878","doi":null,"metadata_source":"pith","pith_arxiv_id":"2405.00878","snapshot_observed_at":"2026-08-05T15:10:32.198155Z","title":"SonicDiffusion: Audio-Driven Image Generation and Editing with Pretrained Diffusion Models","venue":"cs.CV","work_id":"2008f01f-c86e-4f2a-b754-a05cd65dff84","year":2024},"citing_paper":{"arxiv_id":"2508.20379","last_updated":"2025-08-28T03:00:30Z","snapshot_observed_at":"2026-08-15T18:46:01.736843Z","submitted_at":"2025-08-28T03:00:30Z","title":"Audio-Guided Visual Editing with Complex Multi-Modal Prompts","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-05T15:10:31.667945Z"},"links":{"cited_paper":"/paper/2405.00878","citing_paper":"/paper/2508.20379"},"observation_digest":"sha256:c740d5533cd54bb16dd038938712a8db993475b9e1ed98d511484ba9ffe4a6e2","observation_id":"c1b863f0-6252-49cf-8419-27a579b8d80f","resolution":{"observed_at":"2026-08-05T15:10:32.202014Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T15:10:31.671833Z","title":"Align your latents: High-resolution video synthesis with latent diffusion models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2508.20379","last_updated":"2025-08-28T03:00:30Z","snapshot_observed_at":"2026-08-15T18:46:01.736843Z","submitted_at":"2025-08-28T03:00:30Z","title":"Audio-Guided Visual Editing with Complex Multi-Modal Prompts","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-05T15:10:31.671833Z"},"links":{"citing_paper":"/paper/2508.20379"},"observation_digest":"sha256:a2204afe5ca814bea268578897512c42002068fe5b91798d27aa43607c51b402","observation_id":"47e2c4cb-2364-43fa-8d26-fad3ea7f3196","resolution":{"observed_at":"2026-08-05T15:10:31.671833Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T15:10:32.451138Z","title":"Ledits++: Limitless image editing using text-to-image models","venue":null,"work_id":"5c2f8cf3-5a37-4595-a4ae-145d2f166d15","year":2024},"citing_paper":{"arxiv_id":"2508.20379","last_updated":"2025-08-28T03:00:30Z","snapshot_observed_at":"2026-08-15T18:46:01.736843Z","submitted_at":"2025-08-28T03:00:30Z","title":"Audio-Guided Visual Editing with Complex Multi-Modal Prompts","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-05T15:10:31.674911Z"},"links":{"citing_paper":"/paper/2508.20379"},"observation_digest":"sha256:e4d5f5606cf1f6562294ea31be965b06793e9af53355edabbb1d48e95c129587","observation_id":"cb1a46e1-9ea0-42b4-9a49-88786c7f2087","resolution":{"observed_at":"2026-08-05T15:10:32.454984Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T15:10:32.441414Z","title":"Vggsound: A large-scale audio-visual dataset","venue":null,"work_id":"029b7e0d-6709-42a3-8f22-e1ff761e2f5d","year":2020},"citing_paper":{"arxiv_id":"2508.20379","last_updated":"2025-08-28T03:00:30Z","snapshot_observed_at":"2026-08-15T18:46:01.736843Z","submitted_at":"2025-08-28T03:00:30Z","title":"Audio-Guided Visual Editing with Complex Multi-Modal Prompts","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-05T15:10:31.678420Z"},"links":{"citing_paper":"/paper/2508.20379"},"observation_digest":"sha256:2ea9fac64fe71bacd4c58482fab2d6d91eddfd0389e782b846354642294e8777","observation_id":"8038bc95-56ab-4c82-a49a-426e5953eb8f","resolution":{"observed_at":"2026-08-05T15:10:32.444636Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2210.11427","last_updated":"2022-10-20T17:16:37Z","snapshot_observed_at":"2026-08-16T16:22:28.831035Z","submitted_at":"2022-10-20T17:16:37Z","title":"DiffEdit: Diffusion-based semantic image editing with mask guidance","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2210.11427","snapshot_observed_at":"2026-08-05T15:10:31.682377Z","title":"Diffedit: Diffusion-based semantic image editing with mask guidance","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2508.20379","last_updated":"2025-08-28T03:00:30Z","snapshot_observed_at":"2026-08-15T18:46:01.736843Z","submitted_at":"2025-08-28T03:00:30Z","title":"Audio-Guided Visual Editing with Complex Multi-Modal Prompts","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-05T15:10:31.682377Z"},"links":{"cited_paper":"/paper/2210.11427","citing_paper":"/paper/2508.20379"},"observation_digest":"sha256:3a3592408f34ab8620c92ed96814b727e6184ff7055379bad78c62de4a6b53c7","observation_id":"15255ef9-bc95-4305-ae2d-92fa964d1eab","resolution":{"observed_at":"2026-08-05T15:10:31.682377Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T15:10:32.431752Z","title":"Con- ditional generation of audio from video via foley analogies","venue":null,"work_id":"78f0c030-ebeb-4f25-859a-a62267922308","year":2023},"citing_paper":{"arxiv_id":"2508.20379","last_updated":"2025-08-28T03:00:30Z","snapshot_observed_at":"2026-08-15T18:46:01.736843Z","submitted_at":"2025-08-28T03:00:30Z","title":"Audio-Guided Visual Editing with Complex Multi-Modal Prompts","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-05T15:10:31.685950Z"},"links":{"citing_paper":"/paper/2508.20379"},"observation_digest":"sha256:6be5c35b1f6cda5bb6982f2667752dafbd24bcbfcfbc08885ae5ca24406729b1","observation_id":"3a9ba256-3b8c-407b-9a4f-47b4036a63ea","resolution":{"observed_at":"2026-08-05T15:10:32.434962Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T15:10:32.422530Z","title":"Structure and content-guided video synthesis with diffusion models","venue":null,"work_id":"137ba2a9-182c-451f-847e-77509d606339","year":2023},"citing_paper":{"arxiv_id":"2508.20379","last_updated":"2025-08-28T03:00:30Z","snapshot_observed_at":"2026-08-15T18:46:01.736843Z","submitted_at":"2025-08-28T03:00:30Z","title":"Audio-Guided Visual Editing with Complex Multi-Modal Prompts","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-05T15:10:31.689192Z"},"links":{"citing_paper":"/paper/2508.20379"},"observation_digest":"sha256:7cf530b74f9a97ffad071d82705eecbe2d3e24fb4eaddea21b82c7e8aa897449","observation_id":"70e339d7-4417-4a3b-8b9f-20a65d53e31f","resolution":{"observed_at":"2026-08-05T15:10:32.425812Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2307.10373","last_updated":"2023-11-20T10:54:09Z","snapshot_observed_at":"2026-08-15T03:17:05.670808Z","submitted_at":"2023-07-19T18:00:03Z","title":"TokenFlow: Consistent Diffusion Features for Consistent Video Editing","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.10373","snapshot_observed_at":"2026-08-05T15:10:31.692936Z","title":"Tokenflow: Consistent diffusion features for consistent video editing","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2508.20379","last_updated":"2025-08-28T03:00:30Z","snapshot_observed_at":"2026-08-15T18:46:01.736843Z","submitted_at":"2025-08-28T03:00:30Z","title":"Audio-Guided Visual Editing with Complex Multi-Modal Prompts","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-05T15:10:31.692936Z"},"links":{"cited_paper":"/paper/2307.10373","citing_paper":"/paper/2508.20379"},"observation_digest":"sha256:095626ce4743da3f0a85fad7d4c71ef6e4776a2cf703969cca7ffd4f993f2aa2","observation_id":"c1a0ee9a-b796-402c-a5d3-19025e5b4ed8","resolution":{"observed_at":"2026-08-05T15:10:31.692936Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T15:10:32.413322Z","title":"Imagebind: One embedding space to bind them all","venue":null,"work_id":"d18c7b6e-3194-4f31-8e7c-10ed300a7978","year":2023},"citing_paper":{"arxiv_id":"2508.20379","last_updated":"2025-08-28T03:00:30Z","snapshot_observed_at":"2026-08-15T18:46:01.736843Z","submitted_at":"2025-08-28T03:00:30Z","title":"Audio-Guided Visual Editing with Complex Multi-Modal Prompts","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-05T15:10:31.696749Z"},"links":{"citing_paper":"/paper/2508.20379"},"observation_digest":"sha256:549ec381c7629a5d3c2be35aea2b067ecb39c5fbcd2b47434e9b8656bc9197e9","observation_id":"017fc962-2b1e-4a23-b0a5-9fed696c05ea","resolution":{"observed_at":"2026-08-05T15:10:32.416553Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2403.01800","last_updated":"2024-03-05T08:19:51Z","snapshot_observed_at":"2026-08-16T14:13:12.450216Z","submitted_at":"2024-03-04T07:41:50Z","title":"AtomoVideo: High Fidelity Image-to-Video Generation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.01800","snapshot_observed_at":"2026-08-05T15:10:31.700664Z","title":"Atomovideo: High fidelity image-to-video generation","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.20379","last_updated":"2025-08-28T03:00:30Z","snapshot_observed_at":"2026-08-15T18:46:01.736843Z","submitted_at":"2025-08-28T03:00:30Z","title":"Audio-Guided Visual Editing with Complex Multi-Modal Prompts","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-05T15:10:31.700664Z"},"links":{"cited_paper":"/paper/2403.01800","citing_paper":"/paper/2508.20379"},"observation_digest":"sha256:34eee2ef887cbfcabd60c4df70ddb92f5b8558d01d0345e58c3e1c00f3660314","observation_id":"a38220d8-905a-45b9-a58f-de8655d3d5f0","resolution":{"observed_at":"2026-08-05T15:10:31.700664Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2210.08933","last_updated":"2023-02-14T06:45:49Z","snapshot_observed_at":"2026-08-16T19:48:42.861675Z","submitted_at":"2022-10-17T10:49:08Z","title":"DiffuSeq: Sequence to Sequence Text Generation with Diffusion Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2210.08933","snapshot_observed_at":"2026-08-05T15:10:31.704083Z","title":"Dif- fuseq: Sequence to sequence text generation with diffusion models","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2508.20379","last_updated":"2025-08-28T03:00:30Z","snapshot_observed_at":"2026-08-15T18:46:01.736843Z","submitted_at":"2025-08-28T03:00:30Z","title":"Audio-Guided Visual Editing with Complex Multi-Modal Prompts","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-05T15:10:31.704083Z"},"links":{"cited_paper":"/paper/2210.08933","citing_paper":"/paper/2508.20379"},"observation_digest":"sha256:84990cb8ea27356c5a9658b9414da4c6cb52f0e8b261dc262aca0926d0683e80","observation_id":"b3099f05-64d3-4e41-bf32-662f496e67f9","resolution":{"observed_at":"2026-08-05T15:10:31.704083Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.04834","last_updated":"2024-05-22T02:45:13Z","snapshot_observed_at":"2026-08-16T13:54:27.106256Z","submitted_at":"2024-05-08T06:09:11Z","title":"FlexEControl: Flexible and Efficient Multimodal Control for Text-to-Image Generation","version":2},"cited_work":{"arxiv_id":"2405.04834","doi":null,"metadata_source":"pith","pith_arxiv_id":"2405.04834","snapshot_observed_at":"2026-08-05T15:10:32.150739Z","title":"FlexEControl: Flexible and Efficient Multimodal Control for Text-to-Image Generation","venue":"cs.CV","work_id":"9fb07249-741e-467a-ba66-3de6c3e3dd4e","year":2024},"citing_paper":{"arxiv_id":"2508.20379","last_updated":"2025-08-28T03:00:30Z","snapshot_observed_at":"2026-08-15T18:46:01.736843Z","submitted_at":"2025-08-28T03:00:30Z","title":"Audio-Guided Visual Editing with Complex Multi-Modal Prompts","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-05T15:10:31.708990Z"},"links":{"cited_paper":"/paper/2405.04834","citing_paper":"/paper/2508.20379"},"observation_digest":"sha256:ad8fc8282eade60b77634c76096f2217bf4dbb0e6e5ade1fafb50bb3ae067723","observation_id":"c1de15e2-4ec3-43b2-9a43-f8d8bd6fb07e","resolution":{"observed_at":"2026-08-05T15:10:32.154458Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2208.01626","last_updated":"2022-08-02T17:55:41Z","snapshot_observed_at":"2026-08-17T00:44:11.103098Z","submitted_at":"2022-08-02T17:55:41Z","title":"Prompt-to-Prompt Image Editing with Cross Attention Control","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2208.01626","snapshot_observed_at":"2026-08-05T15:10:31.713176Z","title":"Prompt-to-prompt image editing with cross attention control","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2508.20379","last_updated":"2025-08-28T03:00:30Z","snapshot_observed_at":"2026-08-15T18:46:01.736843Z","submitted_at":"2025-08-28T03:00:30Z","title":"Audio-Guided Visual Editing with Complex Multi-Modal Prompts","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-05T15:10:31.713176Z"},"links":{"cited_paper":"/paper/2208.01626","citing_paper":"/paper/2508.20379"},"observation_digest":"sha256:8f34c3b7eb7855f5132fc756ba777c40b64615d7ff7a4149083b4f1a22f866cb","observation_id":"6c938676-cf99-4b22-b3d5-29caf78618bd","resolution":{"observed_at":"2026-08-05T15:10:31.713176Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2104.08718","last_updated":"2022-03-23T19:47:21Z","snapshot_observed_at":"2026-07-06T11:01:02.207193Z","submitted_at":"2021-04-18T05:00:29Z","title":"CLIPScore: A Reference-free Evaluation Metric for Image Captioning","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2104.08718","snapshot_observed_at":"2026-08-05T15:10:31.716262Z","title":"Clip- score: A reference-free evaluation metric for image captioning","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2508.20379","last_updated":"2025-08-28T03:00:30Z","snapshot_observed_at":"2026-08-15T18:46:01.736843Z","submitted_at":"2025-08-28T03:00:30Z","title":"Audio-Guided Visual Editing with Complex Multi-Modal Prompts","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-05T15:10:31.716262Z"},"links":{"cited_paper":"/paper/2104.08718","citing_paper":"/paper/2508.20379"},"observation_digest":"sha256:477d0da24a5c5602d459584946e2d5b4db3e5b40cddcfbd0819c011c1aeab98e","observation_id":"d9c1f186-073e-48e5-a586-4874717b2784","resolution":{"observed_at":"2026-08-05T15:10:31.716262Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.01506","last_updated":"2023-10-19T13:02:21Z","snapshot_observed_at":"2026-08-16T14:55:45.043779Z","submitted_at":"2023-10-02T18:01:55Z","title":"Direct Inversion: Boosting Diffusion-based Editing with 3 Lines of Code","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.01506","snapshot_observed_at":"2026-08-05T15:10:31.719815Z","title":"Direct inversion: Boosting diffusion-based editing with 3 lines of code","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2508.20379","last_updated":"2025-08-28T03:00:30Z","snapshot_observed_at":"2026-08-15T18:46:01.736843Z","submitted_at":"2025-08-28T03:00:30Z","title":"Audio-Guided Visual Editing with Complex Multi-Modal Prompts","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-05T15:10:31.719815Z"},"links":{"cited_paper":"/paper/2310.01506","citing_paper":"/paper/2508.20379"},"observation_digest":"sha256:734243813014f379ba0aede5bc7342ed04dcba4e177dc4ca6dfed2d3faf9257e","observation_id":"c4435c43-05ee-4b21-9678-726f78a5d31f","resolution":{"observed_at":"2026-08-05T15:10:31.719815Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T15:10:32.404299Z","title":"Text2video-zero: Text-to- image diffusion models are zero-shot video generators","venue":null,"work_id":"0dc6ac56-e038-4ac0-b07a-d767a8b65f46","year":2023},"citing_paper":{"arxiv_id":"2508.20379","last_updated":"2025-08-28T03:00:30Z","snapshot_observed_at":"2026-08-15T18:46:01.736843Z","submitted_at":"2025-08-28T03:00:30Z","title":"Audio-Guided Visual Editing with Complex Multi-Modal Prompts","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-05T15:10:31.722751Z"},"links":{"citing_paper":"/paper/2508.20379"},"observation_digest":"sha256:a50c567de1cb9be7fb2fb279d1e76fab1c4a27886e8ad0a6bb76e490d5950350","observation_id":"38c81fa2-f69a-4611-8626-a787974b7d05","resolution":{"observed_at":"2026-08-05T15:10:32.407619Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T15:10:31.725752Z","title":"Enclap: Combining neural audio codec and audio-text joint embedding for automated audio captioning","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.20379","last_updated":"2025-08-28T03:00:30Z","snapshot_observed_at":"2026-08-15T18:46:01.736843Z","submitted_at":"2025-08-28T03:00:30Z","title":"Audio-Guided Visual Editing with Complex Multi-Modal Prompts","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-05T15:10:31.725752Z"},"links":{"citing_paper":"/paper/2508.20379"},"observation_digest":"sha256:c2f4164d7a1a10b662b5b4c19df8677ef8e71cee88d8b708587edaa747853783","observation_id":"d69db800-7323-4db2-a592-e0ed9afcac39","resolution":{"observed_at":"2026-08-05T15:10:31.725752Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T15:10:31.728658Z","title":"Multi-concept customization of text-to-image diffusion","venue":null,"work_id":null,"year":1931},"citing_paper":{"arxiv_id":"2508.20379","last_updated":"2025-08-28T03:00:30Z","snapshot_observed_at":"2026-08-15T18:46:01.736843Z","submitted_at":"2025-08-28T03:00:30Z","title":"Audio-Guided Visual Editing with Complex Multi-Modal Prompts","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-05T15:10:31.728658Z"},"links":{"citing_paper":"/paper/2508.20379"},"observation_digest":"sha256:0032c63cf0a2d2bc26b0a51f56e66c5f997e601f85997086c602abc9713899bd","observation_id":"6ebd06e6-9de3-4d2c-8045-5942e4032e18","resolution":{"observed_at":"2026-08-05T15:10:31.728658Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T15:10:32.389784Z","title":"Sound-guided semantic image manipulation","venue":null,"work_id":"170e9fd8-6d6d-4562-8a2e-55bb10cc0628","year":2022},"citing_paper":{"arxiv_id":"2508.20379","last_updated":"2025-08-28T03:00:30Z","snapshot_observed_at":"2026-08-15T18:46:01.736843Z","submitted_at":"2025-08-28T03:00:30Z","title":"Audio-Guided Visual Editing with Complex Multi-Modal Prompts","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-05T15:10:31.731687Z"},"links":{"citing_paper":"/paper/2508.20379"},"observation_digest":"sha256:b51f8c2870b91c25742db2c4ed9b4ba87647e2a2c662a58dacf6b9f26e38244a","observation_id":"e6b2b2f6-8177-49e4-9f46-f74b2ee39ef4","resolution":{"observed_at":"2026-08-05T15:10:32.392936Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2304.06818","last_updated":"2023-04-13T20:56:53Z","snapshot_observed_at":"2026-08-16T15:40:35.047699Z","submitted_at":"2023-04-13T20:56:53Z","title":"Soundini: Sound-Guided Diffusion for Natural Video Editing","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2304.06818","snapshot_observed_at":"2026-08-05T15:10:31.734970Z","title":"Soundini: Sound-guided diffusion for natural video editing","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2508.20379","last_updated":"2025-08-28T03:00:30Z","snapshot_observed_at":"2026-08-15T18:46:01.736843Z","submitted_at":"2025-08-28T03:00:30Z","title":"Audio-Guided Visual Editing with Complex Multi-Modal Prompts","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-05T15:10:31.734970Z"},"links":{"cited_paper":"/paper/2304.06818","citing_paper":"/paper/2508.20379"},"observation_digest":"sha256:c7eecb530588e02bd419c9cce0f554f1afd23901acf150b1cd262d0a932df78e","observation_id":"44e2fce0-b5e8-460a-89a0-53bb27120f97","resolution":{"observed_at":"2026-08-05T15:10:31.734970Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T15:10:32.380486Z","title":"Generating real- istic images from in-the-wild sounds","venue":null,"work_id":"7ef10abb-e5ef-44c3-8ab5-ec4a135a343e","year":2023},"citing_paper":{"arxiv_id":"2508.20379","last_updated":"2025-08-28T03:00:30Z","snapshot_observed_at":"2026-08-15T18:46:01.736843Z","submitted_at":"2025-08-28T03:00:30Z","title":"Audio-Guided Visual Editing with Complex Multi-Modal Prompts","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-05T15:10:31.737985Z"},"links":{"citing_paper":"/paper/2508.20379"},"observation_digest":"sha256:c1852b72297b8da8974f8d01af03db253467d49b844d0683656e48e7591354a4","observation_id":"2b58a244-9615-45e9-87b1-0f98f98c73d5","resolution":{"observed_at":"2026-08-05T15:10:32.383588Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T15:10:32.370853Z","title":"Learning visual styles from audio-visual associations","venue":null,"work_id":"fc760919-96be-46d3-8d47-a980faf53db0","year":2022},"citing_paper":{"arxiv_id":"2508.20379","last_updated":"2025-08-28T03:00:30Z","snapshot_observed_at":"2026-08-15T18:46:01.736843Z","submitted_at":"2025-08-28T03:00:30Z","title":"Audio-Guided Visual Editing with Complex Multi-Modal Prompts","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-05T15:10:31.741316Z"},"links":{"citing_paper":"/paper/2508.20379"},"observation_digest":"sha256:79c0b3b5fba9f3540008abb43c467e8a72bd5057403aac8b329e529af43766da","observation_id":"dbb0e571-384b-4b43-9fc2-58e48bf14f32","resolution":{"observed_at":"2026-08-05T15:10:32.374499Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T15:10:32.361712Z","title":"Mind the gap: Understanding the modality gap in multi-modal contrastive representation learning","venue":null,"work_id":"9b1b140e-9dbc-4459-bbdc-5b51fc1a2fa9","year":2022},"citing_paper":{"arxiv_id":"2508.20379","last_updated":"2025-08-28T03:00:30Z","snapshot_observed_at":"2026-08-15T18:46:01.736843Z","submitted_at":"2025-08-28T03:00:30Z","title":"Audio-Guided Visual Editing with Complex Multi-Modal Prompts","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-05T15:10:31.744280Z"},"links":{"citing_paper":"/paper/2508.20379"},"observation_digest":"sha256:448560886a8619233f10ccc942d2384a21f12415c6c7cee67191e9f28424b4dd","observation_id":"d0ef518f-84ba-4c12-bfae-ff480a868876","resolution":{"observed_at":"2026-08-05T15:10:32.365099Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2404.09967","last_updated":"2024-05-24T16:29:38Z","snapshot_observed_at":"2026-08-16T14:00:44.815956Z","submitted_at":"2024-04-15T17:45:36Z","title":"Ctrl-Adapter: An Efficient and Versatile Framework for Adapting Diverse Controls to Any Diffusion Model","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.09967","snapshot_observed_at":"2026-08-05T15:10:31.747156Z","title":"Ctrl-adapter: An efficient and versatile framework for adapting diverse controls to any diffusion model","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.20379","last_updated":"2025-08-28T03:00:30Z","snapshot_observed_at":"2026-08-15T18:46:01.736843Z","submitted_at":"2025-08-28T03:00:30Z","title":"Audio-Guided Visual Editing with Complex Multi-Modal Prompts","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-05T15:10:31.747156Z"},"links":{"cited_paper":"/paper/2404.09967","citing_paper":"/paper/2508.20379"},"observation_digest":"sha256:edd240b4b858403796a7591000edde0e4c78bebeca142bd8457f40028522f3e0","observation_id":"ff760cde-a948-48cb-b605-60bd5298135c","resolution":{"observed_at":"2026-08-05T15:10:31.747156Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.20782","last_updated":"2025-03-26T17:59:04Z","snapshot_observed_at":"2026-08-16T12:46:32.588197Z","submitted_at":"2025-03-26T17:59:04Z","title":"Zero-Shot Audio-Visual Editing via Cross-Modal Delta Denoising","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.20782","snapshot_observed_at":"2026-08-05T15:10:31.750629Z","title":"Zero-shot audio-visual editing via cross-modal delta denoising","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2508.20379","last_updated":"2025-08-28T03:00:30Z","snapshot_observed_at":"2026-08-15T18:46:01.736843Z","submitted_at":"2025-08-28T03:00:30Z","title":"Audio-Guided Visual Editing with Complex Multi-Modal Prompts","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-05T15:10:31.750629Z"},"links":{"cited_paper":"/paper/2503.20782","citing_paper":"/paper/2508.20379"},"observation_digest":"sha256:8e34917f5ec978f18cde736e4cf64b641b9f87944ca0313501356eff7ac2dac9","observation_id":"d6bfd0e8-3685-41e7-ab70-c02f60c6012f","resolution":{"observed_at":"2026-08-05T15:10:31.750629Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2301.12503","last_updated":"2023-09-09T15:27:58Z","snapshot_observed_at":"2026-08-16T15:59:22.404915Z","submitted_at":"2023-01-29T17:48:17Z","title":"AudioLDM: Text-to-Audio Generation with Latent Diffusion Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2301.12503","snapshot_observed_at":"2026-08-05T15:10:31.753877Z","title":"Audioldm: Text-to-audio generation with latent diffusion models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2508.20379","last_updated":"2025-08-28T03:00:30Z","snapshot_observed_at":"2026-08-15T18:46:01.736843Z","submitted_at":"2025-08-28T03:00:30Z","title":"Audio-Guided Visual Editing with Complex Multi-Modal Prompts","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-05T15:10:31.753877Z"},"links":{"cited_paper":"/paper/2301.12503","citing_paper":"/paper/2508.20379"},"observation_digest":"sha256:92e053ed7aace93c7c5cfed5dea3976433e4753fc426b2141bfc4c2d525fa348","observation_id":"b0ef9092-7b6a-45a5-a957-900a8070585c","resolution":{"observed_at":"2026-08-05T15:10:31.753877Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T15:10:32.351680Z","title":"Diff-foley: Synchronized video-to-audio synthesis with latent diffusion models","venue":null,"work_id":"d643ea3f-bd67-4838-8642-c72d1ef7c5eb","year":2024},"citing_paper":{"arxiv_id":"2508.20379","last_updated":"2025-08-28T03:00:30Z","snapshot_observed_at":"2026-08-15T18:46:01.736843Z","submitted_at":"2025-08-28T03:00:30Z","title":"Audio-Guided Visual Editing with Complex Multi-Modal Prompts","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-05T15:10:31.757006Z"},"links":{"citing_paper":"/paper/2508.20379"},"observation_digest":"sha256:b7b9441790e97458a0ae1c1c85e0acf1d44587bfbc1ad346dbdbc5aa58ad216a","observation_id":"2af4216c-7cf4-4b16-8b8f-ab8664569220","resolution":{"observed_at":"2026-08-05T15:10:32.355091Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T15:10:32.342518Z","title":"Videofusion: Decomposed diffusion models for high-quality video generation","venue":null,"work_id":"5f035097-8c59-4693-b05c-dbb466a4df22","year":2023},"citing_paper":{"arxiv_id":"2508.20379","last_updated":"2025-08-28T03:00:30Z","snapshot_observed_at":"2026-08-15T18:46:01.736843Z","submitted_at":"2025-08-28T03:00:30Z","title":"Audio-Guided Visual Editing with Complex Multi-Modal Prompts","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-05T15:10:31.760023Z"},"links":{"citing_paper":"/paper/2508.20379"},"observation_digest":"sha256:2e8ed4b916649cf0ff2a771b927af8b18b21b6f5f515c3d526a893b191f4a624","observation_id":"79bccee3-4715-4b5f-baf5-07bff6f8656c","resolution":{"observed_at":"2026-08-05T15:10:32.345669Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.10009","last_updated":"2024-05-29T11:27:24Z","snapshot_observed_at":"2026-08-16T14:18:17.173288Z","submitted_at":"2024-02-15T15:17:26Z","title":"Zero-Shot Unsupervised and Text-Based Audio Editing Using DDPM Inversion","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.10009","snapshot_observed_at":"2026-08-05T15:10:31.763240Z","title":"Zero-shot unsupervised and text-based audio editing using ddpm inversion","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.20379","last_updated":"2025-08-28T03:00:30Z","snapshot_observed_at":"2026-08-15T18:46:01.736843Z","submitted_at":"2025-08-28T03:00:30Z","title":"Audio-Guided Visual Editing with Complex Multi-Modal Prompts","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-05T15:10:31.763240Z"},"links":{"cited_paper":"/paper/2402.10009","citing_paper":"/paper/2508.20379"},"observation_digest":"sha256:fb1ce101b22ebbe021f8da382bf658a1882b49174738bb223659d33e1f2eeada","observation_id":"75333614-6bef-46d9-9f16-2e05dbf39fcb","resolution":{"observed_at":"2026-08-05T15:10:31.763240Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2108.01073","last_updated":"2022-01-05T00:07:35Z","snapshot_observed_at":"2026-08-16T16:53:14.231987Z","submitted_at":"2021-08-02T17:59:47Z","title":"SDEdit: Guided Image Synthesis and Editing with Stochastic Differential Equations","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2108.01073","snapshot_observed_at":"2026-08-05T15:10:31.766335Z","title":"Sdedit: Guided image synthesis and editing with stochastic differential equations","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2508.20379","last_updated":"2025-08-28T03:00:30Z","snapshot_observed_at":"2026-08-15T18:46:01.736843Z","submitted_at":"2025-08-28T03:00:30Z","title":"Audio-Guided Visual Editing with Complex Multi-Modal Prompts","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-05T15:10:31.766335Z"},"links":{"cited_paper":"/paper/2108.01073","citing_paper":"/paper/2508.20379"},"observation_digest":"sha256:508200b115c53a292adf0247bddc28cfdf5ee613b38a7a84c6bec570cd2b4196","observation_id":"81065768-7ebe-4cfd-8d4a-63f846f602dc","resolution":{"observed_at":"2026-08-05T15:10:31.766335Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T15:10:32.333557Z","title":"Freecontrol: Training-free spatial control of any text-to-image diffusion model with any condition","venue":null,"work_id":"91bb0eaf-a7d9-4d30-bd70-38826ad81e81","year":2024},"citing_paper":{"arxiv_id":"2508.20379","last_updated":"2025-08-28T03:00:30Z","snapshot_observed_at":"2026-08-15T18:46:01.736843Z","submitted_at":"2025-08-28T03:00:30Z","title":"Audio-Guided Visual Editing with Complex Multi-Modal Prompts","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-05T15:10:31.769728Z"},"links":{"citing_paper":"/paper/2508.20379"},"observation_digest":"sha256:e62dba910c49c65626def7fb07a46985c995286ddab916e0fd6a21059d6a9ea5","observation_id":"b15750d2-18e5-4fd5-9900-ea7ac919ef72","resolution":{"observed_at":"2026-08-05T15:10:32.336618Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T15:10:32.323910Z","title":"Null-text inversion for editing real images using guided diffusion models","venue":null,"work_id":"ebe7599b-6711-4f2a-a065-662d52c002ff","year":2023},"citing_paper":{"arxiv_id":"2508.20379","last_updated":"2025-08-28T03:00:30Z","snapshot_observed_at":"2026-08-15T18:46:01.736843Z","submitted_at":"2025-08-28T03:00:30Z","title":"Audio-Guided Visual Editing with Complex Multi-Modal Prompts","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-05T15:10:31.773612Z"},"links":{"citing_paper":"/paper/2508.20379"},"observation_digest":"sha256:a13bbf03030a72e8e808ea38a196b4e5138f9ff5d9d60f04827dc620e8e742a1","observation_id":"f717f9cb-22d1-47f5-97fb-41227fd3e1b8","resolution":{"observed_at":"2026-08-05T15:10:32.327476Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T15:10:32.314033Z","title":"Conditional image-to-video generation with latent flow diffusion models","venue":null,"work_id":"1b91c45c-d923-4940-bce8-465eda34ac50","year":2023},"citing_paper":{"arxiv_id":"2508.20379","last_updated":"2025-08-28T03:00:30Z","snapshot_observed_at":"2026-08-15T18:46:01.736843Z","submitted_at":"2025-08-28T03:00:30Z","title":"Audio-Guided Visual Editing with Complex Multi-Modal Prompts","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-05T15:10:31.776779Z"},"links":{"citing_paper":"/paper/2508.20379"},"observation_digest":"sha256:474d9a18044e8342fd0a88b761760e7854ebb4ff2fe2aa9510e439c25192eb5e","observation_id":"705322b1-435b-438a-83ee-9b6922827448","resolution":{"observed_at":"2026-08-05T15:10:32.318131Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2307.01952","last_updated":"2023-07-04T23:04:57Z","snapshot_observed_at":"2026-08-14T22:54:08.184266Z","submitted_at":"2023-07-04T23:04:57Z","title":"SDXL: Improving Latent Diffusion Models for High-Resolution Image Synthesis","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.01952","snapshot_observed_at":"2026-08-05T15:10:31.780021Z","title":"Sdxl: Improving latent diffusion models for high-resolution image synthesis","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2508.20379","last_updated":"2025-08-28T03:00:30Z","snapshot_observed_at":"2026-08-15T18:46:01.736843Z","submitted_at":"2025-08-28T03:00:30Z","title":"Audio-Guided Visual Editing with Complex Multi-Modal Prompts","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-05T15:10:31.780021Z"},"links":{"cited_paper":"/paper/2307.01952","citing_paper":"/paper/2508.20379"},"observation_digest":"sha256:a4d6c401b77afc99a84af77851028133012ef25e668634579f075dc559e27d06","observation_id":"0d3e2c24-9ba4-496b-8b26-cda1590b0b48","resolution":{"observed_at":"2026-08-05T15:10:31.780021Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1704.00675","last_updated":"2018-03-01T17:50:08Z","snapshot_observed_at":"2026-08-02T10:51:13.194643Z","submitted_at":"2017-04-03T16:44:46Z","title":"The 2017 DAVIS Challenge on Video Object Segmentation","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1704.00675","snapshot_observed_at":"2026-08-05T15:10:31.784026Z","title":"The 2017 davis challenge on video object segmentation","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2508.20379","last_updated":"2025-08-28T03:00:30Z","snapshot_observed_at":"2026-08-15T18:46:01.736843Z","submitted_at":"2025-08-28T03:00:30Z","title":"Audio-Guided Visual Editing with Complex Multi-Modal Prompts","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-05T15:10:31.784026Z"},"links":{"cited_paper":"/paper/1704.00675","citing_paper":"/paper/2508.20379"},"observation_digest":"sha256:d3685df14b00dcab442a6b3f00af6e6bae09b2368a3a53800aea9d06a04a4afd","observation_id":"c37a2fe5-dc43-484b-a07a-55102189a072","resolution":{"observed_at":"2026-08-05T15:10:31.784026Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T15:10:31.788198Z","title":"Grad-tts: A diffusion probabilistic model for text-to-speech","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2508.20379","last_updated":"2025-08-28T03:00:30Z","snapshot_observed_at":"2026-08-15T18:46:01.736843Z","submitted_at":"2025-08-28T03:00:30Z","title":"Audio-Guided Visual Editing with Complex Multi-Modal Prompts","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-05T15:10:31.788198Z"},"links":{"citing_paper":"/paper/2508.20379"},"observation_digest":"sha256:e6df2c85a17cc14152829b03af5a061414cda4a505abb2e3f0ef1dd52c8477ab","observation_id":"ed40fd61-e4ed-44a3-9e05-3eaaa2dddf45","resolution":{"observed_at":"2026-08-05T15:10:31.788198Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T15:10:32.298358Z","title":"Fatezero: Fusing attentions for zero-shot text-based video editing","venue":null,"work_id":"801bb11e-7f6b-4a1b-b8b0-7d208cbcaa6d","year":2023},"citing_paper":{"arxiv_id":"2508.20379","last_updated":"2025-08-28T03:00:30Z","snapshot_observed_at":"2026-08-15T18:46:01.736843Z","submitted_at":"2025-08-28T03:00:30Z","title":"Audio-Guided Visual Editing with Complex Multi-Modal Prompts","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-05T15:10:31.791205Z"},"links":{"citing_paper":"/paper/2508.20379"},"observation_digest":"sha256:da6acf4816099fd3abbd519be09774206cd035428188354ea42a6489965e37d7","observation_id":"8d8de396-afe3-4b6b-93c1-4d7b4d040fc0","resolution":{"observed_at":"2026-08-05T15:10:32.301659Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2204.06125","last_updated":"2022-04-13T01:10:33Z","snapshot_observed_at":"2026-08-15T12:50:58.405488Z","submitted_at":"2022-04-13T01:10:33Z","title":"Hierarchical Text-Conditional Image Generation with CLIP Latents","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2204.06125","snapshot_observed_at":"2026-08-05T15:10:31.794473Z","title":"Hierarchi- cal text-conditional image generation with clip latents","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2508.20379","last_updated":"2025-08-28T03:00:30Z","snapshot_observed_at":"2026-08-15T18:46:01.736843Z","submitted_at":"2025-08-28T03:00:30Z","title":"Audio-Guided Visual Editing with Complex Multi-Modal Prompts","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-05T15:10:31.794473Z"},"links":{"cited_paper":"/paper/2204.06125","citing_paper":"/paper/2508.20379"},"observation_digest":"sha256:3c6b0bfbde5055c4de39fcbdbf323c7bc843731a403e6cdc9e50809b858c786d","observation_id":"a225ef8d-4329-4cee-8f46-ac398c6ce10a","resolution":{"observed_at":"2026-08-05T15:10:31.794473Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T15:10:32.288956Z","title":"High-resolution image synthesis with latent diffusion models","venue":null,"work_id":"9026691e-ec45-44e9-adfc-681438846b9d","year":2022},"citing_paper":{"arxiv_id":"2508.20379","last_updated":"2025-08-28T03:00:30Z","snapshot_observed_at":"2026-08-15T18:46:01.736843Z","submitted_at":"2025-08-28T03:00:30Z","title":"Audio-Guided Visual Editing with Complex Multi-Modal Prompts","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-05T15:10:31.797335Z"},"links":{"citing_paper":"/paper/2508.20379"},"observation_digest":"sha256:82c021f29f4b7869dbcbc9ff5364778e457441e619951ccca9892053c51804d6","observation_id":"d343c0ec-5f2a-4eb8-9491-4e2c3ba36eb8","resolution":{"observed_at":"2026-08-05T15:10:32.292428Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T15:10:32.279456Z","title":"Photorealistic text-to-image diffusion models with deep language understanding","venue":null,"work_id":"89b32aef-9ffc-437b-b465-41dcaf3fa701","year":2022},"citing_paper":{"arxiv_id":"2508.20379","last_updated":"2025-08-28T03:00:30Z","snapshot_observed_at":"2026-08-15T18:46:01.736843Z","submitted_at":"2025-08-28T03:00:30Z","title":"Audio-Guided Visual Editing with Complex Multi-Modal Prompts","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-05T15:10:31.801313Z"},"links":{"citing_paper":"/paper/2508.20379"},"observation_digest":"sha256:5f18b97303540244239e444caa0f7e059f4f38b000476d3e44bfa000af0893c2","observation_id":"cc1637b2-aefb-40aa-a17b-b07656bcda18","resolution":{"observed_at":"2026-08-05T15:10:32.283106Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2304.09116","last_updated":"2023-05-30T16:09:10Z","snapshot_observed_at":"2026-08-16T15:39:31.485174Z","submitted_at":"2023-04-18T16:31:59Z","title":"NaturalSpeech 2: Latent Diffusion Models are Natural and Zero-Shot Speech and Singing Synthesizers","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2304.09116","snapshot_observed_at":"2026-08-05T15:10:31.804516Z","title":"Naturalspeech 2: Latent diffusion models are natural and zero-shot speech and singing synthesizers","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2508.20379","last_updated":"2025-08-28T03:00:30Z","snapshot_observed_at":"2026-08-15T18:46:01.736843Z","submitted_at":"2025-08-28T03:00:30Z","title":"Audio-Guided Visual Editing with Complex Multi-Modal Prompts","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-05T15:10:31.804516Z"},"links":{"cited_paper":"/paper/2304.09116","citing_paper":"/paper/2508.20379"},"observation_digest":"sha256:2d43ee3bd3d1adaf3758faf8c95d83a91aa28573d8866ad112eacf26f49be000","observation_id":"6562b558-0a3e-403b-9f40-55481a3dceab","resolution":{"observed_at":"2026-08-05T15:10:31.804516Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2010.02502","last_updated":"2022-10-05T20:19:21Z","snapshot_observed_at":"2026-08-11T15:38:14.931716Z","submitted_at":"2020-10-06T06:15:51Z","title":"Denoising Diffusion Implicit Models","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2010.02502","snapshot_observed_at":"2026-08-05T15:10:31.807657Z","title":"Denoising diffusion implicit models","venue":null,"work_id":null,"year":2010},"citing_paper":{"arxiv_id":"2508.20379","last_updated":"2025-08-28T03:00:30Z","snapshot_observed_at":"2026-08-15T18:46:01.736843Z","submitted_at":"2025-08-28T03:00:30Z","title":"Audio-Guided Visual Editing with Complex Multi-Modal Prompts","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-05T15:10:31.807657Z"},"links":{"cited_paper":"/paper/2010.02502","citing_paper":"/paper/2508.20379"},"observation_digest":"sha256:0e1bdf4f362f93c0d4243fbcae73e2c1a6fa65b98f95125e085a714737221c4e","observation_id":"0277b3f2-5a4f-4538-8813-931e2d73d77c","resolution":{"observed_at":"2026-08-05T15:10:31.807657Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.18775","last_updated":"2023-11-30T18:21:25Z","snapshot_observed_at":"2026-08-16T14:38:43.792245Z","submitted_at":"2023-11-30T18:21:25Z","title":"CoDi-2: In-Context, Interleaved, and Interactive Any-to-Any Generation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.18775","snapshot_observed_at":"2026-08-05T15:10:31.811712Z","title":"Codi-2: In-context, interleaved, and interactive any-to-any generation","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2508.20379","last_updated":"2025-08-28T03:00:30Z","snapshot_observed_at":"2026-08-15T18:46:01.736843Z","submitted_at":"2025-08-28T03:00:30Z","title":"Audio-Guided Visual Editing with Complex Multi-Modal Prompts","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-05T15:10:31.811712Z"},"links":{"cited_paper":"/paper/2311.18775","citing_paper":"/paper/2508.20379"},"observation_digest":"sha256:cbfb087753cc309431e8fef39d8d1a334bfd4553bfc2781f3794dd387d4e4d67","observation_id":"68203758-5db6-4225-9d4d-4f63e58a8ec0","resolution":{"observed_at":"2026-08-05T15:10:31.811712Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.11846","last_updated":"2023-05-19T17:38:32Z","snapshot_observed_at":"2026-08-17T14:11:33.557386Z","submitted_at":"2023-05-19T17:38:32Z","title":"Any-to-Any Generation via Composable Diffusion","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.11846","snapshot_observed_at":"2026-08-05T15:10:31.814837Z","title":"Any-to-any generation via composable diffusion","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2508.20379","last_updated":"2025-08-28T03:00:30Z","snapshot_observed_at":"2026-08-15T18:46:01.736843Z","submitted_at":"2025-08-28T03:00:30Z","title":"Audio-Guided Visual Editing with Complex Multi-Modal Prompts","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-05T15:10:31.814837Z"},"links":{"cited_paper":"/paper/2305.11846","citing_paper":"/paper/2508.20379"},"observation_digest":"sha256:abbd27e7fb6d515c79a9665d54d20b31a7751499f2f81b315f7ce60fccfe7c35","observation_id":"8002fae2-0e9c-43c9-b91c-38834b9edba0","resolution":{"observed_at":"2026-08-05T15:10:31.814837Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T15:10:32.270018Z","title":"Splicing vit features for semantic appearance transfer","venue":null,"work_id":"919e2e04-809a-4918-928d-0632c039b75c","year":2022},"citing_paper":{"arxiv_id":"2508.20379","last_updated":"2025-08-28T03:00:30Z","snapshot_observed_at":"2026-08-15T18:46:01.736843Z","submitted_at":"2025-08-28T03:00:30Z","title":"Audio-Guided Visual Editing with Complex Multi-Modal Prompts","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-05T15:10:31.818212Z"},"links":{"citing_paper":"/paper/2508.20379"},"observation_digest":"sha256:0403602911475efd1698dd97f30b426a184a501b120f56433a5ac30d181469cf","observation_id":"8390fd36-fdb4-4726-9136-619a2a8f4708","resolution":{"observed_at":"2026-08-05T15:10:32.273359Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T15:10:31.821082Z","title":"Plug-and-play diffusion features for text-driven image-to-image translation","venue":null,"work_id":null,"year":1921},"citing_paper":{"arxiv_id":"2508.20379","last_updated":"2025-08-28T03:00:30Z","snapshot_observed_at":"2026-08-15T18:46:01.736843Z","submitted_at":"2025-08-28T03:00:30Z","title":"Audio-Guided Visual Editing with Complex Multi-Modal Prompts","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-05T15:10:31.821082Z"},"links":{"citing_paper":"/paper/2508.20379"},"observation_digest":"sha256:a986f8502bf4dec34e5277c58b4310c745de02d72de346db116ecb75cf0f83dc","observation_id":"99c62098-9257-42b2-8a37-27ae0cebcfaa","resolution":{"observed_at":"2026-08-05T15:10:31.821082Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T15:10:32.254717Z","title":"Audit: Audio editing by following instructions with latent diffusion models","venue":null,"work_id":"43311f38-4a4d-4374-a205-8ff013194994","year":2024},"citing_paper":{"arxiv_id":"2508.20379","last_updated":"2025-08-28T03:00:30Z","snapshot_observed_at":"2026-08-15T18:46:01.736843Z","submitted_at":"2025-08-28T03:00:30Z","title":"Audio-Guided Visual Editing with Complex Multi-Modal Prompts","version":1},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-05T15:10:31.824068Z"},"links":{"citing_paper":"/paper/2508.20379"},"observation_digest":"sha256:7b17c2047ab196be590cb06081afa2327a3057efbe56570cc185a8fae70e9209","observation_id":"fa7fff4f-95cf-4e2e-8053-f3d43caeab9a","resolution":{"observed_at":"2026-08-05T15:10:32.258243Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T15:10:32.245137Z","title":"Tune-a-video: One-shot tuning of image diffusion models for text-to-video generation","venue":null,"work_id":"32b44a67-a5eb-4989-80c8-fe447b36ece2","year":2023},"citing_paper":{"arxiv_id":"2508.20379","last_updated":"2025-08-28T03:00:30Z","snapshot_observed_at":"2026-08-15T18:46:01.736843Z","submitted_at":"2025-08-28T03:00:30Z","title":"Audio-Guided Visual Editing with Complex Multi-Modal Prompts","version":1},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-05T15:10:31.827209Z"},"links":{"citing_paper":"/paper/2508.20379"},"observation_digest":"sha256:b16c88d297bd360361f4b7ba6f36ad13695de813f64bee1e4b47e079d71e5613","observation_id":"509d7ec8-fc05-4c4a-a237-72817d40639c","resolution":{"observed_at":"2026-08-05T15:10:32.248945Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.16003","last_updated":"2023-10-24T16:56:58Z","snapshot_observed_at":"2026-08-16T14:49:15.874057Z","submitted_at":"2023-10-24T16:56:58Z","title":"CVPR 2023 Text Guided Video Editing Competition","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.16003","snapshot_observed_at":"2026-08-05T15:10:31.830361Z","title":"Cvpr 2023 text guided video editing competition","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2508.20379","last_updated":"2025-08-28T03:00:30Z","snapshot_observed_at":"2026-08-15T18:46:01.736843Z","submitted_at":"2025-08-28T03:00:30Z","title":"Audio-Guided Visual Editing with Complex Multi-Modal Prompts","version":1},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-05T15:10:31.830361Z"},"links":{"cited_paper":"/paper/2310.16003","citing_paper":"/paper/2508.20379"},"observation_digest":"sha256:ce90aeb696d1282e6d3e0bf0bb93b4d8c42ae637711cbb83f11d37883310a6f6","observation_id":"12fef8f2-af64-4a1a-b178-bf8f1f08b6cc","resolution":{"observed_at":"2026-08-05T15:10:31.830361Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2309.05519","last_updated":"2024-06-25T05:01:09Z","snapshot_observed_at":"2026-08-17T09:50:53.260956Z","submitted_at":"2023-09-11T15:02:25Z","title":"NExT-GPT: Any-to-Any Multimodal LLM","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.05519","snapshot_observed_at":"2026-08-05T15:10:31.833708Z","title":"Next-gpt: Any-to-any multimodal llm","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2508.20379","last_updated":"2025-08-28T03:00:30Z","snapshot_observed_at":"2026-08-15T18:46:01.736843Z","submitted_at":"2025-08-28T03:00:30Z","title":"Audio-Guided Visual Editing with Complex Multi-Modal Prompts","version":1},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-05T15:10:31.833708Z"},"links":{"cited_paper":"/paper/2309.05519","citing_paper":"/paper/2508.20379"},"observation_digest":"sha256:8b572e214cfae3b0865b42780a95e0b2370d9222cb68316dd1bbc3e4ca9cd4ae","observation_id":"0d76b3bd-d2d5-474b-bdc9-8f2c483b45cd","resolution":{"observed_at":"2026-08-05T15:10:31.833708Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T15:10:32.236546Z","title":"Ar-diffusion: Auto-regressive diffusion model for text generation","venue":null,"work_id":"cd4f4d40-163b-4c9e-8b82-8b37918d391b","year":2024},"citing_paper":{"arxiv_id":"2508.20379","last_updated":"2025-08-28T03:00:30Z","snapshot_observed_at":"2026-08-15T18:46:01.736843Z","submitted_at":"2025-08-28T03:00:30Z","title":"Audio-Guided Visual Editing with Complex Multi-Modal Prompts","version":1},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-05T15:10:31.837124Z"},"links":{"citing_paper":"/paper/2508.20379"},"observation_digest":"sha256:b2341dc3615c5676a262811aa3f66ebb485d3150d27a5df872125152edb6f3f6","observation_id":"b239d8f0-2453-48f3-a5b9-0c93d6930919","resolution":{"observed_at":"2026-08-05T15:10:32.239486Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.17723","last_updated":"2024-02-27T17:57:04Z","snapshot_observed_at":"2026-08-16T14:14:48.116665Z","submitted_at":"2024-02-27T17:57:04Z","title":"Seeing and Hearing: Open-domain Visual-Audio Generation with Diffusion Latent Aligners","version":1},"cited_work":{"arxiv_id":"2402.17723","doi":null,"metadata_source":"pith","pith_arxiv_id":"2402.17723","snapshot_observed_at":"2026-08-05T15:10:31.897560Z","title":"Seeing and Hearing: Open-domain Visual-Audio Generation with Diffusion Latent Aligners","venue":"cs.CV","work_id":"d5cc84f2-89a1-47da-9b5f-4285dccff89c","year":2024},"citing_paper":{"arxiv_id":"2508.20379","last_updated":"2025-08-28T03:00:30Z","snapshot_observed_at":"2026-08-15T18:46:01.736843Z","submitted_at":"2025-08-28T03:00:30Z","title":"Audio-Guided Visual Editing with Complex Multi-Modal Prompts","version":1},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-08-05T15:10:31.840253Z"},"links":{"cited_paper":"/paper/2402.17723","citing_paper":"/paper/2508.20379"},"observation_digest":"sha256:c8b5409a954dcc2df770f76eee0927215442d6d85ee3542225a3516b3263d4ab","observation_id":"6617b490-5b00-4988-a50e-b1cc63fb1f43","resolution":{"observed_at":"2026-08-05T15:10:31.902187Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2306.11504","last_updated":"2023-06-20T12:50:49Z","snapshot_observed_at":"2026-08-16T15:22:34.588504Z","submitted_at":"2023-06-20T12:50:49Z","title":"Align, Adapt and Inject: Sound-guided Unified Image Generation","version":1},"cited_work":{"arxiv_id":"2306.11504","doi":null,"metadata_source":"pith","pith_arxiv_id":"2306.11504","snapshot_observed_at":"2026-08-05T15:10:31.880832Z","title":"Align, Adapt and Inject: Sound-guided Unified Image Generation","venue":"cs.GR","work_id":"031c1ac5-e3a1-48a0-b403-11d6cba98908","year":2023},"citing_paper":{"arxiv_id":"2508.20379","last_updated":"2025-08-28T03:00:30Z","snapshot_observed_at":"2026-08-15T18:46:01.736843Z","submitted_at":"2025-08-28T03:00:30Z","title":"Audio-Guided Visual Editing with Complex Multi-Modal Prompts","version":1},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-08-05T15:10:31.843363Z"},"links":{"cited_paper":"/paper/2306.11504","citing_paper":"/paper/2508.20379"},"observation_digest":"sha256:5e16d0e7fc8bece1f268138b54275b4a8d39dadea4f58e34e879ddf70dffe670","observation_id":"3de73937-bc91-4434-b7a8-97c435a9ecdc","resolution":{"observed_at":"2026-08-05T15:10:31.886034Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T15:10:32.227312Z","title":"The unreasonable effectiveness of deep features as a perceptual metric","venue":null,"work_id":"620734ae-a517-4b11-ac35-61b12d4d8ae1","year":2018},"citing_paper":{"arxiv_id":"2508.20379","last_updated":"2025-08-28T03:00:30Z","snapshot_observed_at":"2026-08-15T18:46:01.736843Z","submitted_at":"2025-08-28T03:00:30Z","title":"Audio-Guided Visual Editing with Complex Multi-Modal Prompts","version":1},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-08-05T15:10:31.846869Z"},"links":{"citing_paper":"/paper/2508.20379"},"observation_digest":"sha256:cc5e8f8f2a873c254ba92e616ff656ba09b2f1b756a1d72c961b38d70f309e6e","observation_id":"91f0718d-73b0-4c14-a3c9-8a09db9e19bf","resolution":{"observed_at":"2026-08-05T15:10:32.230376Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T15:10:32.218330Z","title":"Uni-controlnet: All-in-one control to text-to-image diffusion models","venue":null,"work_id":"10c82f53-4a3e-4666-99b3-9446f8f47d91","year":2024},"citing_paper":{"arxiv_id":"2508.20379","last_updated":"2025-08-28T03:00:30Z","snapshot_observed_at":"2026-08-15T18:46:01.736843Z","submitted_at":"2025-08-28T03:00:30Z","title":"Audio-Guided Visual Editing with Complex Multi-Modal Prompts","version":1},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-08-05T15:10:31.849774Z"},"links":{"citing_paper":"/paper/2508.20379"},"observation_digest":"sha256:73937d17728976437242a039b2242665f3ac971a497048b3d4218a27350b56ca","observation_id":"40491051-3946-400f-9b6c-7283985938a4","resolution":{"observed_at":"2026-08-05T15:10:32.221511Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2508.20379","last_updated":"2025-08-28T03:00:30Z","latest_version":1,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-15T18:46:01.736843Z","submitted_at":"2025-08-28T03:00:30Z","title":"Audio-Guided Visual Editing with Complex Multi-Modal Prompts"},"reference_resolution":{"displayed":57,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":28,"verified_exact":4,"verified_fuzzy":25},"total_outbound_references":57},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"thesis":"As of 17 August 2026, this Paper Citation Record lists 57 of 57 outbound references and 0 inbound Pith citation observations for arXiv:2508.20379."}