{"as_of":"2026-08-18T07:39:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:56b5dd195a8ed6ff5fe20a219e15b0150e708c01806f3e5abb3d7bc34d381106","coverage":[{"denominator":40,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":40,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T11:20:13.434436Z","state":"measured"},{"denominator":42,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":42,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-18T06:34:40.430872+00:00","state":"measured"},{"denominator":2,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":2,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T11:20:10.527238Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-07-04T12:09:49.455046Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2506.02858","last_updated":"2025-06-05T04:46:57Z","snapshot_observed_at":"2026-08-09T09:31:21.536819Z","submitted_at":"2025-06-03T13:24:57Z","title":"DGMO: Training-Free Audio Source Separation through Diffusion-Guided Mask Optimization","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.02858","snapshot_observed_at":"2026-08-07T11:20:10.527238Z","title":"A cat is meowing","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.02858","last_updated":"2025-06-05T04:46:57Z","snapshot_observed_at":"2026-08-09T09:31:21.536819Z","submitted_at":"2025-06-03T13:24:57Z","title":"DGMO: Training-Free Audio Source Separation through Diffusion-Guided Mask Optimization","version":2},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-07T11:20:10.527238Z"},"links":{"cited_paper":"/paper/2506.02858","citing_paper":"/paper/2506.02858"},"observation_digest":"sha256:342f419db46401b431230d86e2f812e8d63ea947a6b271f3ca72ab9f13304116","observation_id":"8e6a2bde-34e2-46f8-ae97-4b14ab0815d6","resolution":{"observed_at":"2026-08-07T11:20:10.527238Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.02858","last_updated":"2025-06-05T04:46:57Z","snapshot_observed_at":"2026-08-09T09:31:21.536819Z","submitted_at":"2025-06-03T13:24:57Z","title":"DGMO: Training-Free Audio Source Separation through Diffusion-Guided Mask Optimization","version":2},"cited_work":{"arxiv_id":"2506.02858","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2506.02858","snapshot_observed_at":"2026-07-04T12:09:49.455046Z","title":"Keon Lee, Kyumin Park, and Daeyoung Kim","venue":null,"work_id":"3755b62f-b0e2-4be9-a9f1-6cf10456970a","year":2023},"citing_paper":{"arxiv_id":"2606.23139","last_updated":"2026-06-22T10:32:25Z","snapshot_observed_at":"2026-08-18T07:30:52.697166Z","submitted_at":"2026-06-22T10:32:25Z","title":"Audio Editing in the Era of Foundation Models: A Survey","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-06-26T07:10:49.047784Z"},"links":{"cited_paper":"/paper/2506.02858","citing_paper":"/paper/2606.23139"},"observation_digest":"sha256:4bebf4b32e4f25ec8661a0d6f4bb90d06985519a735d982d81947031bc009632","observation_id":"62ddaa29-ccb2-47a4-911d-59ebd14e2bcb","resolution":{"observed_at":"2026-07-04T12:09:49.456447Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2506.02858/citation-record","integrity":"/paper/2506.02858/integrity","json":"/paper/2506.02858/citation-record.json","paper":"/paper/2506.02858"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:20:16.106791Z","title":"Computational models aim to replicate this ability through sound separation, isolating target sources from audio mix- tures","venue":null,"work_id":"356c13c2-d05e-498d-92c5-628e4aff44e3","year":null},"citing_paper":{"arxiv_id":"2506.02858","last_updated":"2025-06-05T04:46:57Z","snapshot_observed_at":"2026-08-09T09:31:21.536819Z","submitted_at":"2025-06-03T13:24:57Z","title":"DGMO: Training-Free Audio Source Separation through Diffusion-Guided Mask Optimization","version":2},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-07T11:20:10.455479Z"},"links":{"citing_paper":"/paper/2506.02858"},"observation_digest":"sha256:5a4d571886aa262a7b36fc1c79bd46978384a03d83673080a664f9c6a45d630b","observation_id":"7e9cee9e-1638-4464-a400-f619655afc7b","resolution":{"observed_at":"2026-08-07T11:20:16.168610Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.02858","last_updated":"2025-06-05T04:46:57Z","snapshot_observed_at":"2026-08-09T09:31:21.536819Z","submitted_at":"2025-06-03T13:24:57Z","title":"DGMO: Training-Free Audio Source Separation through Diffusion-Guided Mask Optimization","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.02858","snapshot_observed_at":"2026-08-07T11:20:10.527238Z","title":"A cat is meowing","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.02858","last_updated":"2025-06-05T04:46:57Z","snapshot_observed_at":"2026-08-09T09:31:21.536819Z","submitted_at":"2025-06-03T13:24:57Z","title":"DGMO: Training-Free Audio Source Separation through Diffusion-Guided Mask Optimization","version":2},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-07T11:20:10.527238Z"},"links":{"cited_paper":"/paper/2506.02858","citing_paper":"/paper/2506.02858"},"observation_digest":"sha256:342f419db46401b431230d86e2f812e8d63ea947a6b271f3ca72ab9f13304116","observation_id":"8e6a2bde-34e2-46f8-ae97-4b14ab0815d6","resolution":{"observed_at":"2026-08-07T11:20:10.527238Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:20:16.013882Z","title":null,"venue":null,"work_id":"130a61c9-ff70-42e2-b4be-afef9c663115","year":null},"citing_paper":{"arxiv_id":"2506.02858","last_updated":"2025-06-05T04:46:57Z","snapshot_observed_at":"2026-08-09T09:31:21.536819Z","submitted_at":"2025-06-03T13:24:57Z","title":"DGMO: Training-Free Audio Source Separation through Diffusion-Guided Mask Optimization","version":2},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-07T11:20:10.610196Z"},"links":{"citing_paper":"/paper/2506.02858"},"observation_digest":"sha256:942160cced0982d625c628fa1a8973d60ceb8dfe1efcc8836d5cc272003691f5","observation_id":"d6787cc3-4547-4741-a6eb-39ac8fefe95a","resolution":{"observed_at":"2026-08-07T11:20:16.058705Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:20:15.906335Z","title":"Evaluation Benchmarks For evaluation, we use four publicly available text-aligned au- dio datasets and construct artificial mixtures following prior re- search in LASS [3, 4]","venue":null,"work_id":"188f79e0-89a2-4f46-ba9e-7922bec204e1","year":null},"citing_paper":{"arxiv_id":"2506.02858","last_updated":"2025-06-05T04:46:57Z","snapshot_observed_at":"2026-08-09T09:31:21.536819Z","submitted_at":"2025-06-03T13:24:57Z","title":"DGMO: Training-Free Audio Source Separation through Diffusion-Guided Mask Optimization","version":2},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-07T11:20:10.717988Z"},"links":{"citing_paper":"/paper/2506.02858"},"observation_digest":"sha256:1c3dbf0f89e8fc9ea5b0f4cf88eb77180342a085964fa2da107f66f28e3ce9be","observation_id":"0983e868-166a-4628-8882-11bd21c57549","resolution":{"observed_at":"2026-08-07T11:20:15.945231Z","resolver_source":"raw_fallback","status":"malformed_identifier"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:20:15.799223Z","title":"We analyzed na¨ıve adaptations of diffusion models to LASS and identified key lim- itations","venue":null,"work_id":"f4b6f9fe-ef0b-4ffa-9491-ce9d0dae2003","year":null},"citing_paper":{"arxiv_id":"2506.02858","last_updated":"2025-06-05T04:46:57Z","snapshot_observed_at":"2026-08-09T09:31:21.536819Z","submitted_at":"2025-06-03T13:24:57Z","title":"DGMO: Training-Free Audio Source Separation through Diffusion-Guided Mask Optimization","version":2},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-07T11:20:10.828713Z"},"links":{"citing_paper":"/paper/2506.02858"},"observation_digest":"sha256:8a50b4e8917ef0ac1cb92712001dcdf3dbcdb72723c61e7a8ae161a63f25094c","observation_id":"368ce8af-73b5-4f83-8789-897591f6144a","resolution":{"observed_at":"2026-08-07T11:20:15.865675Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:20:15.687968Z","title":null,"venue":null,"work_id":"1aececd9-d192-400b-85c8-479c63dc9a50","year":2025},"citing_paper":{"arxiv_id":"2506.02858","last_updated":"2025-06-05T04:46:57Z","snapshot_observed_at":"2026-08-09T09:31:21.536819Z","submitted_at":"2025-06-03T13:24:57Z","title":"DGMO: Training-Free Audio Source Separation through Diffusion-Guided Mask Optimization","version":2},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-07T11:20:10.893944Z"},"links":{"citing_paper":"/paper/2506.02858"},"observation_digest":"sha256:2b228774afbed6a035c6f9fecad0c05e905ad3a6078d3541e201e1f4cbe92484","observation_id":"4ef1bfa3-92b5-4227-83db-d16bd2c3c28b","resolution":{"observed_at":"2026-08-07T11:20:15.717558Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:20:10.974188Z","title":"The cocktail party problem,","venue":null,"work_id":null,"year":1902},"citing_paper":{"arxiv_id":"2506.02858","last_updated":"2025-06-05T04:46:57Z","snapshot_observed_at":"2026-08-09T09:31:21.536819Z","submitted_at":"2025-06-03T13:24:57Z","title":"DGMO: Training-Free Audio Source Separation through Diffusion-Guided Mask Optimization","version":2},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-07T11:20:10.974188Z"},"links":{"citing_paper":"/paper/2506.02858"},"observation_digest":"sha256:90662cc09a01316016a146ebc4d6366915ccf5e7087eb880cb971ed556cab6ad","observation_id":"4556db06-61f6-4c29-967e-bbdb7a7513aa","resolution":{"observed_at":"2026-08-07T11:20:10.974188Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:20:15.548199Z","title":"Separate what you describe: Language- queried audio source separation,","venue":null,"work_id":"24c6dc7b-4f46-4299-a5fe-0028bda9d8e4","year":2022},"citing_paper":{"arxiv_id":"2506.02858","last_updated":"2025-06-05T04:46:57Z","snapshot_observed_at":"2026-08-09T09:31:21.536819Z","submitted_at":"2025-06-03T13:24:57Z","title":"DGMO: Training-Free Audio Source Separation through Diffusion-Guided Mask Optimization","version":2},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-07T11:20:11.063353Z"},"links":{"citing_paper":"/paper/2506.02858"},"observation_digest":"sha256:18962ae71f6b99a034b2722c0912b48e5e31f348348586091f2e92902d003176","observation_id":"14f16842-445c-44cf-b9cc-3cca96dc1c57","resolution":{"observed_at":"2026-08-07T11:20:15.593216Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2212.07065","last_updated":"2023-03-03T08:37:38Z","snapshot_observed_at":"2026-08-16T16:08:48.357845Z","submitted_at":"2022-12-14T07:21:45Z","title":"CLIPSep: Learning Text-queried Sound Separation with Noisy Unlabeled Videos","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2212.07065","snapshot_observed_at":"2026-08-07T11:20:11.244437Z","title":"Clipsep: Learning text-queried sound separation with noisy unlabeled videos,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.02858","last_updated":"2025-06-05T04:46:57Z","snapshot_observed_at":"2026-08-09T09:31:21.536819Z","submitted_at":"2025-06-03T13:24:57Z","title":"DGMO: Training-Free Audio Source Separation through Diffusion-Guided Mask Optimization","version":2},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-07T11:20:11.244437Z"},"links":{"cited_paper":"/paper/2212.07065","citing_paper":"/paper/2506.02858"},"observation_digest":"sha256:67428a12c507ceebd3db414e356554c69c99efd113368a9d7be6133711a8d9d9","observation_id":"8a964106-5133-442a-a49c-d84cb42f207e","resolution":{"observed_at":"2026-08-07T11:20:11.244437Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:20:15.431646Z","title":"Separate anything you describe,","venue":null,"work_id":"f4fcf850-cf06-472d-9342-14fa9260f501","year":2024},"citing_paper":{"arxiv_id":"2506.02858","last_updated":"2025-06-05T04:46:57Z","snapshot_observed_at":"2026-08-09T09:31:21.536819Z","submitted_at":"2025-06-03T13:24:57Z","title":"DGMO: Training-Free Audio Source Separation through Diffusion-Guided Mask Optimization","version":2},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-07T11:20:11.354174Z"},"links":{"citing_paper":"/paper/2506.02858"},"observation_digest":"sha256:7909911b7e05c734050a74d87fc55d6741634f2c8c65edf3645aa8c1c90084af","observation_id":"b844ed36-8154-4e28-b38f-f3334d3339d8","resolution":{"observed_at":"2026-08-07T11:20:15.487297Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2409.07614","last_updated":"2025-01-09T15:48:23Z","snapshot_observed_at":"2026-08-16T13:19:19.758378Z","submitted_at":"2024-09-11T20:54:23Z","title":"FlowSep: Language-Queried Sound Separation with Rectified Flow Matching","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.07614","snapshot_observed_at":"2026-08-07T11:20:11.440942Z","title":"Flowsep: Language-queried sound separation with rectified flow matching,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.02858","last_updated":"2025-06-05T04:46:57Z","snapshot_observed_at":"2026-08-09T09:31:21.536819Z","submitted_at":"2025-06-03T13:24:57Z","title":"DGMO: Training-Free Audio Source Separation through Diffusion-Guided Mask Optimization","version":2},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-07T11:20:11.440942Z"},"links":{"cited_paper":"/paper/2409.07614","citing_paper":"/paper/2506.02858"},"observation_digest":"sha256:7b3b9814bdd350b133849eecf0c0ca14c021e45bc7f7493a22620ee8087397c8","observation_id":"a917e2ee-a5c5-49bc-af3c-e64771e6a89f","resolution":{"observed_at":"2026-08-07T11:20:11.440942Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:20:15.306869Z","title":"Soloaudio: Target sound extraction with language-oriented audio diffusion transformer,","venue":null,"work_id":"15337989-485d-4294-a3ae-7a979df82bc5","year":2025},"citing_paper":{"arxiv_id":"2506.02858","last_updated":"2025-06-05T04:46:57Z","snapshot_observed_at":"2026-08-09T09:31:21.536819Z","submitted_at":"2025-06-03T13:24:57Z","title":"DGMO: Training-Free Audio Source Separation through Diffusion-Guided Mask Optimization","version":2},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-07T11:20:11.556063Z"},"links":{"citing_paper":"/paper/2506.02858"},"observation_digest":"sha256:74d0ab8e77ee7abe8a44c6abdc2a5a47ef9cbe30245c64e8f9cebc03a44369d7","observation_id":"903f4d1b-d2bd-4596-86f4-d7152185e606","resolution":{"observed_at":"2026-08-07T11:20:15.359499Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:20:15.215056Z","title":"AudioLDM: Text-to-audio generation with latent diffusion models,","venue":null,"work_id":"553508da-202c-4a3d-a0d9-4675b941f929","year":2023},"citing_paper":{"arxiv_id":"2506.02858","last_updated":"2025-06-05T04:46:57Z","snapshot_observed_at":"2026-08-09T09:31:21.536819Z","submitted_at":"2025-06-03T13:24:57Z","title":"DGMO: Training-Free Audio Source Separation through Diffusion-Guided Mask Optimization","version":2},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-07T11:20:11.666796Z"},"links":{"citing_paper":"/paper/2506.02858"},"observation_digest":"sha256:86dea4c15502206c96f436551fd51d1bd8389915da189e2fb06278dc477ac89a","observation_id":"8956d83f-2fab-48cb-8547-6caf6027c03d","resolution":{"observed_at":"2026-08-07T11:20:15.245854Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:20:15.092354Z","title":"Auffusion: Leveraging the power of diffusion and large language models for text-to-audio generation,","venue":null,"work_id":"112c998a-038f-438b-8171-460f8723804a","year":2024},"citing_paper":{"arxiv_id":"2506.02858","last_updated":"2025-06-05T04:46:57Z","snapshot_observed_at":"2026-08-09T09:31:21.536819Z","submitted_at":"2025-06-03T13:24:57Z","title":"DGMO: Training-Free Audio Source Separation through Diffusion-Guided Mask Optimization","version":2},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-07T11:20:11.756254Z"},"links":{"citing_paper":"/paper/2506.02858"},"observation_digest":"sha256:8d984e6423bdba8c14cef95441037c72156643f2d6408ee732bd7a921f80d2be","observation_id":"d5c9b149-0586-4f27-9776-d68682dabaab","resolution":{"observed_at":"2026-08-07T11:20:15.143106Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2211.13224","last_updated":"2023-06-21T12:35:16Z","snapshot_observed_at":"2026-08-16T20:12:06.010100Z","submitted_at":"2022-11-23T18:59:05Z","title":"Peekaboo: Text to Image Diffusion Models are Zero-Shot Segmentors","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2211.13224","snapshot_observed_at":"2026-08-07T11:20:11.795728Z","title":"Peekaboo: Text to image diffusion models are zero-shot segmentors,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.02858","last_updated":"2025-06-05T04:46:57Z","snapshot_observed_at":"2026-08-09T09:31:21.536819Z","submitted_at":"2025-06-03T13:24:57Z","title":"DGMO: Training-Free Audio Source Separation through Diffusion-Guided Mask Optimization","version":2},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-07T11:20:11.795728Z"},"links":{"cited_paper":"/paper/2211.13224","citing_paper":"/paper/2506.02858"},"observation_digest":"sha256:5febb8f0460f133dfb1720d3fe2041d7172a0cd44b2e497d4f397fdb3a03e403","observation_id":"c9aeeafb-828f-421c-afc0-9446222059b6","resolution":{"observed_at":"2026-08-07T11:20:11.795728Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:20:14.970057Z","title":"Decoupling magnitude and phase estimation with deep resunet for music source separation,","venue":null,"work_id":"5d3e8d44-06a4-49bf-8d15-849ba78665e7","year":2021},"citing_paper":{"arxiv_id":"2506.02858","last_updated":"2025-06-05T04:46:57Z","snapshot_observed_at":"2026-08-09T09:31:21.536819Z","submitted_at":"2025-06-03T13:24:57Z","title":"DGMO: Training-Free Audio Source Separation through Diffusion-Guided Mask Optimization","version":2},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-07T11:20:11.823413Z"},"links":{"citing_paper":"/paper/2506.02858"},"observation_digest":"sha256:220914350c08b550e4eb0de7a4fc81468f580b889297474efe91812f82040c3c","observation_id":"029e9c41-a9df-408f-a42d-55d8e57c6bcc","resolution":{"observed_at":"2026-08-07T11:20:15.034150Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:20:11.874751Z","title":"Supervised speech separation based on deep learning: An overview,","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2506.02858","last_updated":"2025-06-05T04:46:57Z","snapshot_observed_at":"2026-08-09T09:31:21.536819Z","submitted_at":"2025-06-03T13:24:57Z","title":"DGMO: Training-Free Audio Source Separation through Diffusion-Guided Mask Optimization","version":2},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-07T11:20:11.874751Z"},"links":{"citing_paper":"/paper/2506.02858"},"observation_digest":"sha256:97c3ad617c9721ddb4500f08f0a3d765564fe05e1bfee4c4d70fcfa89d892910","observation_id":"5eef99d9-8411-4f41-9f2f-817e05a0a923","resolution":{"observed_at":"2026-08-07T11:20:11.874751Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:20:14.881213Z","title":"Audio prompt tuning for universal sound separation,","venue":null,"work_id":"40822da7-9c37-4ce5-a69b-331b0336baf2","year":2024},"citing_paper":{"arxiv_id":"2506.02858","last_updated":"2025-06-05T04:46:57Z","snapshot_observed_at":"2026-08-09T09:31:21.536819Z","submitted_at":"2025-06-03T13:24:57Z","title":"DGMO: Training-Free Audio Source Separation through Diffusion-Guided Mask Optimization","version":2},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-07T11:20:11.944020Z"},"links":{"citing_paper":"/paper/2506.02858"},"observation_digest":"sha256:ab5551b0d41d90e92051281c9c40ce173f6fc0601706faf0e9b49898b3b47103","observation_id":"deafc59a-f6bf-4b8a-84f6-28c56046e604","resolution":{"observed_at":"2026-08-07T11:20:14.915476Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:20:14.768228Z","title":"The sound of pixels,","venue":null,"work_id":"b67cf581-97c8-4c59-a820-c1d894068a47","year":2018},"citing_paper":{"arxiv_id":"2506.02858","last_updated":"2025-06-05T04:46:57Z","snapshot_observed_at":"2026-08-09T09:31:21.536819Z","submitted_at":"2025-06-03T13:24:57Z","title":"DGMO: Training-Free Audio Source Separation through Diffusion-Guided Mask Optimization","version":2},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-07T11:20:12.009360Z"},"links":{"citing_paper":"/paper/2506.02858"},"observation_digest":"sha256:7393ff3c87d930383ccfeac882568030d50f2f1cab47d61fcf0ee67e95a3b9f0","observation_id":"678e251f-e077-4673-896f-622404135c97","resolution":{"observed_at":"2026-08-07T11:20:14.777697Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2305.07447","last_updated":"2023-05-11T16:41:55Z","snapshot_observed_at":"2026-08-16T15:33:47.607537Z","submitted_at":"2023-05-11T16:41:55Z","title":"Universal Source Separation with Weakly Labelled Data","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.07447","snapshot_observed_at":"2026-08-07T11:20:12.058900Z","title":"Universal source separation with weakly labelled data,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.02858","last_updated":"2025-06-05T04:46:57Z","snapshot_observed_at":"2026-08-09T09:31:21.536819Z","submitted_at":"2025-06-03T13:24:57Z","title":"DGMO: Training-Free Audio Source Separation through Diffusion-Guided Mask Optimization","version":2},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-07T11:20:12.058900Z"},"links":{"cited_paper":"/paper/2305.07447","citing_paper":"/paper/2506.02858"},"observation_digest":"sha256:a24adce8c4fe1a993f3228f0aca7e1ba0c25a17e1597bb35930dc65c854fcb8a","observation_id":"9693f69d-5c97-4016-84f6-3e137b64aac6","resolution":{"observed_at":"2026-08-07T11:20:12.058900Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:20:12.147368Z","title":"Clap learning audio concepts from natural language supervision,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.02858","last_updated":"2025-06-05T04:46:57Z","snapshot_observed_at":"2026-08-09T09:31:21.536819Z","submitted_at":"2025-06-03T13:24:57Z","title":"DGMO: Training-Free Audio Source Separation through Diffusion-Guided Mask Optimization","version":2},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-07T11:20:12.147368Z"},"links":{"citing_paper":"/paper/2506.02858"},"observation_digest":"sha256:e6f6eceeaed2dd3a5360d672bfd8d4b6ad083cbe435be43963f3480a418d6010","observation_id":"2d6b60f5-3ca0-41ed-a9aa-542cb915cc1a","resolution":{"observed_at":"2026-08-07T11:20:12.147368Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:20:12.196924Z","title":"Large-scale contrastive language-audio pretraining with feature fusion and keyword-to-caption augmentation,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.02858","last_updated":"2025-06-05T04:46:57Z","snapshot_observed_at":"2026-08-09T09:31:21.536819Z","submitted_at":"2025-06-03T13:24:57Z","title":"DGMO: Training-Free Audio Source Separation through Diffusion-Guided Mask Optimization","version":2},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-07T11:20:12.196924Z"},"links":{"citing_paper":"/paper/2506.02858"},"observation_digest":"sha256:38e3e5813d1cb65951b5e989f625137526f7b582c3317559e1598b4baf5181da","observation_id":"765e424b-e437-4524-8423-b41b99adceb0","resolution":{"observed_at":"2026-08-07T11:20:12.196924Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:20:12.246500Z","title":"Learning transferable visual models from natural language supervision,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2506.02858","last_updated":"2025-06-05T04:46:57Z","snapshot_observed_at":"2026-08-09T09:31:21.536819Z","submitted_at":"2025-06-03T13:24:57Z","title":"DGMO: Training-Free Audio Source Separation through Diffusion-Guided Mask Optimization","version":2},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-07T11:20:12.246500Z"},"links":{"citing_paper":"/paper/2506.02858"},"observation_digest":"sha256:5d3eba20d1e13beccc461ba4d8442dd4e5837ef20a4ea598d8b177e912faff28","observation_id":"575fff8e-8e70-452f-a38e-812406972e90","resolution":{"observed_at":"2026-08-07T11:20:12.246500Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:20:12.346292Z","title":"High-resolution image synthesis with latent diffusion models,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2506.02858","last_updated":"2025-06-05T04:46:57Z","snapshot_observed_at":"2026-08-09T09:31:21.536819Z","submitted_at":"2025-06-03T13:24:57Z","title":"DGMO: Training-Free Audio Source Separation through Diffusion-Guided Mask Optimization","version":2},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-07T11:20:12.346292Z"},"links":{"citing_paper":"/paper/2506.02858"},"observation_digest":"sha256:4f38ec854241bfbe281cd53e27685034cd20f474159f4e83c6b49acfe7a8cbdf","observation_id":"714a1fc6-0a7b-43be-9598-4c8cea034175","resolution":{"observed_at":"2026-08-07T11:20:12.346292Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:20:14.593713Z","title":"Scaling rectified flow transformers for high-resolution im- age synthesis,","venue":null,"work_id":"68fe3322-2449-4bd5-8127-efe420f9ef88","year":2024},"citing_paper":{"arxiv_id":"2506.02858","last_updated":"2025-06-05T04:46:57Z","snapshot_observed_at":"2026-08-09T09:31:21.536819Z","submitted_at":"2025-06-03T13:24:57Z","title":"DGMO: Training-Free Audio Source Separation through Diffusion-Guided Mask Optimization","version":2},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-07T11:20:12.472817Z"},"links":{"citing_paper":"/paper/2506.02858"},"observation_digest":"sha256:c4d1d2b24403e6579806be92c0ed5f2f7e822d7b1678626fa1560c67839a6914","observation_id":"8d17d801-b83d-4b2d-87bc-8e82dd0dd970","resolution":{"observed_at":"2026-08-07T11:20:14.653854Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:20:14.400790Z","title":"Audioldm 2: Learn- ing holistic audio generation with self-supervised pretraining,","venue":null,"work_id":"c0cdc583-4b0d-449b-b572-3ce408dfbfa7","year":2024},"citing_paper":{"arxiv_id":"2506.02858","last_updated":"2025-06-05T04:46:57Z","snapshot_observed_at":"2026-08-09T09:31:21.536819Z","submitted_at":"2025-06-03T13:24:57Z","title":"DGMO: Training-Free Audio Source Separation through Diffusion-Guided Mask Optimization","version":2},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-07T11:20:12.684722Z"},"links":{"citing_paper":"/paper/2506.02858"},"observation_digest":"sha256:fa5a8065d58e1f5154157060dc69328e8c84aa41ef7a77bf2a43e899d6983ecc","observation_id":"35410eda-d571-4f80-833f-3af867b0e9d1","resolution":{"observed_at":"2026-08-07T11:20:14.503985Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2209.14988","last_updated":"2022-09-29T17:50:40Z","snapshot_observed_at":"2026-07-06T13:57:54.539656Z","submitted_at":"2022-09-29T17:50:40Z","title":"DreamFusion: Text-to-3D using 2D Diffusion","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2209.14988","snapshot_observed_at":"2026-08-07T11:20:12.794540Z","title":"Dreamfusion: Text-to-3d using 2d diffusion,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.02858","last_updated":"2025-06-05T04:46:57Z","snapshot_observed_at":"2026-08-09T09:31:21.536819Z","submitted_at":"2025-06-03T13:24:57Z","title":"DGMO: Training-Free Audio Source Separation through Diffusion-Guided Mask Optimization","version":2},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-07T11:20:12.794540Z"},"links":{"cited_paper":"/paper/2209.14988","citing_paper":"/paper/2506.02858"},"observation_digest":"sha256:384d08cef35fef37b35f8a80193fa8ecb763f3f658c858a7ff6b2c3519d70d37","observation_id":"33d4b280-65cc-4e86-b0e9-ee9b9fc37e1b","resolution":{"observed_at":"2026-08-07T11:20:12.794540Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:20:14.259153Z","title":"Audit: Audio editing by following instructions with latent diffusion models,","venue":null,"work_id":"bb3ad8c0-6fc9-4b96-817b-f0598f5c6e8d","year":2023},"citing_paper":{"arxiv_id":"2506.02858","last_updated":"2025-06-05T04:46:57Z","snapshot_observed_at":"2026-08-09T09:31:21.536819Z","submitted_at":"2025-06-03T13:24:57Z","title":"DGMO: Training-Free Audio Source Separation through Diffusion-Guided Mask Optimization","version":2},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-07T11:20:12.928502Z"},"links":{"citing_paper":"/paper/2506.02858"},"observation_digest":"sha256:ae5dd0bd2ce1846b5392c224509644a1ca6473f389e32668d3145c6827950d79","observation_id":"ee82518c-9729-45d4-a81d-3b102481b868","resolution":{"observed_at":"2026-08-07T11:20:14.328497Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.04350","last_updated":"2024-05-11T07:41:27Z","snapshot_observed_at":"2026-08-16T13:53:34.394133Z","submitted_at":"2024-05-11T07:41:27Z","title":"Prompt-guided Precise Audio Editing with Diffusion Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.04350","snapshot_observed_at":"2026-08-07T11:20:12.940408Z","title":"Prompt-guided precise audio editing with diffusion models,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.02858","last_updated":"2025-06-05T04:46:57Z","snapshot_observed_at":"2026-08-09T09:31:21.536819Z","submitted_at":"2025-06-03T13:24:57Z","title":"DGMO: Training-Free Audio Source Separation through Diffusion-Guided Mask Optimization","version":2},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-07T11:20:12.940408Z"},"links":{"cited_paper":"/paper/2406.04350","citing_paper":"/paper/2506.02858"},"observation_digest":"sha256:b3358bc3323c514da6b6a954d303f190692426e2916e40faf51eddd69d44c7d3","observation_id":"bd3e8d42-2b0b-4fd7-a75c-79cfcd9c54ab","resolution":{"observed_at":"2026-08-07T11:20:12.940408Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2010.02502","last_updated":"2022-10-05T20:19:21Z","snapshot_observed_at":"2026-08-11T15:38:14.931716Z","submitted_at":"2020-10-06T06:15:51Z","title":"Denoising Diffusion Implicit Models","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2010.02502","snapshot_observed_at":"2026-08-07T11:20:13.013086Z","title":"Denoising diffusion implicit models,","venue":null,"work_id":null,"year":2010},"citing_paper":{"arxiv_id":"2506.02858","last_updated":"2025-06-05T04:46:57Z","snapshot_observed_at":"2026-08-09T09:31:21.536819Z","submitted_at":"2025-06-03T13:24:57Z","title":"DGMO: Training-Free Audio Source Separation through Diffusion-Guided Mask Optimization","version":2},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-07T11:20:13.013086Z"},"links":{"cited_paper":"/paper/2010.02502","citing_paper":"/paper/2506.02858"},"observation_digest":"sha256:465016a4fa1f4d297df418a5018370d76ec2a5609e043b1fae6d70423fbf7390","observation_id":"044df5ff-48ac-4fbf-95dd-ed2120f0f158","resolution":{"observed_at":"2026-08-07T11:20:13.013086Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2211.09794","last_updated":"2022-11-17T18:58:14Z","snapshot_observed_at":"2026-08-16T16:15:18.430181Z","submitted_at":"2022-11-17T18:58:14Z","title":"Null-text Inversion for Editing Real Images using Guided Diffusion Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2211.09794","snapshot_observed_at":"2026-08-07T11:20:13.087528Z","title":"Null-text inversion for editing real images using guided diffusion models,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.02858","last_updated":"2025-06-05T04:46:57Z","snapshot_observed_at":"2026-08-09T09:31:21.536819Z","submitted_at":"2025-06-03T13:24:57Z","title":"DGMO: Training-Free Audio Source Separation through Diffusion-Guided Mask Optimization","version":2},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-07T11:20:13.087528Z"},"links":{"cited_paper":"/paper/2211.09794","citing_paper":"/paper/2506.02858"},"observation_digest":"sha256:9515dbcb6a4dca915a456f57f3eeff7f3d05df1616e72a61ba5526ba4694ffc0","observation_id":"950eb791-2843-44f9-b1c3-f8deb46445bd","resolution":{"observed_at":"2026-08-07T11:20:13.087528Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:20:14.127242Z","title":"Denoising diffusion probabilis- tic models,","venue":null,"work_id":"87790321-63a1-434d-8799-3dccf31affc2","year":2020},"citing_paper":{"arxiv_id":"2506.02858","last_updated":"2025-06-05T04:46:57Z","snapshot_observed_at":"2026-08-09T09:31:21.536819Z","submitted_at":"2025-06-03T13:24:57Z","title":"DGMO: Training-Free Audio Source Separation through Diffusion-Guided Mask Optimization","version":2},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-07T11:20:13.146581Z"},"links":{"citing_paper":"/paper/2506.02858"},"observation_digest":"sha256:62a0905d1fb1538f7f14821ec92f894f48e56740e15e4875ceee6ecab7dcb9d2","observation_id":"c472c1d8-c0f8-4e9c-aef7-671feb4a1921","resolution":{"observed_at":"2026-08-07T11:20:14.166897Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:20:13.179546Z","title":"Vggsound: A large-scale audio-visual dataset,","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2506.02858","last_updated":"2025-06-05T04:46:57Z","snapshot_observed_at":"2026-08-09T09:31:21.536819Z","submitted_at":"2025-06-03T13:24:57Z","title":"DGMO: Training-Free Audio Source Separation through Diffusion-Guided Mask Optimization","version":2},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-07T11:20:13.179546Z"},"links":{"citing_paper":"/paper/2506.02858"},"observation_digest":"sha256:ad9b23642cc6edb296bde3813651094ca0227b2b14f03129f4dbd6fca77bf0d0","observation_id":"1fde0118-37e4-4628-8550-8a7155b42d7e","resolution":{"observed_at":"2026-08-07T11:20:13.179546Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:20:14.003007Z","title":"Audiocaps: Generating captions for audios in the wild,","venue":null,"work_id":"191c084c-d535-40a8-9d78-ee76388179f0","year":2019},"citing_paper":{"arxiv_id":"2506.02858","last_updated":"2025-06-05T04:46:57Z","snapshot_observed_at":"2026-08-09T09:31:21.536819Z","submitted_at":"2025-06-03T13:24:57Z","title":"DGMO: Training-Free Audio Source Separation through Diffusion-Guided Mask Optimization","version":2},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-07T11:20:13.220297Z"},"links":{"citing_paper":"/paper/2506.02858"},"observation_digest":"sha256:212e9d0c05b5234e419c0a35e9318eee12d7a4f6607e759c6141b235836aa516","observation_id":"9522a672-3b76-4f25-bd6e-32cf4760e242","resolution":{"observed_at":"2026-08-07T11:20:14.047176Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:20:13.937082Z","title":"Esc: Dataset for environmental sound classifica- tion,","venue":null,"work_id":"e3a8ffa7-e7c1-4c14-8bed-cbb54aea1031","year":2015},"citing_paper":{"arxiv_id":"2506.02858","last_updated":"2025-06-05T04:46:57Z","snapshot_observed_at":"2026-08-09T09:31:21.536819Z","submitted_at":"2025-06-03T13:24:57Z","title":"DGMO: Training-Free Audio Source Separation through Diffusion-Guided Mask Optimization","version":2},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-07T11:20:13.261415Z"},"links":{"citing_paper":"/paper/2506.02858"},"observation_digest":"sha256:490260822de3a40298b8fa02df2adb54d7afa83c285e9c6205e63472e0a660d7","observation_id":"579e4005-c0fd-4561-89c8-d0570b8c65a7","resolution":{"observed_at":"2026-08-07T11:20:13.972616Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:20:13.300750Z","title":"Sdr– half-baked or well done?","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2506.02858","last_updated":"2025-06-05T04:46:57Z","snapshot_observed_at":"2026-08-09T09:31:21.536819Z","submitted_at":"2025-06-03T13:24:57Z","title":"DGMO: Training-Free Audio Source Separation through Diffusion-Guided Mask Optimization","version":2},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-07T11:20:13.300750Z"},"links":{"citing_paper":"/paper/2506.02858"},"observation_digest":"sha256:a17b71c96330144274aa09cc768384ee4f325a37196d2ac3da3c2dc3c3a77888","observation_id":"a7b86e79-094f-4089-af53-41a7c86876e3","resolution":{"observed_at":"2026-08-07T11:20:13.300750Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:20:13.862235Z","title":"A reference-free metric for language- queried audio source separation using contrastive language-audio pretraining,","venue":null,"work_id":"9554d0b7-5d2c-4e56-91c1-9667363d92ed","year":2024},"citing_paper":{"arxiv_id":"2506.02858","last_updated":"2025-06-05T04:46:57Z","snapshot_observed_at":"2026-08-09T09:31:21.536819Z","submitted_at":"2025-06-03T13:24:57Z","title":"DGMO: Training-Free Audio Source Separation through Diffusion-Guided Mask Optimization","version":2},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-07T11:20:13.336498Z"},"links":{"citing_paper":"/paper/2506.02858"},"observation_digest":"sha256:56ff4dd8e29471b7f3856f59d25c7c9c4acc9ee2856ec6343ec5df8db18ffa79","observation_id":"75c1793f-cb8b-4bdd-80f6-26a4aa6272a0","resolution":{"observed_at":"2026-08-07T11:20:13.884572Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1810.04805","last_updated":"2019-05-24T20:37:26Z","snapshot_observed_at":"2026-08-14T18:16:28.847993Z","submitted_at":"2018-10-11T00:50:01Z","title":"BERT: Pre-training of Deep Bidirectional Transformers for Language Understanding","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1810.04805","snapshot_observed_at":"2026-08-07T11:20:13.370915Z","title":"Bert: Pre-training of deep bidirectional transformers for language understanding,","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2506.02858","last_updated":"2025-06-05T04:46:57Z","snapshot_observed_at":"2026-08-09T09:31:21.536819Z","submitted_at":"2025-06-03T13:24:57Z","title":"DGMO: Training-Free Audio Source Separation through Diffusion-Guided Mask Optimization","version":2},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-07T11:20:13.370915Z"},"links":{"cited_paper":"/paper/1810.04805","citing_paper":"/paper/2506.02858"},"observation_digest":"sha256:cf7ca0280c8ce00ff2e80948ba085c2fff3a253014416982cdd1a0bfa57fbd3b","observation_id":"cc63a523-42ec-4b29-9573-1b1a4e2df93e","resolution":{"observed_at":"2026-08-07T11:20:13.370915Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:20:13.757748Z","title":"Resunet- a: A deep learning framework for semantic segmentation of re- motely sensed data,","venue":null,"work_id":"a4c2c043-42c7-40d7-96ca-416a8ee34eec","year":2020},"citing_paper":{"arxiv_id":"2506.02858","last_updated":"2025-06-05T04:46:57Z","snapshot_observed_at":"2026-08-09T09:31:21.536819Z","submitted_at":"2025-06-03T13:24:57Z","title":"DGMO: Training-Free Audio Source Separation through Diffusion-Guided Mask Optimization","version":2},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-07T11:20:13.403631Z"},"links":{"citing_paper":"/paper/2506.02858"},"observation_digest":"sha256:61bf897b9cb4df269cb8993386c3031fdeda41868a77458bdee3bc976ffadc0a","observation_id":"ca76cfd0-fcf3-4ded-9418-3875f2d6753d","resolution":{"observed_at":"2026-08-07T11:20:13.803825Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:20:13.667008Z","title":"Clotho: an audio cap- tioning dataset,","venue":null,"work_id":"75dd1255-e503-49c2-8206-2ce901bf7506","year":2020},"citing_paper":{"arxiv_id":"2506.02858","last_updated":"2025-06-05T04:46:57Z","snapshot_observed_at":"2026-08-09T09:31:21.536819Z","submitted_at":"2025-06-03T13:24:57Z","title":"DGMO: Training-Free Audio Source Separation through Diffusion-Guided Mask Optimization","version":2},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-07T11:20:13.434436Z"},"links":{"citing_paper":"/paper/2506.02858"},"observation_digest":"sha256:ab4446e4b258e37e82b6eeccb8c5056f155086accae25f7b0d5406552de0808c","observation_id":"624856e4-e0a2-49f4-835d-207f6517c8d2","resolution":{"observed_at":"2026-08-07T11:20:13.698592Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2506.02858","last_updated":"2025-06-05T04:46:57Z","latest_version":2,"primary_category":"eess.AS","snapshot_observed_at":"2026-08-09T09:31:21.536819Z","submitted_at":"2025-06-03T13:24:57Z","title":"DGMO: Training-Free Audio Source Separation through Diffusion-Guided Mask Optimization"},"reference_resolution":{"displayed":40,"state_counts":{"malformed_identifier":1,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":20,"verified_exact":0,"verified_fuzzy":19},"total_outbound_references":40},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"thesis":"As of 18 August 2026, this Paper Citation Record lists 40 of 40 outbound references and 2 inbound Pith citation observations for arXiv:2506.02858."}