{"as_of":"2026-08-12T14:11:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:0d2a65b1486faae737a2ca2aab89cf7f3d91eea47fbb3dee5c18a668bfaecc52","coverage":[{"denominator":41,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":41,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T10:53:18.476414Z","state":"measured"},{"denominator":41,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":41,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-12T06:34:41.77262+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2506.04214/citation-record","integrity":"/paper/2506.04214/integrity","json":"/paper/2506.04214/citation-record.json","paper":"/paper/2506.04214"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:53:22.844932Z","title":"S., and Zisserman, A","venue":null,"work_id":"9680aa78-24a5-444e-9a46-05247f967978","year":2020},"citing_paper":{"arxiv_id":"2506.04214","last_updated":"2025-06-04T17:57:26Z","snapshot_observed_at":"2026-08-11T05:04:18.403350Z","submitted_at":"2025-06-04T17:57:26Z","title":"Sounding that Object: Interactive Object-Aware Image to Audio Generation","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-07T10:53:14.166587Z"},"links":{"citing_paper":"/paper/2506.04214"},"observation_digest":"sha256:9ee0e0013d5090d2e47868d8732c86062c59859de3df20691cef7f28c14f3bc6","observation_id":"e79acf52-0658-4e85-9d0d-4c7491b25a18","resolution":{"observed_at":"2026-08-07T10:53:22.979644Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:53:19.382938Z","title":"Effect of positional encoding.We assess the impact of positional encoding (PE) on our model’s performance","venue":null,"work_id":"70f629df-e6d1-4d97-83a8-d0361b28bf4b","year":2024},"citing_paper":{"arxiv_id":"2506.04214","last_updated":"2025-06-04T17:57:26Z","snapshot_observed_at":"2026-08-11T05:04:18.403350Z","submitted_at":"2025-06-04T17:57:26Z","title":"Sounding that Object: Interactive Object-Aware Image to Audio Generation","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-07T10:53:18.261352Z"},"links":{"citing_paper":"/paper/2506.04214"},"observation_digest":"sha256:9063b77be203f0b573d143289ff1717cad927e48c05277e838d776d6b0208d86","observation_id":"690029ba-d601-4347-8455-815102b30820","resolution":{"observed_at":"2026-08-07T10:53:19.495273Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:53:15.135183Z","title":"L., Wu, H.-H., Salamon, J., and Bello, J","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2506.04214","last_updated":"2025-06-04T17:57:26Z","snapshot_observed_at":"2026-08-11T05:04:18.403350Z","submitted_at":"2025-06-04T17:57:26Z","title":"Sounding that Object: Interactive Object-Aware Image to Audio Generation","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-07T10:53:15.135183Z"},"links":{"citing_paper":"/paper/2506.04214"},"observation_digest":"sha256:4f09d4e0980a1326c7411a1864910d4bb384d5829560126237451553386de55a","observation_id":"f34a7d41-b1ed-4f67-8430-9330dc8265c9","resolution":{"observed_at":"2026-08-07T10:53:15.135183Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1810.04805","last_updated":"2019-05-24T20:37:26Z","snapshot_observed_at":"2026-07-30T09:12:38.100527Z","submitted_at":"2018-10-11T00:50:01Z","title":"BERT: Pre-training of Deep Bidirectional Transformers for Language Understanding","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1810.04805","snapshot_observed_at":"2026-08-07T10:53:15.258122Z","title":"Bert: Pre-training of deep bidirectional trans- formers for language understanding.arXiv preprint arXiv:1810.04805,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.04214","last_updated":"2025-06-04T17:57:26Z","snapshot_observed_at":"2026-08-11T05:04:18.403350Z","submitted_at":"2025-06-04T17:57:26Z","title":"Sounding that Object: Interactive Object-Aware Image to Audio Generation","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-07T10:53:15.258122Z"},"links":{"cited_paper":"/paper/1810.04805","citing_paper":"/paper/2506.04214"},"observation_digest":"sha256:f9b01d4f8f49c0f2ac1d676bd75b4c756b9a25f1ba54b7fcc862d0eedab565ad","observation_id":"24645505-7d44-4ab5-ab66-924f51f1f9f0","resolution":{"observed_at":"2026-08-07T10:53:15.258122Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2212.07065","last_updated":"2023-03-03T08:37:38Z","snapshot_observed_at":"2026-08-10T01:58:48.074780Z","submitted_at":"2022-12-14T07:21:45Z","title":"CLIPSep: Learning Text-queried Sound Separation with Noisy Unlabeled Videos","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2212.07065","snapshot_observed_at":"2026-08-07T10:53:15.412519Z","title":"Clipsep: Learning text-queried sound separation with noisy unlabeled videos.arXiv preprint arXiv:2212.07065,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.04214","last_updated":"2025-06-04T17:57:26Z","snapshot_observed_at":"2026-08-11T05:04:18.403350Z","submitted_at":"2025-06-04T17:57:26Z","title":"Sounding that Object: Interactive Object-Aware Image to Audio Generation","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-07T10:53:15.412519Z"},"links":{"cited_paper":"/paper/2212.07065","citing_paper":"/paper/2506.04214"},"observation_digest":"sha256:bb2a30722a08f0d19d0d1fc72fcb8d2e0cef28ee18bc357203ee4c89643edde7","observation_id":"2ab79958-5864-400b-b386-d8ed413de65b","resolution":{"observed_at":"2026-08-07T10:53:15.412519Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:53:19.581907Z","title":"We randomly selected 100 samples for evaluation, each rated by 50 unique participants to ensure reliability","venue":null,"work_id":"73496e73-fc5e-4305-bb71-7bd27c7c77a2","year":2012},"citing_paper":{"arxiv_id":"2506.04214","last_updated":"2025-06-04T17:57:26Z","snapshot_observed_at":"2026-08-11T05:04:18.403350Z","submitted_at":"2025-06-04T17:57:26Z","title":"Sounding that Object: Interactive Object-Aware Image to Audio Generation","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-07T10:53:18.190175Z"},"links":{"citing_paper":"/paper/2506.04214"},"observation_digest":"sha256:2a1c449b783e42e0b4f57ef95b920c284001b2cc3a969f4de20ac0baef3996de","observation_id":"b84b5353-d282-4f1d-b3e2-4fb45c42dbfe","resolution":{"observed_at":"2026-08-07T10:53:19.678359Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:53:21.927551Z","title":"B., and Tor- ralba, A","venue":null,"work_id":"1bf08e27-e668-4bcb-8e0a-55e7731e41ca","year":2020},"citing_paper":{"arxiv_id":"2506.04214","last_updated":"2025-06-04T17:57:26Z","snapshot_observed_at":"2026-08-11T05:04:18.403350Z","submitted_at":"2025-06-04T17:57:26Z","title":"Sounding that Object: Interactive Object-Aware Image to Audio Generation","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-07T10:53:15.903051Z"},"links":{"citing_paper":"/paper/2506.04214"},"observation_digest":"sha256:2eca58daa8c48946433108b225cee70d26538160f4d1ad6e3e6e69d97a31e8b2","observation_id":"306f4733-c98d-4a9a-a73c-6f422635d477","resolution":{"observed_at":"2026-08-07T10:53:22.041748Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2411.15447","last_updated":"2025-08-12T04:20:41Z","snapshot_observed_at":"2026-08-12T01:16:41.259704Z","submitted_at":"2024-11-23T04:27:19Z","title":"Gotta Hear Them All: Towards Sound Source Aware Audio Generation","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.15447","snapshot_observed_at":"2026-08-07T10:53:16.014440Z","title":"Gotta hear them all: Sound source aware vision to audio generation.arXiv preprint arXiv:2411.15447,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.04214","last_updated":"2025-06-04T17:57:26Z","snapshot_observed_at":"2026-08-11T05:04:18.403350Z","submitted_at":"2025-06-04T17:57:26Z","title":"Sounding that Object: Interactive Object-Aware Image to Audio Generation","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-07T10:53:16.014440Z"},"links":{"cited_paper":"/paper/2411.15447","citing_paper":"/paper/2506.04214"},"observation_digest":"sha256:1048b5f1b8b9da0e7131cb854247835726bd254320cd7117f7a5341222061603","observation_id":"03ba7b75-97c6-4683-9c90-352d36f6924d","resolution":{"observed_at":"2026-08-07T10:53:16.014440Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2207.12598","last_updated":"2022-07-26T01:42:07Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-07-26T01:42:07Z","title":"Classifier-Free Diffusion Guidance","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2207.12598","snapshot_observed_at":"2026-08-07T10:53:16.085528Z","title":"and Salimans, T","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.04214","last_updated":"2025-06-04T17:57:26Z","snapshot_observed_at":"2026-08-11T05:04:18.403350Z","submitted_at":"2025-06-04T17:57:26Z","title":"Sounding that Object: Interactive Object-Aware Image to Audio Generation","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-07T10:53:16.085528Z"},"links":{"cited_paper":"/paper/2207.12598","citing_paper":"/paper/2506.04214"},"observation_digest":"sha256:4cbb08da43089e0e70d380c6fdf7e0b64f8268f2fb82e68b7766bdc1a8154794","observation_id":"15194fdf-c0ab-4eaf-b1f4-3b133068b7b8","resolution":{"observed_at":"2026-08-07T10:53:16.085528Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:53:16.285900Z","title":"D., Kim, B., Lee, H., and Kim, G","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2506.04214","last_updated":"2025-06-04T17:57:26Z","snapshot_observed_at":"2026-08-11T05:04:18.403350Z","submitted_at":"2025-06-04T17:57:26Z","title":"Sounding that Object: Interactive Object-Aware Image to Audio Generation","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-07T10:53:16.285900Z"},"links":{"citing_paper":"/paper/2506.04214"},"observation_digest":"sha256:91ab7d301e504335a4a4a3ff0ffb8019cec81bccb6c042581b2f96b9cf3a72f4","observation_id":"352ceb62-d23f-43df-85a7-88a5ea815f5b","resolution":{"observed_at":"2026-08-07T10:53:16.285900Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:53:21.306801Z","title":"Hifi-gan: Generative ad- versarial networks for efficient and high fidelity speech synthesis.Advances in Neural Information Processing Systems, 33:17022–17033, 2020a","venue":null,"work_id":"524766da-09ca-4662-8ec4-d4a1e7541e3a","year":2019},"citing_paper":{"arxiv_id":"2506.04214","last_updated":"2025-06-04T17:57:26Z","snapshot_observed_at":"2026-08-11T05:04:18.403350Z","submitted_at":"2025-06-04T17:57:26Z","title":"Sounding that Object: Interactive Object-Aware Image to Audio Generation","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-07T10:53:16.567043Z"},"links":{"citing_paper":"/paper/2506.04214"},"observation_digest":"sha256:9a4cd10dfa0f655f12989fdb26c1af9dde600880bc63e459b201d8365f48f7b3","observation_id":"96613bab-25e7-4572-a390-b5f75b4c23af","resolution":{"observed_at":"2026-08-07T10:53:21.367734Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2304.06818","last_updated":"2023-04-13T20:56:53Z","snapshot_observed_at":"2026-08-01T16:07:10.401914Z","submitted_at":"2023-04-13T20:56:53Z","title":"Soundini: Sound-Guided Diffusion for Natural Video Editing","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2304.06818","snapshot_observed_at":"2026-08-07T10:53:16.636613Z","title":"H., Kim, S., Yoo, I., Yang, F., Cho, D., Kim, Y ., Chang, H., Kim, J., and Kim, S","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.04214","last_updated":"2025-06-04T17:57:26Z","snapshot_observed_at":"2026-08-11T05:04:18.403350Z","submitted_at":"2025-06-04T17:57:26Z","title":"Sounding that Object: Interactive Object-Aware Image to Audio Generation","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-07T10:53:16.636613Z"},"links":{"cited_paper":"/paper/2304.06818","citing_paper":"/paper/2506.04214"},"observation_digest":"sha256:8a866ea04066628b1736bf01c0b8910d27696a72086c133e40c1158a39dd71da","observation_id":"1ae440de-da3b-4066-a714-4e99af60fb63","resolution":{"observed_at":"2026-08-07T10:53:16.636613Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1711.05101","last_updated":"2019-01-04T21:01:49Z","snapshot_observed_at":"2026-08-09T20:34:52.923500Z","submitted_at":"2017-11-14T14:24:06Z","title":"Decoupled Weight Decay Regularization","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1711.05101","snapshot_observed_at":"2026-08-07T10:53:16.702062Z","title":"and Hutter, F","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.04214","last_updated":"2025-06-04T17:57:26Z","snapshot_observed_at":"2026-08-11T05:04:18.403350Z","submitted_at":"2025-06-04T17:57:26Z","title":"Sounding that Object: Interactive Object-Aware Image to Audio Generation","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-07T10:53:16.702062Z"},"links":{"cited_paper":"/paper/1711.05101","citing_paper":"/paper/2506.04214"},"observation_digest":"sha256:2912cecaf9b4bb9d81a441541faec034c0c3f57689fd217e1f5b8c3de28bf4ae","observation_id":"a6df55b8-a4a8-4bb8-9fb1-8b679d97c704","resolution":{"observed_at":"2026-08-07T10:53:16.702062Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1807.03748","last_updated":"2019-01-22T18:47:12Z","snapshot_observed_at":"2026-07-06T06:49:24.960992Z","submitted_at":"2018-07-10T16:52:11Z","title":"Representation Learning with Contrastive Predictive Coding","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1807.03748","snapshot_observed_at":"2026-08-07T10:53:16.890076Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.04214","last_updated":"2025-06-04T17:57:26Z","snapshot_observed_at":"2026-08-11T05:04:18.403350Z","submitted_at":"2025-06-04T17:57:26Z","title":"Sounding that Object: Interactive Object-Aware Image to Audio Generation","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-07T10:53:16.890076Z"},"links":{"cited_paper":"/paper/1807.03748","citing_paper":"/paper/2506.04214"},"observation_digest":"sha256:30b83a195d09ce8afe558743592091e99c025377110e7549db50352dcc4a2c33","observation_id":"e044c547-1dba-4001-add8-0f90575d7d5b","resolution":{"observed_at":"2026-08-07T10:53:16.890076Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:53:21.113443Z","title":"A., Zhang, R., and Zhu, J.-Y","venue":null,"work_id":"6785d12d-9365-4838-afef-48a3775d6f94","year":2020},"citing_paper":{"arxiv_id":"2506.04214","last_updated":"2025-06-04T17:57:26Z","snapshot_observed_at":"2026-08-11T05:04:18.403350Z","submitted_at":"2025-06-04T17:57:26Z","title":"Sounding that Object: Interactive Object-Aware Image to Audio Generation","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-07T10:53:17.029469Z"},"links":{"citing_paper":"/paper/2506.04214"},"observation_digest":"sha256:8a183d123a1bf30c25f80969be6dbcceb703f629c3a3e8f69792a8488bea9537","observation_id":"fab05a56-1416-46ff-9cb6-7079b351df7b","resolution":{"observed_at":"2026-08-07T10:53:21.187264Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2408.00714","last_updated":"2024-10-28T16:37:57Z","snapshot_observed_at":"2026-07-06T18:55:41.459417Z","submitted_at":"2024-08-01T17:00:08Z","title":"SAM 2: Segment Anything in Images and Videos","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.00714","snapshot_observed_at":"2026-08-07T10:53:17.123505Z","title":"Sam 2: Segment anything in images and videos.arXiv preprint arXiv:2408.00714,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.04214","last_updated":"2025-06-04T17:57:26Z","snapshot_observed_at":"2026-08-11T05:04:18.403350Z","submitted_at":"2025-06-04T17:57:26Z","title":"Sounding that Object: Interactive Object-Aware Image to Audio Generation","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-07T10:53:17.123505Z"},"links":{"cited_paper":"/paper/2408.00714","citing_paper":"/paper/2506.04214"},"observation_digest":"sha256:4081bac145ea92e27ed26fae6881a58f71c38fd1ab08cdebd6bc3ba0df37bb27","observation_id":"d66c4616-7dd0-47b8-ab14-93dde8116703","resolution":{"observed_at":"2026-08-07T10:53:17.123505Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:53:20.901990Z","title":"Self-supervised audio-visual co- segmentation","venue":null,"work_id":"626777af-ad69-431b-8029-c29d975519ac","year":2019},"citing_paper":{"arxiv_id":"2506.04214","last_updated":"2025-06-04T17:57:26Z","snapshot_observed_at":"2026-08-11T05:04:18.403350Z","submitted_at":"2025-06-04T17:57:26Z","title":"Sounding that Object: Interactive Object-Aware Image to Audio Generation","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-07T10:53:17.231123Z"},"links":{"citing_paper":"/paper/2506.04214"},"observation_digest":"sha256:6fc54e59ac344764bc1758e0675c60b8408c66606acbbc885c42e3333e94c75e","observation_id":"d1fc9ea9-2aa6-43f3-a4b8-fe17c98098bb","resolution":{"observed_at":"2026-08-07T10:53:20.993648Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:53:20.694870Z","title":"and Adi, Y","venue":null,"work_id":"1f7a6a6d-6896-4f4c-9dbe-a5a938d8da91","year":2023},"citing_paper":{"arxiv_id":"2506.04214","last_updated":"2025-06-04T17:57:26Z","snapshot_observed_at":"2026-08-11T05:04:18.403350Z","submitted_at":"2025-06-04T17:57:26Z","title":"Sounding that Object: Interactive Object-Aware Image to Audio Generation","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-07T10:53:17.324515Z"},"links":{"citing_paper":"/paper/2506.04214"},"observation_digest":"sha256:ab32647fe4a3b0b299eb9789a77958028a03a9a63cb7a2d5d8d9fe5974d5afcd","observation_id":"88f551ae-306b-4a73-9f74-e5bdc202b4ad","resolution":{"observed_at":"2026-08-07T10:53:20.773082Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2010.02502","last_updated":"2022-10-05T20:19:21Z","snapshot_observed_at":"2026-08-11T15:38:14.931716Z","submitted_at":"2020-10-06T06:15:51Z","title":"Denoising Diffusion Implicit Models","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2010.02502","snapshot_observed_at":"2026-08-07T10:53:17.375318Z","title":"Denoising diffusion implicit models.arXiv preprint arXiv:2010.02502,","venue":null,"work_id":null,"year":2010},"citing_paper":{"arxiv_id":"2506.04214","last_updated":"2025-06-04T17:57:26Z","snapshot_observed_at":"2026-08-11T05:04:18.403350Z","submitted_at":"2025-06-04T17:57:26Z","title":"Sounding that Object: Interactive Object-Aware Image to Audio Generation","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-07T10:53:17.375318Z"},"links":{"cited_paper":"/paper/2010.02502","citing_paper":"/paper/2506.04214"},"observation_digest":"sha256:020dd88a3557b8d3eceaa006bbe837c5aab926b1841783b9c1a31abdf3fd9f2d","observation_id":"f18cc79b-1cf5-483d-8215-d94d3a14a6e3","resolution":{"observed_at":"2026-08-07T10:53:17.375318Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2307.09288","last_updated":"2023-07-19T17:08:59Z","snapshot_observed_at":"2026-08-07T12:56:43.323460Z","submitted_at":"2023-07-18T14:31:57Z","title":"Llama 2: Open Foundation and Fine-Tuned Chat Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.09288","snapshot_observed_at":"2026-08-07T10:53:17.445595Z","title":"Llama 2: Open foundation and fine- tuned chat models.arXiv preprint arXiv:2307.09288,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.04214","last_updated":"2025-06-04T17:57:26Z","snapshot_observed_at":"2026-08-11T05:04:18.403350Z","submitted_at":"2025-06-04T17:57:26Z","title":"Sounding that Object: Interactive Object-Aware Image to Audio Generation","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-07T10:53:17.445595Z"},"links":{"cited_paper":"/paper/2307.09288","citing_paper":"/paper/2506.04214"},"observation_digest":"sha256:c4c244366235d79c8d6ba5957073b103004a039fad3a74d9430cc7c8408acdbf","observation_id":"924826e6-0172-4273-b1ae-d6e2d83287d7","resolution":{"observed_at":"2026-08-07T10:53:17.445595Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1905.09418","last_updated":"2019-06-07T14:00:58Z","snapshot_observed_at":"2026-08-10T10:06:10.793639Z","submitted_at":"2019-05-23T01:13:24Z","title":"Analyzing Multi-Head Self-Attention: Specialized Heads Do the Heavy Lifting, the Rest Can Be Pruned","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1905.09418","snapshot_observed_at":"2026-08-07T10:53:17.538154Z","title":"Analyzing multi-head self-attention: Specialized heads do the heavy lifting, the rest can be pruned.arXiv preprint arXiv:1905.09418,","venue":null,"work_id":null,"year":1905},"citing_paper":{"arxiv_id":"2506.04214","last_updated":"2025-06-04T17:57:26Z","snapshot_observed_at":"2026-08-11T05:04:18.403350Z","submitted_at":"2025-06-04T17:57:26Z","title":"Sounding that Object: Interactive Object-Aware Image to Audio Generation","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-07T10:53:17.538154Z"},"links":{"cited_paper":"/paper/1905.09418","citing_paper":"/paper/2506.04214"},"observation_digest":"sha256:6716c4b985f676a0c9c8e2cddd9e670009b909d4d3657e94f68dd1fac81ab8e4","observation_id":"59579319-00f7-4000-b8af-ca7706245cb1","resolution":{"observed_at":"2026-08-07T10:53:17.538154Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:53:20.482454Z","title":"P., and Salamon, J","venue":null,"work_id":"b996bc87-082b-4356-bf6a-30c315803750","year":2023},"citing_paper":{"arxiv_id":"2506.04214","last_updated":"2025-06-04T17:57:26Z","snapshot_observed_at":"2026-08-11T05:04:18.403350Z","submitted_at":"2025-06-04T17:57:26Z","title":"Sounding that Object: Interactive Object-Aware Image to Audio Generation","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-07T10:53:17.603114Z"},"links":{"citing_paper":"/paper/2506.04214"},"observation_digest":"sha256:a4b58ba363c2fe12712e7b4e35d6e2f94446ebb581d095511c9885cf71f268a8","observation_id":"eb6f9f6b-836a-4797-b06a-4a3e7a96640c","resolution":{"observed_at":"2026-08-07T10:53:20.586856Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2401.01044","last_updated":"2024-01-02T05:42:14Z","snapshot_observed_at":"2026-08-09T15:48:23.364963Z","submitted_at":"2024-01-02T05:42:14Z","title":"Auffusion: Leveraging the Power of Diffusion and Large Language Models for Text-to-Audio Generation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.01044","snapshot_observed_at":"2026-08-07T10:53:17.684335Z","title":"Auffusion: Leveraging the power of diffusion and large language models for text- to-audio generation.arXiv preprint arXiv:2401.01044,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.04214","last_updated":"2025-06-04T17:57:26Z","snapshot_observed_at":"2026-08-11T05:04:18.403350Z","submitted_at":"2025-06-04T17:57:26Z","title":"Sounding that Object: Interactive Object-Aware Image to Audio Generation","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-07T10:53:17.684335Z"},"links":{"cited_paper":"/paper/2401.01044","citing_paper":"/paper/2506.04214"},"observation_digest":"sha256:722509c0fd4cb146419f3c6cdd1cfdf3cd5498e090481d780039f8ce2a20664e","observation_id":"428750bf-740f-4dbf-b041-10c95fbbbbac","resolution":{"observed_at":"2026-08-07T10:53:17.684335Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.04416","last_updated":"2025-01-01T13:46:37Z","snapshot_observed_at":"2026-07-06T18:41:53.152987Z","submitted_at":"2024-07-05T11:07:13Z","title":"Sound-VECaps: Improving Audio Generation with Visual Enhanced Captions","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.04416","snapshot_observed_at":"2026-08-07T10:53:17.755251Z","title":"D., et al","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.04214","last_updated":"2025-06-04T17:57:26Z","snapshot_observed_at":"2026-08-11T05:04:18.403350Z","submitted_at":"2025-06-04T17:57:26Z","title":"Sounding that Object: Interactive Object-Aware Image to Audio Generation","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-07T10:53:17.755251Z"},"links":{"cited_paper":"/paper/2407.04416","citing_paper":"/paper/2506.04214"},"observation_digest":"sha256:19558bdfff8545721b066a062562a3e26f7a33842789c027cc7c534e2f55742b","observation_id":"f491f5a3-11f0-4614-94de-1a71b8fca4f4","resolution":{"observed_at":"2026-08-07T10:53:17.755251Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.01494","last_updated":"2024-07-01T17:35:56Z","snapshot_observed_at":"2026-08-11T02:20:01.201834Z","submitted_at":"2024-07-01T17:35:56Z","title":"FoleyCrafter: Bring Silent Videos to Life with Lifelike and Synchronized Sounds","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.01494","snapshot_observed_at":"2026-08-07T10:53:17.851996Z","title":"Foleycrafter: Bring silent videos to life with lifelike and synchronized sounds.arXiv preprint arXiv:2407.01494,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.04214","last_updated":"2025-06-04T17:57:26Z","snapshot_observed_at":"2026-08-11T05:04:18.403350Z","submitted_at":"2025-06-04T17:57:26Z","title":"Sounding that Object: Interactive Object-Aware Image to Audio Generation","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-07T10:53:17.851996Z"},"links":{"cited_paper":"/paper/2407.01494","citing_paper":"/paper/2506.04214"},"observation_digest":"sha256:f59d5b7545accaf231514a5467e0ff55492e9ba546fdf1325b71421a2ac6499c","observation_id":"d226c09d-d252-4134-a793-847f7f69ca39","resolution":{"observed_at":"2026-08-07T10:53:17.851996Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:53:20.247196Z","title":"Results Video We provide a results video on the project webpage, which showcases our model’s ability to generate sounds based on the masked object prompts","venue":null,"work_id":"cecd0494-2050-432a-91b3-69e506ca487d","year":2017},"citing_paper":{"arxiv_id":"2506.04214","last_updated":"2025-06-04T17:57:26Z","snapshot_observed_at":"2026-08-11T05:04:18.403350Z","submitted_at":"2025-06-04T17:57:26Z","title":"Sounding that Object: Interactive Object-Aware Image to Audio Generation","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-07T10:53:17.911045Z"},"links":{"citing_paper":"/paper/2506.04214"},"observation_digest":"sha256:d823745b092fb711e297f22abad4684f26c09145b41a6798d528fc25f0a52745","observation_id":"014a0f98-9611-4d99-9212-b584e52053f6","resolution":{"observed_at":"2026-08-07T10:53:20.349641Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:53:19.999631Z","title":"The original dataset comprises 4,616 hours of video clips, each paired with corresponding labels and captions","venue":null,"work_id":"2ee906fe-ca83-4d04-8bdb-f023701bc829","year":2024},"citing_paper":{"arxiv_id":"2506.04214","last_updated":"2025-06-04T17:57:26Z","snapshot_observed_at":"2026-08-11T05:04:18.403350Z","submitted_at":"2025-06-04T17:57:26Z","title":"Sounding that Object: Interactive Object-Aware Image to Audio Generation","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-07T10:53:17.979108Z"},"links":{"citing_paper":"/paper/2506.04214"},"observation_digest":"sha256:10346e990e32d439be48bcf4698d59a1bd787c1b56370476a249b0853ee4c31e","observation_id":"f2e512bb-446e-45db-9b36-ab6e5a2b0c89","resolution":{"observed_at":"2026-08-07T10:53:20.122666Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:53:19.774240Z","title":"Speech\" and “Music","venue":null,"work_id":"06dc4d8d-f160-4e06-9808-354a6cb1cc3b","year":2017},"citing_paper":{"arxiv_id":"2506.04214","last_updated":"2025-06-04T17:57:26Z","snapshot_observed_at":"2026-08-11T05:04:18.403350Z","submitted_at":"2025-06-04T17:57:26Z","title":"Sounding that Object: Interactive Object-Aware Image to Audio Generation","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-07T10:53:18.061160Z"},"links":{"citing_paper":"/paper/2506.04214"},"observation_digest":"sha256:e7ef3d4cb31cc5c4557d897325a1ea961e2c8091e37e06191d1cfcb8d30e83ea","observation_id":"89c7e839-6d02-4d91-b3e5-4d8946b2b60b","resolution":{"observed_at":"2026-08-07T10:53:19.887206Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:53:19.218537Z","title":"By extracting features from both modalities and computing cosine similarity, we show in Table 9 that our method consistently outperforms baselines on this metric","venue":null,"work_id":"c98aa592-0f6d-4460-b574-0626681c7fc9","year":2020},"citing_paper":{"arxiv_id":"2506.04214","last_updated":"2025-06-04T17:57:26Z","snapshot_observed_at":"2026-08-11T05:04:18.403350Z","submitted_at":"2025-06-04T17:57:26Z","title":"Sounding that Object: Interactive Object-Aware Image to Audio Generation","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-07T10:53:18.389315Z"},"links":{"citing_paper":"/paper/2506.04214"},"observation_digest":"sha256:f19b87f309f58829c4f16925c236b356918b2e7d7f6199b801cceb7664a0a286","observation_id":"c4b27ee5-ee27-4ffb-95ef-e47c2b6e99f3","resolution":{"observed_at":"2026-08-07T10:53:19.281192Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:53:19.021457Z","title":"video clips with better audio-visual synchronization, for test- ing","venue":null,"work_id":"796913ba-1430-4cc5-b5ca-7800a9642b46","year":2023},"citing_paper":{"arxiv_id":"2506.04214","last_updated":"2025-06-04T17:57:26Z","snapshot_observed_at":"2026-08-11T05:04:18.403350Z","submitted_at":"2025-06-04T17:57:26Z","title":"Sounding that Object: Interactive Object-Aware Image to Audio Generation","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-07T10:53:18.476414Z"},"links":{"citing_paper":"/paper/2506.04214"},"observation_digest":"sha256:d04fd0aae3e359b9ad9e239d8d701cfb14a0489ad4077aa9b485b64afa6cac41","observation_id":"eb734ed4-bcef-4f39-9e5b-731ed4ad6714","resolution":{"observed_at":"2026-08-07T10:53:19.118786Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1901.11390","last_updated":"2019-01-22T18:55:34Z","snapshot_observed_at":"2026-08-10T22:58:10.731624Z","submitted_at":"2019-01-22T18:55:34Z","title":"MONet: Unsupervised Scene Decomposition and Representation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1901.11390","snapshot_observed_at":"2026-08-07T10:53:14.410618Z","title":"P., Matthey, L., Watters, N., Kabra, R., Higgins, I., Botvinick, M., and Lerchner, A","venue":null,"work_id":null,"year":1901},"citing_paper":{"arxiv_id":"2506.04214","last_updated":"2025-06-04T17:57:26Z","snapshot_observed_at":"2026-08-11T05:04:18.403350Z","submitted_at":"2025-06-04T17:57:26Z","title":"Sounding that Object: Interactive Object-Aware Image to Audio Generation","version":1},"reference_index":1994,"source":"pdf_text","source_observed_at":"2026-08-07T10:53:14.410618Z"},"links":{"cited_paper":"/paper/1901.11390","citing_paper":"/paper/2506.04214"},"observation_digest":"sha256:548fa2a397d0bc2944653b8fdae7e3e604d40e6d142a85f7a2f908b202dbb25e","observation_id":"05235672-3c85-44af-928a-a5ffbf6dde8a","resolution":{"observed_at":"2026-08-07T10:53:14.410618Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1312.6114","last_updated":"2022-12-10T21:04:00Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2013-12-20T20:58:10Z","title":"Auto-Encoding Variational Bayes","version":11},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1312.6114","snapshot_observed_at":"2026-08-07T10:53:16.344543Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.04214","last_updated":"2025-06-04T17:57:26Z","snapshot_observed_at":"2026-08-11T05:04:18.403350Z","submitted_at":"2025-06-04T17:57:26Z","title":"Sounding that Object: Interactive Object-Aware Image to Audio Generation","version":1},"reference_index":2015,"source":"pdf_text","source_observed_at":"2026-08-07T10:53:16.344543Z"},"links":{"cited_paper":"/paper/1312.6114","citing_paper":"/paper/2506.04214"},"observation_digest":"sha256:d626765eb22d0bde61a6c88d3b621405e86f9482ebea992bc8a7f8b558043596","observation_id":"36292d4d-164e-47c1-a47d-b26706e60b98","resolution":{"observed_at":"2026-08-07T10:53:16.344543Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:53:15.739919Z","title":"D., Carr, C., Zukowski, Z., Taylor, J., and Pons, J","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.04214","last_updated":"2025-06-04T17:57:26Z","snapshot_observed_at":"2026-08-11T05:04:18.403350Z","submitted_at":"2025-06-04T17:57:26Z","title":"Sounding that Object: Interactive Object-Aware Image to Audio Generation","version":1},"reference_index":2016,"source":"pdf_text","source_observed_at":"2026-08-07T10:53:15.739919Z"},"links":{"citing_paper":"/paper/2506.04214"},"observation_digest":"sha256:134099cc2325b8c2d5b93fa1cc9195a0ca3cdf152c3d9ec40b1313b85317a430","observation_id":"10f7d14b-2f4b-4782-bd2e-6c614d482d2d","resolution":{"observed_at":"2026-08-07T10:53:15.739919Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2306.17203","last_updated":"2023-06-29T12:39:58Z","snapshot_observed_at":"2026-08-10T16:47:10.910422Z","submitted_at":"2023-06-29T12:39:58Z","title":"Diff-Foley: Synchronized Video-to-Audio Synthesis with Latent Diffusion Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.17203","snapshot_observed_at":"2026-08-07T10:53:16.772565Z","title":"Diff-foley: Syn- chronized video-to-audio synthesis with latent diffusion models.arXiv preprint arXiv:2306.17203,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.04214","last_updated":"2025-06-04T17:57:26Z","snapshot_observed_at":"2026-08-11T05:04:18.403350Z","submitted_at":"2025-06-04T17:57:26Z","title":"Sounding that Object: Interactive Object-Aware Image to Audio Generation","version":1},"reference_index":2017,"source":"pdf_text","source_observed_at":"2026-08-07T10:53:16.772565Z"},"links":{"cited_paper":"/paper/2306.17203","citing_paper":"/paper/2506.04214"},"observation_digest":"sha256:553a652a2bb60bc7703286d5eae00e5433bcee489961356e09ffc3683e407303","observation_id":"a35530dd-e4d0-41b2-9fe0-2674cf50081d","resolution":{"observed_at":"2026-08-07T10:53:16.772565Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1409.0473","last_updated":"2016-05-19T21:53:22Z","snapshot_observed_at":"2026-08-12T12:07:33.202888Z","submitted_at":"2014-09-01T16:33:02Z","title":"Neural Machine Translation by Jointly Learning to Align and Translate","version":7},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1409.0473","snapshot_observed_at":"2026-08-07T10:53:14.283844Z","title":"Neural machine translation by jointly learning to align and translate.arXiv preprint arXiv:1409.0473,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.04214","last_updated":"2025-06-04T17:57:26Z","snapshot_observed_at":"2026-08-11T05:04:18.403350Z","submitted_at":"2025-06-04T17:57:26Z","title":"Sounding that Object: Interactive Object-Aware Image to Audio Generation","version":1},"reference_index":2018,"source":"pdf_text","source_observed_at":"2026-08-07T10:53:14.283844Z"},"links":{"cited_paper":"/paper/1409.0473","citing_paper":"/paper/2506.04214"},"observation_digest":"sha256:58d289e8262897b045f7b893364f96250087309af0b57870d5423e22fb2073a9","observation_id":"9b5802cf-c42f-4ba2-a2ef-a519db155eee","resolution":{"observed_at":"2026-08-07T10:53:14.283844Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:53:22.531688Z","title":"Visual acoustic matching","venue":null,"work_id":"a12ba7e6-0cb1-4ed5-b875-12f4e60a5d8e","year":2020},"citing_paper":{"arxiv_id":"2506.04214","last_updated":"2025-06-04T17:57:26Z","snapshot_observed_at":"2026-08-11T05:04:18.403350Z","submitted_at":"2025-06-04T17:57:26Z","title":"Sounding that Object: Interactive Object-Aware Image to Audio Generation","version":1},"reference_index":2019,"source":"pdf_text","source_observed_at":"2026-08-07T10:53:14.542529Z"},"links":{"citing_paper":"/paper/2506.04214"},"observation_digest":"sha256:daa5a3d04979a8d3590323c90474844d154ffb7077f598498ef5885908e92820","observation_id":"75e97090-91e3-411d-88d0-3d00fd96cdb5","resolution":{"observed_at":"2026-08-07T10:53:22.719167Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2112.04432","last_updated":"2021-12-08T17:50:26Z","snapshot_observed_at":"2026-08-09T17:52:57.920993Z","submitted_at":"2021-12-08T17:50:26Z","title":"Audio-Visual Synchronisation in the wild","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2112.04432","snapshot_observed_at":"2026-08-07T10:53:14.750169Z","title":"Audio-visual synchronisation in the wild.arXiv preprint arXiv:2112.04432, 2021a","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.04214","last_updated":"2025-06-04T17:57:26Z","snapshot_observed_at":"2026-08-11T05:04:18.403350Z","submitted_at":"2025-06-04T17:57:26Z","title":"Sounding that Object: Interactive Object-Aware Image to Audio Generation","version":1},"reference_index":2020,"source":"pdf_text","source_observed_at":"2026-08-07T10:53:14.750169Z"},"links":{"cited_paper":"/paper/2112.04432","citing_paper":"/paper/2506.04214"},"observation_digest":"sha256:f589bf6c27a32e4d86cc275d50fa0db91d851761acdf4bf2eb348bea9d8d3ce6","observation_id":"8ac5f492-375f-4c66-a64e-f9ad9a2bc2a7","resolution":{"observed_at":"2026-08-07T10:53:14.750169Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:53:21.697857Z","title":"Synch- former: Efficient synchronization from sparse cues","venue":null,"work_id":"2d377cda-66a9-4ac3-96f8-1e6bbc220ab7","year":2024},"citing_paper":{"arxiv_id":"2506.04214","last_updated":"2025-06-04T17:57:26Z","snapshot_observed_at":"2026-08-11T05:04:18.403350Z","submitted_at":"2025-06-04T17:57:26Z","title":"Sounding that Object: Interactive Object-Aware Image to Audio Generation","version":1},"reference_index":2021,"source":"pdf_text","source_observed_at":"2026-08-07T10:53:16.157720Z"},"links":{"citing_paper":"/paper/2506.04214"},"observation_digest":"sha256:69980fb77dcc0937666bb64ce3368b68c655d2b762b9d969a55d6f3dcc844f08","observation_id":"92982670-0cc1-4f22-9e56-f5e5bfa7c2e8","resolution":{"observed_at":"2026-08-07T10:53:21.806357Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:53:22.176224Z","title":"On uni-modal feature learning in supervised multi-modal learning","venue":null,"work_id":"5e16025d-6bbb-4316-92e8-5cca4cfddff9","year":2023},"citing_paper":{"arxiv_id":"2506.04214","last_updated":"2025-06-04T17:57:26Z","snapshot_observed_at":"2026-08-11T05:04:18.403350Z","submitted_at":"2025-06-04T17:57:26Z","title":"Sounding that Object: Interactive Object-Aware Image to Audio Generation","version":1},"reference_index":2022,"source":"pdf_text","source_observed_at":"2026-08-07T10:53:15.611374Z"},"links":{"citing_paper":"/paper/2506.04214"},"observation_digest":"sha256:d92c0fb3125df09309a968a0b40fd4fc204f0dbd21f034e8248d98288ea3e156","observation_id":"ba9961c9-9d3c-42a4-9dfd-ff2d9a87981d","resolution":{"observed_at":"2026-08-07T10:53:22.306427Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:53:21.466827Z","title":"S., Wiles, O., Moses, Y ., and Zisserman, A","venue":null,"work_id":"9a381c3d-80d5-4f1d-a7b0-aff0a972d4b5","year":2020},"citing_paper":{"arxiv_id":"2506.04214","last_updated":"2025-06-04T17:57:26Z","snapshot_observed_at":"2026-08-11T05:04:18.403350Z","submitted_at":"2025-06-04T17:57:26Z","title":"Sounding that Object: Interactive Object-Aware Image to Audio Generation","version":1},"reference_index":2023,"source":"pdf_text","source_observed_at":"2026-08-07T10:53:16.461969Z"},"links":{"citing_paper":"/paper/2506.04214"},"observation_digest":"sha256:018ae1a8f9243ba3456007666979fc400f0676690ac43f039450b7ebbcc571e5","observation_id":"f344cc3e-447f-4383-8639-dbe578e98bd8","resolution":{"observed_at":"2026-08-07T10:53:21.536182Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.15322","last_updated":"2025-04-07T18:00:00Z","snapshot_observed_at":"2026-08-12T01:16:42.382558Z","submitted_at":"2024-12-19T18:59:55Z","title":"MMAudio: Taming Multimodal Joint Training for High-Quality Video-to-Audio Synthesis","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.15322","snapshot_observed_at":"2026-08-07T10:53:14.895706Z","title":"K., Ishii, M., Hayakawa, A., Shibuya, T., Schwing, A., and Mitsufuji, Y","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.04214","last_updated":"2025-06-04T17:57:26Z","snapshot_observed_at":"2026-08-11T05:04:18.403350Z","submitted_at":"2025-06-04T17:57:26Z","title":"Sounding that Object: Interactive Object-Aware Image to Audio Generation","version":1},"reference_index":2024,"source":"pdf_text","source_observed_at":"2026-08-07T10:53:14.895706Z"},"links":{"cited_paper":"/paper/2412.15322","citing_paper":"/paper/2506.04214"},"observation_digest":"sha256:94cd3164ad0b4c6ea150aacd2b447853303f6d0a08e15655ca796c48ff8a081a","observation_id":"14e806fc-87e0-48fa-9c31-79ec9b6b96c0","resolution":{"observed_at":"2026-08-07T10:53:14.895706Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2506.04214","last_updated":"2025-06-04T17:57:26Z","latest_version":1,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-11T05:04:18.403350Z","submitted_at":"2025-06-04T17:57:26Z","title":"Sounding that Object: Interactive Object-Aware Image to Audio Generation"},"reference_resolution":{"displayed":41,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":23,"verified_exact":0,"verified_fuzzy":18},"total_outbound_references":41},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"thesis":"As of 12 August 2026, this Paper Citation Record lists 41 of 41 outbound references and 0 inbound Pith citation observations for arXiv:2506.04214."}