{"as_of":"2026-08-10T14:10:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:881b1b75c44c13a9cb8e4bda2637c32c7bbcbcf4923eb56e36a2fb6a149708cb","coverage":[{"denominator":57,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":57,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-06T19:39:57.158925Z","state":"measured"},{"denominator":57,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":57,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-10T06:31:04.303077+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2507.04959/citation-record","integrity":"/paper/2507.04959/integrity","json":"/paper/2507.04959/citation-record.json","paper":"/paper/2507.04959"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2404.16305","last_updated":"2024-04-26T02:23:24Z","snapshot_observed_at":"2026-07-06T18:05:16.683850Z","submitted_at":"2024-04-25T03:14:49Z","title":"Semantically consistent Video-to-Audio Generation using Multimodal Language Large Model","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.16305","snapshot_observed_at":"2026-08-06T19:39:52.764864Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.04959","last_updated":"2025-07-13T09:31:19Z","snapshot_observed_at":"2026-08-07T10:47:44.341783Z","submitted_at":"2025-07-07T13:01:50Z","title":"Hear-Your-Click: Interactive Object-Specific Video-to-Audio Generation","version":2},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-06T19:39:52.764864Z"},"links":{"cited_paper":"/paper/2404.16305","citing_paper":"/paper/2507.04959"},"observation_digest":"sha256:abd4186c76fb5debc6488dfd2b791dc4cc141949ee96ad833b5f4509355a86aa","observation_id":"7a208eb1-b5ab-4f60-b6cb-f59eda251448","resolution":{"observed_at":"2026-08-06T19:39:52.764864Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:40:03.692503Z","title":null,"venue":null,"work_id":"758f8437-0be2-4949-a8a3-b499b87671d9","year":null},"citing_paper":{"arxiv_id":"2507.04959","last_updated":"2025-07-13T09:31:19Z","snapshot_observed_at":"2026-08-07T10:47:44.341783Z","submitted_at":"2025-07-07T13:01:50Z","title":"Hear-Your-Click: Interactive Object-Specific Video-to-Audio Generation","version":2},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-06T19:39:52.823087Z"},"links":{"citing_paper":"/paper/2507.04959"},"observation_digest":"sha256:07aba59bf7f386e58bd9c19e0a5418e5e812ee43c2d23e0ae633000186ff44df","observation_id":"86a1d26f-0606-4f19-8a36-1dbc0fa40b72","resolution":{"observed_at":"2026-08-06T19:40:03.792847Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:40:03.317480Z","title":null,"venue":null,"work_id":"813aae04-9465-486f-b5d1-b3950945973e","year":2023},"citing_paper":{"arxiv_id":"2507.04959","last_updated":"2025-07-13T09:31:19Z","snapshot_observed_at":"2026-08-07T10:47:44.341783Z","submitted_at":"2025-07-07T13:01:50Z","title":"Hear-Your-Click: Interactive Object-Specific Video-to-Audio Generation","version":2},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-06T19:39:52.967014Z"},"links":{"citing_paper":"/paper/2507.04959"},"observation_digest":"sha256:ef3db5fdc9f2868e3c485551013091c4ef00159a5808869bbcb7aa32de1ec6cc","observation_id":"4bd191fe-bf82-4d29-867d-43f661cdb118","resolution":{"observed_at":"2026-08-06T19:40:03.402727Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:40:03.132598Z","title":null,"venue":null,"work_id":"797a4ee8-3cdb-4135-93c0-1053ebcd8362","year":2023},"citing_paper":{"arxiv_id":"2507.04959","last_updated":"2025-07-13T09:31:19Z","snapshot_observed_at":"2026-08-07T10:47:44.341783Z","submitted_at":"2025-07-07T13:01:50Z","title":"Hear-Your-Click: Interactive Object-Specific Video-to-Audio Generation","version":2},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-06T19:39:53.048808Z"},"links":{"citing_paper":"/paper/2507.04959"},"observation_digest":"sha256:3b9a91f7b903b24fe95bc293593ce5517c01e74d3751eb70cc895f99f5116743","observation_id":"8b073e49-aa51-4ad3-adb9-1c09008e31ea","resolution":{"observed_at":"2026-08-06T19:40:03.203909Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2304.14601","last_updated":"2023-05-14T19:25:16Z","snapshot_observed_at":"2026-08-09T02:28:54.859514Z","submitted_at":"2023-04-28T03:06:37Z","title":"Improve Video Representation with Temporal Adversarial Augmentation","version":2},"cited_work":{"arxiv_id":"2304.14601","doi":null,"metadata_source":"pith","pith_arxiv_id":"2304.14601","snapshot_observed_at":"2026-08-06T19:39:57.962242Z","title":"Improve Video Representation with Temporal Adversarial Augmentation","venue":"cs.CV","work_id":"be3b34f9-2549-4ffc-aac3-31a7e34f82ac","year":2023},"citing_paper":{"arxiv_id":"2507.04959","last_updated":"2025-07-13T09:31:19Z","snapshot_observed_at":"2026-08-07T10:47:44.341783Z","submitted_at":"2025-07-07T13:01:50Z","title":"Hear-Your-Click: Interactive Object-Specific Video-to-Audio Generation","version":2},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-06T19:39:53.080150Z"},"links":{"cited_paper":"/paper/2304.14601","citing_paper":"/paper/2507.04959"},"observation_digest":"sha256:b2576b9132597eb968adda1429c5ae16f39a2061e4e70e1464968fe8193b116d","observation_id":"a41c6c94-15bc-427a-825f-9c33fa8e1cac","resolution":{"observed_at":"2026-08-06T19:39:58.058215Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:40:02.993887Z","title":null,"venue":null,"work_id":"5ed76b1b-02f3-4597-9e17-4d567dd15b55","year":2023},"citing_paper":{"arxiv_id":"2507.04959","last_updated":"2025-07-13T09:31:19Z","snapshot_observed_at":"2026-08-07T10:47:44.341783Z","submitted_at":"2025-07-07T13:01:50Z","title":"Hear-Your-Click: Interactive Object-Specific Video-to-Audio Generation","version":2},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-06T19:39:53.154100Z"},"links":{"citing_paper":"/paper/2507.04959"},"observation_digest":"sha256:2e8c9658371f14948424e59ba7e4cc4fac2d678ee71e58ecef7f7a543e67d052","observation_id":"660c309d-a262-40f0-b2eb-3f483c935275","resolution":{"observed_at":"2026-08-06T19:40:03.033796Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:40:02.877720Z","title":null,"venue":null,"work_id":"d2864e23-066d-418f-85e1-5e73e973ea8a","year":null},"citing_paper":{"arxiv_id":"2507.04959","last_updated":"2025-07-13T09:31:19Z","snapshot_observed_at":"2026-08-07T10:47:44.341783Z","submitted_at":"2025-07-07T13:01:50Z","title":"Hear-Your-Click: Interactive Object-Specific Video-to-Audio Generation","version":2},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-06T19:39:53.209673Z"},"links":{"citing_paper":"/paper/2507.04959"},"observation_digest":"sha256:a6070246b25e5607b99d9117246d493549d33905cf5e0cd676c1c57a07cc7ed3","observation_id":"3cc84977-7e6e-4e90-8c8d-77b72a5d36b6","resolution":{"observed_at":"2026-08-06T19:40:02.935437Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:40:02.729996Z","title":null,"venue":null,"work_id":"62848543-da03-4f89-924f-b2da18642112","year":null},"citing_paper":{"arxiv_id":"2507.04959","last_updated":"2025-07-13T09:31:19Z","snapshot_observed_at":"2026-08-07T10:47:44.341783Z","submitted_at":"2025-07-07T13:01:50Z","title":"Hear-Your-Click: Interactive Object-Specific Video-to-Audio Generation","version":2},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-06T19:39:53.313334Z"},"links":{"citing_paper":"/paper/2507.04959"},"observation_digest":"sha256:4437be0bba302fcef088196503839810f1589bbb55e51555dd79ce6886d0b7eb","observation_id":"e96a279a-8fe7-435c-a0cb-70551485c5aa","resolution":{"observed_at":"2026-08-06T19:40:02.785264Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:40:02.429112Z","title":null,"venue":null,"work_id":"ad20a429-5c63-440e-a222-5829681128eb","year":2023},"citing_paper":{"arxiv_id":"2507.04959","last_updated":"2025-07-13T09:31:19Z","snapshot_observed_at":"2026-08-07T10:47:44.341783Z","submitted_at":"2025-07-07T13:01:50Z","title":"Hear-Your-Click: Interactive Object-Specific Video-to-Audio Generation","version":2},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-06T19:39:53.441186Z"},"links":{"citing_paper":"/paper/2507.04959"},"observation_digest":"sha256:2fc83e5e9cebae55842a5c292ad78034ec520666175f49f1b3a444258b83d509","observation_id":"030f5c59-22ca-4218-b7b1-4c18bf103a20","resolution":{"observed_at":"2026-08-06T19:40:02.506605Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2307.10373","last_updated":"2023-11-20T10:54:09Z","snapshot_observed_at":"2026-08-06T08:12:35.134201Z","submitted_at":"2023-07-19T18:00:03Z","title":"TokenFlow: Consistent Diffusion Features for Consistent Video Editing","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.10373","snapshot_observed_at":"2026-08-06T19:39:53.488001Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.04959","last_updated":"2025-07-13T09:31:19Z","snapshot_observed_at":"2026-08-07T10:47:44.341783Z","submitted_at":"2025-07-07T13:01:50Z","title":"Hear-Your-Click: Interactive Object-Specific Video-to-Audio Generation","version":2},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-06T19:39:53.488001Z"},"links":{"cited_paper":"/paper/2307.10373","citing_paper":"/paper/2507.04959"},"observation_digest":"sha256:f067a9be5e365a4997da47cbb3e0b800cd85c84117cc919a168706854493a875","observation_id":"dab50cf8-659d-4ac3-80a6-32935221495f","resolution":{"observed_at":"2026-08-06T19:39:53.488001Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:40:02.281057Z","title":null,"venue":null,"work_id":"02bd9a13-e1a7-4dee-9c2a-80dca0512b21","year":2023},"citing_paper":{"arxiv_id":"2507.04959","last_updated":"2025-07-13T09:31:19Z","snapshot_observed_at":"2026-08-07T10:47:44.341783Z","submitted_at":"2025-07-07T13:01:50Z","title":"Hear-Your-Click: Interactive Object-Specific Video-to-Audio Generation","version":2},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-06T19:39:53.544757Z"},"links":{"citing_paper":"/paper/2507.04959"},"observation_digest":"sha256:cded5d61d7934289092575608c015d618f192706cb1463acf0d5124887dc9572","observation_id":"6b6a6d81-2b11-48f2-a7f8-904c51426b5a","resolution":{"observed_at":"2026-08-06T19:40:02.335385Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2210.07839","last_updated":"2023-04-11T22:47:19Z","snapshot_observed_at":"2026-08-10T01:58:32.784453Z","submitted_at":"2022-10-02T07:29:57Z","title":"Contrastive Audio-Visual Masked Autoencoder","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2210.07839","snapshot_observed_at":"2026-08-06T19:39:53.588345Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2507.04959","last_updated":"2025-07-13T09:31:19Z","snapshot_observed_at":"2026-08-07T10:47:44.341783Z","submitted_at":"2025-07-07T13:01:50Z","title":"Hear-Your-Click: Interactive Object-Specific Video-to-Audio Generation","version":2},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-06T19:39:53.588345Z"},"links":{"cited_paper":"/paper/2210.07839","citing_paper":"/paper/2507.04959"},"observation_digest":"sha256:0ff83ba8f888bc1fa8a75655dbb7edc98da4884e540d348b3cab764ed96e35da","observation_id":"b8a4800c-84d1-4295-8a4d-20dd0bc26f7b","resolution":{"observed_at":"2026-08-06T19:39:53.588345Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:40:02.133156Z","title":null,"venue":null,"work_id":"5cf90725-3a49-4270-b749-127083a21101","year":2020},"citing_paper":{"arxiv_id":"2507.04959","last_updated":"2025-07-13T09:31:19Z","snapshot_observed_at":"2026-08-07T10:47:44.341783Z","submitted_at":"2025-07-07T13:01:50Z","title":"Hear-Your-Click: Interactive Object-Specific Video-to-Audio Generation","version":2},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-06T19:39:53.655141Z"},"links":{"citing_paper":"/paper/2507.04959"},"observation_digest":"sha256:88328d85fc96cd174a7acf4af341b66ea14368f50b524f1db0221992b0a9415c","observation_id":"04bb6b80-fdd9-47df-8248-f63c9de96ef3","resolution":{"observed_at":"2026-08-06T19:40:02.175024Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:40:01.981187Z","title":null,"venue":null,"work_id":"2d8f5e01-a48c-4e1a-850f-6ef96d24059f","year":2024},"citing_paper":{"arxiv_id":"2507.04959","last_updated":"2025-07-13T09:31:19Z","snapshot_observed_at":"2026-08-07T10:47:44.341783Z","submitted_at":"2025-07-07T13:01:50Z","title":"Hear-Your-Click: Interactive Object-Specific Video-to-Audio Generation","version":2},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-06T19:39:53.698522Z"},"links":{"citing_paper":"/paper/2507.04959"},"observation_digest":"sha256:68f8adee7f15eb1bfbaa83c853d918fb2735554687f8162c88e6e1b1f9c5ae13","observation_id":"b09bbb0d-7b09-4305-aa70-6297a9a4b2df","resolution":{"observed_at":"2026-08-06T19:40:02.063076Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:40:01.846687Z","title":null,"venue":null,"work_id":"3a6009bd-0fe9-4d57-bd86-07c2c06e0822","year":2022},"citing_paper":{"arxiv_id":"2507.04959","last_updated":"2025-07-13T09:31:19Z","snapshot_observed_at":"2026-08-07T10:47:44.341783Z","submitted_at":"2025-07-07T13:01:50Z","title":"Hear-Your-Click: Interactive Object-Specific Video-to-Audio Generation","version":2},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-06T19:39:53.784364Z"},"links":{"citing_paper":"/paper/2507.04959"},"observation_digest":"sha256:3feddf14f68a94dbbc34716bf550700e63f70a8aac18e02de6174af23a623ed9","observation_id":"fda05080-26d3-468b-bdf7-67fc28e71731","resolution":{"observed_at":"2026-08-06T19:40:01.908279Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:40:01.732266Z","title":null,"venue":null,"work_id":"9da0161b-31b6-44cd-a4ea-0b8a690153f9","year":2023},"citing_paper":{"arxiv_id":"2507.04959","last_updated":"2025-07-13T09:31:19Z","snapshot_observed_at":"2026-08-07T10:47:44.341783Z","submitted_at":"2025-07-07T13:01:50Z","title":"Hear-Your-Click: Interactive Object-Specific Video-to-Audio Generation","version":2},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-06T19:39:53.931341Z"},"links":{"citing_paper":"/paper/2507.04959"},"observation_digest":"sha256:47d355db8913c2b5ab14547fa8c028ce59f8767777a54eefc5f26af793abbc82","observation_id":"7c5a6630-9a13-43fe-ac1f-f3d4bede1c17","resolution":{"observed_at":"2026-08-06T19:40:01.779917Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:39:54.050589Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2507.04959","last_updated":"2025-07-13T09:31:19Z","snapshot_observed_at":"2026-08-07T10:47:44.341783Z","submitted_at":"2025-07-07T13:01:50Z","title":"Hear-Your-Click: Interactive Object-Specific Video-to-Audio Generation","version":2},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-06T19:39:54.050589Z"},"links":{"citing_paper":"/paper/2507.04959"},"observation_digest":"sha256:b68d670376a5449a0305cddaba79e3a59ce02025312d6b6e367d3d53115f7295","observation_id":"ec4be851-97f1-4594-b4c0-6d1c261626ff","resolution":{"observed_at":"2026-08-06T19:39:54.050589Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:40:01.566022Z","title":null,"venue":null,"work_id":"972eb3cb-30d7-4e0c-aa5e-f27c6e001b84","year":2024},"citing_paper":{"arxiv_id":"2507.04959","last_updated":"2025-07-13T09:31:19Z","snapshot_observed_at":"2026-08-07T10:47:44.341783Z","submitted_at":"2025-07-07T13:01:50Z","title":"Hear-Your-Click: Interactive Object-Specific Video-to-Audio Generation","version":2},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-06T19:39:54.098823Z"},"links":{"citing_paper":"/paper/2507.04959"},"observation_digest":"sha256:cd5e47e3ae8748d38c3d28e3543d53a0caceb7c4f43536656488f7308ae8697d","observation_id":"ea799743-86e6-4f5a-8a5d-029e50ec880e","resolution":{"observed_at":"2026-08-06T19:40:01.629196Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2302.03917","last_updated":"2023-03-06T18:09:56Z","snapshot_observed_at":"2026-08-07T18:29:25.356544Z","submitted_at":"2023-02-08T07:27:27Z","title":"Noise2Music: Text-conditioned Music Generation with Diffusion Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2302.03917","snapshot_observed_at":"2026-08-06T19:39:54.151850Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.04959","last_updated":"2025-07-13T09:31:19Z","snapshot_observed_at":"2026-08-07T10:47:44.341783Z","submitted_at":"2025-07-07T13:01:50Z","title":"Hear-Your-Click: Interactive Object-Specific Video-to-Audio Generation","version":2},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-06T19:39:54.151850Z"},"links":{"cited_paper":"/paper/2302.03917","citing_paper":"/paper/2507.04959"},"observation_digest":"sha256:29bcd45c085f3f8e96b9ed15a5ef47e2d681f8d5488be9aead26ca7fa439e173","observation_id":"edeebd84-0513-45ed-bc21-0844fbe762e9","resolution":{"observed_at":"2026-08-06T19:39:54.151850Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2110.08791","last_updated":"2021-10-17T11:14:00Z","snapshot_observed_at":"2026-07-06T11:58:46.444354Z","submitted_at":"2021-10-17T11:14:00Z","title":"Taming Visually Guided Sound Generation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2110.08791","snapshot_observed_at":"2026-08-06T19:39:54.199483Z","title":null,"venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2507.04959","last_updated":"2025-07-13T09:31:19Z","snapshot_observed_at":"2026-08-07T10:47:44.341783Z","submitted_at":"2025-07-07T13:01:50Z","title":"Hear-Your-Click: Interactive Object-Specific Video-to-Audio Generation","version":2},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-06T19:39:54.199483Z"},"links":{"cited_paper":"/paper/2110.08791","citing_paper":"/paper/2507.04959"},"observation_digest":"sha256:9c86a867947f3c5e529a65304e1d51968e88f08d18e44fab5b35c2b724be0f74","observation_id":"4b1030d6-dc2b-463a-9ef1-ff3b29db080f","resolution":{"observed_at":"2026-08-06T19:39:54.199483Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.06976","last_updated":"2024-03-11T17:59:31Z","snapshot_observed_at":"2026-07-06T17:42:49.471518Z","submitted_at":"2024-03-11T17:59:31Z","title":"BrushNet: A Plug-and-Play Image Inpainting Model with Decomposed Dual-Branch Diffusion","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.06976","snapshot_observed_at":"2026-08-06T19:39:54.244160Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.04959","last_updated":"2025-07-13T09:31:19Z","snapshot_observed_at":"2026-08-07T10:47:44.341783Z","submitted_at":"2025-07-07T13:01:50Z","title":"Hear-Your-Click: Interactive Object-Specific Video-to-Audio Generation","version":2},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-06T19:39:54.244160Z"},"links":{"cited_paper":"/paper/2403.06976","citing_paper":"/paper/2507.04959"},"observation_digest":"sha256:ef36ad9f39bb372ccde55849d7c0c7a195bacb5dd43d0243f0bc59852ce9e55f","observation_id":"41754310-407b-4bad-82e1-8ce583d87d8b","resolution":{"observed_at":"2026-08-06T19:39:54.244160Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:40:01.422418Z","title":null,"venue":null,"work_id":"16c92927-5c58-4171-99e9-f96d9a40dc9f","year":2023},"citing_paper":{"arxiv_id":"2507.04959","last_updated":"2025-07-13T09:31:19Z","snapshot_observed_at":"2026-08-07T10:47:44.341783Z","submitted_at":"2025-07-07T13:01:50Z","title":"Hear-Your-Click: Interactive Object-Specific Video-to-Audio Generation","version":2},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-06T19:39:54.307715Z"},"links":{"citing_paper":"/paper/2507.04959"},"observation_digest":"sha256:12032c407e8fa14061f77d429de607eea7611ebc97d369f85b1897205523bd2b","observation_id":"aa2598fb-cb24-4b48-8229-de4f6266239a","resolution":{"observed_at":"2026-08-06T19:40:01.492635Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:39:54.391288Z","title":null,"venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2507.04959","last_updated":"2025-07-13T09:31:19Z","snapshot_observed_at":"2026-08-07T10:47:44.341783Z","submitted_at":"2025-07-07T13:01:50Z","title":"Hear-Your-Click: Interactive Object-Specific Video-to-Audio Generation","version":2},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-06T19:39:54.391288Z"},"links":{"citing_paper":"/paper/2507.04959"},"observation_digest":"sha256:daa27bb1c29f1b6b04f7d839a3d26c0edf73cbe80563b1b197d12f69f3d78c3c","observation_id":"801a2e06-4342-4c06-aa3e-f93d7b5c1215","resolution":{"observed_at":"2026-08-06T19:39:54.391288Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:40:01.274486Z","title":null,"venue":null,"work_id":"34ecf9a1-f2cb-4b0b-98e3-0ed35b9a50fd","year":null},"citing_paper":{"arxiv_id":"2507.04959","last_updated":"2025-07-13T09:31:19Z","snapshot_observed_at":"2026-08-07T10:47:44.341783Z","submitted_at":"2025-07-07T13:01:50Z","title":"Hear-Your-Click: Interactive Object-Specific Video-to-Audio Generation","version":2},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-06T19:39:54.466514Z"},"links":{"citing_paper":"/paper/2507.04959"},"observation_digest":"sha256:ad631227ab554f16092f5b997ebe36c8284f0768d1c1323a8f3ee0cb979082cd","observation_id":"c916f467-5699-4f80-af8b-df1791ce71ca","resolution":{"observed_at":"2026-08-06T19:40:01.328048Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2301.12503","last_updated":"2023-09-09T15:27:58Z","snapshot_observed_at":"2026-08-06T16:43:15.954030Z","submitted_at":"2023-01-29T17:48:17Z","title":"AudioLDM: Text-to-Audio Generation with Latent Diffusion Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2301.12503","snapshot_observed_at":"2026-08-06T19:39:54.589254Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.04959","last_updated":"2025-07-13T09:31:19Z","snapshot_observed_at":"2026-08-07T10:47:44.341783Z","submitted_at":"2025-07-07T13:01:50Z","title":"Hear-Your-Click: Interactive Object-Specific Video-to-Audio Generation","version":2},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-06T19:39:54.589254Z"},"links":{"cited_paper":"/paper/2301.12503","citing_paper":"/paper/2507.04959"},"observation_digest":"sha256:2094dd1db4ab3edb6a52ed7f56b0a34ee25c67c99faa8e0d77743cf2fb454381","observation_id":"3384e3c5-011a-4867-b15e-0451f2ba050a","resolution":{"observed_at":"2026-08-06T19:39:54.589254Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:40:00.967920Z","title":"Plumbley","venue":null,"work_id":"ab8cc9ce-9a2d-465d-9b76-45209e51f510","year":null},"citing_paper":{"arxiv_id":"2507.04959","last_updated":"2025-07-13T09:31:19Z","snapshot_observed_at":"2026-08-07T10:47:44.341783Z","submitted_at":"2025-07-07T13:01:50Z","title":"Hear-Your-Click: Interactive Object-Specific Video-to-Audio Generation","version":2},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-06T19:39:54.608363Z"},"links":{"citing_paper":"/paper/2507.04959"},"observation_digest":"sha256:f9d96848878701a573f608a5fb77a1202c609351e186d483fb49b0a8930ce59a","observation_id":"9746f996-f4c1-4418-b7c2-f1e65e63f9b9","resolution":{"observed_at":"2026-08-06T19:40:01.006648Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2212.14453","last_updated":"2023-04-24T14:48:00Z","snapshot_observed_at":"2026-07-06T14:35:57.506538Z","submitted_at":"2022-12-29T20:39:36Z","title":"Learning Multimodal Data Augmentation in Feature Space","version":2},"cited_work":{"arxiv_id":"2212.14453","doi":null,"metadata_source":"pith","pith_arxiv_id":"2212.14453","snapshot_observed_at":"2026-08-06T19:39:57.511044Z","title":"Learning Multimodal Data Augmentation in Feature Space","venue":"cs.LG","work_id":"a022d66b-6e71-4bfd-9a16-ae19d203a5e8","year":2022},"citing_paper":{"arxiv_id":"2507.04959","last_updated":"2025-07-13T09:31:19Z","snapshot_observed_at":"2026-08-07T10:47:44.341783Z","submitted_at":"2025-07-07T13:01:50Z","title":"Hear-Your-Click: Interactive Object-Specific Video-to-Audio Generation","version":2},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-06T19:39:54.695510Z"},"links":{"cited_paper":"/paper/2212.14453","citing_paper":"/paper/2507.04959"},"observation_digest":"sha256:4799d1ab5716f5006b9694689547c3222921f8bb565001a4209018689a08dbb1","observation_id":"9e0015cf-d45e-4cce-b302-0af53f030a85","resolution":{"observed_at":"2026-08-06T19:39:57.596717Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:40:01.073350Z","title":"In Proceedings of the IEEE/CVF Conference on Computer Vision and Pattern Recognition","venue":null,"work_id":"f0513152-8c4b-4d3b-9b4e-cb823f48356b","year":null},"citing_paper":{"arxiv_id":"2507.04959","last_updated":"2025-07-13T09:31:19Z","snapshot_observed_at":"2026-08-07T10:47:44.341783Z","submitted_at":"2025-07-07T13:01:50Z","title":"Hear-Your-Click: Interactive Object-Specific Video-to-Audio Generation","version":2},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-06T19:39:54.506689Z"},"links":{"citing_paper":"/paper/2507.04959"},"observation_digest":"sha256:0e112383c0eb0b3248faaec20aebe3df494cad7b5d56cba066e74d6876a9c95d","observation_id":"ebcc8601-cdcc-4528-926f-e3e76cfb6df1","resolution":{"observed_at":"2026-08-06T19:40:01.185686Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:40:00.891435Z","title":null,"venue":null,"work_id":"d1f0dfa4-a432-48a0-90a7-3a9823b2b623","year":2024},"citing_paper":{"arxiv_id":"2507.04959","last_updated":"2025-07-13T09:31:19Z","snapshot_observed_at":"2026-08-07T10:47:44.341783Z","submitted_at":"2025-07-07T13:01:50Z","title":"Hear-Your-Click: Interactive Object-Specific Video-to-Audio Generation","version":2},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-06T19:39:54.751007Z"},"links":{"citing_paper":"/paper/2507.04959"},"observation_digest":"sha256:1341a2455ff485a18013d15376f6114af5b2fc40390563f920d01947273e28ad","observation_id":"a9c2ecf8-4692-48a4-8641-4f17eee50514","resolution":{"observed_at":"2026-08-06T19:40:00.924856Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:40:00.809878Z","title":null,"venue":null,"work_id":"4061aff4-d26e-47c1-a8bf-4622cbda299e","year":null},"citing_paper":{"arxiv_id":"2507.04959","last_updated":"2025-07-13T09:31:19Z","snapshot_observed_at":"2026-08-07T10:47:44.341783Z","submitted_at":"2025-07-07T13:01:50Z","title":"Hear-Your-Click: Interactive Object-Specific Video-to-Audio Generation","version":2},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-06T19:39:54.866408Z"},"links":{"citing_paper":"/paper/2507.04959"},"observation_digest":"sha256:c419ae506a8c8abfebd3d3d322499f9ec911ee9aec6602cca1581d94ef42e9d0","observation_id":"b9d85108-dafb-47c9-86cb-e55f90f1f40b","resolution":{"observed_at":"2026-08-06T19:40:00.840736Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:39:54.654896Z","title":"IEEE/ACM Transactions on Audio, Speech, and Language Processing 32 (2024), 2871–2883","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.04959","last_updated":"2025-07-13T09:31:19Z","snapshot_observed_at":"2026-08-07T10:47:44.341783Z","submitted_at":"2025-07-07T13:01:50Z","title":"Hear-Your-Click: Interactive Object-Specific Video-to-Audio Generation","version":2},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-06T19:39:54.654896Z"},"links":{"citing_paper":"/paper/2507.04959"},"observation_digest":"sha256:68e89b14e7e14bc17f07d54c2fe6dec2c54afec29b655ef57cf9e4be8fb70d76","observation_id":"98b2e379-21b1-47ef-8de7-cb2f6b62be4b","resolution":{"observed_at":"2026-08-06T19:39:54.654896Z","resolver_source":null,"status":"malformed_identifier"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:40:00.571858Z","title":null,"venue":null,"work_id":"594ada27-847f-4b1c-85de-b23ecc47e513","year":null},"citing_paper":{"arxiv_id":"2507.04959","last_updated":"2025-07-13T09:31:19Z","snapshot_observed_at":"2026-08-07T10:47:44.341783Z","submitted_at":"2025-07-07T13:01:50Z","title":"Hear-Your-Click: Interactive Object-Specific Video-to-Audio Generation","version":2},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-06T19:39:55.155913Z"},"links":{"citing_paper":"/paper/2507.04959"},"observation_digest":"sha256:8dbe8d6b6e0a06bf8b50cb0f51cc0cc5b7442c76f09648bff58c6aafce90e078","observation_id":"55816bce-be8a-4743-a773-3f0d6905ccd4","resolution":{"observed_at":"2026-08-06T19:40:00.631460Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2211.01095","last_updated":"2025-05-19T07:56:56Z","snapshot_observed_at":"2026-07-29T20:17:21.488997Z","submitted_at":"2022-11-02T13:14:30Z","title":"DPM-Solver++: Fast Solver for Guided Sampling of Diffusion Probabilistic Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2211.01095","snapshot_observed_at":"2026-08-06T19:39:54.725495Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2507.04959","last_updated":"2025-07-13T09:31:19Z","snapshot_observed_at":"2026-08-07T10:47:44.341783Z","submitted_at":"2025-07-07T13:01:50Z","title":"Hear-Your-Click: Interactive Object-Specific Video-to-Audio Generation","version":2},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-06T19:39:54.725495Z"},"links":{"cited_paper":"/paper/2211.01095","citing_paper":"/paper/2507.04959"},"observation_digest":"sha256:65f08737f2f924ac8eb483353999d75488c80ca4973342336fbc9a57f4b9b3b8","observation_id":"71ff73be-b19b-422b-b69c-52b714bd4136","resolution":{"observed_at":"2026-08-06T19:39:54.725495Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:40:00.457360Z","title":null,"venue":null,"work_id":"c0a4f26e-e812-4837-8faa-d630d5340bcd","year":2022},"citing_paper":{"arxiv_id":"2507.04959","last_updated":"2025-07-13T09:31:19Z","snapshot_observed_at":"2026-08-07T10:47:44.341783Z","submitted_at":"2025-07-07T13:01:50Z","title":"Hear-Your-Click: Interactive Object-Specific Video-to-Audio Generation","version":2},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-06T19:39:55.490404Z"},"links":{"citing_paper":"/paper/2507.04959"},"observation_digest":"sha256:1426c6106d0b9a9f401fff24b35a8742bb46f01ef716bf8ee849d485c7b043b8","observation_id":"886f3f58-ff5d-4256-8e99-ba174a8c7187","resolution":{"observed_at":"2026-08-06T19:40:00.494772Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:40:00.368034Z","title":null,"venue":null,"work_id":"a06dd18f-b0b4-4353-9e3f-72bdcf713a01","year":2023},"citing_paper":{"arxiv_id":"2507.04959","last_updated":"2025-07-13T09:31:19Z","snapshot_observed_at":"2026-08-07T10:47:44.341783Z","submitted_at":"2025-07-07T13:01:50Z","title":"Hear-Your-Click: Interactive Object-Specific Video-to-Audio Generation","version":2},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-06T19:39:55.579692Z"},"links":{"citing_paper":"/paper/2507.04959"},"observation_digest":"sha256:2438eed1a02c4f0a35e0117edc9aa09348857dd1390dd79206b77d3ab4fe146e","observation_id":"9b0248d9-2880-4da6-924e-8ef8d69bea6b","resolution":{"observed_at":"2026-08-06T19:40:00.408687Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2403.08268","last_updated":"2024-03-13T05:44:37Z","snapshot_observed_at":"2026-07-06T17:43:44.153710Z","submitted_at":"2024-03-13T05:44:37Z","title":"Follow-Your-Click: Open-domain Regional Image Animation via Short Prompts","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.08268","snapshot_observed_at":"2026-08-06T19:39:54.968164Z","title":"arXiv preprint arXiv:2403.08268 (2024)","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.04959","last_updated":"2025-07-13T09:31:19Z","snapshot_observed_at":"2026-08-07T10:47:44.341783Z","submitted_at":"2025-07-07T13:01:50Z","title":"Hear-Your-Click: Interactive Object-Specific Video-to-Audio Generation","version":2},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-06T19:39:54.968164Z"},"links":{"cited_paper":"/paper/2403.08268","citing_paper":"/paper/2507.04959"},"observation_digest":"sha256:6ec9546239fbc359c5f27f7deabd07356d5ccb60e3333d327c66f3ee20257d8d","observation_id":"1468a394-4a52-4449-9fa3-60514a38244d","resolution":{"observed_at":"2026-08-06T19:39:54.968164Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:40:00.709440Z","title":null,"venue":null,"work_id":"96abb773-ed94-4cc3-9281-f4ad09cec287","year":2021},"citing_paper":{"arxiv_id":"2507.04959","last_updated":"2025-07-13T09:31:19Z","snapshot_observed_at":"2026-08-07T10:47:44.341783Z","submitted_at":"2025-07-07T13:01:50Z","title":"Hear-Your-Click: Interactive Object-Specific Video-to-Audio Generation","version":2},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-06T19:39:55.069058Z"},"links":{"citing_paper":"/paper/2507.04959"},"observation_digest":"sha256:1ee9253a0f3e6a915e2a7379ec0b2ad975736ac8810d20ca318e41a9c2b660a7","observation_id":"002dccf9-976b-48cd-be9a-dcb3666ec33f","resolution":{"observed_at":"2026-08-06T19:40:00.766306Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:39:59.860623Z","title":null,"venue":null,"work_id":"918659f1-d00e-4405-ba5f-7fd0d16a4139","year":null},"citing_paper":{"arxiv_id":"2507.04959","last_updated":"2025-07-13T09:31:19Z","snapshot_observed_at":"2026-08-07T10:47:44.341783Z","submitted_at":"2025-07-07T13:01:50Z","title":"Hear-Your-Click: Interactive Object-Specific Video-to-Audio Generation","version":2},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-06T19:39:55.946213Z"},"links":{"citing_paper":"/paper/2507.04959"},"observation_digest":"sha256:0f602b98c345af999e51da863463e424deacf7b763aff4210c66bdb6fb8d591d","observation_id":"34b9fb55-75b5-490d-9da3-bf36a57fad81","resolution":{"observed_at":"2026-08-06T19:39:59.949155Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.10387","last_updated":"2024-07-15T01:49:59Z","snapshot_observed_at":"2026-07-06T18:46:14.144689Z","submitted_at":"2024-07-15T01:49:59Z","title":"Masked Generative Video-to-Audio Transformers with Enhanced Synchronicity","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.10387","snapshot_observed_at":"2026-08-06T19:39:55.265439Z","title":"arXiv preprint arXiv:2407.10387 (2024)","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.04959","last_updated":"2025-07-13T09:31:19Z","snapshot_observed_at":"2026-08-07T10:47:44.341783Z","submitted_at":"2025-07-07T13:01:50Z","title":"Hear-Your-Click: Interactive Object-Specific Video-to-Audio Generation","version":2},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-06T19:39:55.265439Z"},"links":{"cited_paper":"/paper/2407.10387","citing_paper":"/paper/2507.04959"},"observation_digest":"sha256:935713fd551e0db75e3c8de0f17e7bf4e65ab4ba6b4865e91ff6c3ef6b2cfafd","observation_id":"e36ae61c-fcb7-4b43-b9b8-0fc062fd2e54","resolution":{"observed_at":"2026-08-06T19:39:55.265439Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:39:55.381445Z","title":null,"venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2507.04959","last_updated":"2025-07-13T09:31:19Z","snapshot_observed_at":"2026-08-07T10:47:44.341783Z","submitted_at":"2025-07-07T13:01:50Z","title":"Hear-Your-Click: Interactive Object-Specific Video-to-Audio Generation","version":2},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-06T19:39:55.381445Z"},"links":{"citing_paper":"/paper/2507.04959"},"observation_digest":"sha256:8b5a8e7927ea6c325bb8e0710b3f16e6a3f300258272f488678039c39cd2797d","observation_id":"c5915422-7b04-4829-81e9-d4d6532ca460","resolution":{"observed_at":"2026-08-06T19:39:55.381445Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:39:59.570915Z","title":null,"venue":null,"work_id":"94e00631-4dc8-4658-821a-b2e41cda7d7a","year":2024},"citing_paper":{"arxiv_id":"2507.04959","last_updated":"2025-07-13T09:31:19Z","snapshot_observed_at":"2026-08-07T10:47:44.341783Z","submitted_at":"2025-07-07T13:01:50Z","title":"Hear-Your-Click: Interactive Object-Specific Video-to-Audio Generation","version":2},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-06T19:39:56.418497Z"},"links":{"citing_paper":"/paper/2507.04959"},"observation_digest":"sha256:e41239193b16aafef71e33d0d6dbd64dbee587efa1b9bc1f0e6a6b610061f35d","observation_id":"f5dfbfb7-b6db-405d-b87f-15c87ac582d7","resolution":{"observed_at":"2026-08-06T19:39:59.636795Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:39:59.426788Z","title":null,"venue":null,"work_id":"e7d8d2ff-b254-456b-9428-3213ee129da5","year":2023},"citing_paper":{"arxiv_id":"2507.04959","last_updated":"2025-07-13T09:31:19Z","snapshot_observed_at":"2026-08-07T10:47:44.341783Z","submitted_at":"2025-07-07T13:01:50Z","title":"Hear-Your-Click: Interactive Object-Specific Video-to-Audio Generation","version":2},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-06T19:39:56.546320Z"},"links":{"citing_paper":"/paper/2507.04959"},"observation_digest":"sha256:ac897692c6b2dbf5747d503dd03d4c77691b516a67442a47f7ff62ec95cfc4ad","observation_id":"70e37d59-e20e-4f80-a5bf-1a2171bced30","resolution":{"observed_at":"2026-08-06T19:39:59.497551Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:40:00.258287Z","title":null,"venue":null,"work_id":"a6162bfb-32e1-401f-b81e-fb9db7f38da7","year":2023},"citing_paper":{"arxiv_id":"2507.04959","last_updated":"2025-07-13T09:31:19Z","snapshot_observed_at":"2026-08-07T10:47:44.341783Z","submitted_at":"2025-07-07T13:01:50Z","title":"Hear-Your-Click: Interactive Object-Specific Video-to-Audio Generation","version":2},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-06T19:39:55.671382Z"},"links":{"citing_paper":"/paper/2507.04959"},"observation_digest":"sha256:a26cd4ec94bb3b8193f1fe9c9475920db7cf31be8b7f8954e5336c808b80b544","observation_id":"ee10da50-43cd-4984-ba70-b83a4b902016","resolution":{"observed_at":"2026-08-06T19:40:00.319464Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:40:00.072158Z","title":null,"venue":null,"work_id":"52dca43c-167e-46ea-b2b2-1c88be6c782b","year":2024},"citing_paper":{"arxiv_id":"2507.04959","last_updated":"2025-07-13T09:31:19Z","snapshot_observed_at":"2026-08-07T10:47:44.341783Z","submitted_at":"2025-07-07T13:01:50Z","title":"Hear-Your-Click: Interactive Object-Specific Video-to-Audio Generation","version":2},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-06T19:39:55.833913Z"},"links":{"citing_paper":"/paper/2507.04959"},"observation_digest":"sha256:6cd54958c4b2aca3d29f7e677b8660ed16c335b0a4baef13790f3810dbf2f4bc","observation_id":"79d897ec-a4f3-4022-8e46-e68d755665ca","resolution":{"observed_at":"2026-08-06T19:40:00.181294Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:39:58.393346Z","title":null,"venue":null,"work_id":"15561438-15d7-4707-8feb-4775712c6de4","year":2024},"citing_paper":{"arxiv_id":"2507.04959","last_updated":"2025-07-13T09:31:19Z","snapshot_observed_at":"2026-08-07T10:47:44.341783Z","submitted_at":"2025-07-07T13:01:50Z","title":"Hear-Your-Click: Interactive Object-Specific Video-to-Audio Generation","version":2},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-06T19:39:56.975149Z"},"links":{"citing_paper":"/paper/2507.04959"},"observation_digest":"sha256:0c6825c79870f99c495e6222f23840c1d4f5a95b55d683e1aa25353a2126025f","observation_id":"c642f2ee-432e-4545-847f-1233a794a53a","resolution":{"observed_at":"2026-08-06T19:39:58.505523Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.05782","last_updated":"2025-03-16T13:36:14Z","snapshot_observed_at":"2026-08-07T09:08:18.238973Z","submitted_at":"2024-07-08T09:45:20Z","title":"Sequential Contrastive Audio-Visual Learning","version":2},"cited_work":{"arxiv_id":"2407.05782","doi":null,"metadata_source":"pith","pith_arxiv_id":"2407.05782","snapshot_observed_at":"2026-08-06T19:39:57.302891Z","title":"Sequential Contrastive Audio-Visual Learning","venue":"cs.SD","work_id":"b180564c-d56f-448e-bc10-afbad9470c06","year":2024},"citing_paper":{"arxiv_id":"2507.04959","last_updated":"2025-07-13T09:31:19Z","snapshot_observed_at":"2026-08-07T10:47:44.341783Z","submitted_at":"2025-07-07T13:01:50Z","title":"Hear-Your-Click: Interactive Object-Specific Video-to-Audio Generation","version":2},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-06T19:39:56.044230Z"},"links":{"cited_paper":"/paper/2407.05782","citing_paper":"/paper/2507.04959"},"observation_digest":"sha256:459e73797a2bb2e0d990c549eaf5a96f9181cf51fa0dd0cfdc4f4fd56f05bfa6","observation_id":"60fe9a37-b0e5-4954-ad0f-1a01fc0f5504","resolution":{"observed_at":"2026-08-06T19:39:57.368414Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:39:56.154330Z","title":null,"venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2507.04959","last_updated":"2025-07-13T09:31:19Z","snapshot_observed_at":"2026-08-07T10:47:44.341783Z","submitted_at":"2025-07-07T13:01:50Z","title":"Hear-Your-Click: Interactive Object-Specific Video-to-Audio Generation","version":2},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-06T19:39:56.154330Z"},"links":{"citing_paper":"/paper/2507.04959"},"observation_digest":"sha256:8015095eabeb9a37d2c9cb53c3bc9867d8ec5ae088c73f048d30527163e8fd95","observation_id":"7c0f4ba3-7110-40d2-a57c-5230bce8de8a","resolution":{"observed_at":"2026-08-06T19:39:56.154330Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:39:59.696801Z","title":null,"venue":null,"work_id":"affc6103-1cd1-48ad-9cb3-2f1c3189cdec","year":2024},"citing_paper":{"arxiv_id":"2507.04959","last_updated":"2025-07-13T09:31:19Z","snapshot_observed_at":"2026-08-07T10:47:44.341783Z","submitted_at":"2025-07-07T13:01:50Z","title":"Hear-Your-Click: Interactive Object-Specific Video-to-Audio Generation","version":2},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-06T19:39:56.284381Z"},"links":{"citing_paper":"/paper/2507.04959"},"observation_digest":"sha256:0d909cd6c24d7af1834a5814eedcab868ce86139043920b40bd02b7a7f0405c2","observation_id":"969a5b33-b4fb-43c9-a076-b5a116d556d7","resolution":{"observed_at":"2026-08-06T19:39:59.773930Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:39:59.190594Z","title":null,"venue":null,"work_id":"40282e2b-c39f-4984-887e-c2ee7a6093fc","year":2024},"citing_paper":{"arxiv_id":"2507.04959","last_updated":"2025-07-13T09:31:19Z","snapshot_observed_at":"2026-08-07T10:47:44.341783Z","submitted_at":"2025-07-07T13:01:50Z","title":"Hear-Your-Click: Interactive Object-Specific Video-to-Audio Generation","version":2},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-06T19:39:56.692918Z"},"links":{"citing_paper":"/paper/2507.04959"},"observation_digest":"sha256:e42e02ed3797abaa473c9bf9f9676bbd997ac4c2d27f200ff67c134b71408cd1","observation_id":"50897d92-0f69-419e-9bd7-87341c0c0409","resolution":{"observed_at":"2026-08-06T19:39:59.325850Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:39:58.920900Z","title":null,"venue":null,"work_id":"75889072-53b6-4aab-9a2f-dcc6b6d47537","year":null},"citing_paper":{"arxiv_id":"2507.04959","last_updated":"2025-07-13T09:31:19Z","snapshot_observed_at":"2026-08-07T10:47:44.341783Z","submitted_at":"2025-07-07T13:01:50Z","title":"Hear-Your-Click: Interactive Object-Specific Video-to-Audio Generation","version":2},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-06T19:39:56.809105Z"},"links":{"citing_paper":"/paper/2507.04959"},"observation_digest":"sha256:b10ff1d2224c6c5e198e392377e92b30e04b36e278f892c58c0771b10b39e1b6","observation_id":"ca5b4710-8800-4595-99d7-0b37e154cf60","resolution":{"observed_at":"2026-08-06T19:39:59.050971Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:39:58.616805Z","title":"In Proceedings of the IEEE/CVF Conference on Computer Vision and Pattern Recognition","venue":null,"work_id":"8a534da2-0842-4f00-b506-f30d35b67170","year":null},"citing_paper":{"arxiv_id":"2507.04959","last_updated":"2025-07-13T09:31:19Z","snapshot_observed_at":"2026-08-07T10:47:44.341783Z","submitted_at":"2025-07-07T13:01:50Z","title":"Hear-Your-Click: Interactive Object-Specific Video-to-Audio Generation","version":2},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-06T19:39:56.897553Z"},"links":{"citing_paper":"/paper/2507.04959"},"observation_digest":"sha256:4dd1007d3b240c0940305031b1f3b075eed5f19323478903b106ff3c5a9dd380","observation_id":"d6734e55-4860-4499-b697-5d5f705f1e9f","resolution":{"observed_at":"2026-08-06T19:39:58.773220Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2304.11968","last_updated":"2023-04-28T03:21:27Z","snapshot_observed_at":"2026-08-10T06:14:13.595413Z","submitted_at":"2023-04-24T10:04:06Z","title":"Track Anything: Segment Anything Meets Videos","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2304.11968","snapshot_observed_at":"2026-08-06T19:39:57.025806Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.04959","last_updated":"2025-07-13T09:31:19Z","snapshot_observed_at":"2026-08-07T10:47:44.341783Z","submitted_at":"2025-07-07T13:01:50Z","title":"Hear-Your-Click: Interactive Object-Specific Video-to-Audio Generation","version":2},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-08-06T19:39:57.025806Z"},"links":{"cited_paper":"/paper/2304.11968","citing_paper":"/paper/2507.04959"},"observation_digest":"sha256:d76e9c6a2b70bf112b58769cb925abd08b0e1d7703dc427ce0abd2300422dc80","observation_id":"c66b9629-eb4d-4b1e-b7c0-17d197ee9f7f","resolution":{"observed_at":"2026-08-06T19:39:57.025806Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:39:58.197209Z","title":null,"venue":null,"work_id":"84f35579-c9d0-4e2d-8087-0ba9561183ab","year":2019},"citing_paper":{"arxiv_id":"2507.04959","last_updated":"2025-07-13T09:31:19Z","snapshot_observed_at":"2026-08-07T10:47:44.341783Z","submitted_at":"2025-07-07T13:01:50Z","title":"Hear-Your-Click: Interactive Object-Specific Video-to-Audio Generation","version":2},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-08-06T19:39:57.084611Z"},"links":{"citing_paper":"/paper/2507.04959"},"observation_digest":"sha256:7a6f2ca9f7a111563f77053ad39936b0328698d3789b70d6c895ad4f13ed1267","observation_id":"24951a8e-4dc5-4c97-afc9-a66dd78d89e2","resolution":{"observed_at":"2026-08-06T19:39:58.273405Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.01494","last_updated":"2024-07-01T17:35:56Z","snapshot_observed_at":"2026-08-07T10:46:50.742580Z","submitted_at":"2024-07-01T17:35:56Z","title":"FoleyCrafter: Bring Silent Videos to Life with Lifelike and Synchronized Sounds","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.01494","snapshot_observed_at":"2026-08-06T19:39:57.158925Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.04959","last_updated":"2025-07-13T09:31:19Z","snapshot_observed_at":"2026-08-07T10:47:44.341783Z","submitted_at":"2025-07-07T13:01:50Z","title":"Hear-Your-Click: Interactive Object-Specific Video-to-Audio Generation","version":2},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-08-06T19:39:57.158925Z"},"links":{"cited_paper":"/paper/2407.01494","citing_paper":"/paper/2507.04959"},"observation_digest":"sha256:7da1868678813e5e6a7eee427296b6303dfe8d70527b7093afb0310d857987a7","observation_id":"bfc0c11b-f339-45d8-9cc3-b579320ba730","resolution":{"observed_at":"2026-08-06T19:39:57.158925Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:40:02.580183Z","title":"In Proceedings of the IEEE/CVF international conference on computer vision","venue":null,"work_id":"f4f3ed3a-4faa-415d-9c91-80cf61a709b2","year":null},"citing_paper":{"arxiv_id":"2507.04959","last_updated":"2025-07-13T09:31:19Z","snapshot_observed_at":"2026-08-07T10:47:44.341783Z","submitted_at":"2025-07-07T13:01:50Z","title":"Hear-Your-Click: Interactive Object-Specific Video-to-Audio Generation","version":2},"reference_index":2019,"source":"pdf_text","source_observed_at":"2026-08-06T19:39:53.364872Z"},"links":{"citing_paper":"/paper/2507.04959"},"observation_digest":"sha256:be83b0337f7b4c3fc10b583d0c057c21720b979c8844c16734113bc24bcf78c6","observation_id":"cda8c648-880f-4b2c-a3e1-c289ee5cd7a6","resolution":{"observed_at":"2026-08-06T19:40:02.640597Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:40:03.487084Z","title":"In ICASSP 2020- 2020 IEEE International Conference on Acoustics, Speech and Signal Processing (ICASSP)","venue":null,"work_id":"600b74b8-53fc-4415-bcdf-8094e302e609","year":2020},"citing_paper":{"arxiv_id":"2507.04959","last_updated":"2025-07-13T09:31:19Z","snapshot_observed_at":"2026-08-07T10:47:44.341783Z","submitted_at":"2025-07-07T13:01:50Z","title":"Hear-Your-Click: Interactive Object-Specific Video-to-Audio Generation","version":2},"reference_index":2020,"source":"pdf_text","source_observed_at":"2026-08-06T19:39:52.899873Z"},"links":{"citing_paper":"/paper/2507.04959"},"observation_digest":"sha256:b4c25c36fefcdbcd1c0c97a62162fe4c340d2b2623d317b105140d75931443ca","observation_id":"ff2c66bd-993e-4447-baa2-1c330f5b06f9","resolution":{"observed_at":"2026-08-06T19:40:03.578680Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.04825","last_updated":"2024-05-13T14:05:00Z","snapshot_observed_at":"2026-08-10T07:59:31.427201Z","submitted_at":"2024-02-07T13:23:25Z","title":"Fast Timing-Conditioned Latent Audio Diffusion","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.04825","snapshot_observed_at":"2026-08-06T19:39:53.274224Z","title":"arXiv preprint arXiv:2402.04825 (2024)","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.04959","last_updated":"2025-07-13T09:31:19Z","snapshot_observed_at":"2026-08-07T10:47:44.341783Z","submitted_at":"2025-07-07T13:01:50Z","title":"Hear-Your-Click: Interactive Object-Specific Video-to-Audio Generation","version":2},"reference_index":2024,"source":"pdf_text","source_observed_at":"2026-08-06T19:39:53.274224Z"},"links":{"cited_paper":"/paper/2402.04825","citing_paper":"/paper/2507.04959"},"observation_digest":"sha256:10703edfeed5c12655ef3b2f00070fdedfc5aa21c493131bce06d39d88ec32dc","observation_id":"cd05d04f-bdfb-47f3-90e8-829559e48630","resolution":{"observed_at":"2026-08-06T19:39:53.274224Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2507.04959","last_updated":"2025-07-13T09:31:19Z","latest_version":2,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-07T10:47:44.341783Z","submitted_at":"2025-07-07T13:01:50Z","title":"Hear-Your-Click: Interactive Object-Specific Video-to-Audio Generation"},"reference_resolution":{"displayed":57,"state_counts":{"malformed_identifier":1,"metadata_mismatch":1,"parse_uncertain":0,"unresolved":48,"verified_exact":2,"verified_fuzzy":5},"total_outbound_references":57},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"thesis":"As of 10 August 2026, this Paper Citation Record lists 57 of 57 outbound references and 0 inbound Pith citation observations for arXiv:2507.04959."}