{"as_of":"2026-08-10T20:21:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:93a564b99d9557a09f248a2756225288fa90de4fd972bcfe2c91641b94ee9f2d","coverage":[{"denominator":69,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":69,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-05T14:03:22.242986Z","state":"measured"},{"denominator":69,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":69,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-10T06:31:04.303077+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2508.21761/citation-record","integrity":"/paper/2508.21761/integrity","json":"/paper/2508.21761/citation-record.json","paper":"/paper/2508.21761"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T14:03:34.892373Z","title":"Adobe audition sound effects, 2023","venue":null,"work_id":"192e25fc-0ddb-489b-84e1-e38041f5cd52","year":2023},"citing_paper":{"arxiv_id":"2508.21761","last_updated":"2025-08-29T16:36:16Z","snapshot_observed_at":"2026-08-09T01:02:15.677909Z","submitted_at":"2025-08-29T16:36:16Z","title":"Learning from Silence and Noise for Visual Sound Source Localization","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-05T14:03:15.918896Z"},"links":{"citing_paper":"/paper/2508.21761"},"observation_digest":"sha256:3a0fbb837a9a74cf7ee9bc307c762d91e52fc8b83012f079cf28e848822c191a","observation_id":"3e4a7fab-55d5-457f-86a4-8f3593837185","resolution":{"observed_at":"2026-08-05T14:03:34.971984Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T14:03:34.726592Z","title":"Self- supervised learning of audio-visual objects from video","venue":null,"work_id":"f520e76b-9039-45bf-ba55-8b037119cac3","year":2020},"citing_paper":{"arxiv_id":"2508.21761","last_updated":"2025-08-29T16:36:16Z","snapshot_observed_at":"2026-08-09T01:02:15.677909Z","submitted_at":"2025-08-29T16:36:16Z","title":"Learning from Silence and Noise for Visual Sound Source Localization","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-05T14:03:16.037998Z"},"links":{"citing_paper":"/paper/2508.21761"},"observation_digest":"sha256:dc8353bad50fdee4a8a7d6d1b76d47f1277fe5b28b9c6b4e5f16cf3c3e125b2f","observation_id":"2487fb81-ca58-4a6e-9bbc-3c103ff6edd9","resolution":{"observed_at":"2026-08-05T14:03:34.794728Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T14:03:34.521493Z","title":"Look, listen and learn","venue":null,"work_id":"6ccc8bfe-d219-43f7-b0ca-e3d6d100a5fc","year":2017},"citing_paper":{"arxiv_id":"2508.21761","last_updated":"2025-08-29T16:36:16Z","snapshot_observed_at":"2026-08-09T01:02:15.677909Z","submitted_at":"2025-08-29T16:36:16Z","title":"Learning from Silence and Noise for Visual Sound Source Localization","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-05T14:03:16.212958Z"},"links":{"citing_paper":"/paper/2508.21761"},"observation_digest":"sha256:c6895d6f52ea1c55fb742c7952e1b5efc0fb74a2b261e31af2bfb2fa42fc5f1c","observation_id":"167a7fe3-becb-4103-88ac-23a71fd954ee","resolution":{"observed_at":"2026-08-05T14:03:34.604618Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T14:03:34.284783Z","title":"Objects that sound","venue":null,"work_id":"7bed885b-93ee-431b-ac53-d9422478dd40","year":2018},"citing_paper":{"arxiv_id":"2508.21761","last_updated":"2025-08-29T16:36:16Z","snapshot_observed_at":"2026-08-09T01:02:15.677909Z","submitted_at":"2025-08-29T16:36:16Z","title":"Learning from Silence and Noise for Visual Sound Source Localization","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-05T14:03:16.317154Z"},"links":{"citing_paper":"/paper/2508.21761"},"observation_digest":"sha256:f55f8f295e34938616ae8becca982970af2bf5c653b7224cc8514e1cdc693c8a","observation_id":"36d7af9e-35fc-4dd2-a2c6-11d63e7e929c","resolution":{"observed_at":"2026-08-05T14:03:34.384136Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T14:03:34.027677Z","title":"Vggsound: A large-scale audio-visual dataset","venue":null,"work_id":"16174d9b-7007-41a5-a855-4fcea9ace903","year":2020},"citing_paper":{"arxiv_id":"2508.21761","last_updated":"2025-08-29T16:36:16Z","snapshot_observed_at":"2026-08-09T01:02:15.677909Z","submitted_at":"2025-08-29T16:36:16Z","title":"Learning from Silence and Noise for Visual Sound Source Localization","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-05T14:03:16.462096Z"},"links":{"citing_paper":"/paper/2508.21761"},"observation_digest":"sha256:18d357e8fe5d51bd152bac25099dea437a3fac93688cb7976d09067bfc721195","observation_id":"06da2763-a6f0-434b-915e-20afb4a4cf7f","resolution":{"observed_at":"2026-08-05T14:03:34.185269Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T14:03:33.755733Z","title":"Localizing visual sounds the hard way","venue":null,"work_id":"054ad0ef-6927-4c7f-96bf-6c5d8415f507","year":2021},"citing_paper":{"arxiv_id":"2508.21761","last_updated":"2025-08-29T16:36:16Z","snapshot_observed_at":"2026-08-09T01:02:15.677909Z","submitted_at":"2025-08-29T16:36:16Z","title":"Learning from Silence and Noise for Visual Sound Source Localization","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-05T14:03:16.662025Z"},"links":{"citing_paper":"/paper/2508.21761"},"observation_digest":"sha256:b691b8f77ce3d41fa586fef054fbd36f226ae26974fea23bc60bf4b8322853aa","observation_id":"8f8dccc0-9e7d-48aa-8820-e48257bbecff","resolution":{"observed_at":"2026-08-05T14:03:33.877814Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T14:03:16.836987Z","title":"A simple framework for contrastive learning of visual representations","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2508.21761","last_updated":"2025-08-29T16:36:16Z","snapshot_observed_at":"2026-08-09T01:02:15.677909Z","submitted_at":"2025-08-29T16:36:16Z","title":"Learning from Silence and Noise for Visual Sound Source Localization","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-05T14:03:16.836987Z"},"links":{"citing_paper":"/paper/2508.21761"},"observation_digest":"sha256:9be600234d1fce7755e428467f78d0e4c573ce6918cc9a7e2ee7a7743f2855c5","observation_id":"ce4379dd-7053-4613-9993-a857258bcb61","resolution":{"observed_at":"2026-08-05T14:03:16.836987Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T14:03:33.585678Z","title":"Exploring simple siamese representation learning","venue":null,"work_id":"6ff5f9e2-ea95-406f-b04e-95a823fa26f7","year":2021},"citing_paper":{"arxiv_id":"2508.21761","last_updated":"2025-08-29T16:36:16Z","snapshot_observed_at":"2026-08-09T01:02:15.677909Z","submitted_at":"2025-08-29T16:36:16Z","title":"Learning from Silence and Noise for Visual Sound Source Localization","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-05T14:03:16.989821Z"},"links":{"citing_paper":"/paper/2508.21761"},"observation_digest":"sha256:708514efba3ab8305c9a55fffb3dd03691554924dba550525f0f41195ff326c5","observation_id":"9612ced4-e39e-4d8f-98e7-88a8bb288676","resolution":{"observed_at":"2026-08-05T14:03:33.654480Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2408.12102","last_updated":"2024-08-22T03:34:03Z","snapshot_observed_at":"2026-08-10T07:05:53.947754Z","submitted_at":"2024-08-22T03:34:03Z","title":"Integrating Audio, Visual, and Semantic Information for Enhanced Multimodal Speaker Diarization","version":1},"cited_work":{"arxiv_id":"2408.12102","doi":null,"metadata_source":"pith","pith_arxiv_id":"2408.12102","snapshot_observed_at":"2026-08-05T14:03:23.702312Z","title":"Integrating Audio, Visual, and Semantic Information for Enhanced Multimodal Speaker Diarization","venue":"cs.LG","work_id":"9e879b76-c8a9-4c23-9e47-2a5f64fb1e88","year":2024},"citing_paper":{"arxiv_id":"2508.21761","last_updated":"2025-08-29T16:36:16Z","snapshot_observed_at":"2026-08-09T01:02:15.677909Z","submitted_at":"2025-08-29T16:36:16Z","title":"Learning from Silence and Noise for Visual Sound Source Localization","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-05T14:03:17.100791Z"},"links":{"cited_paper":"/paper/2408.12102","citing_paper":"/paper/2508.21761"},"observation_digest":"sha256:a83642393b29604eb0b1347f587dedb9710cb1ada748fe1084390584be042d3e","observation_id":"18f1a1bf-66a1-46a6-84d2-e8af7158bfb4","resolution":{"observed_at":"2026-08-05T14:03:23.762550Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T14:03:33.416848Z","title":"Learning a similarity metric discrimi- natively, with application to face verification","venue":null,"work_id":"7784c732-7553-40b7-a931-9f51ce77acc9","year":2005},"citing_paper":{"arxiv_id":"2508.21761","last_updated":"2025-08-29T16:36:16Z","snapshot_observed_at":"2026-08-09T01:02:15.677909Z","submitted_at":"2025-08-29T16:36:16Z","title":"Learning from Silence and Noise for Visual Sound Source Localization","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-05T14:03:17.193287Z"},"links":{"citing_paper":"/paper/2508.21761"},"observation_digest":"sha256:d5abdcd252ffa49eac7aa8777d61c20f99049b9c5de58f260e914ac8c43e8bd3","observation_id":"0a716c15-8ebd-4fd0-88bb-34b2ee5bbf71","resolution":{"observed_at":"2026-08-05T14:03:33.487670Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T14:03:33.179784Z","title":"Imagenet: A large-scale hierarchical image database","venue":null,"work_id":"4ba9d353-9e2b-430c-8e98-1eb9d84c21cb","year":2009},"citing_paper":{"arxiv_id":"2508.21761","last_updated":"2025-08-29T16:36:16Z","snapshot_observed_at":"2026-08-09T01:02:15.677909Z","submitted_at":"2025-08-29T16:36:16Z","title":"Learning from Silence and Noise for Visual Sound Source Localization","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-05T14:03:17.318838Z"},"links":{"citing_paper":"/paper/2508.21761"},"observation_digest":"sha256:64d0cd1678b0bbece934281ac5a69bb031b4c89c3b5a1f26bb0f8352249db566","observation_id":"e14f1e04-fc7c-4f20-a678-de813f45fdb2","resolution":{"observed_at":"2026-08-05T14:03:33.265198Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T14:03:33.056288Z","title":"Condi- tional generation of audio from video via foley analogies","venue":null,"work_id":"c85ed274-cdcf-439b-9b46-45a9a6ef63fb","year":2023},"citing_paper":{"arxiv_id":"2508.21761","last_updated":"2025-08-29T16:36:16Z","snapshot_observed_at":"2026-08-09T01:02:15.677909Z","submitted_at":"2025-08-29T16:36:16Z","title":"Learning from Silence and Noise for Visual Sound Source Localization","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-05T14:03:17.370379Z"},"links":{"citing_paper":"/paper/2508.21761"},"observation_digest":"sha256:5e3f66067ee5679b532450ac0e6087db1ae1fe49d99c437c815df3d3803c7893","observation_id":"d975b22f-4ca3-4589-a2e4-72ee818513cb","resolution":{"observed_at":"2026-08-05T14:03:33.105208Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.01774","last_updated":"2025-01-15T13:04:43Z","snapshot_observed_at":"2026-08-04T23:59:19.987065Z","submitted_at":"2024-07-01T20:06:57Z","title":"Audio-Visual Approach For Multimodal Concurrent Speaker Detection","version":2},"cited_work":{"arxiv_id":"2407.01774","doi":null,"metadata_source":"pith","pith_arxiv_id":"2407.01774","snapshot_observed_at":"2026-08-05T14:03:23.533527Z","title":"Audio-Visual Approach For Multimodal Concurrent Speaker Detection","venue":"eess.AS","work_id":"484f7897-9b84-488a-ad4e-f86b513bcd51","year":2024},"citing_paper":{"arxiv_id":"2508.21761","last_updated":"2025-08-29T16:36:16Z","snapshot_observed_at":"2026-08-09T01:02:15.677909Z","submitted_at":"2025-08-29T16:36:16Z","title":"Learning from Silence and Noise for Visual Sound Source Localization","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-05T14:03:17.449504Z"},"links":{"cited_paper":"/paper/2407.01774","citing_paper":"/paper/2508.21761"},"observation_digest":"sha256:88545ae41f6b272ca3e48bd5fee09911eb4ce547000f229a5255d5805d5667a7","observation_id":"289e305d-b66e-4ba4-bce0-e02e77410ff9","resolution":{"observed_at":"2026-08-05T14:03:23.586547Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T14:03:32.880973Z","title":"Effect of acoustic scene complexity and visual scene representation on auditory perception in virtual audio-visual environments","venue":null,"work_id":"5035cac2-63c3-4257-bee4-2dcd5320b3f8","year":2021},"citing_paper":{"arxiv_id":"2508.21761","last_updated":"2025-08-29T16:36:16Z","snapshot_observed_at":"2026-08-09T01:02:15.677909Z","submitted_at":"2025-08-29T16:36:16Z","title":"Learning from Silence and Noise for Visual Sound Source Localization","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-05T14:03:17.494864Z"},"links":{"citing_paper":"/paper/2508.21761"},"observation_digest":"sha256:d3de1f522e63ebf63ddca2830e3af71415c450084845e23ea17aedd68d1bf79a","observation_id":"4ab82633-9016-4ffb-81d5-3db50d0ec276","resolution":{"observed_at":"2026-08-05T14:03:32.961414Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T14:03:32.674566Z","title":"Learning joint sta- tistical models for audio-visual fusion and segregation","venue":null,"work_id":"0baec302-4216-4bc5-a848-d0a323150628","year":2000},"citing_paper":{"arxiv_id":"2508.21761","last_updated":"2025-08-29T16:36:16Z","snapshot_observed_at":"2026-08-09T01:02:15.677909Z","submitted_at":"2025-08-29T16:36:16Z","title":"Learning from Silence and Noise for Visual Sound Source Localization","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-05T14:03:17.608532Z"},"links":{"citing_paper":"/paper/2508.21761"},"observation_digest":"sha256:01359b72542f320d7c19d66900974c5fd03dd03742af38e36283ecf68ab07203","observation_id":"7035228b-f75d-47ad-8bb6-095d71fefd7f","resolution":{"observed_at":"2026-08-05T14:03:32.769252Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T14:03:32.499191Z","title":"Visualvoice: Audio-visual speech separation with cross-modal consistency","venue":null,"work_id":"4080f8f4-dc7b-4a18-a975-5ce78876e120","year":2021},"citing_paper":{"arxiv_id":"2508.21761","last_updated":"2025-08-29T16:36:16Z","snapshot_observed_at":"2026-08-09T01:02:15.677909Z","submitted_at":"2025-08-29T16:36:16Z","title":"Learning from Silence and Noise for Visual Sound Source Localization","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-05T14:03:17.717130Z"},"links":{"citing_paper":"/paper/2508.21761"},"observation_digest":"sha256:e62def7675530c6261ae3736dc595d1c062798658c58ac7c3b050458898f79d6","observation_id":"21b16037-084b-48f8-9727-8994e6d63e22","resolution":{"observed_at":"2026-08-05T14:03:32.569106Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T14:03:32.251520Z","title":"Cyclip: Cyclic contrastive language-image pretraining","venue":null,"work_id":"b142c3c0-89a7-41ef-9757-14c88c2131e6","year":2022},"citing_paper":{"arxiv_id":"2508.21761","last_updated":"2025-08-29T16:36:16Z","snapshot_observed_at":"2026-08-09T01:02:15.677909Z","submitted_at":"2025-08-29T16:36:16Z","title":"Learning from Silence and Noise for Visual Sound Source Localization","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-05T14:03:17.817540Z"},"links":{"citing_paper":"/paper/2508.21761"},"observation_digest":"sha256:1b076ceb99398ad74e212a75a59769df0f513d79d10a678ef79515ca52d583ee","observation_id":"7a8dccc9-a42b-4a45-9b98-5a25c45fe29f","resolution":{"observed_at":"2026-08-05T14:03:32.373662Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T14:03:17.872247Z","title":"Bootstrap your own latent-a new approach to self-supervised learning","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2508.21761","last_updated":"2025-08-29T16:36:16Z","snapshot_observed_at":"2026-08-09T01:02:15.677909Z","submitted_at":"2025-08-29T16:36:16Z","title":"Learning from Silence and Noise for Visual Sound Source Localization","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-05T14:03:17.872247Z"},"links":{"citing_paper":"/paper/2508.21761"},"observation_digest":"sha256:06ba5032cbd2d50a2c4206daf41ce821128b16921ffdeacd692b8b768d353530","observation_id":"555accc2-bd1e-4443-be62-406557953cf7","resolution":{"observed_at":"2026-08-05T14:03:17.872247Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T14:03:32.076017Z","title":"chirp\" from the","venue":null,"work_id":"d9c8b27e-7d41-47fa-98f1-2d5e124da60e","year":2024},"citing_paper":{"arxiv_id":"2508.21761","last_updated":"2025-08-29T16:36:16Z","snapshot_observed_at":"2026-08-09T01:02:15.677909Z","submitted_at":"2025-08-29T16:36:16Z","title":"Learning from Silence and Noise for Visual Sound Source Localization","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-05T14:03:17.970801Z"},"links":{"citing_paper":"/paper/2508.21761"},"observation_digest":"sha256:7dca7ac0e2fd516aa8435297ceaadf8cfb61512c1cd43d7c1c3e96e50922bd19","observation_id":"9117824f-d757-446f-a13a-c5ca6b004c8a","resolution":{"observed_at":"2026-08-05T14:03:32.139912Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T14:03:31.865893Z","title":"Canonical correlation analysis: An overview with application to learning methods","venue":null,"work_id":"dd518fc3-5218-4535-9b97-cabae0f3a266","year":2004},"citing_paper":{"arxiv_id":"2508.21761","last_updated":"2025-08-29T16:36:16Z","snapshot_observed_at":"2026-08-09T01:02:15.677909Z","submitted_at":"2025-08-29T16:36:16Z","title":"Learning from Silence and Noise for Visual Sound Source Localization","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-05T14:03:18.046880Z"},"links":{"citing_paper":"/paper/2508.21761"},"observation_digest":"sha256:4203aa1a81824c101723b1585809ad43564308f30efc55518585801dedc4dcca","observation_id":"c1f857d6-a920-4f0c-8c65-9a2f577b3ec1","resolution":{"observed_at":"2026-08-05T14:03:31.989916Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T14:03:31.663281Z","title":"Deep residual learning for image recognition","venue":null,"work_id":"1c947c28-5c8f-4fe1-8578-0a1dd3aa77ce","year":2016},"citing_paper":{"arxiv_id":"2508.21761","last_updated":"2025-08-29T16:36:16Z","snapshot_observed_at":"2026-08-09T01:02:15.677909Z","submitted_at":"2025-08-29T16:36:16Z","title":"Learning from Silence and Noise for Visual Sound Source Localization","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-05T14:03:18.151815Z"},"links":{"citing_paper":"/paper/2508.21761"},"observation_digest":"sha256:ac27e6cdce27b0a12541f6710c73d749a5fc8251c26cf1904add58aac26024bf","observation_id":"f9ac9d16-c864-4f9a-874c-84270023d2d5","resolution":{"observed_at":"2026-08-05T14:03:31.716044Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T14:03:31.516313Z","title":"Momentum contrast for unsupervised visual representation learning","venue":null,"work_id":"2b8fcbca-cfb3-4613-aa86-11dd93a9789f","year":2020},"citing_paper":{"arxiv_id":"2508.21761","last_updated":"2025-08-29T16:36:16Z","snapshot_observed_at":"2026-08-09T01:02:15.677909Z","submitted_at":"2025-08-29T16:36:16Z","title":"Learning from Silence and Noise for Visual Sound Source Localization","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-05T14:03:18.223211Z"},"links":{"citing_paper":"/paper/2508.21761"},"observation_digest":"sha256:a6cf899206dd67e1a0ac9c02f2e561814b0c5e84a6cadc09762d28d66e7e1019","observation_id":"bdcaa123-6481-48ef-8d32-f6d0a08e3848","resolution":{"observed_at":"2026-08-05T14:03:31.579954Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T14:03:31.255057Z","title":"Audio vision: Using audio-visual synchrony to locate sounds","venue":null,"work_id":"e3dc48cc-0fb3-4790-8419-257cd632f798","year":1999},"citing_paper":{"arxiv_id":"2508.21761","last_updated":"2025-08-29T16:36:16Z","snapshot_observed_at":"2026-08-09T01:02:15.677909Z","submitted_at":"2025-08-29T16:36:16Z","title":"Learning from Silence and Noise for Visual Sound Source Localization","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-05T14:03:18.309446Z"},"links":{"citing_paper":"/paper/2508.21761"},"observation_digest":"sha256:c72bb4757d2713a07d21cfb3de154360ce3a0e45c1850157f462745980f88749","observation_id":"1531a6c8-67b1-4cd1-b540-fb97086735e4","resolution":{"observed_at":"2026-08-05T14:03:31.401708Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T14:03:31.062189Z","title":"Discriminative sounding objects localization via self-supervised audiovisual matching","venue":null,"work_id":"f0a21758-6649-45af-be3b-6c875a942f17","year":2020},"citing_paper":{"arxiv_id":"2508.21761","last_updated":"2025-08-29T16:36:16Z","snapshot_observed_at":"2026-08-09T01:02:15.677909Z","submitted_at":"2025-08-29T16:36:16Z","title":"Learning from Silence and Noise for Visual Sound Source Localization","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-05T14:03:18.380386Z"},"links":{"citing_paper":"/paper/2508.21761"},"observation_digest":"sha256:be12f2763cddc125952d3d51d61865849aa44f51af5ca79f3f4ae9b184b0d1b2","observation_id":"2f85e6e0-8b9c-4b19-b9d8-e3c329afbaa8","resolution":{"observed_at":"2026-08-05T14:03:31.135238Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T14:03:30.793236Z","title":"Mix and localize: Localizing sound sources in mixtures","venue":null,"work_id":"d92594b5-1568-47ff-ac3f-c2461211e5eb","year":2022},"citing_paper":{"arxiv_id":"2508.21761","last_updated":"2025-08-29T16:36:16Z","snapshot_observed_at":"2026-08-09T01:02:15.677909Z","submitted_at":"2025-08-29T16:36:16Z","title":"Learning from Silence and Noise for Visual Sound Source Localization","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-05T14:03:18.493766Z"},"links":{"citing_paper":"/paper/2508.21761"},"observation_digest":"sha256:603d84221f637e50459f2977e2b5229e800580c99477a740b4a0d09d18aa4370","observation_id":"d41ebcae-edae-4131-a152-077352edea82","resolution":{"observed_at":"2026-08-05T14:03:30.939933Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T14:03:30.589035Z","title":"You said that?: Synthesising talking faces from audio","venue":null,"work_id":"cc02d670-c3f0-499b-a8cd-7ac94eac815c","year":2019},"citing_paper":{"arxiv_id":"2508.21761","last_updated":"2025-08-29T16:36:16Z","snapshot_observed_at":"2026-08-09T01:02:15.677909Z","submitted_at":"2025-08-29T16:36:16Z","title":"Learning from Silence and Noise for Visual Sound Source Localization","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-05T14:03:18.591004Z"},"links":{"citing_paper":"/paper/2508.21761"},"observation_digest":"sha256:01877b0c8128dca7417ec6a629c75299ad327eff1044b268354fd3e5915ab96f","observation_id":"f24628e5-4deb-4bd6-a161-2ec939372d7b","resolution":{"observed_at":"2026-08-05T14:03:30.689850Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T14:03:30.394328Z","title":"A critical assessment of visual sound source localization models including negative audio","venue":null,"work_id":"8439a8bf-8baf-4506-865f-4f7ed57b6536","year":2025},"citing_paper":{"arxiv_id":"2508.21761","last_updated":"2025-08-29T16:36:16Z","snapshot_observed_at":"2026-08-09T01:02:15.677909Z","submitted_at":"2025-08-29T16:36:16Z","title":"Learning from Silence and Noise for Visual Sound Source Localization","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-05T14:03:18.664703Z"},"links":{"citing_paper":"/paper/2508.21761"},"observation_digest":"sha256:f4aee761339731747fceaebb5c442102dfae475413c49041297ed1ac6080de8e","observation_id":"fe8c4062-3b87-4099-b58b-ab27916b5b14","resolution":{"observed_at":"2026-08-05T14:03:30.496216Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T14:03:30.203182Z","title":"Pixels that sound","venue":null,"work_id":"9cf301c8-eeeb-40a4-bb57-cc896fb39c0d","year":2005},"citing_paper":{"arxiv_id":"2508.21761","last_updated":"2025-08-29T16:36:16Z","snapshot_observed_at":"2026-08-09T01:02:15.677909Z","submitted_at":"2025-08-29T16:36:16Z","title":"Learning from Silence and Noise for Visual Sound Source Localization","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-05T14:03:18.762759Z"},"links":{"citing_paper":"/paper/2508.21761"},"observation_digest":"sha256:aafb8f0633aca2ef91f3c36a5dcb3d83d8b01df83ea8bc54b74db9bf8c53718b","observation_id":"3c20823b-4950-455a-9f2d-e625d405f647","resolution":{"observed_at":"2026-08-05T14:03:30.279438Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T14:03:30.012945Z","title":"Learning to visually localize sound sources from mixtures without prior source knowledge","venue":null,"work_id":"6df45389-6ef0-4a89-a4e6-0d01520391d8","year":2024},"citing_paper":{"arxiv_id":"2508.21761","last_updated":"2025-08-29T16:36:16Z","snapshot_observed_at":"2026-08-09T01:02:15.677909Z","submitted_at":"2025-08-29T16:36:16Z","title":"Learning from Silence and Noise for Visual Sound Source Localization","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-05T14:03:18.830545Z"},"links":{"citing_paper":"/paper/2508.21761"},"observation_digest":"sha256:1eb1116b8578549038d7de7dae03b91228d78af62c0c8d389ca9577a24acfdb2","observation_id":"86a4e8a1-aca1-4a30-a092-b47e19d647af","resolution":{"observed_at":"2026-08-05T14:03:30.115536Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1412.6980","last_updated":"2017-01-30T01:27:54Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2014-12-22T13:54:29Z","title":"Adam: A Method for Stochastic Optimization","version":9},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1412.6980","snapshot_observed_at":"2026-08-05T14:03:18.902349Z","title":"Adam: A method for stochastic optimization","venue":null,"work_id":null,"year":2014},"citing_paper":{"arxiv_id":"2508.21761","last_updated":"2025-08-29T16:36:16Z","snapshot_observed_at":"2026-08-09T01:02:15.677909Z","submitted_at":"2025-08-29T16:36:16Z","title":"Learning from Silence and Noise for Visual Sound Source Localization","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-05T14:03:18.902349Z"},"links":{"cited_paper":"/paper/1412.6980","citing_paper":"/paper/2508.21761"},"observation_digest":"sha256:348b81c600337d1571cf7e53cdb67584dc1e2a5f79dc6d76b0e272720ba90759","observation_id":"f74c8c59-b5b1-4b15-9869-a16ad8230e4a","resolution":{"observed_at":"2026-08-05T14:03:18.902349Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T14:03:29.862469Z","title":"Cooperative learning of audio and video models from self-supervised synchronization","venue":null,"work_id":"d33758f8-90f8-434c-8249-a5dc77004794","year":2018},"citing_paper":{"arxiv_id":"2508.21761","last_updated":"2025-08-29T16:36:16Z","snapshot_observed_at":"2026-08-09T01:02:15.677909Z","submitted_at":"2025-08-29T16:36:16Z","title":"Learning from Silence and Noise for Visual Sound Source Localization","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-05T14:03:19.044555Z"},"links":{"citing_paper":"/paper/2508.21761"},"observation_digest":"sha256:32b7c985fefc4e0fe727e0837e581a2c626cad9e0f6e0714f9ac8b63d6fef590","observation_id":"26e5a637-3c5a-4d02-83c3-de343d8cab76","resolution":{"observed_at":"2026-08-05T14:03:29.932477Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.15676","last_updated":"2026-06-01T14:59:35Z","snapshot_observed_at":"2026-07-06T16:37:42.806807Z","submitted_at":"2023-10-24T09:39:05Z","title":"Recent Advances in Multi-modal 3D Intelligence: A Comprehensive Survey and Evaluation","version":2},"cited_work":{"arxiv_id":"2310.15676","doi":null,"metadata_source":"pith","pith_arxiv_id":"2310.15676","snapshot_observed_at":"2026-08-05T14:03:23.280228Z","title":"Recent Advances in Multi-modal 3D Intelligence: A Comprehensive Survey and Evaluation","venue":"cs.CV","work_id":"014d37c5-aab4-4d2b-8428-130997206d69","year":2023},"citing_paper":{"arxiv_id":"2508.21761","last_updated":"2025-08-29T16:36:16Z","snapshot_observed_at":"2026-08-09T01:02:15.677909Z","submitted_at":"2025-08-29T16:36:16Z","title":"Learning from Silence and Noise for Visual Sound Source Localization","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-05T14:03:19.177165Z"},"links":{"cited_paper":"/paper/2310.15676","citing_paper":"/paper/2508.21761"},"observation_digest":"sha256:d15a3ec5cd6ab607813685acf9ee7e64f14734d4fcaa8bfe074acff4125de49c","observation_id":"c3270f41-9b6a-4e61-a63d-3ae7c5b4fc9e","resolution":{"observed_at":"2026-08-05T14:03:23.396154Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.00358","last_updated":"2025-02-20T22:37:12Z","snapshot_observed_at":"2026-08-10T19:20:27.419561Z","submitted_at":"2025-02-01T07:40:29Z","title":"Do Audio-Visual Segmentation Models Truly Segment Sounding Objects?","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.00358","snapshot_observed_at":"2026-08-05T14:03:19.216337Z","title":"Do audio-visual segmentation models truly segment sounding objects? arXiv preprint arXiv:2502.00358, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2508.21761","last_updated":"2025-08-29T16:36:16Z","snapshot_observed_at":"2026-08-09T01:02:15.677909Z","submitted_at":"2025-08-29T16:36:16Z","title":"Learning from Silence and Noise for Visual Sound Source Localization","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-05T14:03:19.216337Z"},"links":{"cited_paper":"/paper/2502.00358","citing_paper":"/paper/2508.21761"},"observation_digest":"sha256:da00908451952635d2373553b375082af85c22638608dbf684719047e9612252","observation_id":"5ac2cb49-56c7-419a-97c4-702c5577b400","resolution":{"observed_at":"2026-08-05T14:03:19.216337Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T14:03:29.620903Z","title":"Av-nerf: Learning neural fields for real-world audio-visual scene synthesis","venue":null,"work_id":"25c19cd7-f111-40e0-8e67-c0b5e5e8a9b7","year":2023},"citing_paper":{"arxiv_id":"2508.21761","last_updated":"2025-08-29T16:36:16Z","snapshot_observed_at":"2026-08-09T01:02:15.677909Z","submitted_at":"2025-08-29T16:36:16Z","title":"Learning from Silence and Noise for Visual Sound Source Localization","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-05T14:03:19.287441Z"},"links":{"citing_paper":"/paper/2508.21761"},"observation_digest":"sha256:be6cc58aadcb98e613a2013ca74c4a275389ad34a17c910dbbba3bf57a71a5b2","observation_id":"5726eb08-efbe-48d2-8b9a-57ff590efcdd","resolution":{"observed_at":"2026-08-05T14:03:29.749676Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T14:03:29.364947Z","title":"Exploiting transformation invariance and equivariance for self-supervised sound localisation","venue":null,"work_id":"6f7587b6-af2d-438a-8e4b-7b8fa5bfbcce","year":2022},"citing_paper":{"arxiv_id":"2508.21761","last_updated":"2025-08-29T16:36:16Z","snapshot_observed_at":"2026-08-09T01:02:15.677909Z","submitted_at":"2025-08-29T16:36:16Z","title":"Learning from Silence and Noise for Visual Sound Source Localization","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-05T14:03:19.364018Z"},"links":{"citing_paper":"/paper/2508.21761"},"observation_digest":"sha256:580062a08c7e6e98cdcaf2a18808360c166b555fc3bf7e8b369db87847828e37","observation_id":"545b8489-112a-4a7c-acb4-3bf5445ac3b9","resolution":{"observed_at":"2026-08-05T14:03:29.444007Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T14:03:29.196159Z","title":"Visual sound localization in the wild by cross-modal interference erasing","venue":null,"work_id":"70bcbaeb-0258-4c34-af9a-bc037644f686","year":2022},"citing_paper":{"arxiv_id":"2508.21761","last_updated":"2025-08-29T16:36:16Z","snapshot_observed_at":"2026-08-09T01:02:15.677909Z","submitted_at":"2025-08-29T16:36:16Z","title":"Learning from Silence and Noise for Visual Sound Source Localization","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-05T14:03:19.430163Z"},"links":{"citing_paper":"/paper/2508.21761"},"observation_digest":"sha256:773a15f3960eaea31a717d3a54e84594f7474cf08b01b487d3f0afd3d4eff5e2","observation_id":"d6efb336-eb53-4d2b-8eb8-ead267617474","resolution":{"observed_at":"2026-08-05T14:03:29.268918Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T14:03:28.902239Z","title":"Image segmentation using text and image prompts","venue":null,"work_id":"60241513-feb3-4ac8-9f92-cb85bbc07189","year":2022},"citing_paper":{"arxiv_id":"2508.21761","last_updated":"2025-08-29T16:36:16Z","snapshot_observed_at":"2026-08-09T01:02:15.677909Z","submitted_at":"2025-08-29T16:36:16Z","title":"Learning from Silence and Noise for Visual Sound Source Localization","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-05T14:03:19.524109Z"},"links":{"citing_paper":"/paper/2508.21761"},"observation_digest":"sha256:fd603abfd6a33699abe7f485555ba9038a8260917852ffbe9fedf678c8d0dc5c","observation_id":"dfadd034-3502-4d21-8367-823a8361e709","resolution":{"observed_at":"2026-08-05T14:03:29.062912Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T14:03:28.575451Z","title":"T-vsl: Text-guided visual sound source localization in mixtures","venue":null,"work_id":"828686e8-fe24-48b7-ae0e-fe9edbe964aa","year":2024},"citing_paper":{"arxiv_id":"2508.21761","last_updated":"2025-08-29T16:36:16Z","snapshot_observed_at":"2026-08-09T01:02:15.677909Z","submitted_at":"2025-08-29T16:36:16Z","title":"Learning from Silence and Noise for Visual Sound Source Localization","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-05T14:03:19.613935Z"},"links":{"citing_paper":"/paper/2508.21761"},"observation_digest":"sha256:c7a4ef829d906e14fded467d2c2a00317ec2e1a92c389213528bb109643b1dc1","observation_id":"f3b6196e-4d12-4e59-9b43-ef4eb58d925e","resolution":{"observed_at":"2026-08-05T14:03:28.730076Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T14:03:28.366911Z","title":"Localizing visual sounds the easy way","venue":null,"work_id":"4dba03c9-4e37-4844-9642-0f7715dec485","year":2022},"citing_paper":{"arxiv_id":"2508.21761","last_updated":"2025-08-29T16:36:16Z","snapshot_observed_at":"2026-08-09T01:02:15.677909Z","submitted_at":"2025-08-29T16:36:16Z","title":"Learning from Silence and Noise for Visual Sound Source Localization","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-05T14:03:19.694552Z"},"links":{"citing_paper":"/paper/2508.21761"},"observation_digest":"sha256:2d4c631e43c7d922d9cd79ca69aae6629f3c2fd8ad83a90bf9b2a6ef1289ddcd","observation_id":"1b55d64d-b16d-409d-bd20-36164e3dab4a","resolution":{"observed_at":"2026-08-05T14:03:28.457229Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T14:03:28.140235Z","title":"A closer look at weakly-supervised audio-visual source localization","venue":null,"work_id":"ea0a12cb-7b69-4f36-8133-1010c59d94c0","year":2022},"citing_paper":{"arxiv_id":"2508.21761","last_updated":"2025-08-29T16:36:16Z","snapshot_observed_at":"2026-08-09T01:02:15.677909Z","submitted_at":"2025-08-29T16:36:16Z","title":"Learning from Silence and Noise for Visual Sound Source Localization","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-05T14:03:19.728379Z"},"links":{"citing_paper":"/paper/2508.21761"},"observation_digest":"sha256:a8d9082bb704102ef24850a23ef89661bff22f2f798cfa69932dd49ad125d46a","observation_id":"5198aa3c-400b-4ebf-a71e-8d6cee7cc734","resolution":{"observed_at":"2026-08-05T14:03:28.241052Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T14:03:27.925477Z","title":"Audio-visual grouping network for sound localization from mixtures","venue":null,"work_id":"cdfdf67b-9a71-4d30-9d94-5e3be2e6427c","year":2023},"citing_paper":{"arxiv_id":"2508.21761","last_updated":"2025-08-29T16:36:16Z","snapshot_observed_at":"2026-08-09T01:02:15.677909Z","submitted_at":"2025-08-29T16:36:16Z","title":"Learning from Silence and Noise for Visual Sound Source Localization","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-05T14:03:19.819750Z"},"links":{"citing_paper":"/paper/2508.21761"},"observation_digest":"sha256:310e66cfc61e2550ec352a46e9447a0fb31fff56affe5740a1947d41c073c4a0","observation_id":"29abf2f1-28ad-4e4d-9c21-79903fa57789","resolution":{"observed_at":"2026-08-05T14:03:28.027267Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T14:03:27.754383Z","title":"V ovit: Low latency graph-based audio-visual voice separation transformer","venue":null,"work_id":"ded959de-01dd-4eb4-8922-525735a51134","year":2022},"citing_paper":{"arxiv_id":"2508.21761","last_updated":"2025-08-29T16:36:16Z","snapshot_observed_at":"2026-08-09T01:02:15.677909Z","submitted_at":"2025-08-29T16:36:16Z","title":"Learning from Silence and Noise for Visual Sound Source Localization","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-05T14:03:19.877524Z"},"links":{"citing_paper":"/paper/2508.21761"},"observation_digest":"sha256:7be6f6e8fca875ec0b6a980ab890882158e192f5205cc4d48dd67165e641b448","observation_id":"f6d1524a-ddb1-46a0-8027-bc1a17cdaaee","resolution":{"observed_at":"2026-08-05T14:03:27.867430Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T14:03:27.539792Z","title":"Speech inpainting: Context-based speech synthesis guided by video","venue":null,"work_id":"b4970bfa-e3c0-49ea-8233-efbb8a98af40","year":2023},"citing_paper":{"arxiv_id":"2508.21761","last_updated":"2025-08-29T16:36:16Z","snapshot_observed_at":"2026-08-09T01:02:15.677909Z","submitted_at":"2025-08-29T16:36:16Z","title":"Learning from Silence and Noise for Visual Sound Source Localization","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-05T14:03:19.963920Z"},"links":{"citing_paper":"/paper/2508.21761"},"observation_digest":"sha256:a767f840f2cdeb5a2943aba2fa9ac28a47d8e1838043b469f41946dbcd95cd2f","observation_id":"4212176c-8216-4b62-9e64-87aa0313ae39","resolution":{"observed_at":"2026-08-05T14:03:27.640497Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1807.03748","last_updated":"2019-01-22T18:47:12Z","snapshot_observed_at":"2026-07-06T06:49:24.960992Z","submitted_at":"2018-07-10T16:52:11Z","title":"Representation Learning with Contrastive Predictive Coding","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1807.03748","snapshot_observed_at":"2026-08-05T14:03:20.022923Z","title":"Representation learning with contrastive predictive coding","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2508.21761","last_updated":"2025-08-29T16:36:16Z","snapshot_observed_at":"2026-08-09T01:02:15.677909Z","submitted_at":"2025-08-29T16:36:16Z","title":"Learning from Silence and Noise for Visual Sound Source Localization","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-05T14:03:20.022923Z"},"links":{"cited_paper":"/paper/1807.03748","citing_paper":"/paper/2508.21761"},"observation_digest":"sha256:6f7af1803affc64cad6e752e75ec738b5ba74459459fd63f3a003fc2dce1fb58","observation_id":"35c1b0bd-8031-4bfc-87ec-decfcf16a85b","resolution":{"observed_at":"2026-08-05T14:03:20.022923Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T14:03:27.337938Z","title":"Audio-visual scene analysis with self-supervised multisensory features","venue":null,"work_id":"ad2659fe-42a3-461c-b757-1b54165aa241","year":2018},"citing_paper":{"arxiv_id":"2508.21761","last_updated":"2025-08-29T16:36:16Z","snapshot_observed_at":"2026-08-09T01:02:15.677909Z","submitted_at":"2025-08-29T16:36:16Z","title":"Learning from Silence and Noise for Visual Sound Source Localization","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-05T14:03:20.134878Z"},"links":{"citing_paper":"/paper/2508.21761"},"observation_digest":"sha256:e8dfc04465cee1fffc06bc7936f92b227901f80d15abdfba4f1fa4d534791442","observation_id":"ccb7fd8a-a7cb-4ea2-8729-807d1485a669","resolution":{"observed_at":"2026-08-05T14:03:27.447874Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T14:03:27.123250Z","title":"Do we need sound for sound source localization? In Asian Conference on Computer Vision, 2020","venue":null,"work_id":"a3f21693-6db5-47f6-8f04-aaa85b3bf1ec","year":2020},"citing_paper":{"arxiv_id":"2508.21761","last_updated":"2025-08-29T16:36:16Z","snapshot_observed_at":"2026-08-09T01:02:15.677909Z","submitted_at":"2025-08-29T16:36:16Z","title":"Learning from Silence and Noise for Visual Sound Source Localization","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-05T14:03:20.231901Z"},"links":{"citing_paper":"/paper/2508.21761"},"observation_digest":"sha256:1ca69c9b5fb251b78a4c629287d18a71d1749feb4aeef2952c733d0840fb1756","observation_id":"8bff9481-9821-4878-a193-e6c244a8ef4b","resolution":{"observed_at":"2026-08-05T14:03:27.224197Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T14:03:26.849710Z","title":"Marginnce: Robust sound localization with a negative margin","venue":null,"work_id":"a819b334-7c27-4ee6-a1be-5f3bf1f36e8b","year":2023},"citing_paper":{"arxiv_id":"2508.21761","last_updated":"2025-08-29T16:36:16Z","snapshot_observed_at":"2026-08-09T01:02:15.677909Z","submitted_at":"2025-08-29T16:36:16Z","title":"Learning from Silence and Noise for Visual Sound Source Localization","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-05T14:03:20.299684Z"},"links":{"citing_paper":"/paper/2508.21761"},"observation_digest":"sha256:2ea4f5455d11dc1968902a72f8babaf7e923d0a9c2c9f5b44f4087ccb932ba16","observation_id":"40558691-05dd-42d0-b7bb-56127c08ea6e","resolution":{"observed_at":"2026-08-05T14:03:27.021849Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T14:03:26.525409Z","title":"Can clip help sound source localization? In IEEE/CVF Winter Conference on Applications of Computer Vision, pages 5711–5720, 2024","venue":null,"work_id":"1269763e-3e52-496f-8129-59bbaddd3b9d","year":2024},"citing_paper":{"arxiv_id":"2508.21761","last_updated":"2025-08-29T16:36:16Z","snapshot_observed_at":"2026-08-09T01:02:15.677909Z","submitted_at":"2025-08-29T16:36:16Z","title":"Learning from Silence and Noise for Visual Sound Source Localization","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-05T14:03:20.368803Z"},"links":{"citing_paper":"/paper/2508.21761"},"observation_digest":"sha256:b24382e657d01addd80f94848138d87282dafa94f65e24d9b28d17fa3b58b8e0","observation_id":"b267725d-7f77-42e1-88e6-f3f085c22a92","resolution":{"observed_at":"2026-08-05T14:03:26.681627Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T14:03:26.111037Z","title":"Multiple sound sources localization from coarse to fine","venue":null,"work_id":"d8dd33e2-bd0d-4c86-84fa-4b426cb1a82a","year":2020},"citing_paper":{"arxiv_id":"2508.21761","last_updated":"2025-08-29T16:36:16Z","snapshot_observed_at":"2026-08-09T01:02:15.677909Z","submitted_at":"2025-08-29T16:36:16Z","title":"Learning from Silence and Noise for Visual Sound Source Localization","version":1},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-05T14:03:20.433210Z"},"links":{"citing_paper":"/paper/2508.21761"},"observation_digest":"sha256:74b11861595613f7cd98567bcf5b0a4b6755b2e33b4198b2a33e53f80a77b18f","observation_id":"41058908-543f-4c88-a706-d013f88c9a81","resolution":{"observed_at":"2026-08-05T14:03:26.217672Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T14:03:26.058728Z","title":"See the sound, hear the pixels","venue":null,"work_id":"98f8eb4d-d3a2-47d5-809b-36259067c014","year":2020},"citing_paper":{"arxiv_id":"2508.21761","last_updated":"2025-08-29T16:36:16Z","snapshot_observed_at":"2026-08-09T01:02:15.677909Z","submitted_at":"2025-08-29T16:36:16Z","title":"Learning from Silence and Noise for Visual Sound Source Localization","version":1},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-05T14:03:20.496314Z"},"links":{"citing_paper":"/paper/2508.21761"},"observation_digest":"sha256:276e878663a08456c387079493f60691f5280f9e6754d1ea7410c1ebcea91883","observation_id":"b70c6e83-750c-47ff-bb69-fae5b234ca61","resolution":{"observed_at":"2026-08-05T14:03:26.068140Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T14:03:25.893528Z","title":"Sound source localization","venue":null,"work_id":"e65f4249-68d0-42bf-9849-ab189a2e8e57","year":2018},"citing_paper":{"arxiv_id":"2508.21761","last_updated":"2025-08-29T16:36:16Z","snapshot_observed_at":"2026-08-09T01:02:15.677909Z","submitted_at":"2025-08-29T16:36:16Z","title":"Learning from Silence and Noise for Visual Sound Source Localization","version":1},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-05T14:03:20.563495Z"},"links":{"citing_paper":"/paper/2508.21761"},"observation_digest":"sha256:93faac6097e986fb581dcad304c627c70b46c55f028347101e715a83dc70fa64","observation_id":"c89f614e-64eb-4afe-9485-56ad4c7a6dc3","resolution":{"observed_at":"2026-08-05T14:03:25.968208Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T14:03:25.710614Z","title":"High-resolution image synthesis with latent diffusion models","venue":null,"work_id":"1d0afb48-5f49-481c-99a2-e9f83592dcfc","year":2022},"citing_paper":{"arxiv_id":"2508.21761","last_updated":"2025-08-29T16:36:16Z","snapshot_observed_at":"2026-08-09T01:02:15.677909Z","submitted_at":"2025-08-29T16:36:16Z","title":"Learning from Silence and Noise for Visual Sound Source Localization","version":1},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-05T14:03:20.665585Z"},"links":{"citing_paper":"/paper/2508.21761"},"observation_digest":"sha256:811c502fed283ec19fa8618bbdf283f7f4ac6f24208bcd5bce5d6daf969a6229","observation_id":"d1015605-cbf7-49cd-b70f-aeb0766ec065","resolution":{"observed_at":"2026-08-05T14:03:25.822302Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T14:03:25.570420Z","title":"Multimodal emotion recognition based on a fusion of audiovi- sual information with temporal dynamics","venue":null,"work_id":"f1a16a4b-dbfb-4085-9e9b-e6ce983a5dd7","year":2024},"citing_paper":{"arxiv_id":"2508.21761","last_updated":"2025-08-29T16:36:16Z","snapshot_observed_at":"2026-08-09T01:02:15.677909Z","submitted_at":"2025-08-29T16:36:16Z","title":"Learning from Silence and Noise for Visual Sound Source Localization","version":1},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-05T14:03:20.753635Z"},"links":{"citing_paper":"/paper/2508.21761"},"observation_digest":"sha256:29abbc8df9616363800891ba99b3f2439e2cba53b9d0e4c5cf01c1cedf47f017","observation_id":"7bdcae6c-96c0-4e71-94d6-f754b9f90e0f","resolution":{"observed_at":"2026-08-05T14:03:25.641943Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T14:03:25.414329Z","title":"Learn- ing to localize sound source in visual scenes","venue":null,"work_id":"2686a451-9c8c-49ab-b5b7-a1c6eeb74999","year":2018},"citing_paper":{"arxiv_id":"2508.21761","last_updated":"2025-08-29T16:36:16Z","snapshot_observed_at":"2026-08-09T01:02:15.677909Z","submitted_at":"2025-08-29T16:36:16Z","title":"Learning from Silence and Noise for Visual Sound Source Localization","version":1},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-08-05T14:03:20.867559Z"},"links":{"citing_paper":"/paper/2508.21761"},"observation_digest":"sha256:d903e7a523bfdb5af86bbb2671923d4d2ee7b4b10c75e1acd89f98f9eb5f7b0f","observation_id":"76cf4767-5cb6-4e57-95b5-ec764ceea4c5","resolution":{"observed_at":"2026-08-05T14:03:25.491772Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T14:03:25.272483Z","title":"Learn- ing to localize sound sources in visual scenes: Analysis and applications","venue":null,"work_id":"9d8cbd1b-680b-46f1-8bad-c9cbf49d447a","year":2019},"citing_paper":{"arxiv_id":"2508.21761","last_updated":"2025-08-29T16:36:16Z","snapshot_observed_at":"2026-08-09T01:02:15.677909Z","submitted_at":"2025-08-29T16:36:16Z","title":"Learning from Silence and Noise for Visual Sound Source Localization","version":1},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-08-05T14:03:20.939327Z"},"links":{"citing_paper":"/paper/2508.21761"},"observation_digest":"sha256:ce72ab94438dd21c334ea6ec89d6b74e458cf403fda48ab56b9aa13f4df71d40","observation_id":"fa0e209e-fb30-4268-a906-a1141e833c0f","resolution":{"observed_at":"2026-08-05T14:03:25.322500Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T14:03:25.117705Z","title":"Learning sound localization better from semantically similar samples","venue":null,"work_id":"322520cf-ba99-4230-839d-0d4e893d65c4","year":2022},"citing_paper":{"arxiv_id":"2508.21761","last_updated":"2025-08-29T16:36:16Z","snapshot_observed_at":"2026-08-09T01:02:15.677909Z","submitted_at":"2025-08-29T16:36:16Z","title":"Learning from Silence and Noise for Visual Sound Source Localization","version":1},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-08-05T14:03:21.045335Z"},"links":{"citing_paper":"/paper/2508.21761"},"observation_digest":"sha256:e388fef8973a54bb2352b3adc210ba42df3ceb0db266446ae031bfc9234a80c3","observation_id":"c0ed37e3-6dda-4b6b-845c-8fd6163ece78","resolution":{"observed_at":"2026-08-05T14:03:25.181472Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T14:03:25.001819Z","title":"Less can be more: Sound source localization with a classification model","venue":null,"work_id":"81dc31cd-75e4-49c5-9826-a0f6f14a18b4","year":2022},"citing_paper":{"arxiv_id":"2508.21761","last_updated":"2025-08-29T16:36:16Z","snapshot_observed_at":"2026-08-09T01:02:15.677909Z","submitted_at":"2025-08-29T16:36:16Z","title":"Learning from Silence and Noise for Visual Sound Source Localization","version":1},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-08-05T14:03:21.119429Z"},"links":{"citing_paper":"/paper/2508.21761"},"observation_digest":"sha256:944195d1b92f8c92ddf2bcd199de0819dd022e9388b0620942f6a44c78f71892","observation_id":"c3ee7642-6288-4b1d-a719-e0eea20dadac","resolution":{"observed_at":"2026-08-05T14:03:25.058136Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.13676","last_updated":"2024-07-18T16:51:15Z","snapshot_observed_at":"2026-07-06T18:48:37.723242Z","submitted_at":"2024-07-18T16:51:15Z","title":"Aligning Sight and Sound: Advanced Sound Source Localization Through Audio-Visual Alignment","version":1},"cited_work":{"arxiv_id":"2407.13676","doi":null,"metadata_source":"pith","pith_arxiv_id":"2407.13676","snapshot_observed_at":"2026-08-05T14:03:23.115871Z","title":"Aligning Sight and Sound: Advanced Sound Source Localization Through Audio-Visual Alignment","venue":"cs.MM","work_id":"141b1b7b-ec5e-4772-a118-abbdefb64ed1","year":2024},"citing_paper":{"arxiv_id":"2508.21761","last_updated":"2025-08-29T16:36:16Z","snapshot_observed_at":"2026-08-09T01:02:15.677909Z","submitted_at":"2025-08-29T16:36:16Z","title":"Learning from Silence and Noise for Visual Sound Source Localization","version":1},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-08-05T14:03:21.201865Z"},"links":{"cited_paper":"/paper/2407.13676","citing_paper":"/paper/2508.21761"},"observation_digest":"sha256:bfcfeab1f94daf4b440daeecffe3732b629f66a24b3d5e7d67ddc81be5e7bd61","observation_id":"a86842d6-bc6f-4693-9f2b-08d3fc350837","resolution":{"observed_at":"2026-08-05T14:03:23.177348Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2108.00443","last_updated":"2021-08-01T12:35:16Z","snapshot_observed_at":"2026-08-10T09:50:05.686094Z","submitted_at":"2021-08-01T12:35:16Z","title":"A Survey on Audio Synthesis and Audio-Visual Multimodal Processing","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2108.00443","snapshot_observed_at":"2026-08-05T14:03:21.327224Z","title":"A survey on audio synthesis and audio-visual multimodal processing","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2508.21761","last_updated":"2025-08-29T16:36:16Z","snapshot_observed_at":"2026-08-09T01:02:15.677909Z","submitted_at":"2025-08-29T16:36:16Z","title":"Learning from Silence and Noise for Visual Sound Source Localization","version":1},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-08-05T14:03:21.327224Z"},"links":{"cited_paper":"/paper/2108.00443","citing_paper":"/paper/2508.21761"},"observation_digest":"sha256:b19e2e9784aa08f18bf42b8f310aeb5eaf1b71fa04e65c206791211f18ae4a7e","observation_id":"3c7d422b-5187-4053-8ea8-18ee6b274945","resolution":{"observed_at":"2026-08-05T14:03:21.327224Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T14:03:24.856676Z","title":"En- hancing sound source localization via false negative elimination","venue":null,"work_id":"b2612aac-5a4a-4c6b-a263-08c2ba2cf82e","year":2024},"citing_paper":{"arxiv_id":"2508.21761","last_updated":"2025-08-29T16:36:16Z","snapshot_observed_at":"2026-08-09T01:02:15.677909Z","submitted_at":"2025-08-29T16:36:16Z","title":"Learning from Silence and Noise for Visual Sound Source Localization","version":1},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-08-05T14:03:21.398564Z"},"links":{"citing_paper":"/paper/2508.21761"},"observation_digest":"sha256:15a39ceb0bbc1cfb62dfb5aae1f1f1921a0a6b7bd3d54e0229523dfcae16c8f5","observation_id":"c6f32e40-f962-4dbf-a376-12ab955ba608","resolution":{"observed_at":"2026-08-05T14:03:24.933449Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T14:03:24.710472Z","title":"Learning audio-visual source localization via false negative aware contrastive learning","venue":null,"work_id":"65b60b22-ffba-46ba-9c57-f5fda567268d","year":2023},"citing_paper":{"arxiv_id":"2508.21761","last_updated":"2025-08-29T16:36:16Z","snapshot_observed_at":"2026-08-09T01:02:15.677909Z","submitted_at":"2025-08-29T16:36:16Z","title":"Learning from Silence and Noise for Visual Sound Source Localization","version":1},"reference_index":61,"source":"pdf_text","source_observed_at":"2026-08-05T14:03:21.503132Z"},"links":{"citing_paper":"/paper/2508.21761"},"observation_digest":"sha256:68122de0067f1d5e56aae2c59061f99c941d4bae5b3bbb7a8a48ac7d1d5fd10c","observation_id":"b90020e4-a3a1-4aaf-a769-4fc824b1fef4","resolution":{"observed_at":"2026-08-05T14:03:24.767706Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T14:03:24.549685Z","title":"Sound to visual scene generation by audio-to-visual latent alignment","venue":null,"work_id":"2677f8f9-40b9-4d6e-979f-d696cf0e2e14","year":2023},"citing_paper":{"arxiv_id":"2508.21761","last_updated":"2025-08-29T16:36:16Z","snapshot_observed_at":"2026-08-09T01:02:15.677909Z","submitted_at":"2025-08-29T16:36:16Z","title":"Learning from Silence and Noise for Visual Sound Source Localization","version":1},"reference_index":62,"source":"pdf_text","source_observed_at":"2026-08-05T14:03:21.569517Z"},"links":{"citing_paper":"/paper/2508.21761"},"observation_digest":"sha256:c1006f9abbb4208d600da4716a0a6f1d94aeaac9b3d53fd6e6526cea29b91056","observation_id":"582a0c3a-1945-42fb-b321-9d4ed159de83","resolution":{"observed_at":"2026-08-05T14:03:24.635351Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.06209","last_updated":"2024-12-09T05:04:50Z","snapshot_observed_at":"2026-08-10T20:19:40.066083Z","submitted_at":"2024-12-09T05:04:50Z","title":"Sound2Vision: Generating Diverse Visuals from Audio through Cross-Modal Latent Alignment","version":1},"cited_work":{"arxiv_id":"2412.06209","doi":null,"metadata_source":"pith","pith_arxiv_id":"2412.06209","snapshot_observed_at":"2026-08-05T14:03:22.989858Z","title":"Sound2Vision: Generating Diverse Visuals from Audio through Cross-Modal Latent Alignment","venue":"cs.CV","work_id":"5274d8eb-932a-4e9c-b11b-45b44d751fde","year":2024},"citing_paper":{"arxiv_id":"2508.21761","last_updated":"2025-08-29T16:36:16Z","snapshot_observed_at":"2026-08-09T01:02:15.677909Z","submitted_at":"2025-08-29T16:36:16Z","title":"Learning from Silence and Noise for Visual Sound Source Localization","version":1},"reference_index":63,"source":"pdf_text","source_observed_at":"2026-08-05T14:03:21.674724Z"},"links":{"cited_paper":"/paper/2412.06209","citing_paper":"/paper/2508.21761"},"observation_digest":"sha256:516eddd6b72f3e0c572b28423d861072ddc240c33f749920e795a2239a42f76e","observation_id":"fd6bf942-0d75-4daa-8780-f3e02d52b7b9","resolution":{"observed_at":"2026-08-05T14:03:23.027866Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T14:03:24.347192Z","title":"Audio-visual event localization in unconstrained videos","venue":null,"work_id":"7b686cec-71b1-4051-b7c0-9075337b987a","year":2018},"citing_paper":{"arxiv_id":"2508.21761","last_updated":"2025-08-29T16:36:16Z","snapshot_observed_at":"2026-08-09T01:02:15.677909Z","submitted_at":"2025-08-29T16:36:16Z","title":"Learning from Silence and Noise for Visual Sound Source Localization","version":1},"reference_index":64,"source":"pdf_text","source_observed_at":"2026-08-05T14:03:21.770318Z"},"links":{"citing_paper":"/paper/2508.21761"},"observation_digest":"sha256:1f26bd2241e9fda8fb7307961f32dacf929cc4c573f2f42fbf0e63d794b6466e","observation_id":"d030f199-b42e-4bd6-a4d8-bf6c0aef12c9","resolution":{"observed_at":"2026-08-05T14:03:24.453977Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T14:03:24.171489Z","title":"Phrasecut: Language-based image segmentation in the wild","venue":null,"work_id":"6108931c-bdd0-42cb-8744-96bc789fd54f","year":2020},"citing_paper":{"arxiv_id":"2508.21761","last_updated":"2025-08-29T16:36:16Z","snapshot_observed_at":"2026-08-09T01:02:15.677909Z","submitted_at":"2025-08-29T16:36:16Z","title":"Learning from Silence and Noise for Visual Sound Source Localization","version":1},"reference_index":65,"source":"pdf_text","source_observed_at":"2026-08-05T14:03:21.859711Z"},"links":{"citing_paper":"/paper/2508.21761"},"observation_digest":"sha256:1393bd19e2a1f954660d7e6949fc693d79102158cf008b54e6aade7e93c0061d","observation_id":"ff4b3a39-ebe0-402b-b3e6-63d44945da3b","resolution":{"observed_at":"2026-08-05T14:03:24.279956Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T14:03:23.998012Z","title":"How to listen? rethinking visual sound localization","venue":null,"work_id":"215adec0-f2f4-47d8-b365-69f12b1b27e0","year":2022},"citing_paper":{"arxiv_id":"2508.21761","last_updated":"2025-08-29T16:36:16Z","snapshot_observed_at":"2026-08-09T01:02:15.677909Z","submitted_at":"2025-08-29T16:36:16Z","title":"Learning from Silence and Noise for Visual Sound Source Localization","version":1},"reference_index":66,"source":"pdf_text","source_observed_at":"2026-08-05T14:03:21.931296Z"},"links":{"citing_paper":"/paper/2508.21761"},"observation_digest":"sha256:d9770f037518c0e61d16b14698164573f0d37ca9f034c309ea5373b460bb14a5","observation_id":"913503cf-93d5-4e6b-a859-7063cfbc141a","resolution":{"observed_at":"2026-08-05T14:03:24.077187Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T14:03:23.835152Z","title":"Acoustic and visual knowledge distillation for contrastive audio-visual localization","venue":null,"work_id":"8fea7cb6-8bea-446d-be4f-2fded21f5ad9","year":2023},"citing_paper":{"arxiv_id":"2508.21761","last_updated":"2025-08-29T16:36:16Z","snapshot_observed_at":"2026-08-09T01:02:15.677909Z","submitted_at":"2025-08-29T16:36:16Z","title":"Learning from Silence and Noise for Visual Sound Source Localization","version":1},"reference_index":67,"source":"pdf_text","source_observed_at":"2026-08-05T14:03:22.024661Z"},"links":{"citing_paper":"/paper/2508.21761"},"observation_digest":"sha256:350ae3407c1a9f0d4c7fee34656f1d60129ac1ef1fc04461428299f5bbb739dd","observation_id":"36113071-3274-493b-80ff-fc83234719e8","resolution":{"observed_at":"2026-08-05T14:03:23.900431Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2302.04269","last_updated":"2023-02-08T18:59:42Z","snapshot_observed_at":"2026-07-06T14:49:48.724079Z","submitted_at":"2023-02-08T18:59:42Z","title":"Diagnosing and Rectifying Vision Models using Language","version":1},"cited_work":{"arxiv_id":"2302.04269","doi":null,"metadata_source":"pith","pith_arxiv_id":"2302.04269","snapshot_observed_at":"2026-08-05T14:03:22.738072Z","title":"Diagnosing and Rectifying Vision Models using Language","venue":"cs.LG","work_id":"96cf9a9c-5789-4fc5-b413-225764ea7607","year":2023},"citing_paper":{"arxiv_id":"2508.21761","last_updated":"2025-08-29T16:36:16Z","snapshot_observed_at":"2026-08-09T01:02:15.677909Z","submitted_at":"2025-08-29T16:36:16Z","title":"Learning from Silence and Noise for Visual Sound Source Localization","version":1},"reference_index":68,"source":"pdf_text","source_observed_at":"2026-08-05T14:03:22.115862Z"},"links":{"cited_paper":"/paper/2302.04269","citing_paper":"/paper/2508.21761"},"observation_digest":"sha256:ccab71e744bee453ecb95edcf3f9d7b5e25a671f5fa02abce9bd3ab7d3aeb13f","observation_id":"5472dad6-6e1f-401b-a811-31d910bf3686","resolution":{"observed_at":"2026-08-05T14:03:22.863662Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2514.8713","doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T14:03:22.523151Z","title":"chicken clucking","venue":null,"work_id":"7587282f-6d58-44fb-aab6-d48935d53f25","year":2024},"citing_paper":{"arxiv_id":"2508.21761","last_updated":"2025-08-29T16:36:16Z","snapshot_observed_at":"2026-08-09T01:02:15.677909Z","submitted_at":"2025-08-29T16:36:16Z","title":"Learning from Silence and Noise for Visual Sound Source Localization","version":1},"reference_index":69,"source":"pdf_text","source_observed_at":"2026-08-05T14:03:22.242986Z"},"links":{"citing_paper":"/paper/2508.21761"},"observation_digest":"sha256:467bf88ee5ba8b476e867b55d06a892079ffe2009926658fa2a547e6f751ff98","observation_id":"0e808f95-19fd-484e-813b-c4a6e281eee7","resolution":{"observed_at":"2026-08-05T14:03:22.624081Z","resolver_source":"raw_fallback","status":"malformed_identifier"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2508.21761","last_updated":"2025-08-29T16:36:16Z","latest_version":1,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-09T01:02:15.677909Z","submitted_at":"2025-08-29T16:36:16Z","title":"Learning from Silence and Noise for Visual Sound Source Localization"},"reference_resolution":{"displayed":69,"state_counts":{"malformed_identifier":1,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":6,"verified_exact":6,"verified_fuzzy":56},"total_outbound_references":69},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"thesis":"As of 10 August 2026, this Paper Citation Record lists 69 of 69 outbound references and 0 inbound Pith citation observations for arXiv:2508.21761."}