{"as_of":"2026-08-14T03:03:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:c89aee7044373f9507ef473b53b5ca9012e272d92b2618768591e846a82ddfdf","coverage":[{"denominator":49,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":49,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-06T23:20:49.374967Z","state":"measured"},{"denominator":49,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":49,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-13T06:32:02.005865+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2506.18557/citation-record","integrity":"/paper/2506.18557/integrity","json":"/paper/2506.18557/citation-record.json","paper":"/paper/2506.18557"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:20:44.623191Z","title":"write newline","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.18557","last_updated":"2025-06-24T02:05:51Z","snapshot_observed_at":"2026-08-06T23:13:29.775397Z","submitted_at":"2025-06-23T12:08:07Z","title":"Object-aware Sound Source Localization via Audio-Visual Scene Understanding","version":2},"reference_index":1,"source":"arxiv_source","source_observed_at":"2026-08-06T23:20:44.623191Z"},"links":{"citing_paper":"/paper/2506.18557"},"observation_digest":"sha256:a1f899f80ec7c98aafe10e967ca71b2e254414ddaad4a1e23a22a96c8d49fd14","observation_id":"cc21691c-a3a3-4237-830a-168b45d996dc","resolution":{"observed_at":"2026-08-06T23:20:44.623191Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:20:58.944239Z","title":"Objects that sound","venue":null,"work_id":"5e9b3703-b952-4306-90ab-1f50704edac5","year":2018},"citing_paper":{"arxiv_id":"2506.18557","last_updated":"2025-06-24T02:05:51Z","snapshot_observed_at":"2026-08-06T23:13:29.775397Z","submitted_at":"2025-06-23T12:08:07Z","title":"Object-aware Sound Source Localization via Audio-Visual Scene Understanding","version":2},"reference_index":2,"source":"arxiv_source","source_observed_at":"2026-08-06T23:20:44.739030Z"},"links":{"citing_paper":"/paper/2506.18557"},"observation_digest":"sha256:72150943b4a0f4bf0d17159a8f8e2a3ad61865c4d8b860ce129debf97509ea3d","observation_id":"e009438d-2da3-44a7-937e-2cab930c2b7a","resolution":{"observed_at":"2026-08-06T23:20:59.016524Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:20:58.726611Z","title":"Vggsound: A large-scale audio-visual dataset","venue":null,"work_id":"44a5cdc5-ff6f-469f-9944-cfe998156ab0","year":2020},"citing_paper":{"arxiv_id":"2506.18557","last_updated":"2025-06-24T02:05:51Z","snapshot_observed_at":"2026-08-06T23:13:29.775397Z","submitted_at":"2025-06-23T12:08:07Z","title":"Object-aware Sound Source Localization via Audio-Visual Scene Understanding","version":2},"reference_index":3,"source":"arxiv_source","source_observed_at":"2026-08-06T23:20:44.827505Z"},"links":{"citing_paper":"/paper/2506.18557"},"observation_digest":"sha256:c24885dd564ded0ea7bfc72dcab8c1139cd762ac6ade1880e233326aaf695364","observation_id":"dcfd5eab-c51b-4ab0-9a80-ba0fed71de2a","resolution":{"observed_at":"2026-08-06T23:20:58.812481Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:20:58.547062Z","title":"Localizing visual sounds the hard way","venue":null,"work_id":"e781a361-cc9b-4b47-97a4-f288ab27a33d","year":2021},"citing_paper":{"arxiv_id":"2506.18557","last_updated":"2025-06-24T02:05:51Z","snapshot_observed_at":"2026-08-06T23:13:29.775397Z","submitted_at":"2025-06-23T12:08:07Z","title":"Object-aware Sound Source Localization via Audio-Visual Scene Understanding","version":2},"reference_index":4,"source":"arxiv_source","source_observed_at":"2026-08-06T23:20:44.963367Z"},"links":{"citing_paper":"/paper/2506.18557"},"observation_digest":"sha256:78716b57aca69ac350c0608894bbd82a3164401a346c4b1a628c67cd49a7d1a5","observation_id":"f152976f-0ba2-4acb-954e-ec303d1b96a0","resolution":{"observed_at":"2026-08-06T23:20:58.588619Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:20:45.067294Z","title":"Exploring simple siamese representation learning","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2506.18557","last_updated":"2025-06-24T02:05:51Z","snapshot_observed_at":"2026-08-06T23:13:29.775397Z","submitted_at":"2025-06-23T12:08:07Z","title":"Object-aware Sound Source Localization via Audio-Visual Scene Understanding","version":2},"reference_index":5,"source":"arxiv_source","source_observed_at":"2026-08-06T23:20:45.067294Z"},"links":{"citing_paper":"/paper/2506.18557"},"observation_digest":"sha256:45fba23b97cc310cdc8310562813c80f9eb4910c76c07d4f38e156233c4af4cb","observation_id":"dd4af06e-17c5-4d08-8ab4-0589e05ecb75","resolution":{"observed_at":"2026-08-06T23:20:45.067294Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:20:58.354337Z","title":"Internvl: Scaling up vision foundation models and aligning for generic visual-linguistic tasks","venue":null,"work_id":"494d2150-6336-4633-9653-f8c5a1846413","year":2024},"citing_paper":{"arxiv_id":"2506.18557","last_updated":"2025-06-24T02:05:51Z","snapshot_observed_at":"2026-08-06T23:13:29.775397Z","submitted_at":"2025-06-23T12:08:07Z","title":"Object-aware Sound Source Localization via Audio-Visual Scene Understanding","version":2},"reference_index":6,"source":"arxiv_source","source_observed_at":"2026-08-06T23:20:45.124745Z"},"links":{"citing_paper":"/paper/2506.18557"},"observation_digest":"sha256:17fd348a5fd83ad4ddbff4890cb4e13a00f2c7d9ec6fa8a95de2a247cc09d5a1","observation_id":"9d7937df-f7d3-4751-b852-a6663328b554","resolution":{"observed_at":"2026-08-06T23:20:58.416200Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:20:45.241334Z","title":"Sinkhorn distances: Lightspeed computation of optimal transport","venue":null,"work_id":null,"year":2013},"citing_paper":{"arxiv_id":"2506.18557","last_updated":"2025-06-24T02:05:51Z","snapshot_observed_at":"2026-08-06T23:13:29.775397Z","submitted_at":"2025-06-23T12:08:07Z","title":"Object-aware Sound Source Localization via Audio-Visual Scene Understanding","version":2},"reference_index":7,"source":"arxiv_source","source_observed_at":"2026-08-06T23:20:45.241334Z"},"links":{"citing_paper":"/paper/2506.18557"},"observation_digest":"sha256:dcb09762ba8dae92721fd24e3a7e750a9e6ff0669ff7330fee77a8b110d8eaeb","observation_id":"71495029-6d41-4882-920a-4fd2ee8da924","resolution":{"observed_at":"2026-08-06T23:20:45.241334Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:20:45.352669Z","title":"Imagenet: A large-scale hierarchical image database","venue":null,"work_id":null,"year":2009},"citing_paper":{"arxiv_id":"2506.18557","last_updated":"2025-06-24T02:05:51Z","snapshot_observed_at":"2026-08-06T23:13:29.775397Z","submitted_at":"2025-06-23T12:08:07Z","title":"Object-aware Sound Source Localization via Audio-Visual Scene Understanding","version":2},"reference_index":8,"source":"arxiv_source","source_observed_at":"2026-08-06T23:20:45.352669Z"},"links":{"citing_paper":"/paper/2506.18557"},"observation_digest":"sha256:2b5d88f317cfe90317fc2f7d24e15046adcf1cd6f539cd6c9112197f5067a84f","observation_id":"cb5fff76-df51-49c0-8092-58bc5216a9f1","resolution":{"observed_at":"2026-08-06T23:20:45.352669Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:20:58.219244Z","title":"Cross-modal prompts: Adapting large pre-trained models for audio-visual downstream tasks","venue":null,"work_id":"a96ae628-cdbc-41f2-be65-545d941d20f6","year":2024},"citing_paper":{"arxiv_id":"2506.18557","last_updated":"2025-06-24T02:05:51Z","snapshot_observed_at":"2026-08-06T23:13:29.775397Z","submitted_at":"2025-06-23T12:08:07Z","title":"Object-aware Sound Source Localization via Audio-Visual Scene Understanding","version":2},"reference_index":9,"source":"arxiv_source","source_observed_at":"2026-08-06T23:20:45.494963Z"},"links":{"citing_paper":"/paper/2506.18557"},"observation_digest":"sha256:4c92a3c951f1a783b78e3e46eec31beb1bae741029d4620d13f9663edd725ad8","observation_id":"100fedaa-026b-4114-907f-c8f5cbcad8dd","resolution":{"observed_at":"2026-08-06T23:20:58.265975Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:20:57.997605Z","title":"With a little help from my friends: Nearest-neighbor contrastive learning of visual representations","venue":null,"work_id":"72f96009-e620-45a6-a130-c8fe44071bdc","year":2021},"citing_paper":{"arxiv_id":"2506.18557","last_updated":"2025-06-24T02:05:51Z","snapshot_observed_at":"2026-08-06T23:13:29.775397Z","submitted_at":"2025-06-23T12:08:07Z","title":"Object-aware Sound Source Localization via Audio-Visual Scene Understanding","version":2},"reference_index":10,"source":"arxiv_source","source_observed_at":"2026-08-06T23:20:45.594337Z"},"links":{"citing_paper":"/paper/2506.18557"},"observation_digest":"sha256:36e1269124acdada63d96563ba2147971588be22e650dd27539b1c7bda01fc14","observation_id":"12d58a27-c3a6-42b7-879b-6a065254e04c","resolution":{"observed_at":"2026-08-06T23:20:58.116336Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:20:57.743240Z","title":"Hear the flow: Optical flow-based self-supervised visual sound source localization","venue":null,"work_id":"79384900-c99b-4342-a187-7e21dc983b27","year":2023},"citing_paper":{"arxiv_id":"2506.18557","last_updated":"2025-06-24T02:05:51Z","snapshot_observed_at":"2026-08-06T23:13:29.775397Z","submitted_at":"2025-06-23T12:08:07Z","title":"Object-aware Sound Source Localization via Audio-Visual Scene Understanding","version":2},"reference_index":11,"source":"arxiv_source","source_observed_at":"2026-08-06T23:20:45.678394Z"},"links":{"citing_paper":"/paper/2506.18557"},"observation_digest":"sha256:28be81b52a2e93eee5e9011f26e21d8dd4df1b6d7935c3b477c761b67597ad1b","observation_id":"ffcba95a-21df-47a5-8d80-a8e8ed04626e","resolution":{"observed_at":"2026-08-06T23:20:57.831456Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:20:57.546131Z","title":"Audioclip: Extending clip to image, text and audio","venue":null,"work_id":"db5f57fc-f96a-485b-8aa3-2705eb5183cb","year":2022},"citing_paper":{"arxiv_id":"2506.18557","last_updated":"2025-06-24T02:05:51Z","snapshot_observed_at":"2026-08-06T23:13:29.775397Z","submitted_at":"2025-06-23T12:08:07Z","title":"Object-aware Sound Source Localization via Audio-Visual Scene Understanding","version":2},"reference_index":12,"source":"arxiv_source","source_observed_at":"2026-08-06T23:20:45.810588Z"},"links":{"citing_paper":"/paper/2506.18557"},"observation_digest":"sha256:02916fa172c499eb94e1c4bbf82cdcec4920fbd80b91ce9a74bdea2fac910089","observation_id":"686ef128-6d45-4c11-a4da-ae432dc4a78a","resolution":{"observed_at":"2026-08-06T23:20:57.654611Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:20:45.882461Z","title":"Deep residual learning for image recognition","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2506.18557","last_updated":"2025-06-24T02:05:51Z","snapshot_observed_at":"2026-08-06T23:13:29.775397Z","submitted_at":"2025-06-23T12:08:07Z","title":"Object-aware Sound Source Localization via Audio-Visual Scene Understanding","version":2},"reference_index":13,"source":"arxiv_source","source_observed_at":"2026-08-06T23:20:45.882461Z"},"links":{"citing_paper":"/paper/2506.18557"},"observation_digest":"sha256:ca84487ad4f4457c88e14a1c0f90f7688b35e3dd0681ee4e4c541d514f4cda3d","observation_id":"314c11cc-f68e-4daa-97a6-0aad424811eb","resolution":{"observed_at":"2026-08-06T23:20:45.882461Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:20:57.274018Z","title":"Deep multimodal clustering for unsupervised audiovisual learning","venue":null,"work_id":"e749aec7-f13b-4396-b0ed-9d4fdc0c1b46","year":2019},"citing_paper":{"arxiv_id":"2506.18557","last_updated":"2025-06-24T02:05:51Z","snapshot_observed_at":"2026-08-06T23:13:29.775397Z","submitted_at":"2025-06-23T12:08:07Z","title":"Object-aware Sound Source Localization via Audio-Visual Scene Understanding","version":2},"reference_index":14,"source":"arxiv_source","source_observed_at":"2026-08-06T23:20:45.999412Z"},"links":{"citing_paper":"/paper/2506.18557"},"observation_digest":"sha256:4dbd338ced85b0b0485ec87c42b16b2fa767097a319f7658faff87ff82aae728","observation_id":"45025512-b2a6-4da2-b930-10160292978c","resolution":{"observed_at":"2026-08-06T23:20:57.394754Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:20:57.064902Z","title":"Discriminative sounding objects localization via self-supervised audiovisual matching","venue":null,"work_id":"6308cede-b391-4720-aed0-0da7c151fcd5","year":2020},"citing_paper":{"arxiv_id":"2506.18557","last_updated":"2025-06-24T02:05:51Z","snapshot_observed_at":"2026-08-06T23:13:29.775397Z","submitted_at":"2025-06-23T12:08:07Z","title":"Object-aware Sound Source Localization via Audio-Visual Scene Understanding","version":2},"reference_index":15,"source":"arxiv_source","source_observed_at":"2026-08-06T23:20:46.075610Z"},"links":{"citing_paper":"/paper/2506.18557"},"observation_digest":"sha256:98c8aa0c425e744554d4b326a001f745cec2388a969b6a36854335a8a1bd0d3a","observation_id":"64deb004-f7ae-4e9b-abbe-a48c365b3762","resolution":{"observed_at":"2026-08-06T23:20:57.153525Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:20:56.816839Z","title":"Mix and localize: Localizing sound sources in mixtures","venue":null,"work_id":"da2cbd38-ff31-4d03-af6c-d213e665f285","year":2022},"citing_paper":{"arxiv_id":"2506.18557","last_updated":"2025-06-24T02:05:51Z","snapshot_observed_at":"2026-08-06T23:13:29.775397Z","submitted_at":"2025-06-23T12:08:07Z","title":"Object-aware Sound Source Localization via Audio-Visual Scene Understanding","version":2},"reference_index":16,"source":"arxiv_source","source_observed_at":"2026-08-06T23:20:46.152099Z"},"links":{"citing_paper":"/paper/2506.18557"},"observation_digest":"sha256:8564e939712da8262e97ce28e79b199981889d0b0f049ac40180f06c16e6bea0","observation_id":"cc069196-7209-4cd1-bb72-3dc76df8ebdf","resolution":{"observed_at":"2026-08-06T23:20:56.914740Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:20:56.534255Z","title":"Boosting contrastive self-supervised learning with false negative cancellation","venue":null,"work_id":"fcd7ee19-86ba-4637-a93c-517f8da196e8","year":2022},"citing_paper":{"arxiv_id":"2506.18557","last_updated":"2025-06-24T02:05:51Z","snapshot_observed_at":"2026-08-06T23:13:29.775397Z","submitted_at":"2025-06-23T12:08:07Z","title":"Object-aware Sound Source Localization via Audio-Visual Scene Understanding","version":2},"reference_index":17,"source":"arxiv_source","source_observed_at":"2026-08-06T23:20:46.260804Z"},"links":{"citing_paper":"/paper/2506.18557"},"observation_digest":"sha256:f2e9e846dc98428a5c48819a2534c0ec3fd274a30f6e13c9ce274f79627a601e","observation_id":"9faa0021-b426-4b9a-85af-cd5d45bafa24","resolution":{"observed_at":"2026-08-06T23:20:56.674748Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:20:56.283472Z","title":"A review of recent advances on deep learning methods for audio-visual speech recognition","venue":null,"work_id":"4f550bba-041c-4671-b26b-adc22825c718","year":2023},"citing_paper":{"arxiv_id":"2506.18557","last_updated":"2025-06-24T02:05:51Z","snapshot_observed_at":"2026-08-06T23:13:29.775397Z","submitted_at":"2025-06-23T12:08:07Z","title":"Object-aware Sound Source Localization via Audio-Visual Scene Understanding","version":2},"reference_index":18,"source":"arxiv_source","source_observed_at":"2026-08-06T23:20:46.326449Z"},"links":{"citing_paper":"/paper/2506.18557"},"observation_digest":"sha256:026ec62f223de2ead3fb82ab8d201aa1f7820783de3037767c4d265135f9bfc2","observation_id":"f11684f8-189a-4455-bcfd-dfee9d4c5ca1","resolution":{"observed_at":"2026-08-06T23:20:56.385786Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:20:56.006927Z","title":"Learning to visually localize sound sources from mixtures without prior source knowledge","venue":null,"work_id":"40be126f-7eba-4676-991f-4fef485c11dd","year":2024},"citing_paper":{"arxiv_id":"2506.18557","last_updated":"2025-06-24T02:05:51Z","snapshot_observed_at":"2026-08-06T23:13:29.775397Z","submitted_at":"2025-06-23T12:08:07Z","title":"Object-aware Sound Source Localization via Audio-Visual Scene Understanding","version":2},"reference_index":19,"source":"arxiv_source","source_observed_at":"2026-08-06T23:20:46.404760Z"},"links":{"citing_paper":"/paper/2506.18557"},"observation_digest":"sha256:90932d9f8355d3711638240ddda9324516c5ac4227555170160e49ba8c39c92b","observation_id":"ac83f528-b373-4ce5-94d9-41338915fbbb","resolution":{"observed_at":"2026-08-06T23:20:56.134749Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1412.6980","last_updated":"2017-01-30T01:27:54Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2014-12-22T13:54:29Z","title":"Adam: A Method for Stochastic Optimization","version":9},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1412.6980","snapshot_observed_at":"2026-08-06T23:20:46.466395Z","title":"Adam: A method for stochastic optimization","venue":null,"work_id":null,"year":2014},"citing_paper":{"arxiv_id":"2506.18557","last_updated":"2025-06-24T02:05:51Z","snapshot_observed_at":"2026-08-06T23:13:29.775397Z","submitted_at":"2025-06-23T12:08:07Z","title":"Object-aware Sound Source Localization via Audio-Visual Scene Understanding","version":2},"reference_index":20,"source":"arxiv_source","source_observed_at":"2026-08-06T23:20:46.466395Z"},"links":{"cited_paper":"/paper/1412.6980","citing_paper":"/paper/2506.18557"},"observation_digest":"sha256:0de9a6bfab9b9b7e1eaef91907af99e328428d253962c820b0809f822d34af2e","observation_id":"085df064-f62c-4d87-8d26-60ae9757c918","resolution":{"observed_at":"2026-08-06T23:20:46.466395Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:20:55.872877Z","title":"Unsupervised sound localization via iterative contrastive learning","venue":null,"work_id":"9204479e-ef2a-4bf8-8854-d7642c364b15","year":2023},"citing_paper":{"arxiv_id":"2506.18557","last_updated":"2025-06-24T02:05:51Z","snapshot_observed_at":"2026-08-06T23:13:29.775397Z","submitted_at":"2025-06-23T12:08:07Z","title":"Object-aware Sound Source Localization via Audio-Visual Scene Understanding","version":2},"reference_index":21,"source":"arxiv_source","source_observed_at":"2026-08-06T23:20:46.543786Z"},"links":{"citing_paper":"/paper/2506.18557"},"observation_digest":"sha256:32ff92eb70739360ed73c2c0bffc85773c8b88fc7b1d3edb2cd9137b1d18e819","observation_id":"572067d7-d2fc-498e-968e-d1122aeb18d6","resolution":{"observed_at":"2026-08-06T23:20:55.942335Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:20:55.586453Z","title":"Exploiting transformation invariance and equivariance for self-supervised sound localisation","venue":null,"work_id":"eb7ec45d-bb7c-475c-baa6-c0678e8e80b5","year":2022},"citing_paper":{"arxiv_id":"2506.18557","last_updated":"2025-06-24T02:05:51Z","snapshot_observed_at":"2026-08-06T23:13:29.775397Z","submitted_at":"2025-06-23T12:08:07Z","title":"Object-aware Sound Source Localization via Audio-Visual Scene Understanding","version":2},"reference_index":22,"source":"arxiv_source","source_observed_at":"2026-08-06T23:20:46.716945Z"},"links":{"citing_paper":"/paper/2506.18557"},"observation_digest":"sha256:7f170f3ed18aef0544b7848c366319b684472dd73473c1edd1ac66b25a743368","observation_id":"e9005eba-beb0-4a48-98b5-bd5048d15ffb","resolution":{"observed_at":"2026-08-06T23:20:55.749982Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:20:55.348938Z","title":"Generalized video anomaly event detection: Systematic taxonomy and comparison of deep models","venue":null,"work_id":"0c277c97-944f-4ff3-acff-f6a2356453d4","year":2024},"citing_paper":{"arxiv_id":"2506.18557","last_updated":"2025-06-24T02:05:51Z","snapshot_observed_at":"2026-08-06T23:13:29.775397Z","submitted_at":"2025-06-23T12:08:07Z","title":"Object-aware Sound Source Localization via Audio-Visual Scene Understanding","version":2},"reference_index":23,"source":"arxiv_source","source_observed_at":"2026-08-06T23:20:46.825427Z"},"links":{"citing_paper":"/paper/2506.18557"},"observation_digest":"sha256:9032c1fa1fbc21c339320111cca36d30dc9479a9b2afc4b453d4f0d56bdaa87a","observation_id":"5ee4ac45-00ea-492c-aee1-293e2cc937d9","resolution":{"observed_at":"2026-08-06T23:20:55.434742Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:20:55.116198Z","title":"T-vsl: Text-guided visual sound source localization in mixtures","venue":null,"work_id":"c46e139d-26b6-4a37-b7f2-ebd8ba4464c0","year":2024},"citing_paper":{"arxiv_id":"2506.18557","last_updated":"2025-06-24T02:05:51Z","snapshot_observed_at":"2026-08-06T23:13:29.775397Z","submitted_at":"2025-06-23T12:08:07Z","title":"Object-aware Sound Source Localization via Audio-Visual Scene Understanding","version":2},"reference_index":24,"source":"arxiv_source","source_observed_at":"2026-08-06T23:20:47.179413Z"},"links":{"citing_paper":"/paper/2506.18557"},"observation_digest":"sha256:487f66bbc1ddb2c1bd36a0ac78e56bb3ec7800904c2e033da3d5fab7df3359d7","observation_id":"dab2a57e-d48f-462e-ae71-3874f91a96fa","resolution":{"observed_at":"2026-08-06T23:20:55.207310Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:20:54.904736Z","title":"Localizing visual sounds the easy way","venue":null,"work_id":"d7ac67f5-de08-4f15-b27b-858c1e5d23ff","year":2022},"citing_paper":{"arxiv_id":"2506.18557","last_updated":"2025-06-24T02:05:51Z","snapshot_observed_at":"2026-08-06T23:13:29.775397Z","submitted_at":"2025-06-23T12:08:07Z","title":"Object-aware Sound Source Localization via Audio-Visual Scene Understanding","version":2},"reference_index":25,"source":"arxiv_source","source_observed_at":"2026-08-06T23:20:47.319708Z"},"links":{"citing_paper":"/paper/2506.18557"},"observation_digest":"sha256:dc2dc97da96285d3c3cdf26fe5179b747c1722527dbcb390c2beba59e7ded8b5","observation_id":"d6076cb8-c9fa-45a4-a79f-0e9f64d5713c","resolution":{"observed_at":"2026-08-06T23:20:54.989857Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:20:54.700947Z","title":"A closer look at weakly-supervised audio-visual source localization","venue":null,"work_id":"48dc1776-8db8-4ceb-94f6-580071926ebd","year":2022},"citing_paper":{"arxiv_id":"2506.18557","last_updated":"2025-06-24T02:05:51Z","snapshot_observed_at":"2026-08-06T23:13:29.775397Z","submitted_at":"2025-06-23T12:08:07Z","title":"Object-aware Sound Source Localization via Audio-Visual Scene Understanding","version":2},"reference_index":26,"source":"arxiv_source","source_observed_at":"2026-08-06T23:20:47.399677Z"},"links":{"citing_paper":"/paper/2506.18557"},"observation_digest":"sha256:591fb8b0fe4a9bf133c04589a420f214439d15f00fd1f87ae331548ee94e2dbb","observation_id":"510a2c9a-c178-450c-9083-5d6387ce1c88","resolution":{"observed_at":"2026-08-06T23:20:54.793986Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:20:54.476888Z","title":"Audio-visual grouping network for sound localization from mixtures","venue":null,"work_id":"bbce7a4e-4b1f-4904-930d-a5e2180b081d","year":2023},"citing_paper":{"arxiv_id":"2506.18557","last_updated":"2025-06-24T02:05:51Z","snapshot_observed_at":"2026-08-06T23:13:29.775397Z","submitted_at":"2025-06-23T12:08:07Z","title":"Object-aware Sound Source Localization via Audio-Visual Scene Understanding","version":2},"reference_index":27,"source":"arxiv_source","source_observed_at":"2026-08-06T23:20:47.445298Z"},"links":{"citing_paper":"/paper/2506.18557"},"observation_digest":"sha256:812620173ff665c8043fbabad078ce78579d1fd68f83a545d33b6dd88e85d32c","observation_id":"7ead8897-a468-4d84-9723-bbdd899358ea","resolution":{"observed_at":"2026-08-06T23:20:54.602287Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:20:54.290215Z","title":"Audio-visual scene analysis with self-supervised multisensory features","venue":null,"work_id":"126e0f1b-2e75-4c4e-afe5-57304bb097ce","year":2018},"citing_paper":{"arxiv_id":"2506.18557","last_updated":"2025-06-24T02:05:51Z","snapshot_observed_at":"2026-08-06T23:13:29.775397Z","submitted_at":"2025-06-23T12:08:07Z","title":"Object-aware Sound Source Localization via Audio-Visual Scene Understanding","version":2},"reference_index":28,"source":"arxiv_source","source_observed_at":"2026-08-06T23:20:47.474313Z"},"links":{"citing_paper":"/paper/2506.18557"},"observation_digest":"sha256:b19af7c3defe66f80a69db751d4e322f198e5fac1223d86b56af8016b5108c91","observation_id":"a7f2f281-70a1-44d5-a856-c0cdf82229f3","resolution":{"observed_at":"2026-08-06T23:20:54.380654Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:20:54.060452Z","title":"Multiple sound sources localization from coarse to fine","venue":null,"work_id":"9ec23431-a7b9-4c89-ad32-089a802eec57","year":2020},"citing_paper":{"arxiv_id":"2506.18557","last_updated":"2025-06-24T02:05:51Z","snapshot_observed_at":"2026-08-06T23:13:29.775397Z","submitted_at":"2025-06-23T12:08:07Z","title":"Object-aware Sound Source Localization via Audio-Visual Scene Understanding","version":2},"reference_index":29,"source":"arxiv_source","source_observed_at":"2026-08-06T23:20:47.545828Z"},"links":{"citing_paper":"/paper/2506.18557"},"observation_digest":"sha256:2137413de19b1d5b4a44cdbb1e54a60bebf2d450b88e9e45f5193a57bc1367de","observation_id":"78868aa1-7c8c-4746-98c3-374d3e091bc9","resolution":{"observed_at":"2026-08-06T23:20:54.184834Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2207.07646","last_updated":"2022-07-15T17:59:11Z","snapshot_observed_at":"2026-08-13T15:03:20.259006Z","submitted_at":"2022-07-15T17:59:11Z","title":"Multimodal Open-Vocabulary Video Classification via Pre-Trained Vision and Language Models","version":1},"cited_work":{"arxiv_id":"2207.07646","doi":null,"metadata_source":"pith","pith_arxiv_id":"2207.07646","snapshot_observed_at":"2026-08-06T23:20:49.500854Z","title":"Multimodal Open-Vocabulary Video Classification via Pre-Trained Vision and Language Models","venue":"cs.CV","work_id":"f07e851d-bbed-46b3-a06c-f3fa662b6363","year":2022},"citing_paper":{"arxiv_id":"2506.18557","last_updated":"2025-06-24T02:05:51Z","snapshot_observed_at":"2026-08-06T23:13:29.775397Z","submitted_at":"2025-06-23T12:08:07Z","title":"Object-aware Sound Source Localization via Audio-Visual Scene Understanding","version":2},"reference_index":30,"source":"arxiv_source","source_observed_at":"2026-08-06T23:20:47.607798Z"},"links":{"cited_paper":"/paper/2207.07646","citing_paper":"/paper/2506.18557"},"observation_digest":"sha256:413d1441c0f22f3de7495c7ee47f85afe54661d24f5782a2a1d052fa6f3f328b","observation_id":"a8698035-bfd8-4a4e-993b-51396e7e26a4","resolution":{"observed_at":"2026-08-06T23:20:49.591703Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:20:53.862611Z","title":"Mm-diffusion: Learning multi-modal diffusion models for joint audio and video generation","venue":null,"work_id":"25f7bef2-69d7-41f9-a5b1-c16bbed2e4de","year":2023},"citing_paper":{"arxiv_id":"2506.18557","last_updated":"2025-06-24T02:05:51Z","snapshot_observed_at":"2026-08-06T23:13:29.775397Z","submitted_at":"2025-06-23T12:08:07Z","title":"Object-aware Sound Source Localization via Audio-Visual Scene Understanding","version":2},"reference_index":31,"source":"arxiv_source","source_observed_at":"2026-08-06T23:20:47.662872Z"},"links":{"citing_paper":"/paper/2506.18557"},"observation_digest":"sha256:d121264c330cd98ef9c7a29771fa1604c67bebb22c633125237a4ded340b4d6c","observation_id":"9b0ae4b5-47ac-48ad-9615-77b480b67d4a","resolution":{"observed_at":"2026-08-06T23:20:53.964747Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:20:53.704863Z","title":"Learning to localize sound source in visual scenes","venue":null,"work_id":"3c5c1c1c-6a03-495a-9a20-c90ec493c3e6","year":2018},"citing_paper":{"arxiv_id":"2506.18557","last_updated":"2025-06-24T02:05:51Z","snapshot_observed_at":"2026-08-06T23:13:29.775397Z","submitted_at":"2025-06-23T12:08:07Z","title":"Object-aware Sound Source Localization via Audio-Visual Scene Understanding","version":2},"reference_index":32,"source":"arxiv_source","source_observed_at":"2026-08-06T23:20:47.742209Z"},"links":{"citing_paper":"/paper/2506.18557"},"observation_digest":"sha256:658b5893bf7de44adb7ed7bf0481525493d65b4df3159302477211903145a074","observation_id":"d51aa6db-5f85-46d9-ad3c-9af470c889bc","resolution":{"observed_at":"2026-08-06T23:20:53.797386Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:20:53.252042Z","title":"Learning sound localization better from semantically similar samples","venue":null,"work_id":"c7455f8b-cb02-4f4a-82cf-8d9ddf778639","year":2022},"citing_paper":{"arxiv_id":"2506.18557","last_updated":"2025-06-24T02:05:51Z","snapshot_observed_at":"2026-08-06T23:13:29.775397Z","submitted_at":"2025-06-23T12:08:07Z","title":"Object-aware Sound Source Localization via Audio-Visual Scene Understanding","version":2},"reference_index":33,"source":"arxiv_source","source_observed_at":"2026-08-06T23:20:47.780015Z"},"links":{"citing_paper":"/paper/2506.18557"},"observation_digest":"sha256:9f6a604b03fc09a8202a860571e8847b7df8c99c595fbb1a64bd7d9f448a6798","observation_id":"fc4440a1-9511-4a3e-a515-fb31081f8a81","resolution":{"observed_at":"2026-08-06T23:20:53.536440Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:20:53.013919Z","title":"Sound source localization is all about cross-modal alignment","venue":null,"work_id":"1646a925-5d03-4b6e-9708-06bea609c1c0","year":2023},"citing_paper":{"arxiv_id":"2506.18557","last_updated":"2025-06-24T02:05:51Z","snapshot_observed_at":"2026-08-06T23:13:29.775397Z","submitted_at":"2025-06-23T12:08:07Z","title":"Object-aware Sound Source Localization via Audio-Visual Scene Understanding","version":2},"reference_index":34,"source":"arxiv_source","source_observed_at":"2026-08-06T23:20:47.952858Z"},"links":{"citing_paper":"/paper/2506.18557"},"observation_digest":"sha256:28e49b87c4afd09fd3d56749084b9086550bbd6e3f85df24603e0482851ed1de","observation_id":"c3c94bfc-8ce8-4f7c-99ff-cfaa9bf03581","resolution":{"observed_at":"2026-08-06T23:20:53.104744Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:20:52.787787Z","title":"Unsupervised sounding object localization with bottom-up and top-down attention","venue":null,"work_id":"9f469910-2b83-4e94-ba3b-8a30aeb2e0b9","year":2022},"citing_paper":{"arxiv_id":"2506.18557","last_updated":"2025-06-24T02:05:51Z","snapshot_observed_at":"2026-08-06T23:13:29.775397Z","submitted_at":"2025-06-23T12:08:07Z","title":"Object-aware Sound Source Localization via Audio-Visual Scene Understanding","version":2},"reference_index":35,"source":"arxiv_source","source_observed_at":"2026-08-06T23:20:47.985284Z"},"links":{"citing_paper":"/paper/2506.18557"},"observation_digest":"sha256:d44321077629a948df2b87db24b417a5e6ed8d34de2049576b44f477af33e64d","observation_id":"edc0cf83-fb89-4bc0-8973-1cce97dd04a5","resolution":{"observed_at":"2026-08-06T23:20:52.876261Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:20:52.363674Z","title":"Flowgrad: Using motion for visual sound source localization","venue":null,"work_id":"ce825217-d505-43ef-bd44-9a14d0e247d8","year":2023},"citing_paper":{"arxiv_id":"2506.18557","last_updated":"2025-06-24T02:05:51Z","snapshot_observed_at":"2026-08-06T23:13:29.775397Z","submitted_at":"2025-06-23T12:08:07Z","title":"Object-aware Sound Source Localization via Audio-Visual Scene Understanding","version":2},"reference_index":36,"source":"arxiv_source","source_observed_at":"2026-08-06T23:20:48.061595Z"},"links":{"citing_paper":"/paper/2506.18557"},"observation_digest":"sha256:a8465da87f8f7c8cd0b1b8622911f0184ddb18c1e80834e68897a1fb8abbb0da","observation_id":"e821573b-01b8-42d4-b2ee-4af3b572fda0","resolution":{"observed_at":"2026-08-06T23:20:52.534945Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:20:52.142637Z","title":"Self-supervised predictive learning: A negative-free method for sound source localization in visual scenes","venue":null,"work_id":"bc04851d-6f91-4850-a856-5f44ecc8c23e","year":2022},"citing_paper":{"arxiv_id":"2506.18557","last_updated":"2025-06-24T02:05:51Z","snapshot_observed_at":"2026-08-06T23:13:29.775397Z","submitted_at":"2025-06-23T12:08:07Z","title":"Object-aware Sound Source Localization via Audio-Visual Scene Understanding","version":2},"reference_index":37,"source":"arxiv_source","source_observed_at":"2026-08-06T23:20:48.196924Z"},"links":{"citing_paper":"/paper/2506.18557"},"observation_digest":"sha256:6abbcad82febfa72332b3aa44c767380d3fc312b61b96a333ad1246fc8bb86a3","observation_id":"9b7a432f-dd00-4e2e-880b-98c6df771e1f","resolution":{"observed_at":"2026-08-06T23:20:52.215295Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:20:51.890495Z","title":"Learning audio-visual source localization via false negative aware contrastive learning","venue":null,"work_id":"e0461996-7de1-4d48-be68-7d8ba8fd91e8","year":2023},"citing_paper":{"arxiv_id":"2506.18557","last_updated":"2025-06-24T02:05:51Z","snapshot_observed_at":"2026-08-06T23:13:29.775397Z","submitted_at":"2025-06-23T12:08:07Z","title":"Object-aware Sound Source Localization via Audio-Visual Scene Understanding","version":2},"reference_index":38,"source":"arxiv_source","source_observed_at":"2026-08-06T23:20:48.316561Z"},"links":{"citing_paper":"/paper/2506.18557"},"observation_digest":"sha256:2c278a169a7d604c80908f0d68fbe001cc881d736c7226bb572bba4bacc82f9f","observation_id":"0099b1eb-197c-4982-bbdd-470db32f7dbe","resolution":{"observed_at":"2026-08-06T23:20:51.998121Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:20:51.681873Z","title":"Audio-visual spatial integration and recursive attention for robust sound source localization","venue":null,"work_id":"1f7f30f9-1076-42f4-a16b-8b7407e629c8","year":2023},"citing_paper":{"arxiv_id":"2506.18557","last_updated":"2025-06-24T02:05:51Z","snapshot_observed_at":"2026-08-06T23:13:29.775397Z","submitted_at":"2025-06-23T12:08:07Z","title":"Object-aware Sound Source Localization via Audio-Visual Scene Understanding","version":2},"reference_index":39,"source":"arxiv_source","source_observed_at":"2026-08-06T23:20:48.413073Z"},"links":{"citing_paper":"/paper/2506.18557"},"observation_digest":"sha256:4edfc8cbbcc4f719bc54134641799883bcb35883abd54a262719970df9af7b98","observation_id":"04793bae-3c14-47f6-b257-7b79e6ed984b","resolution":{"observed_at":"2026-08-06T23:20:51.739907Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:20:51.422300Z","title":"Watch video, catch keyword: Context-aware keyword attention for moment retrieval and highlight detection","venue":null,"work_id":"d0f4c0c0-443f-4939-a4fd-4a9a35ddc0be","year":2025},"citing_paper":{"arxiv_id":"2506.18557","last_updated":"2025-06-24T02:05:51Z","snapshot_observed_at":"2026-08-06T23:13:29.775397Z","submitted_at":"2025-06-23T12:08:07Z","title":"Object-aware Sound Source Localization via Audio-Visual Scene Understanding","version":2},"reference_index":40,"source":"arxiv_source","source_observed_at":"2026-08-06T23:20:48.481956Z"},"links":{"citing_paper":"/paper/2506.18557"},"observation_digest":"sha256:2dc9bf3cece8e31cdeec1ea48fafbed9008518101e72550dbd21bcd362d7cb5a","observation_id":"a4793b17-fe85-4b43-8de0-53d48099bcae","resolution":{"observed_at":"2026-08-06T23:20:51.514758Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:20:51.156930Z","title":"V2a-mapper: A lightweight solution for vision-to-audio generation by connecting foundation models","venue":null,"work_id":"f6d64217-c024-4a77-8dcb-7234c632e9f9","year":2024},"citing_paper":{"arxiv_id":"2506.18557","last_updated":"2025-06-24T02:05:51Z","snapshot_observed_at":"2026-08-06T23:13:29.775397Z","submitted_at":"2025-06-23T12:08:07Z","title":"Object-aware Sound Source Localization via Audio-Visual Scene Understanding","version":2},"reference_index":41,"source":"arxiv_source","source_observed_at":"2026-08-06T23:20:48.538040Z"},"links":{"citing_paper":"/paper/2506.18557"},"observation_digest":"sha256:269de87c33ef47c12823fc62f8ead797e8541fe56cf23d921db2a23b73ccd921","observation_id":"de45388e-df01-4cc3-aafa-63a089495525","resolution":{"observed_at":"2026-08-06T23:20:51.283695Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:20:50.930047Z","title":"Multimodal large language models: A survey","venue":null,"work_id":"dadce087-f9c6-4ec0-a64b-fc18d3fd3443","year":2023},"citing_paper":{"arxiv_id":"2506.18557","last_updated":"2025-06-24T02:05:51Z","snapshot_observed_at":"2026-08-06T23:13:29.775397Z","submitted_at":"2025-06-23T12:08:07Z","title":"Object-aware Sound Source Localization via Audio-Visual Scene Understanding","version":2},"reference_index":42,"source":"arxiv_source","source_observed_at":"2026-08-06T23:20:48.669587Z"},"links":{"citing_paper":"/paper/2506.18557"},"observation_digest":"sha256:b8a8c50caabc4514795c011e5f5f316f6d4c64536bce21cc110dd8c911b48b67","observation_id":"02f9acb8-8e93-4110-856a-999f7b07683d","resolution":{"observed_at":"2026-08-06T23:20:51.046232Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:20:50.683789Z","title":"Sonicvisionlm: Playing sound with vision language models","venue":null,"work_id":"149aa04a-5448-4f57-821a-a14fa6e85d66","year":2024},"citing_paper":{"arxiv_id":"2506.18557","last_updated":"2025-06-24T02:05:51Z","snapshot_observed_at":"2026-08-06T23:13:29.775397Z","submitted_at":"2025-06-23T12:08:07Z","title":"Object-aware Sound Source Localization via Audio-Visual Scene Understanding","version":2},"reference_index":43,"source":"arxiv_source","source_observed_at":"2026-08-06T23:20:48.722137Z"},"links":{"citing_paper":"/paper/2506.18557"},"observation_digest":"sha256:f776f8ba24bb4b9ae0cef94fd60c50e1cf757ceb8f1cc4fac72e14c344eebe4a","observation_id":"caf9bdfc-63e5-467e-a050-368ba2d6297b","resolution":{"observed_at":"2026-08-06T23:20:50.814775Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:20:50.497745Z","title":"A proposal-based paradigm for self-supervised sound source localization in videos","venue":null,"work_id":"6a0937d4-256c-4231-916c-467a5106776b","year":2022},"citing_paper":{"arxiv_id":"2506.18557","last_updated":"2025-06-24T02:05:51Z","snapshot_observed_at":"2026-08-06T23:13:29.775397Z","submitted_at":"2025-06-23T12:08:07Z","title":"Object-aware Sound Source Localization via Audio-Visual Scene Understanding","version":2},"reference_index":44,"source":"arxiv_source","source_observed_at":"2026-08-06T23:20:48.915324Z"},"links":{"citing_paper":"/paper/2506.18557"},"observation_digest":"sha256:d2bf05f09254a8e27e0a9854cc9ddeb9bb277f64347dc1bf67073de8c75e6c18","observation_id":"e09ecbac-9ff0-495b-9354-2b1ed2b00458","resolution":{"observed_at":"2026-08-06T23:20:50.588081Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2306.13549","last_updated":"2024-11-29T15:51:23Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-06-23T15:21:52Z","title":"A Survey on Multimodal Large Language Models","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.13549","snapshot_observed_at":"2026-08-06T23:20:48.985249Z","title":"A survey on multimodal large language models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.18557","last_updated":"2025-06-24T02:05:51Z","snapshot_observed_at":"2026-08-06T23:13:29.775397Z","submitted_at":"2025-06-23T12:08:07Z","title":"Object-aware Sound Source Localization via Audio-Visual Scene Understanding","version":2},"reference_index":45,"source":"arxiv_source","source_observed_at":"2026-08-06T23:20:48.985249Z"},"links":{"cited_paper":"/paper/2306.13549","citing_paper":"/paper/2506.18557"},"observation_digest":"sha256:2002a5aaff38ac594a53142d4162aecc707cebdb4f745beb7c81e712fd36a190","observation_id":"0ae44f15-eda2-4597-b370-81865df6e06d","resolution":{"observed_at":"2026-08-06T23:20:48.985249Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2306.02858","last_updated":"2023-10-25T06:23:31Z","snapshot_observed_at":"2026-08-13T15:50:38.254753Z","submitted_at":"2023-06-05T13:17:27Z","title":"Video-LLaMA: An Instruction-tuned Audio-Visual Language Model for Video Understanding","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.02858","snapshot_observed_at":"2026-08-06T23:20:49.075435Z","title":"Video-llama: An instruction-tuned audio-visual language model for video understanding","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.18557","last_updated":"2025-06-24T02:05:51Z","snapshot_observed_at":"2026-08-06T23:13:29.775397Z","submitted_at":"2025-06-23T12:08:07Z","title":"Object-aware Sound Source Localization via Audio-Visual Scene Understanding","version":2},"reference_index":46,"source":"arxiv_source","source_observed_at":"2026-08-06T23:20:49.075435Z"},"links":{"cited_paper":"/paper/2306.02858","citing_paper":"/paper/2506.18557"},"observation_digest":"sha256:ef3157ef3f0a016ef005a84b3b3a6c6a5b1e899bc4a5a5251efc7c18f2f0cd62","observation_id":"52a526d2-17b8-4015-8ead-64026d200fcc","resolution":{"observed_at":"2026-08-06T23:20:49.075435Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:20:50.146911Z","title":"The sound of pixels","venue":null,"work_id":"0a987918-0c76-4692-8c20-e6fefe2ea17f","year":2018},"citing_paper":{"arxiv_id":"2506.18557","last_updated":"2025-06-24T02:05:51Z","snapshot_observed_at":"2026-08-06T23:13:29.775397Z","submitted_at":"2025-06-23T12:08:07Z","title":"Object-aware Sound Source Localization via Audio-Visual Scene Understanding","version":2},"reference_index":47,"source":"arxiv_source","source_observed_at":"2026-08-06T23:20:49.160956Z"},"links":{"citing_paper":"/paper/2506.18557"},"observation_digest":"sha256:0ce421da876813cbfccda712ff7531ed5a20d5ab7d2c8319214e0b41a0a3ce42","observation_id":"7d765c18-5d41-445c-a565-addc16c9924e","resolution":{"observed_at":"2026-08-06T23:20:50.348537Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:20:49.942418Z","title":"Weakly supervised contrastive learning","venue":null,"work_id":"ffc88a2f-e2aa-4ea8-9767-2c80a7c220df","year":2021},"citing_paper":{"arxiv_id":"2506.18557","last_updated":"2025-06-24T02:05:51Z","snapshot_observed_at":"2026-08-06T23:13:29.775397Z","submitted_at":"2025-06-23T12:08:07Z","title":"Object-aware Sound Source Localization via Audio-Visual Scene Understanding","version":2},"reference_index":48,"source":"arxiv_source","source_observed_at":"2026-08-06T23:20:49.253720Z"},"links":{"citing_paper":"/paper/2506.18557"},"observation_digest":"sha256:aecf9e422b1bfb1f3f11421ae6bacc24fa68fdf9ce78d89543387789dc290283","observation_id":"37e29985-6257-4e8f-af2e-e41c0dfa0027","resolution":{"observed_at":"2026-08-06T23:20:50.052232Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:20:49.729512Z","title":"Exploiting visual context semantics for sound source localization","venue":null,"work_id":"1fadf405-8d4b-44f0-815a-2c394693d6cb","year":2023},"citing_paper":{"arxiv_id":"2506.18557","last_updated":"2025-06-24T02:05:51Z","snapshot_observed_at":"2026-08-06T23:13:29.775397Z","submitted_at":"2025-06-23T12:08:07Z","title":"Object-aware Sound Source Localization via Audio-Visual Scene Understanding","version":2},"reference_index":49,"source":"arxiv_source","source_observed_at":"2026-08-06T23:20:49.374967Z"},"links":{"citing_paper":"/paper/2506.18557"},"observation_digest":"sha256:1dcb0e530374ad5b824be82557c9834bd5a83a64dc6b2d1887c3b6daffb36149","observation_id":"69480215-0ca9-4260-b091-d46be833e310","resolution":{"observed_at":"2026-08-06T23:20:49.795672Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2506.18557","last_updated":"2025-06-24T02:05:51Z","latest_version":2,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-06T23:13:29.775397Z","submitted_at":"2025-06-23T12:08:07Z","title":"Object-aware Sound Source Localization via Audio-Visual Scene Understanding"},"reference_resolution":{"displayed":49,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":8,"verified_exact":1,"verified_fuzzy":40},"total_outbound_references":49},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"thesis":"As of 14 August 2026, this Paper Citation Record lists 49 of 49 outbound references and 0 inbound Pith citation observations for arXiv:2506.18557."}