{"as_of":"2026-08-10T18:49:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:9faa3b2402e18d7d5a05e182790d95b20a7953cc800f073eb76a3d276cc9461e","coverage":[{"denominator":41,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":41,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T23:04:01.886110Z","state":"measured"},{"denominator":41,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":41,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-10T06:31:04.303077+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2608.05816/citation-record","integrity":"/paper/2608.05816/integrity","json":"/paper/2608.05816/citation-record.json","paper":"/paper/2608.05816"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T23:04:02.598791Z","title":"In: Proceedings of the IEEE international conference on computer vision","venue":null,"work_id":"8d6f66a8-e214-4ab8-854a-292a1f984c8b","year":2017},"citing_paper":{"arxiv_id":"2608.05816","last_updated":"2026-08-06T09:47:34Z","snapshot_observed_at":"2026-08-09T23:11:38.499398Z","submitted_at":"2026-08-06T09:47:34Z","title":"Whence the Voice? Self-supervised Dual-source Audio-Visual Localisation via Selective Convergence","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-07T23:04:01.554204Z"},"links":{"citing_paper":"/paper/2608.05816"},"observation_digest":"sha256:55954cdc1dda2b73a97b93a6cee53c45cdd81a6dc6fd22aaf74b2ad6376570ec","observation_id":"6c274851-dcd5-4301-ac50-615b7b1006bc","resolution":{"observed_at":"2026-08-07T23:04:02.603025Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T23:04:02.584279Z","title":"In: Proceedings of the Euro- pean conference on computer vision (ECCV)","venue":null,"work_id":"b92e0794-fb71-430c-9a66-054294246ef0","year":2018},"citing_paper":{"arxiv_id":"2608.05816","last_updated":"2026-08-06T09:47:34Z","snapshot_observed_at":"2026-08-09T23:11:38.499398Z","submitted_at":"2026-08-06T09:47:34Z","title":"Whence the Voice? Self-supervised Dual-source Audio-Visual Localisation via Selective Convergence","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-07T23:04:01.559635Z"},"links":{"citing_paper":"/paper/2608.05816"},"observation_digest":"sha256:5e973027a912e2633308e7413a96562b201ebf68fb3b3c61c4c6ce78c4ffcd89","observation_id":"1860f9dc-9b7b-4999-8dcb-9d2fc6394f17","resolution":{"observed_at":"2026-08-07T23:04:02.588893Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T23:04:02.568188Z","title":"Advances in neural information processing systems29(2016)","venue":null,"work_id":"fb7e188a-35f4-4a1a-b3be-7bae45d55673","year":2016},"citing_paper":{"arxiv_id":"2608.05816","last_updated":"2026-08-06T09:47:34Z","snapshot_observed_at":"2026-08-09T23:11:38.499398Z","submitted_at":"2026-08-06T09:47:34Z","title":"Whence the Voice? Self-supervised Dual-source Audio-Visual Localisation via Selective Convergence","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-07T23:04:01.564650Z"},"links":{"citing_paper":"/paper/2608.05816"},"observation_digest":"sha256:5b0adb05de53a9d71448e32d0b7fbd8e558e730776618266edd9c7d28710c7d4","observation_id":"37445cdf-c368-4921-907f-b9a63da27640","resolution":{"observed_at":"2026-08-07T23:04:02.572902Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T23:04:02.553808Z","title":"Frontiers in Neuroscience11, 159 (2017)","venue":null,"work_id":"e31f385a-c6f2-45c8-bd57-c92707ab8234","year":2017},"citing_paper":{"arxiv_id":"2608.05816","last_updated":"2026-08-06T09:47:34Z","snapshot_observed_at":"2026-08-09T23:11:38.499398Z","submitted_at":"2026-08-06T09:47:34Z","title":"Whence the Voice? Self-supervised Dual-source Audio-Visual Localisation via Selective Convergence","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-07T23:04:01.569568Z"},"links":{"citing_paper":"/paper/2608.05816"},"observation_digest":"sha256:dadcdfeebf25841290bc498b61dddbcff0743e656216d1d1401220b4709858fd","observation_id":"fe0cb4b8-2b9c-4535-bc18-b60886a618c4","resolution":{"observed_at":"2026-08-07T23:04:02.558217Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T23:04:02.538390Z","title":"Attention, Perception, & Psychophysics77(5), 1465– 1487 (2015)","venue":null,"work_id":"123a0d4d-1e0b-48c8-bf7c-0abb4942c386","year":2015},"citing_paper":{"arxiv_id":"2608.05816","last_updated":"2026-08-06T09:47:34Z","snapshot_observed_at":"2026-08-09T23:11:38.499398Z","submitted_at":"2026-08-06T09:47:34Z","title":"Whence the Voice? Self-supervised Dual-source Audio-Visual Localisation via Selective Convergence","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-07T23:04:01.575305Z"},"links":{"citing_paper":"/paper/2608.05816"},"observation_digest":"sha256:9312a8cabeb6e951dfa4e88744d10898baf462317f9ec924cd9c289032769ea9","observation_id":"2226b01b-410e-4810-8a64-7fb3295ee0d7","resolution":{"observed_at":"2026-08-07T23:04:02.543677Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T23:04:02.522198Z","title":"In: Proceedings of the IEEE/CVF conference on computer vision and pattern recognition","venue":null,"work_id":"371b4476-2e55-4d60-be71-e57010920f52","year":2021},"citing_paper":{"arxiv_id":"2608.05816","last_updated":"2026-08-06T09:47:34Z","snapshot_observed_at":"2026-08-09T23:11:38.499398Z","submitted_at":"2026-08-06T09:47:34Z","title":"Whence the Voice? Self-supervised Dual-source Audio-Visual Localisation via Selective Convergence","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-07T23:04:01.580317Z"},"links":{"citing_paper":"/paper/2608.05816"},"observation_digest":"sha256:62ae5a7f50c401208be0313adbbef92083b66c3937c0489f7fd76293b4e8b711","observation_id":"70bbde47-6c15-44e2-accc-24068ee7d583","resolution":{"observed_at":"2026-08-07T23:04:02.527389Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T23:04:02.505107Z","title":"In: ICASSP 2020-2020 IEEE International Conference on Acoustics, Speech and Signal Processing (ICASSP)","venue":null,"work_id":"da701944-5cbb-4ce1-8347-cbd9b5a35a4a","year":2020},"citing_paper":{"arxiv_id":"2608.05816","last_updated":"2026-08-06T09:47:34Z","snapshot_observed_at":"2026-08-09T23:11:38.499398Z","submitted_at":"2026-08-06T09:47:34Z","title":"Whence the Voice? Self-supervised Dual-source Audio-Visual Localisation via Selective Convergence","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-07T23:04:01.586258Z"},"links":{"citing_paper":"/paper/2608.05816"},"observation_digest":"sha256:497ae5232cb118ea98dd70e08ac09ebe857365ad7eab063eea820310d989d104","observation_id":"04861d27-f7da-46b9-9d0c-60e141688c93","resolution":{"observed_at":"2026-08-07T23:04:02.510649Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T23:04:02.487497Z","title":"In: Conference on Computer Vision and Pattern Recognition (CVPR) (2020)","venue":null,"work_id":"47b193b6-118e-41b8-9b17-f5d28c2d3f5e","year":2020},"citing_paper":{"arxiv_id":"2608.05816","last_updated":"2026-08-06T09:47:34Z","snapshot_observed_at":"2026-08-09T23:11:38.499398Z","submitted_at":"2026-08-06T09:47:34Z","title":"Whence the Voice? Self-supervised Dual-source Audio-Visual Localisation via Selective Convergence","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-07T23:04:01.591367Z"},"links":{"citing_paper":"/paper/2608.05816"},"observation_digest":"sha256:291b7ba7ed8bac14acd267b2161a4203fe504c253d6c9500a1505b82a901f0e3","observation_id":"aa60035c-c75c-4be2-815f-8443961b437e","resolution":{"observed_at":"2026-08-07T23:04:02.492991Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T23:04:02.471448Z","title":"In: Proceedings of the IEEE/CVF International Confer- ence on Computer Vision (ICCV) (2025)","venue":null,"work_id":"e016470d-705e-40f0-8618-b3a07fa5f00e","year":2025},"citing_paper":{"arxiv_id":"2608.05816","last_updated":"2026-08-06T09:47:34Z","snapshot_observed_at":"2026-08-09T23:11:38.499398Z","submitted_at":"2026-08-06T09:47:34Z","title":"Whence the Voice? Self-supervised Dual-source Audio-Visual Localisation via Selective Convergence","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-07T23:04:01.596497Z"},"links":{"citing_paper":"/paper/2608.05816"},"observation_digest":"sha256:f9acb1d8eb4d6eff9478898ac4e457c98277332a9d6919edbbc4afe5fce9d99d","observation_id":"24df23de-f6f3-4649-96cf-a1d483f84a1b","resolution":{"observed_at":"2026-08-07T23:04:02.476703Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T23:04:02.455698Z","title":"In: Proceedings of the AAAI Conference on Artificial Intelligence (AAAI)","venue":null,"work_id":"914a1a85-a50a-470a-8af3-bfaff50cfec9","year":2024},"citing_paper":{"arxiv_id":"2608.05816","last_updated":"2026-08-06T09:47:34Z","snapshot_observed_at":"2026-08-09T23:11:38.499398Z","submitted_at":"2026-08-06T09:47:34Z","title":"Whence the Voice? Self-supervised Dual-source Audio-Visual Localisation via Selective Convergence","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-07T23:04:01.601464Z"},"links":{"citing_paper":"/paper/2608.05816"},"observation_digest":"sha256:570eab824339dfb4be09cfedccd9f28b835ef0d0200de33202f0ed57db36ed52","observation_id":"b39f2f56-35e7-4d00-a4a4-535a8ff02df8","resolution":{"observed_at":"2026-08-07T23:04:02.460940Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T23:04:02.439760Z","title":"In: Proceedings of the IEEE/CVF Conference on Computer Vision and Pattern Recognition (CVPR) (2025)","venue":null,"work_id":"4431f029-bf69-488e-9b99-b00a91f89385","year":2025},"citing_paper":{"arxiv_id":"2608.05816","last_updated":"2026-08-06T09:47:34Z","snapshot_observed_at":"2026-08-09T23:11:38.499398Z","submitted_at":"2026-08-06T09:47:34Z","title":"Whence the Voice? Self-supervised Dual-source Audio-Visual Localisation via Selective Convergence","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-07T23:04:01.613119Z"},"links":{"citing_paper":"/paper/2608.05816"},"observation_digest":"sha256:4df699ee0f5956f1fc02eff24ad01a9d337dee7356f71dca3812e4c0ea5220e9","observation_id":"3a424f31-5dac-467d-b69f-93376678c2f1","resolution":{"observed_at":"2026-08-07T23:04:02.444767Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T23:04:02.424640Z","title":"In: Advances in Neural Information Processing Systems (NeurIPS)","venue":null,"work_id":"2b52785a-3c41-4852-936a-756322775f07","year":2023},"citing_paper":{"arxiv_id":"2608.05816","last_updated":"2026-08-06T09:47:34Z","snapshot_observed_at":"2026-08-09T23:11:38.499398Z","submitted_at":"2026-08-06T09:47:34Z","title":"Whence the Voice? Self-supervised Dual-source Audio-Visual Localisation via Selective Convergence","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-07T23:04:01.628526Z"},"links":{"citing_paper":"/paper/2608.05816"},"observation_digest":"sha256:607e76539ce0d9effec4ad78d89cb789428b8268dda1b78789b061c220247ff7","observation_id":"8ea478e6-0ac9-4039-9617-0d09ef77e084","resolution":{"observed_at":"2026-08-07T23:04:02.429207Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T23:04:01.645386Z","title":null,"venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2608.05816","last_updated":"2026-08-06T09:47:34Z","snapshot_observed_at":"2026-08-09T23:11:38.499398Z","submitted_at":"2026-08-06T09:47:34Z","title":"Whence the Voice? Self-supervised Dual-source Audio-Visual Localisation via Selective Convergence","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-07T23:04:01.645386Z"},"links":{"citing_paper":"/paper/2608.05816"},"observation_digest":"sha256:1508bd63083a77b208fbda189dbdf2be0eef79a8879f42b55bd263350b596d2d","observation_id":"210ccabd-7b88-4e58-a277-8c47d2959df1","resolution":{"observed_at":"2026-08-07T23:04:01.645386Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T23:04:02.396930Z","title":"In: Proceedings of the IEEE/CVF conference on computer vision and pattern recognition","venue":null,"work_id":"ea525fad-8018-428a-b1d5-b38a7f3693e6","year":2019},"citing_paper":{"arxiv_id":"2608.05816","last_updated":"2026-08-06T09:47:34Z","snapshot_observed_at":"2026-08-09T23:11:38.499398Z","submitted_at":"2026-08-06T09:47:34Z","title":"Whence the Voice? Self-supervised Dual-source Audio-Visual Localisation via Selective Convergence","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-07T23:04:01.656480Z"},"links":{"citing_paper":"/paper/2608.05816"},"observation_digest":"sha256:9ee148af8ec9e4b29371f946f8d039585d1096e94a0d5c7ea91d8186565c4648","observation_id":"d322b711-de24-4baa-b2a8-46f8d5ca0d46","resolution":{"observed_at":"2026-08-07T23:04:02.401361Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T23:04:02.381028Z","title":"Advances in Neural Information Processing Systems33, 10077–10087 (2020)","venue":null,"work_id":"48abed69-3745-4186-b9ac-b41bdc46f65e","year":2020},"citing_paper":{"arxiv_id":"2608.05816","last_updated":"2026-08-06T09:47:34Z","snapshot_observed_at":"2026-08-09T23:11:38.499398Z","submitted_at":"2026-08-06T09:47:34Z","title":"Whence the Voice? Self-supervised Dual-source Audio-Visual Localisation via Selective Convergence","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-07T23:04:01.667931Z"},"links":{"citing_paper":"/paper/2608.05816"},"observation_digest":"sha256:aa6ba155a6a421ac82d50beea8b821be0d81f37268c119e6f08054bc23b92231","observation_id":"a441b1f1-0c6e-4e0c-9643-8db7ab5d6bcf","resolution":{"observed_at":"2026-08-07T23:04:02.386110Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T23:04:02.364748Z","title":"In: British Machine Vision Conference (BMVC) (2025)","venue":null,"work_id":"6356469d-ba5e-4a50-9db6-7265eb70f63c","year":2025},"citing_paper":{"arxiv_id":"2608.05816","last_updated":"2026-08-06T09:47:34Z","snapshot_observed_at":"2026-08-09T23:11:38.499398Z","submitted_at":"2026-08-06T09:47:34Z","title":"Whence the Voice? Self-supervised Dual-source Audio-Visual Localisation via Selective Convergence","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-07T23:04:01.679994Z"},"links":{"citing_paper":"/paper/2608.05816"},"observation_digest":"sha256:20beb4ed148145d385b3c150b471936c579f09c2a8346d9acaec91db63d1af1d","observation_id":"fa0c01c6-d212-4035-81ba-28fb7fbe33e1","resolution":{"observed_at":"2026-08-07T23:04:02.369268Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T23:04:02.348917Z","title":"In: Proceedings of the IEEE/CVF Conference on Computer Vision and Pat- tern Recognition (2022) Whence the Voice? 33","venue":null,"work_id":"152f1c97-95b6-45a8-abfb-0eb6c21db65d","year":2022},"citing_paper":{"arxiv_id":"2608.05816","last_updated":"2026-08-06T09:47:34Z","snapshot_observed_at":"2026-08-09T23:11:38.499398Z","submitted_at":"2026-08-06T09:47:34Z","title":"Whence the Voice? Self-supervised Dual-source Audio-Visual Localisation via Selective Convergence","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-07T23:04:01.692047Z"},"links":{"citing_paper":"/paper/2608.05816"},"observation_digest":"sha256:dc850cc24452fd2dd386f18877a21751e61f889cf5117fa08188e2e6b2ab3079","observation_id":"cc5e74c0-e9c9-454e-9394-3862c0ec41f4","resolution":{"observed_at":"2026-08-07T23:04:02.354037Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T23:04:02.331948Z","title":"In: British Machine Vision Conference (BMVC) (2025)","venue":null,"work_id":"11c5e17d-0dc9-44ad-9548-cc838d3dea18","year":2025},"citing_paper":{"arxiv_id":"2608.05816","last_updated":"2026-08-06T09:47:34Z","snapshot_observed_at":"2026-08-09T23:11:38.499398Z","submitted_at":"2026-08-06T09:47:34Z","title":"Whence the Voice? Self-supervised Dual-source Audio-Visual Localisation via Selective Convergence","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-07T23:04:01.704370Z"},"links":{"citing_paper":"/paper/2608.05816"},"observation_digest":"sha256:a36ef38a8fe141de61502f90a07455846c0ce53b5fd0628c1f7d86a05e32631c","observation_id":"a00b0d01-9f57-469b-939c-66eb56d2f339","resolution":{"observed_at":"2026-08-07T23:04:02.337579Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T23:04:02.314635Z","title":"In: Proceedings of the IEEE/CVF Conference on Computer Vision and Pattern Recognition","venue":null,"work_id":"6fbf2cf1-5086-4f40-bf5a-3ddae62b9218","year":2024},"citing_paper":{"arxiv_id":"2608.05816","last_updated":"2026-08-06T09:47:34Z","snapshot_observed_at":"2026-08-09T23:11:38.499398Z","submitted_at":"2026-08-06T09:47:34Z","title":"Whence the Voice? Self-supervised Dual-source Audio-Visual Localisation via Selective Convergence","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-07T23:04:01.717929Z"},"links":{"citing_paper":"/paper/2608.05816"},"observation_digest":"sha256:b787edcc39d22e7212562575bf2c09c58eead2c666616366e97bbf6e83edd58f","observation_id":"01159ed1-3a04-4182-abd5-d43280ebe315","resolution":{"observed_at":"2026-08-07T23:04:02.320224Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T23:04:02.297473Z","title":"In: Proceedings of the IEEE/CVF Conference on Computer Vision and Pattern Recognition (CVPR)","venue":null,"work_id":"6f3d1b6a-8c20-412d-aacd-f288b3f29f22","year":2025},"citing_paper":{"arxiv_id":"2608.05816","last_updated":"2026-08-06T09:47:34Z","snapshot_observed_at":"2026-08-09T23:11:38.499398Z","submitted_at":"2026-08-06T09:47:34Z","title":"Whence the Voice? Self-supervised Dual-source Audio-Visual Localisation via Selective Convergence","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-07T23:04:01.731400Z"},"links":{"citing_paper":"/paper/2608.05816"},"observation_digest":"sha256:aad2725bc1798fc837ba7835bb0c13b5a75762b043efaae6465b4c0c4e23b84a","observation_id":"0a9cdadb-e65e-470b-9873-9f088ea81ed5","resolution":{"observed_at":"2026-08-07T23:04:02.303101Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1412.6980","last_updated":"2017-01-30T01:27:54Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2014-12-22T13:54:29Z","title":"Adam: A Method for Stochastic Optimization","version":9},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1412.6980","snapshot_observed_at":"2026-08-07T23:04:01.744967Z","title":"arXiv preprint arXiv:1412.6980 (2014)","venue":null,"work_id":null,"year":2014},"citing_paper":{"arxiv_id":"2608.05816","last_updated":"2026-08-06T09:47:34Z","snapshot_observed_at":"2026-08-09T23:11:38.499398Z","submitted_at":"2026-08-06T09:47:34Z","title":"Whence the Voice? Self-supervised Dual-source Audio-Visual Localisation via Selective Convergence","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-07T23:04:01.744967Z"},"links":{"cited_paper":"/paper/1412.6980","citing_paper":"/paper/2608.05816"},"observation_digest":"sha256:699c576dcd8c7ae0d0825937a492caf9a49938f303e5d9ac49dcb03f66a47ca7","observation_id":"c799eb3e-e1a8-4529-98df-28647321f6d7","resolution":{"observed_at":"2026-08-07T23:04:01.744967Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T23:04:01.759221Z","title":"In: Proceedings of the IEEE/CVF international conference on computer vision","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2608.05816","last_updated":"2026-08-06T09:47:34Z","snapshot_observed_at":"2026-08-09T23:11:38.499398Z","submitted_at":"2026-08-06T09:47:34Z","title":"Whence the Voice? Self-supervised Dual-source Audio-Visual Localisation via Selective Convergence","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-07T23:04:01.759221Z"},"links":{"citing_paper":"/paper/2608.05816"},"observation_digest":"sha256:37fcd6571e5cdc20e0b146f1998e7a1de8b73a272b77669413640fbfd0d210de","observation_id":"5eb0effc-344b-4a37-bbe8-7d646a28c510","resolution":{"observed_at":"2026-08-07T23:04:01.759221Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T23:04:02.270877Z","title":"In: Proceedings of the AAAI Conference on Artificial Intelligence","venue":null,"work_id":"744c5af4-0f54-4ee3-a252-401a06bd18b9","year":2022},"citing_paper":{"arxiv_id":"2608.05816","last_updated":"2026-08-06T09:47:34Z","snapshot_observed_at":"2026-08-09T23:11:38.499398Z","submitted_at":"2026-08-06T09:47:34Z","title":"Whence the Voice? Self-supervised Dual-source Audio-Visual Localisation via Selective Convergence","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-07T23:04:01.771411Z"},"links":{"citing_paper":"/paper/2608.05816"},"observation_digest":"sha256:663884b60a175db1237b94adec4c81944d60b0961fe7d49c7aba0e05d75fa287","observation_id":"9a3a2b95-8243-4ef0-b3e9-89a7ae82b892","resolution":{"observed_at":"2026-08-07T23:04:02.275731Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T23:04:02.255552Z","title":"In: Proceedings of the IEEE/CVF Conference on Computer Vision and Pattern Recognition (CVPR)","venue":null,"work_id":"858cc111-186c-4d39-bd67-536cc47f5ee4","year":2024},"citing_paper":{"arxiv_id":"2608.05816","last_updated":"2026-08-06T09:47:34Z","snapshot_observed_at":"2026-08-09T23:11:38.499398Z","submitted_at":"2026-08-06T09:47:34Z","title":"Whence the Voice? Self-supervised Dual-source Audio-Visual Localisation via Selective Convergence","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-07T23:04:01.776984Z"},"links":{"citing_paper":"/paper/2608.05816"},"observation_digest":"sha256:2ebe68ba02f5475c6dadd1d1aa91e3963aa95547f9a8ce61ddd670d30ef35c57","observation_id":"afe5a8c0-2469-42dc-86ac-082e3f35f50f","resolution":{"observed_at":"2026-08-07T23:04:02.260518Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T23:04:02.238296Z","title":"In: European Confer- ence on Computer Vision","venue":null,"work_id":"bdb364b1-d0fe-4aaf-9656-63c8e8dad6e1","year":2022},"citing_paper":{"arxiv_id":"2608.05816","last_updated":"2026-08-06T09:47:34Z","snapshot_observed_at":"2026-08-09T23:11:38.499398Z","submitted_at":"2026-08-06T09:47:34Z","title":"Whence the Voice? Self-supervised Dual-source Audio-Visual Localisation via Selective Convergence","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-07T23:04:01.781720Z"},"links":{"citing_paper":"/paper/2608.05816"},"observation_digest":"sha256:62e53138bfbdea99a4e9ef1ffc891b0d82c1d5dbb3bf832f934addb14dfbcace","observation_id":"6289fb5c-0299-4add-99be-b18439494471","resolution":{"observed_at":"2026-08-07T23:04:02.243499Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T23:04:02.223211Z","title":null,"venue":null,"work_id":"6e51e12f-fd82-4875-a843-50628699718f","year":2023},"citing_paper":{"arxiv_id":"2608.05816","last_updated":"2026-08-06T09:47:34Z","snapshot_observed_at":"2026-08-09T23:11:38.499398Z","submitted_at":"2026-08-06T09:47:34Z","title":"Whence the Voice? Self-supervised Dual-source Audio-Visual Localisation via Selective Convergence","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-07T23:04:01.786501Z"},"links":{"citing_paper":"/paper/2608.05816"},"observation_digest":"sha256:2f59ef2bfa402ab53199dd28c239449275d4f79dab930822a6756e4d312bc76d","observation_id":"058b684d-7c8c-48f1-acb4-3e8b47e2325f","resolution":{"observed_at":"2026-08-07T23:04:02.227849Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2409.00486","last_updated":"2024-08-31T15:43:22Z","snapshot_observed_at":"2026-08-09T20:54:09.572441Z","submitted_at":"2024-08-31T15:43:22Z","title":"Multi-scale Multi-instance Visual Sound Localization and Segmentation","version":1},"cited_work":{"arxiv_id":"2409.00486","doi":null,"metadata_source":"pith","pith_arxiv_id":"2409.00486","snapshot_observed_at":"2026-08-07T23:04:01.974209Z","title":"Multi-scale Multi-instance Visual Sound Localization and Segmentation","venue":"cs.CV","work_id":"9aab51dd-5305-41f8-b3ff-0c3301c006a5","year":2024},"citing_paper":{"arxiv_id":"2608.05816","last_updated":"2026-08-06T09:47:34Z","snapshot_observed_at":"2026-08-09T23:11:38.499398Z","submitted_at":"2026-08-06T09:47:34Z","title":"Whence the Voice? Self-supervised Dual-source Audio-Visual Localisation via Selective Convergence","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-07T23:04:01.791902Z"},"links":{"cited_paper":"/paper/2409.00486","citing_paper":"/paper/2608.05816"},"observation_digest":"sha256:959b00e59a58f0a1eb77b5ab8374b932a7c462b36854e76e5563db0a2c99793d","observation_id":"7d9570fc-408d-4b6a-b6aa-a5a106d818b8","resolution":{"observed_at":"2026-08-07T23:04:01.982686Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1807.03748","last_updated":"2019-01-22T18:47:12Z","snapshot_observed_at":"2026-07-06T06:49:24.960992Z","submitted_at":"2018-07-10T16:52:11Z","title":"Representation Learning with Contrastive Predictive Coding","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1807.03748","snapshot_observed_at":"2026-08-07T23:04:01.797039Z","title":"arXiv preprint arXiv:1807.03748 (2018)","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2608.05816","last_updated":"2026-08-06T09:47:34Z","snapshot_observed_at":"2026-08-09T23:11:38.499398Z","submitted_at":"2026-08-06T09:47:34Z","title":"Whence the Voice? Self-supervised Dual-source Audio-Visual Localisation via Selective Convergence","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-07T23:04:01.797039Z"},"links":{"cited_paper":"/paper/1807.03748","citing_paper":"/paper/2608.05816"},"observation_digest":"sha256:b5811565ca04865238357ee86077686441fa136338ea2fcc73b9c6e55f09d373","observation_id":"0b86ad80-4dc9-45c6-b617-66949b7bdde8","resolution":{"observed_at":"2026-08-07T23:04:01.797039Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T23:04:02.208995Z","title":"In: Proceedings of the European conference on computer vision (ECCV)","venue":null,"work_id":"0ce74a7e-44d8-4c78-8fe0-00f5c1e131c2","year":2018},"citing_paper":{"arxiv_id":"2608.05816","last_updated":"2026-08-06T09:47:34Z","snapshot_observed_at":"2026-08-09T23:11:38.499398Z","submitted_at":"2026-08-06T09:47:34Z","title":"Whence the Voice? Self-supervised Dual-source Audio-Visual Localisation via Selective Convergence","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-07T23:04:01.803709Z"},"links":{"citing_paper":"/paper/2608.05816"},"observation_digest":"sha256:15a6ade27c4a0dc527a2cb12d3e6cd057b54987553e9896e4ce7774fcebc69c6","observation_id":"f8669019-ec0f-4286-b572-2f2f0744da26","resolution":{"observed_at":"2026-08-07T23:04:02.213675Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T23:04:02.194485Z","title":"In: European conference on computer vi- sion","venue":null,"work_id":"95a7de26-fe4c-4bac-beaa-e034bc4b6bf3","year":2016},"citing_paper":{"arxiv_id":"2608.05816","last_updated":"2026-08-06T09:47:34Z","snapshot_observed_at":"2026-08-09T23:11:38.499398Z","submitted_at":"2026-08-06T09:47:34Z","title":"Whence the Voice? Self-supervised Dual-source Audio-Visual Localisation via Selective Convergence","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-07T23:04:01.810853Z"},"links":{"citing_paper":"/paper/2608.05816"},"observation_digest":"sha256:56ebacab9ae89d1413235d3e91430ad140b8ab8f124195ad274316e5ff7e1702","observation_id":"872970d9-7b66-42c4-8e95-ee3866be1439","resolution":{"observed_at":"2026-08-07T23:04:02.198824Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T23:04:02.179913Z","title":null,"venue":null,"work_id":"50f33df2-83fe-4f84-bf5e-09be48085eec","year":2024},"citing_paper":{"arxiv_id":"2608.05816","last_updated":"2026-08-06T09:47:34Z","snapshot_observed_at":"2026-08-09T23:11:38.499398Z","submitted_at":"2026-08-06T09:47:34Z","title":"Whence the Voice? Self-supervised Dual-source Audio-Visual Localisation via Selective Convergence","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-07T23:04:01.815816Z"},"links":{"citing_paper":"/paper/2608.05816"},"observation_digest":"sha256:4b87bcdb4c6bb79bdfdaa8fdffcaec5f9c0dd1d3828ce4bf808a6612eb77ffa8","observation_id":"ab100932-b508-46dd-be9d-d176605f76d5","resolution":{"observed_at":"2026-08-07T23:04:02.184569Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T23:04:02.164824Z","title":"In: European Conference on Computer Vision","venue":null,"work_id":"2f9e13c7-9b96-4874-b1d4-d04ecb45b0c9","year":2020},"citing_paper":{"arxiv_id":"2608.05816","last_updated":"2026-08-06T09:47:34Z","snapshot_observed_at":"2026-08-09T23:11:38.499398Z","submitted_at":"2026-08-06T09:47:34Z","title":"Whence the Voice? Self-supervised Dual-source Audio-Visual Localisation via Selective Convergence","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-07T23:04:01.823082Z"},"links":{"citing_paper":"/paper/2608.05816"},"observation_digest":"sha256:9636889471742ef7c2995b285b7984033ef7feb29b2772ab3b17285c3242d82f","observation_id":"2965b4f1-3b10-43fa-87b4-e4afc5d408c5","resolution":{"observed_at":"2026-08-07T23:04:02.169557Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T23:04:02.149468Z","title":"In: Proceedings of the IEEE conference on computer vision and pattern recognition","venue":null,"work_id":"7cc22404-b8f1-46d4-bd2a-12b15af81c9a","year":2018},"citing_paper":{"arxiv_id":"2608.05816","last_updated":"2026-08-06T09:47:34Z","snapshot_observed_at":"2026-08-09T23:11:38.499398Z","submitted_at":"2026-08-06T09:47:34Z","title":"Whence the Voice? Self-supervised Dual-source Audio-Visual Localisation via Selective Convergence","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-07T23:04:01.828317Z"},"links":{"citing_paper":"/paper/2608.05816"},"observation_digest":"sha256:7696804d5cad15e0b04686a7cbbca8803a917ba8842090790a97a21970ae4a25","observation_id":"d95d7cd5-6837-4960-9822-0fff0adb090a","resolution":{"observed_at":"2026-08-07T23:04:02.154225Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T23:04:02.132799Z","title":"IEEE Transactions on Pattern Analysis and Machine Intelligence42(8), 1984–1997 (2020)","venue":null,"work_id":"d8aaaf13-0200-4379-9a69-e1e9e86860f2","year":2020},"citing_paper":{"arxiv_id":"2608.05816","last_updated":"2026-08-06T09:47:34Z","snapshot_observed_at":"2026-08-09T23:11:38.499398Z","submitted_at":"2026-08-06T09:47:34Z","title":"Whence the Voice? Self-supervised Dual-source Audio-Visual Localisation via Selective Convergence","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-07T23:04:01.834636Z"},"links":{"citing_paper":"/paper/2608.05816"},"observation_digest":"sha256:11a1fe82407722910298d86d72911d949a1fca0535810e2a57dd6a97650db062","observation_id":"56b0f1df-d741-4d6d-bcb7-4044eb785e8f","resolution":{"observed_at":"2026-08-07T23:04:02.137544Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T23:04:02.116000Z","title":"Hu et al","venue":null,"work_id":"d07cfc1a-48d4-418a-afd3-300f0fe56afe","year":2023},"citing_paper":{"arxiv_id":"2608.05816","last_updated":"2026-08-06T09:47:34Z","snapshot_observed_at":"2026-08-09T23:11:38.499398Z","submitted_at":"2026-08-06T09:47:34Z","title":"Whence the Voice? Self-supervised Dual-source Audio-Visual Localisation via Selective Convergence","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-07T23:04:01.847282Z"},"links":{"citing_paper":"/paper/2608.05816"},"observation_digest":"sha256:2dd9ac310c4901841dfaa3d3a9238be3b24ce980d81be51fd7b10d62cc2b5a5d","observation_id":"035a9a13-d765-4d3f-976b-538cc424f664","resolution":{"observed_at":"2026-08-07T23:04:02.120779Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T23:04:02.097554Z","title":"Journal of Speech, Language, and Hearing Research60(10), 2989–3000 (2017)","venue":null,"work_id":"ef8430f9-63c6-4922-b282-83bb125695c2","year":2017},"citing_paper":{"arxiv_id":"2608.05816","last_updated":"2026-08-06T09:47:34Z","snapshot_observed_at":"2026-08-09T23:11:38.499398Z","submitted_at":"2026-08-06T09:47:34Z","title":"Whence the Voice? Self-supervised Dual-source Audio-Visual Localisation via Selective Convergence","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-07T23:04:01.854989Z"},"links":{"citing_paper":"/paper/2608.05816"},"observation_digest":"sha256:7a517ab40eed6359a28f0fe619270855a8795c0baa6f595cce24c20b2d4c8d32","observation_id":"9e0ca096-c3ef-4693-9934-eccc92b981c8","resolution":{"observed_at":"2026-08-07T23:04:02.102936Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T23:04:02.081289Z","title":"In: Proceedings of the Computer Vision and Pattern Recognition Conference","venue":null,"work_id":"a74abd5e-dfd1-42d5-9072-0fb5de16585c","year":2025},"citing_paper":{"arxiv_id":"2608.05816","last_updated":"2026-08-06T09:47:34Z","snapshot_observed_at":"2026-08-09T23:11:38.499398Z","submitted_at":"2026-08-06T09:47:34Z","title":"Whence the Voice? Self-supervised Dual-source Audio-Visual Localisation via Selective Convergence","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-07T23:04:01.860761Z"},"links":{"citing_paper":"/paper/2608.05816"},"observation_digest":"sha256:6c1e82eb9e4380d9d33ca86e99938c03ff57fa5958b283d6b1a8012dec239168","observation_id":"4395275b-730b-4d7f-90e9-fa21db9ffef9","resolution":{"observed_at":"2026-08-07T23:04:02.086380Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T23:04:02.063463Z","title":"In: International Conference on Machine Learning (2023)","venue":null,"work_id":"8d4ad78d-c487-46b7-9408-f92560da0348","year":2023},"citing_paper":{"arxiv_id":"2608.05816","last_updated":"2026-08-06T09:47:34Z","snapshot_observed_at":"2026-08-09T23:11:38.499398Z","submitted_at":"2026-08-06T09:47:34Z","title":"Whence the Voice? Self-supervised Dual-source Audio-Visual Localisation via Selective Convergence","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-07T23:04:01.866450Z"},"links":{"citing_paper":"/paper/2608.05816"},"observation_digest":"sha256:d26bbe0e696acf6ed570706b38f8f37cfb95855f1b40fd1b058c13fc57f044c7","observation_id":"0e8bbfe5-f322-4844-9222-d57d9560d1b3","resolution":{"observed_at":"2026-08-07T23:04:02.068961Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T23:04:02.039243Z","title":null,"venue":null,"work_id":"d763efd6-d7bd-47ff-be4c-d921860a4a53","year":2018},"citing_paper":{"arxiv_id":"2608.05816","last_updated":"2026-08-06T09:47:34Z","snapshot_observed_at":"2026-08-09T23:11:38.499398Z","submitted_at":"2026-08-06T09:47:34Z","title":"Whence the Voice? Self-supervised Dual-source Audio-Visual Localisation via Selective Convergence","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-07T23:04:01.873644Z"},"links":{"citing_paper":"/paper/2608.05816"},"observation_digest":"sha256:8a87d45c71e542f1bf02443739299544da4ad445427cabdae8089b8a501331b4","observation_id":"1af77587-3acd-4773-83bf-f867cd91f2cc","resolution":{"observed_at":"2026-08-07T23:04:02.050943Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2301.13190","last_updated":"2023-01-30T18:53:32Z","snapshot_observed_at":"2026-08-05T20:42:38.247638Z","submitted_at":"2023-01-30T18:53:32Z","title":"Audio-Visual Segmentation with Semantics","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2301.13190","snapshot_observed_at":"2026-08-07T23:04:01.879461Z","title":"arXiv preprint arXiv:2301.13190 (2023)","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2608.05816","last_updated":"2026-08-06T09:47:34Z","snapshot_observed_at":"2026-08-09T23:11:38.499398Z","submitted_at":"2026-08-06T09:47:34Z","title":"Whence the Voice? Self-supervised Dual-source Audio-Visual Localisation via Selective Convergence","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-07T23:04:01.879461Z"},"links":{"cited_paper":"/paper/2301.13190","citing_paper":"/paper/2608.05816"},"observation_digest":"sha256:dd9460c3dd23c60ef835dce8986504b321dfcca2c5891b5d0739edeb2b01101a","observation_id":"027d935b-c4ad-4bfa-976f-f0b81b9b0548","resolution":{"observed_at":"2026-08-07T23:04:01.879461Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T23:04:02.020065Z","title":"In: Proceedings of the European Conference on Computer Vision (ECCV) (2022)","venue":null,"work_id":"b7321f34-c47f-4086-9ccd-47cd7947928e","year":2022},"citing_paper":{"arxiv_id":"2608.05816","last_updated":"2026-08-06T09:47:34Z","snapshot_observed_at":"2026-08-09T23:11:38.499398Z","submitted_at":"2026-08-06T09:47:34Z","title":"Whence the Voice? Self-supervised Dual-source Audio-Visual Localisation via Selective Convergence","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-07T23:04:01.886110Z"},"links":{"citing_paper":"/paper/2608.05816"},"observation_digest":"sha256:f6f7313913a3488531b81703e033cb321e591bb92fd012258574603a4c0c3aeb","observation_id":"70c20b9a-212b-49ef-89d3-3efa484953b0","resolution":{"observed_at":"2026-08-07T23:04:02.027050Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2608.05816","last_updated":"2026-08-06T09:47:34Z","latest_version":1,"primary_category":"cs.MM","snapshot_observed_at":"2026-08-09T23:11:38.499398Z","submitted_at":"2026-08-06T09:47:34Z","title":"Whence the Voice? Self-supervised Dual-source Audio-Visual Localisation via Selective Convergence"},"reference_resolution":{"displayed":41,"state_counts":{"malformed_identifier":0,"metadata_mismatch":1,"parse_uncertain":0,"unresolved":8,"verified_exact":0,"verified_fuzzy":32},"total_outbound_references":41},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"thesis":"As of 10 August 2026, this Paper Citation Record lists 41 of 41 outbound references and 0 inbound Pith citation observations for arXiv:2608.05816."}