{"as_of":"2026-08-18T20:10:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:e0a82152d9bca74f602430f2a4166ffe73a8f3c384849e8fa9b9a9dbd9cb77d9","coverage":[{"denominator":33,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":33,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-12T15:32:52.282885Z","state":"measured"},{"denominator":36,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":36,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-18T06:34:40.430872+00:00","state":"measured"},{"denominator":3,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":3,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-15T16:20:26.167344Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-05-22T20:35:06.497891Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2411.14153","last_updated":"2024-11-21T14:18:10Z","snapshot_observed_at":"2026-08-18T08:25:32.432321Z","submitted_at":"2024-11-21T14:18:10Z","title":"MVANet: Multi-Stage Video Attention Network for Sound Event Localization and Detection with Source Distance Estimation","version":1},"cited_work":{"arxiv_id":"2411.14153","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2411.14153","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"MV ANet: Multi-stage video attention network for sound event localization and detection with source distance estimation","venue":null,"work_id":"0e4f1ba4-b3db-4bad-a335-febac90ea0d9","year":2024},"citing_paper":{"arxiv_id":"2504.08644","last_updated":"2026-04-20T08:35:46Z","snapshot_observed_at":"2026-08-16T08:11:32.317130Z","submitted_at":"2025-04-11T15:43:13Z","title":"Reverberation-based Features for Sound Event Localization and Detection with Distance Estimation","version":2},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-05-22T20:33:31.388607Z"},"links":{"cited_paper":"/paper/2411.14153","citing_paper":"/paper/2504.08644"},"observation_digest":"sha256:d5c99d4b4ddbc008a70d7c9343731e9c714ba1734b6e75f63e4dcb5deb86388f","observation_id":"a3d73d71-68ba-4a56-93a6-1a1bdbf96b22","resolution":{"observed_at":"2026-05-22T20:35:06.500086Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2411.14153","last_updated":"2024-11-21T14:18:10Z","snapshot_observed_at":"2026-08-18T08:25:32.432321Z","submitted_at":"2024-11-21T14:18:10Z","title":"MVANet: Multi-Stage Video Attention Network for Sound Event Localization and Detection with Source Distance Estimation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.14153","snapshot_observed_at":"2026-08-06T19:43:00.135285Z","title":"MV ANet: Multi-stage video attention network for sound event localization and detection with source distance estima- tion,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.04845","last_updated":"2025-07-07T10:08:57Z","snapshot_observed_at":"2026-08-17T19:33:52.396398Z","submitted_at":"2025-07-07T10:08:57Z","title":"Spatial and Semantic Embedding Integration for Stereo Sound Event Localization and Detection in Regular Videos","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-06T19:43:00.135285Z"},"links":{"cited_paper":"/paper/2411.14153","citing_paper":"/paper/2507.04845"},"observation_digest":"sha256:4b3894b1006c2a3557f15cef702e949d64afc15ed72366b66c07bc4584b69394","observation_id":"8c269f59-3f37-4139-85da-838595967f76","resolution":{"observed_at":"2026-08-06T19:43:00.135285Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2411.14153","last_updated":"2024-11-21T14:18:10Z","snapshot_observed_at":"2026-08-18T08:25:32.432321Z","submitted_at":"2024-11-21T14:18:10Z","title":"MVANet: Multi-Stage Video Attention Network for Sound Event Localization and Detection with Source Distance Estimation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.14153","snapshot_observed_at":"2026-08-15T16:20:26.167344Z","title":"MV ANet: Multi-stage video attention network for sound event localization and detection with source distance estimation,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.06598","last_updated":"2025-09-08T12:07:32Z","snapshot_observed_at":"2026-08-17T18:40:11.499169Z","submitted_at":"2025-09-08T12:07:32Z","title":"Integrating Spatial and Semantic Embeddings for Stereo Sound Event Localization in Videos","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-15T16:20:26.167344Z"},"links":{"cited_paper":"/paper/2411.14153","citing_paper":"/paper/2509.06598"},"observation_digest":"sha256:90ff76c65bbf7f9d969942a9b26e2cdbce00a1dd89bd1d250ea1bda9e9d5931c","observation_id":"2063501a-bcec-44db-b833-e0abb2e2fd5f","resolution":{"observed_at":"2026-08-15T16:20:26.167344Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2411.14153/citation-record","integrity":"/paper/2411.14153/integrity","json":"/paper/2411.14153/citation-record.json","paper":"/paper/2411.14153"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T15:32:52.777297Z","title":"Overview and evaluation of sound event localization and detection in DCASE 2019,","venue":null,"work_id":"5e3cd88d-f25a-403b-ab7f-ed711c8cde50","year":2019},"citing_paper":{"arxiv_id":"2411.14153","last_updated":"2024-11-21T14:18:10Z","snapshot_observed_at":"2026-08-18T08:25:32.432321Z","submitted_at":"2024-11-21T14:18:10Z","title":"MVANet: Multi-Stage Video Attention Network for Sound Event Localization and Detection with Source Distance Estimation","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-12T15:32:52.149304Z"},"links":{"citing_paper":"/paper/2411.14153"},"observation_digest":"sha256:aff07a194061db911bff6aad3c78674c22a292a6d3dcaa56f1b6426d50eba870","observation_id":"32121164-58a0-425f-a2e5-4ef43fedc955","resolution":{"observed_at":"2026-08-12T15:32:52.783575Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T15:32:52.761959Z","title":"A sequence matching network for polyphonic sound event localization and detection,","venue":null,"work_id":"7ab3b520-6069-472c-b176-b3ab9b90d3ac","year":2020},"citing_paper":{"arxiv_id":"2411.14153","last_updated":"2024-11-21T14:18:10Z","snapshot_observed_at":"2026-08-18T08:25:32.432321Z","submitted_at":"2024-11-21T14:18:10Z","title":"MVANet: Multi-Stage Video Attention Network for Sound Event Localization and Detection with Source Distance Estimation","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-12T15:32:52.153967Z"},"links":{"citing_paper":"/paper/2411.14153"},"observation_digest":"sha256:0349b8474f6d545c38cb65ca35f923a6042949a50a8f1133d21a0caed1d0e9b7","observation_id":"aa325994-b5e1-4f85-a46c-4b6599bbe8f0","resolution":{"observed_at":"2026-08-12T15:32:52.767154Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T15:32:52.748369Z","title":"Sound event localization and detection of overlapping sources using convolutional recurrent neural networks,","venue":null,"work_id":"5e9d5521-bae1-4228-84ed-3250e892053c","year":2019},"citing_paper":{"arxiv_id":"2411.14153","last_updated":"2024-11-21T14:18:10Z","snapshot_observed_at":"2026-08-18T08:25:32.432321Z","submitted_at":"2024-11-21T14:18:10Z","title":"MVANet: Multi-Stage Video Attention Network for Sound Event Localization and Detection with Source Distance Estimation","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-12T15:32:52.158302Z"},"links":{"citing_paper":"/paper/2411.14153"},"observation_digest":"sha256:f0a0c9ae442fb234740ca3f1c2ca0c2435ffd818e314669a2e7420553def2431","observation_id":"30bd0c96-33fe-453c-a75a-b3941b16ac4d","resolution":{"observed_at":"2026-08-12T15:32:52.753606Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T15:32:52.732693Z","title":"ACCDOA: Activity-coupled cartesian direction of arrival representation for sound event localization and detection,","venue":null,"work_id":"aff60b9e-a432-4ed7-870c-fea51fd4c4e4","year":2021},"citing_paper":{"arxiv_id":"2411.14153","last_updated":"2024-11-21T14:18:10Z","snapshot_observed_at":"2026-08-18T08:25:32.432321Z","submitted_at":"2024-11-21T14:18:10Z","title":"MVANet: Multi-Stage Video Attention Network for Sound Event Localization and Detection with Source Distance Estimation","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-12T15:32:52.162766Z"},"links":{"citing_paper":"/paper/2411.14153"},"observation_digest":"sha256:ac00c4f18ea688c483b7f332c241bdded5fed8dab1e7e0104d37f0fbfc168e2a","observation_id":"79070411-95fe-4944-af0c-2d859019d051","resolution":{"observed_at":"2026-08-12T15:32:52.737139Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T15:32:52.712765Z","title":"An improved event-independent network for polyphonic sound event local- ization and detection,","venue":null,"work_id":"1e8c8afa-9ad1-4cb2-9bd2-470dff9c5a49","year":2021},"citing_paper":{"arxiv_id":"2411.14153","last_updated":"2024-11-21T14:18:10Z","snapshot_observed_at":"2026-08-18T08:25:32.432321Z","submitted_at":"2024-11-21T14:18:10Z","title":"MVANet: Multi-Stage Video Attention Network for Sound Event Localization and Detection with Source Distance Estimation","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-12T15:32:52.166850Z"},"links":{"citing_paper":"/paper/2411.14153"},"observation_digest":"sha256:1cbe2c8011bd7edb959ff18d94382b9658edd8f99f5af0a31e51f199f69a3b60","observation_id":"8bc54648-6450-4dfb-81be-5d8f946882ab","resolution":{"observed_at":"2026-08-12T15:32:52.720198Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T15:32:52.695360Z","title":"Multi-ACCDOA: Localizing and detecting overlapping sounds from the same class with auxiliary duplicating permutation invariant training,","venue":null,"work_id":"a72ab3cf-a535-4135-8d3d-9e68186a0f3f","year":2022},"citing_paper":{"arxiv_id":"2411.14153","last_updated":"2024-11-21T14:18:10Z","snapshot_observed_at":"2026-08-18T08:25:32.432321Z","submitted_at":"2024-11-21T14:18:10Z","title":"MVANet: Multi-Stage Video Attention Network for Sound Event Localization and Detection with Source Distance Estimation","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-12T15:32:52.171570Z"},"links":{"citing_paper":"/paper/2411.14153"},"observation_digest":"sha256:3e2c3f47fab001151b95e0fb77c99fe9d7dae192cb7d5c0bc25d23971a6726b5","observation_id":"36bca2ba-995b-4948-ad43-8450484bdfd0","resolution":{"observed_at":"2026-08-12T15:32:52.700529Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T15:32:52.680126Z","title":"AD-YOLO: You look only once in training multiple sound event localization and detection,","venue":null,"work_id":"330da6c1-6a4e-46dc-a254-73375796e4c6","year":2023},"citing_paper":{"arxiv_id":"2411.14153","last_updated":"2024-11-21T14:18:10Z","snapshot_observed_at":"2026-08-18T08:25:32.432321Z","submitted_at":"2024-11-21T14:18:10Z","title":"MVANet: Multi-Stage Video Attention Network for Sound Event Localization and Detection with Source Distance Estimation","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-12T15:32:52.176113Z"},"links":{"citing_paper":"/paper/2411.14153"},"observation_digest":"sha256:d5210907da1f2516421ff754c6b8a71ebb2259f48ad22aa519a7c6df67a8a8a6","observation_id":"00cfc11a-4a29-41ac-afee-f78275c1bbce","resolution":{"observed_at":"2026-08-12T15:32:52.684671Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2403.11827","last_updated":"2024-06-12T13:54:11Z","snapshot_observed_at":"2026-08-16T14:08:46.735202Z","submitted_at":"2024-03-18T14:34:16Z","title":"Sound Event Detection and Localization with Distance Estimation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.11827","snapshot_observed_at":"2026-08-12T15:32:52.182984Z","title":"Sound event detection and localization with distance estimation,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2411.14153","last_updated":"2024-11-21T14:18:10Z","snapshot_observed_at":"2026-08-18T08:25:32.432321Z","submitted_at":"2024-11-21T14:18:10Z","title":"MVANet: Multi-Stage Video Attention Network for Sound Event Localization and Detection with Source Distance Estimation","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-12T15:32:52.182984Z"},"links":{"cited_paper":"/paper/2403.11827","citing_paper":"/paper/2411.14153"},"observation_digest":"sha256:7c8cbeafb2a3ad1a6aa984a0bb0c3ecbd9aad63010316fb61b186264c89425ba","observation_id":"decf026c-86ab-4904-923d-02ce4ecf9d18","resolution":{"observed_at":"2026-08-12T15:32:52.182984Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T15:32:52.665549Z","title":"Binaural sound source distance estimation and localization for a moving listener,","venue":null,"work_id":"3e8929e0-e339-44dd-8223-2c56d41d84a9","year":2024},"citing_paper":{"arxiv_id":"2411.14153","last_updated":"2024-11-21T14:18:10Z","snapshot_observed_at":"2026-08-18T08:25:32.432321Z","submitted_at":"2024-11-21T14:18:10Z","title":"MVANet: Multi-Stage Video Attention Network for Sound Event Localization and Detection with Source Distance Estimation","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-12T15:32:52.187003Z"},"links":{"citing_paper":"/paper/2411.14153"},"observation_digest":"sha256:4b8f597dcb0c1bd6e202505c836db9ad56a934922019442c3b555bf05dc2a106","observation_id":"a3dab823-b725-45f1-adec-95141f40d893","resolution":{"observed_at":"2026-08-12T15:32:52.669838Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T15:32:52.649648Z","title":"Speaker distance estimation in enclosures from single-channel audio,","venue":null,"work_id":"914292a8-8a1b-4432-a171-c449e921b0cd","year":2024},"citing_paper":{"arxiv_id":"2411.14153","last_updated":"2024-11-21T14:18:10Z","snapshot_observed_at":"2026-08-18T08:25:32.432321Z","submitted_at":"2024-11-21T14:18:10Z","title":"MVANet: Multi-Stage Video Attention Network for Sound Event Localization and Detection with Source Distance Estimation","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-12T15:32:52.191038Z"},"links":{"citing_paper":"/paper/2411.14153"},"observation_digest":"sha256:c494f28c681fe44279a24f28a7d74589b699b2a3767a371fc732118a8c16a147","observation_id":"5c218c29-f207-4b87-b5ff-5c675991029c","resolution":{"observed_at":"2026-08-12T15:32:52.653676Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T15:32:52.634004Z","title":"Fusion of audio and visual embeddings for sound event localization and detection,","venue":null,"work_id":"1a382009-7dd5-4938-8cac-d0d77a0d0cb3","year":2024},"citing_paper":{"arxiv_id":"2411.14153","last_updated":"2024-11-21T14:18:10Z","snapshot_observed_at":"2026-08-18T08:25:32.432321Z","submitted_at":"2024-11-21T14:18:10Z","title":"MVANet: Multi-Stage Video Attention Network for Sound Event Localization and Detection with Source Distance Estimation","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-12T15:32:52.194196Z"},"links":{"citing_paper":"/paper/2411.14153"},"observation_digest":"sha256:52f3279d2ec657e1dd2af878ac9b5fa3aad64927366fd66a44c6fb6719565196","observation_id":"b0b6c177-d4b6-4293-a528-2a4c3e546ea8","resolution":{"observed_at":"2026-08-12T15:32:52.640257Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T15:32:52.620734Z","title":"Egocentric deep multi-channel audio-visual active speaker localization,","venue":null,"work_id":"6e05c4a2-1f06-4abb-b901-f8ae12c2fbfa","year":2022},"citing_paper":{"arxiv_id":"2411.14153","last_updated":"2024-11-21T14:18:10Z","snapshot_observed_at":"2026-08-18T08:25:32.432321Z","submitted_at":"2024-11-21T14:18:10Z","title":"MVANet: Multi-Stage Video Attention Network for Sound Event Localization and Detection with Source Distance Estimation","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-12T15:32:52.197217Z"},"links":{"citing_paper":"/paper/2411.14153"},"observation_digest":"sha256:35e78cd5abff8429293908e57d1bcb059e4d849a21c767ce1ba10f28e8f3f3e4","observation_id":"b46a62a9-032f-46b8-a487-1cdedac3b314","resolution":{"observed_at":"2026-08-12T15:32:52.625299Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T15:32:52.608154Z","title":"The nerc-slip system for sound event localization and detection of DCASE2023 challenge,","venue":null,"work_id":"2aa43ff8-d841-4963-8cfe-588eb37f15e5","year":2023},"citing_paper":{"arxiv_id":"2411.14153","last_updated":"2024-11-21T14:18:10Z","snapshot_observed_at":"2026-08-18T08:25:32.432321Z","submitted_at":"2024-11-21T14:18:10Z","title":"MVANet: Multi-Stage Video Attention Network for Sound Event Localization and Detection with Source Distance Estimation","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-12T15:32:52.200924Z"},"links":{"citing_paper":"/paper/2411.14153"},"observation_digest":"sha256:29fdb17c632d3204fe78ccdbf4e447f3f3a4ca837735a5d7197e94ae5274d848","observation_id":"9375628f-3560-4be2-bc56-bb4c89613a38","resolution":{"observed_at":"2026-08-12T15:32:52.612537Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T15:32:52.593256Z","title":"Exploring audio-visual information fusion for sound event localization and detection in low- resource realistic scenarios,","venue":null,"work_id":"7d09c763-cdd3-4dae-a924-a1aa728ca3d7","year":2024},"citing_paper":{"arxiv_id":"2411.14153","last_updated":"2024-11-21T14:18:10Z","snapshot_observed_at":"2026-08-18T08:25:32.432321Z","submitted_at":"2024-11-21T14:18:10Z","title":"MVANet: Multi-Stage Video Attention Network for Sound Event Localization and Detection with Source Distance Estimation","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-12T15:32:52.204679Z"},"links":{"citing_paper":"/paper/2411.14153"},"observation_digest":"sha256:bc4473f63397c76617d26ad2899694d2b55db51f6b361f69f22aeb0ed150d717","observation_id":"2400e8b4-86bd-44c3-95ea-37aa73902073","resolution":{"observed_at":"2026-08-12T15:32:52.598423Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T15:32:52.578917Z","title":"The distillation system for sound event localization and detection of DCASE2023 challenge,","venue":null,"work_id":"f911b5c6-e663-4519-9784-9736fdf1016f","year":2023},"citing_paper":{"arxiv_id":"2411.14153","last_updated":"2024-11-21T14:18:10Z","snapshot_observed_at":"2026-08-18T08:25:32.432321Z","submitted_at":"2024-11-21T14:18:10Z","title":"MVANet: Multi-Stage Video Attention Network for Sound Event Localization and Detection with Source Distance Estimation","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-12T15:32:52.208233Z"},"links":{"citing_paper":"/paper/2411.14153"},"observation_digest":"sha256:4dc85c686f6177af189d7b92297e7c0ed47b634a081247719823b910fd47921a","observation_id":"52ef2f9c-443d-406c-9a68-66053b152680","resolution":{"observed_at":"2026-08-12T15:32:52.584091Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T15:32:52.558920Z","title":"Data augmentation, neural networks, and ensemble methods for sound event localization and detection,","venue":null,"work_id":"98f34b0c-eddf-4d14-a860-f21c547d2e51","year":2023},"citing_paper":{"arxiv_id":"2411.14153","last_updated":"2024-11-21T14:18:10Z","snapshot_observed_at":"2026-08-18T08:25:32.432321Z","submitted_at":"2024-11-21T14:18:10Z","title":"MVANet: Multi-Stage Video Attention Network for Sound Event Localization and Detection with Source Distance Estimation","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-12T15:32:52.211342Z"},"links":{"citing_paper":"/paper/2411.14153"},"observation_digest":"sha256:14105dd5dd24c519d589e1b8094fdecbcb9100360e84f88635c4c02c7d74c249","observation_id":"1ab706f4-58bc-4085-803f-69dba407dbf0","resolution":{"observed_at":"2026-08-12T15:32:52.565542Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T15:32:52.543942Z","title":"Audio-visual event localization in unconstrained videos,","venue":null,"work_id":"49df6a00-5308-4a0e-b19f-21c24c519822","year":2018},"citing_paper":{"arxiv_id":"2411.14153","last_updated":"2024-11-21T14:18:10Z","snapshot_observed_at":"2026-08-18T08:25:32.432321Z","submitted_at":"2024-11-21T14:18:10Z","title":"MVANet: Multi-Stage Video Attention Network for Sound Event Localization and Detection with Source Distance Estimation","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-12T15:32:52.214472Z"},"links":{"citing_paper":"/paper/2411.14153"},"observation_digest":"sha256:86a6f6ce4e5590485262d22faf02ba7232ebd63b75a537f1db05f5d798291a43","observation_id":"f8050558-3e72-4b10-abc0-6878b2083e5b","resolution":{"observed_at":"2026-08-12T15:32:52.548868Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T15:32:52.530380Z","title":"An experimental study on sound event localization and detection under realistic testing conditions,","venue":null,"work_id":"99bff1c8-d618-48e7-9018-69599fcecaff","year":2023},"citing_paper":{"arxiv_id":"2411.14153","last_updated":"2024-11-21T14:18:10Z","snapshot_observed_at":"2026-08-18T08:25:32.432321Z","submitted_at":"2024-11-21T14:18:10Z","title":"MVANet: Multi-Stage Video Attention Network for Sound Event Localization and Detection with Source Distance Estimation","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-12T15:32:52.219293Z"},"links":{"citing_paper":"/paper/2411.14153"},"observation_digest":"sha256:73a775bc97f7a14fb44d700acca8c943b8e52216121bfc483a800370f1da64ec","observation_id":"2b6bb573-8a87-444b-814b-d4b69be539fa","resolution":{"observed_at":"2026-08-12T15:32:52.534593Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T15:32:52.515819Z","title":"Deep residual learning for image recognition,","venue":null,"work_id":"53c6e415-bd67-42de-a486-c11a10797182","year":2016},"citing_paper":{"arxiv_id":"2411.14153","last_updated":"2024-11-21T14:18:10Z","snapshot_observed_at":"2026-08-18T08:25:32.432321Z","submitted_at":"2024-11-21T14:18:10Z","title":"MVANet: Multi-Stage Video Attention Network for Sound Event Localization and Detection with Source Distance Estimation","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-12T15:32:52.223114Z"},"links":{"citing_paper":"/paper/2411.14153"},"observation_digest":"sha256:f565521667b89b0abe9e8e8f4b4d4bd026f60119584a0ed5559ced3352ae21d4","observation_id":"f1e69a19-5af0-4fea-a7b9-041d8f888c4c","resolution":{"observed_at":"2026-08-12T15:32:52.520920Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T15:32:52.227071Z","title":"Conformer: Convolution- augmented transformer for speech recognition,","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2411.14153","last_updated":"2024-11-21T14:18:10Z","snapshot_observed_at":"2026-08-18T08:25:32.432321Z","submitted_at":"2024-11-21T14:18:10Z","title":"MVANet: Multi-Stage Video Attention Network for Sound Event Localization and Detection with Source Distance Estimation","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-12T15:32:52.227071Z"},"links":{"citing_paper":"/paper/2411.14153"},"observation_digest":"sha256:e092e89527a3d36a94e6c2237225daf469d05d81e0b4dcb1139391b56e68dc34","observation_id":"338f8d1d-1a77-45e6-b09a-ad60d1b9f8ff","resolution":{"observed_at":"2026-08-12T15:32:52.227071Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2207.10141","last_updated":"2022-07-20T18:44:01Z","snapshot_observed_at":"2026-08-16T16:44:27.899966Z","submitted_at":"2022-07-20T18:44:01Z","title":"AudioScopeV2: Audio-Visual Attention Architectures for Calibrated Open-Domain On-Screen Sound Separation","version":1},"cited_work":{"arxiv_id":"2207.10141","doi":null,"metadata_source":"pith","pith_arxiv_id":"2207.10141","snapshot_observed_at":"2026-08-12T15:32:52.342510Z","title":"AudioScopeV2: Audio-Visual Attention Architectures for Calibrated Open-Domain On-Screen Sound Separation","venue":"cs.SD","work_id":"ead9de96-ccb6-4599-a872-755505654a8e","year":2022},"citing_paper":{"arxiv_id":"2411.14153","last_updated":"2024-11-21T14:18:10Z","snapshot_observed_at":"2026-08-18T08:25:32.432321Z","submitted_at":"2024-11-21T14:18:10Z","title":"MVANet: Multi-Stage Video Attention Network for Sound Event Localization and Detection with Source Distance Estimation","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-12T15:32:52.232014Z"},"links":{"cited_paper":"/paper/2207.10141","citing_paper":"/paper/2411.14153"},"observation_digest":"sha256:94e7f6118acbef81f3e6ded6803de23ece96473d7b7076f14ddb460b0c61ea7e","observation_id":"e0d6c448-531e-4a14-bfc3-dae78c80c2a8","resolution":{"observed_at":"2026-08-12T15:32:52.350109Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T15:32:52.496913Z","title":"Audio-visual event localization by learning spatial and semantic co-attention,","venue":null,"work_id":"193cdc6f-68ac-4c3b-96a8-6f9d17caf05c","year":2023},"citing_paper":{"arxiv_id":"2411.14153","last_updated":"2024-11-21T14:18:10Z","snapshot_observed_at":"2026-08-18T08:25:32.432321Z","submitted_at":"2024-11-21T14:18:10Z","title":"MVANet: Multi-Stage Video Attention Network for Sound Event Localization and Detection with Source Distance Estimation","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-12T15:32:52.236460Z"},"links":{"citing_paper":"/paper/2411.14153"},"observation_digest":"sha256:2a0f38b8c3d84c169f2acd64a4f32b560bf5b926d318473de67eccb38e001440","observation_id":"3fd345a2-95ba-485f-b694-25ecb0b72928","resolution":{"observed_at":"2026-08-12T15:32:52.501209Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T15:32:52.484956Z","title":"STARSS23: An audio-visual dataset of spatial recordings of real scenes with spatiotemporal annotations of sound events,","venue":null,"work_id":"5cde5129-c837-4fe6-b730-ccbd36ed5c70","year":2023},"citing_paper":{"arxiv_id":"2411.14153","last_updated":"2024-11-21T14:18:10Z","snapshot_observed_at":"2026-08-18T08:25:32.432321Z","submitted_at":"2024-11-21T14:18:10Z","title":"MVANet: Multi-Stage Video Attention Network for Sound Event Localization and Detection with Source Distance Estimation","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-12T15:32:52.240403Z"},"links":{"citing_paper":"/paper/2411.14153"},"observation_digest":"sha256:97197a0baa5af363c02fbde17510e7dcbe7784b037f004fd5b5f0b1a7e9497ea","observation_id":"d1823ecb-4ec4-4a27-8cab-2b7a24e81579","resolution":{"observed_at":"2026-08-12T15:32:52.488841Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2401.17129","last_updated":"2024-01-29T06:05:23Z","snapshot_observed_at":"2026-08-16T14:23:46.827475Z","submitted_at":"2024-01-29T06:05:23Z","title":"Enhanced Sound Event Localization and Detection in Real 360-degree audio-visual soundscapes","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.17129","snapshot_observed_at":"2026-08-12T15:32:52.244102Z","title":"Enhanced sound event localization and detection in real 360-degree audio-visual sound- scapes,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2411.14153","last_updated":"2024-11-21T14:18:10Z","snapshot_observed_at":"2026-08-18T08:25:32.432321Z","submitted_at":"2024-11-21T14:18:10Z","title":"MVANet: Multi-Stage Video Attention Network for Sound Event Localization and Detection with Source Distance Estimation","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-12T15:32:52.244102Z"},"links":{"cited_paper":"/paper/2401.17129","citing_paper":"/paper/2411.14153"},"observation_digest":"sha256:842186476105bc5ca2063d44cb5c26f3d0318c6ce4e75962e0e00131aa256395","observation_id":"ef77d998-d0a8-4e89-9bf8-1ab4cd702f3c","resolution":{"observed_at":"2026-08-12T15:32:52.244102Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T15:32:52.474157Z","title":"Spatial scaper: A library to simulate and augment soundscapes for sound event localization and detection in realistic rooms,","venue":null,"work_id":"83e42109-5066-44b7-b207-5cdecfff39b5","year":2024},"citing_paper":{"arxiv_id":"2411.14153","last_updated":"2024-11-21T14:18:10Z","snapshot_observed_at":"2026-08-18T08:25:32.432321Z","submitted_at":"2024-11-21T14:18:10Z","title":"MVANet: Multi-Stage Video Attention Network for Sound Event Localization and Detection with Source Distance Estimation","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-12T15:32:52.248535Z"},"links":{"citing_paper":"/paper/2411.14153"},"observation_digest":"sha256:7ead11c3b60d53ff8d5cb8900f183cb28599f57c43cb22a44f8adcb4c53e422d","observation_id":"23039da7-622e-4cf2-a2ac-5c3f3a4d7d7d","resolution":{"observed_at":"2026-08-12T15:32:52.478058Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T15:32:52.463050Z","title":"METU SPARG eigenmike em32 acoustic impulse response dataset v0. 1.0,","venue":null,"work_id":"d1f78a4f-098d-4c51-97ec-e8ec12a6943e","year":2019},"citing_paper":{"arxiv_id":"2411.14153","last_updated":"2024-11-21T14:18:10Z","snapshot_observed_at":"2026-08-18T08:25:32.432321Z","submitted_at":"2024-11-21T14:18:10Z","title":"MVANet: Multi-Stage Video Attention Network for Sound Event Localization and Detection with Source Distance Estimation","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-12T15:32:52.253765Z"},"links":{"citing_paper":"/paper/2411.14153"},"observation_digest":"sha256:5c9c89a5106c86ea9978478a38f0ff9f6eb0918fb3b542c3c238f371dec64311","observation_id":"3c772668-461a-4685-bb45-efdd5054de3e","resolution":{"observed_at":"2026-08-12T15:32:52.466950Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T15:32:52.450596Z","title":"A dataset of reverberant spatial sound scenes with moving sources for sound event localization and detection,","venue":null,"work_id":"f12103f1-76c2-41a3-9853-63928d28d9ff","year":2020},"citing_paper":{"arxiv_id":"2411.14153","last_updated":"2024-11-21T14:18:10Z","snapshot_observed_at":"2026-08-18T08:25:32.432321Z","submitted_at":"2024-11-21T14:18:10Z","title":"MVANet: Multi-Stage Video Attention Network for Sound Event Localization and Detection with Source Distance Estimation","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-12T15:32:52.258131Z"},"links":{"citing_paper":"/paper/2411.14153"},"observation_digest":"sha256:b5e855038a03d8f5c4f6be430ab9d5345b9cf879c0b8f4937c9a6ef965a7a44d","observation_id":"5a17e531-5751-4db4-b13f-ffdfaa5132e0","resolution":{"observed_at":"2026-08-12T15:32:52.454739Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T15:32:52.435352Z","title":"A four-stage data augmentation approach to resnet-conformer based acoustic model- ing for sound event localization and detection,","venue":null,"work_id":"13d7e481-557c-4c2d-8d67-40bc87a9a2db","year":2023},"citing_paper":{"arxiv_id":"2411.14153","last_updated":"2024-11-21T14:18:10Z","snapshot_observed_at":"2026-08-18T08:25:32.432321Z","submitted_at":"2024-11-21T14:18:10Z","title":"MVANet: Multi-Stage Video Attention Network for Sound Event Localization and Detection with Source Distance Estimation","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-12T15:32:52.262813Z"},"links":{"citing_paper":"/paper/2411.14153"},"observation_digest":"sha256:8a0e87011d7000cc00d446abcea8ced562083a23e925f5b18c7767e709c21490","observation_id":"1073a935-dd0a-4bea-84f5-1150997eabc3","resolution":{"observed_at":"2026-08-12T15:32:52.439988Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1412.6980","last_updated":"2017-01-30T01:27:54Z","snapshot_observed_at":"2026-08-17T19:26:44.032537Z","submitted_at":"2014-12-22T13:54:29Z","title":"Adam: A Method for Stochastic Optimization","version":9},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1412.6980","snapshot_observed_at":"2026-08-12T15:32:52.266974Z","title":"Adam: A method for stochastic optimization,","venue":null,"work_id":null,"year":2014},"citing_paper":{"arxiv_id":"2411.14153","last_updated":"2024-11-21T14:18:10Z","snapshot_observed_at":"2026-08-18T08:25:32.432321Z","submitted_at":"2024-11-21T14:18:10Z","title":"MVANet: Multi-Stage Video Attention Network for Sound Event Localization and Detection with Source Distance Estimation","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-12T15:32:52.266974Z"},"links":{"cited_paper":"/paper/1412.6980","citing_paper":"/paper/2411.14153"},"observation_digest":"sha256:1e60288adc590ebbf8e17ecbdb9455258e28263b9a22bef421a67b6f2382454c","observation_id":"7bf40ab6-214c-47db-9db6-59699491cace","resolution":{"observed_at":"2026-08-12T15:32:52.266974Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T15:32:52.419043Z","title":"SpecAugment: A simple data augmentation method for automatic speech recognition,","venue":null,"work_id":"7d957924-f3db-4ad5-a7d5-f73ecc3811f1","year":2019},"citing_paper":{"arxiv_id":"2411.14153","last_updated":"2024-11-21T14:18:10Z","snapshot_observed_at":"2026-08-18T08:25:32.432321Z","submitted_at":"2024-11-21T14:18:10Z","title":"MVANet: Multi-Stage Video Attention Network for Sound Event Localization and Detection with Source Distance Estimation","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-12T15:32:52.271051Z"},"links":{"citing_paper":"/paper/2411.14153"},"observation_digest":"sha256:8212728a9765547cca606081c7b1ced4b8d2755f1aaa1559138374be24607b84","observation_id":"47a60528-5cb2-4371-8429-72cb21859489","resolution":{"observed_at":"2026-08-12T15:32:52.425257Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T15:32:52.402372Z","title":"The nerc-slip system for sound event localization and detection with source distance estimation of DCASE 2024 challenge,","venue":null,"work_id":"1a07c0fe-9355-4036-912e-4519b374a4e1","year":2024},"citing_paper":{"arxiv_id":"2411.14153","last_updated":"2024-11-21T14:18:10Z","snapshot_observed_at":"2026-08-18T08:25:32.432321Z","submitted_at":"2024-11-21T14:18:10Z","title":"MVANet: Multi-Stage Video Attention Network for Sound Event Localization and Detection with Source Distance Estimation","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-12T15:32:52.276756Z"},"links":{"citing_paper":"/paper/2411.14153"},"observation_digest":"sha256:216606d9bed91aa24699a85e5fe3386a88cf0e71f0353d845d233ac5867fdd2d","observation_id":"6bf24bdc-583e-4081-9aa3-356b67593995","resolution":{"observed_at":"2026-08-12T15:32:52.407217Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T15:32:52.389785Z","title":"Leveraging reverberation and visual depth cues for sound event localization and detection with distance estimation,","venue":null,"work_id":"6f365352-79ac-4985-a330-d821b7a3fee6","year":2024},"citing_paper":{"arxiv_id":"2411.14153","last_updated":"2024-11-21T14:18:10Z","snapshot_observed_at":"2026-08-18T08:25:32.432321Z","submitted_at":"2024-11-21T14:18:10Z","title":"MVANet: Multi-Stage Video Attention Network for Sound Event Localization and Detection with Source Distance Estimation","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-12T15:32:52.280022Z"},"links":{"citing_paper":"/paper/2411.14153"},"observation_digest":"sha256:e1bffc75b13f31f01b9376e2222c1be3e4c14aa0c5a05f5e91153c4ed8ca3051","observation_id":"cc1cae79-dd65-439e-b9ca-9fd1a2dea9cb","resolution":{"observed_at":"2026-08-12T15:32:52.394252Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T15:32:52.377185Z","title":"Data augmentation and cross-fusion for audiovisual sound event localization and detection with source distance estimation,","venue":null,"work_id":"5c071f3c-4a77-4adf-b024-083e357216a5","year":2024},"citing_paper":{"arxiv_id":"2411.14153","last_updated":"2024-11-21T14:18:10Z","snapshot_observed_at":"2026-08-18T08:25:32.432321Z","submitted_at":"2024-11-21T14:18:10Z","title":"MVANet: Multi-Stage Video Attention Network for Sound Event Localization and Detection with Source Distance Estimation","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-12T15:32:52.282885Z"},"links":{"citing_paper":"/paper/2411.14153"},"observation_digest":"sha256:0fe93b2134c0e817320657e00f51a61241f4221a591cfda147e754780d147e8f","observation_id":"4578fd74-88d3-4d2d-a968-503e1e085f1a","resolution":{"observed_at":"2026-08-12T15:32:52.381589Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2411.14153","last_updated":"2024-11-21T14:18:10Z","latest_version":1,"primary_category":"eess.AS","snapshot_observed_at":"2026-08-18T08:25:32.432321Z","submitted_at":"2024-11-21T14:18:10Z","title":"MVANet: Multi-Stage Video Attention Network for Sound Event Localization and Detection with Source Distance Estimation"},"reference_resolution":{"displayed":33,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":4,"verified_exact":1,"verified_fuzzy":28},"total_outbound_references":33},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"thesis":"As of 18 August 2026, this Paper Citation Record lists 33 of 33 outbound references and 3 inbound Pith citation observations for arXiv:2411.14153."}