{"as_of":"2026-08-10T02:43:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:05056ad2842790eedbb6aa4979afca49cb1a4b5836c9de8e4f7d6da508b17d57","coverage":[{"denominator":32,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":32,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-06T11:54:44.832800Z","state":"measured"},{"denominator":33,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":33,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-09T06:31:02.800959+00:00","state":"measured"},{"denominator":1,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":1,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-06T11:54:44.760115Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"pith","source_observed_at":"2026-08-06T11:54:44.959776Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2507.22322","last_updated":"2025-07-30T01:51:38Z","snapshot_observed_at":"2026-08-09T14:00:52.547797Z","submitted_at":"2025-07-30T01:51:38Z","title":"A Two-Step Learning Framework for Enhancing Sound Event Localization and Detection","version":1},"cited_work":{"arxiv_id":"2507.22322","doi":null,"metadata_source":"pith","pith_arxiv_id":"2507.22322","snapshot_observed_at":"2026-08-06T11:54:44.959776Z","title":"A Two-Step Learning Framework for Enhancing Sound Event Localization and Detection","venue":"cs.SD","work_id":"57b50ea1-6d78-4684-b394-35156465be8a","year":2025},"citing_paper":{"arxiv_id":"2507.22322","last_updated":"2025-07-30T01:51:38Z","snapshot_observed_at":"2026-08-09T14:00:52.547797Z","submitted_at":"2025-07-30T01:51:38Z","title":"A Two-Step Learning Framework for Enhancing Sound Event Localization and Detection","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-06T11:54:44.760115Z"},"links":{"cited_paper":"/paper/2507.22322","citing_paper":"/paper/2507.22322"},"observation_digest":"sha256:30611d93eca531a91f2d63293ef2658d39c41209acadc0d84bb879b8418b0799","observation_id":"d14a321f-502e-45e1-b4aa-14a8a68cc68c","resolution":{"observed_at":"2026-08-06T11:54:44.962468Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2507.22322/citation-record","integrity":"/paper/2507.22322/integrity","json":"/paper/2507.22322/citation-record.json","paper":"/paper/2507.22322"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T11:54:45.121831Z","title":null,"venue":null,"work_id":"fb3e023c-c149-4f45-b5e1-23c68b0d9408","year":2019},"citing_paper":{"arxiv_id":"2507.22322","last_updated":"2025-07-30T01:51:38Z","snapshot_observed_at":"2026-08-09T14:00:52.547797Z","submitted_at":"2025-07-30T01:51:38Z","title":"A Two-Step Learning Framework for Enhancing Sound Event Localization and Detection","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-06T11:54:44.757445Z"},"links":{"citing_paper":"/paper/2507.22322"},"observation_digest":"sha256:6caab49eee44e7da857daebc7ab900cc5f4922212d9359b67e11e0adef736d4c","observation_id":"0c9fef52-330c-4162-b1e0-083eb29874e2","resolution":{"observed_at":"2026-08-06T11:54:45.123888Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2507.22322","last_updated":"2025-07-30T01:51:38Z","snapshot_observed_at":"2026-08-09T14:00:52.547797Z","submitted_at":"2025-07-30T01:51:38Z","title":"A Two-Step Learning Framework for Enhancing Sound Event Localization and Detection","version":1},"cited_work":{"arxiv_id":"2507.22322","doi":null,"metadata_source":"pith","pith_arxiv_id":"2507.22322","snapshot_observed_at":"2026-08-06T11:54:44.959776Z","title":"A Two-Step Learning Framework for Enhancing Sound Event Localization and Detection","venue":"cs.SD","work_id":"57b50ea1-6d78-4684-b394-35156465be8a","year":2025},"citing_paper":{"arxiv_id":"2507.22322","last_updated":"2025-07-30T01:51:38Z","snapshot_observed_at":"2026-08-09T14:00:52.547797Z","submitted_at":"2025-07-30T01:51:38Z","title":"A Two-Step Learning Framework for Enhancing Sound Event Localization and Detection","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-06T11:54:44.760115Z"},"links":{"cited_paper":"/paper/2507.22322","citing_paper":"/paper/2507.22322"},"observation_digest":"sha256:30611d93eca531a91f2d63293ef2658d39c41209acadc0d84bb879b8418b0799","observation_id":"d14a321f-502e-45e1-b4aa-14a8a68cc68c","resolution":{"observed_at":"2026-08-06T11:54:44.962468Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T11:54:45.114410Z","title":"Implementation Details For training, we utilized the STARSS23[25] dev-set-train and a synthetic dataset, while evaluation was conducted on the dev- set-test","venue":null,"work_id":"67201d56-e253-4ac6-bdb5-95bf362c9ec8","year":2023},"citing_paper":{"arxiv_id":"2507.22322","last_updated":"2025-07-30T01:51:38Z","snapshot_observed_at":"2026-08-09T14:00:52.547797Z","submitted_at":"2025-07-30T01:51:38Z","title":"A Two-Step Learning Framework for Enhancing Sound Event Localization and Detection","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-06T11:54:44.762785Z"},"links":{"citing_paper":"/paper/2507.22322"},"observation_digest":"sha256:dd5ed73be067b6e583d7dff4bf2b3096016924f90feff3e14435bfcf3e5e256d","observation_id":"11bb52f6-dba9-4061-9a3f-f49e5d9627f1","resolution":{"observed_at":"2026-08-06T11:54:45.117151Z","resolver_source":"raw_fallback","status":"malformed_identifier"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T11:54:45.108101Z","title":"The trackwise reordering format and beamformed spatial features enhance temporal consistency and localization accuracy","venue":null,"work_id":"5e0e3809-db8e-49e7-9bbb-07461dd90ddf","year":2023},"citing_paper":{"arxiv_id":"2507.22322","last_updated":"2025-07-30T01:51:38Z","snapshot_observed_at":"2026-08-09T14:00:52.547797Z","submitted_at":"2025-07-30T01:51:38Z","title":"A Two-Step Learning Framework for Enhancing Sound Event Localization and Detection","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-06T11:54:44.765298Z"},"links":{"citing_paper":"/paper/2507.22322"},"observation_digest":"sha256:a4a686a6a4050300d65752717fefe4a5d5eb59c8152c25314b0d760073c1b8d5","observation_id":"a2201a4d-4bba-4c52-9dd5-3e98b363cba4","resolution":{"observed_at":"2026-08-06T11:54:45.110391Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T11:54:45.101120Z","title":"Sound event localization and detection of overlapping sources using con- volutional recurrent neural networks,","venue":null,"work_id":"a4c56d78-c4a7-4f65-84e3-d3f8bd3986c5","year":2018},"citing_paper":{"arxiv_id":"2507.22322","last_updated":"2025-07-30T01:51:38Z","snapshot_observed_at":"2026-08-09T14:00:52.547797Z","submitted_at":"2025-07-30T01:51:38Z","title":"A Two-Step Learning Framework for Enhancing Sound Event Localization and Detection","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-06T11:54:44.768398Z"},"links":{"citing_paper":"/paper/2507.22322"},"observation_digest":"sha256:3854d28c99bb4660bb17bccc062e11f2a77dc4a10e78751f3c3d69e434611c74","observation_id":"6a2ae811-790d-4c1f-ac08-bec0f1798d20","resolution":{"observed_at":"2026-08-06T11:54:45.103931Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T11:54:45.094206Z","title":"The ustc-iflytek system for sound event localization and detection of dcase2020 challenge,","venue":null,"work_id":"a588972b-5d50-46dc-b752-2979ec5cbcca","year":2020},"citing_paper":{"arxiv_id":"2507.22322","last_updated":"2025-07-30T01:51:38Z","snapshot_observed_at":"2026-08-09T14:00:52.547797Z","submitted_at":"2025-07-30T01:51:38Z","title":"A Two-Step Learning Framework for Enhancing Sound Event Localization and Detection","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-06T11:54:44.771412Z"},"links":{"citing_paper":"/paper/2507.22322"},"observation_digest":"sha256:38182f64d2e73601c64a1dfc47a7aa58ac1cae63e818f641d5785b579d0de1cb","observation_id":"7e19f8aa-dfba-466b-8c6c-c6551c22d1f9","resolution":{"observed_at":"2026-08-06T11:54:45.096828Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T11:54:45.088137Z","title":"Overview and evaluation of sound event localization and detec- tion in dcase 2019,","venue":null,"work_id":"2b0871ba-41ca-4f54-94b9-6e6b87ad6ce2","year":2019},"citing_paper":{"arxiv_id":"2507.22322","last_updated":"2025-07-30T01:51:38Z","snapshot_observed_at":"2026-08-09T14:00:52.547797Z","submitted_at":"2025-07-30T01:51:38Z","title":"A Two-Step Learning Framework for Enhancing Sound Event Localization and Detection","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-06T11:54:44.773942Z"},"links":{"citing_paper":"/paper/2507.22322"},"observation_digest":"sha256:f16c9a4ced6fb106c3cfadb455448859ab6386eb7dec9636dac17b6f824f2bb3","observation_id":"86739d06-1a94-442c-9e43-ee9d4538e234","resolution":{"observed_at":"2026-08-06T11:54:45.090336Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T11:54:45.082027Z","title":"Seld-tcn: Sound event localization & detection via temporal con- volutional networks,","venue":null,"work_id":"aa7a0eaa-6387-4614-92a9-3ebb8e2f4c51","year":2020},"citing_paper":{"arxiv_id":"2507.22322","last_updated":"2025-07-30T01:51:38Z","snapshot_observed_at":"2026-08-09T14:00:52.547797Z","submitted_at":"2025-07-30T01:51:38Z","title":"A Two-Step Learning Framework for Enhancing Sound Event Localization and Detection","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-06T11:54:44.776372Z"},"links":{"citing_paper":"/paper/2507.22322"},"observation_digest":"sha256:9ebc876565d33a91eee055a3bd75c0b4bf2fb841f05729b3114f058e8e9dab45","observation_id":"4f9130b7-05d4-4e08-a8b9-d766d1aa9e57","resolution":{"observed_at":"2026-08-06T11:54:45.084202Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T11:54:45.075484Z","title":"An improved event-independent network for polyphonic sound event localization and detection,","venue":null,"work_id":"2e5534bd-75bb-4732-aa00-dea6efa059ea","year":2021},"citing_paper":{"arxiv_id":"2507.22322","last_updated":"2025-07-30T01:51:38Z","snapshot_observed_at":"2026-08-09T14:00:52.547797Z","submitted_at":"2025-07-30T01:51:38Z","title":"A Two-Step Learning Framework for Enhancing Sound Event Localization and Detection","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-06T11:54:44.778770Z"},"links":{"citing_paper":"/paper/2507.22322"},"observation_digest":"sha256:40becdd05a7d8de364d0f6c295b5ea024e4f6be29598e2553201cda260ce04a8","observation_id":"4fdfcabd-cae1-424c-a146-9727a8b7b774","resolution":{"observed_at":"2026-08-06T11:54:45.077729Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T11:54:45.067556Z","title":"A track-wise ensemble event independent network for polyphonic sound event localization and detection,","venue":null,"work_id":"91090a17-7ef5-46a5-943d-6d2908d2a41c","year":2022},"citing_paper":{"arxiv_id":"2507.22322","last_updated":"2025-07-30T01:51:38Z","snapshot_observed_at":"2026-08-09T14:00:52.547797Z","submitted_at":"2025-07-30T01:51:38Z","title":"A Two-Step Learning Framework for Enhancing Sound Event Localization and Detection","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-06T11:54:44.781052Z"},"links":{"citing_paper":"/paper/2507.22322"},"observation_digest":"sha256:b014dcce2c70094e37128caca04bfa491d97cb4f10dd80b4298bc839f3bebf38","observation_id":"6bdec6d4-f55c-4061-bb25-c7d9423b586f","resolution":{"observed_at":"2026-08-06T11:54:45.070927Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2209.01802","last_updated":"2022-09-09T10:06:29Z","snapshot_observed_at":"2026-08-09T14:00:44.473726Z","submitted_at":"2022-09-05T07:30:06Z","title":"Sound Event Localization and Detection for Real Spatial Sound Scenes: Event-Independent Network and Data Augmentation Chains","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2209.01802","snapshot_observed_at":"2026-08-06T11:54:44.783031Z","title":"Sound event localization and detection for real spatial sound scenes: Event-independent network and data augmentation chains,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2507.22322","last_updated":"2025-07-30T01:51:38Z","snapshot_observed_at":"2026-08-09T14:00:52.547797Z","submitted_at":"2025-07-30T01:51:38Z","title":"A Two-Step Learning Framework for Enhancing Sound Event Localization and Detection","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-06T11:54:44.783031Z"},"links":{"cited_paper":"/paper/2209.01802","citing_paper":"/paper/2507.22322"},"observation_digest":"sha256:3fc4f89336068b52dba7abceb0300975af93defb67aded71a69baf0ed5afbe48","observation_id":"c02b05be-dd03-48ef-8247-bb025a35044f","resolution":{"observed_at":"2026-08-06T11:54:44.783031Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.08771","last_updated":"2024-06-15T11:52:49Z","snapshot_observed_at":"2026-08-09T09:47:51.570980Z","submitted_at":"2024-06-13T03:03:02Z","title":"MFF-EINV2: Multi-scale Feature Fusion across Spectral-Spatial-Temporal Domains for Sound Event Localization and Detection","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.08771","snapshot_observed_at":"2026-08-06T11:54:44.785286Z","title":"Mff-einv2: Multi-scale feature fu- sion across spectral-spatial-temporal domains for sound event lo- calization and detection,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.22322","last_updated":"2025-07-30T01:51:38Z","snapshot_observed_at":"2026-08-09T14:00:52.547797Z","submitted_at":"2025-07-30T01:51:38Z","title":"A Two-Step Learning Framework for Enhancing Sound Event Localization and Detection","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-06T11:54:44.785286Z"},"links":{"cited_paper":"/paper/2406.08771","citing_paper":"/paper/2507.22322"},"observation_digest":"sha256:534a984e241573250fbbd2dececdc7f4303901ada343895c47d12aebb34ff112","observation_id":"7612de79-7b3c-4007-a895-a452d929c543","resolution":{"observed_at":"2026-08-06T11:54:44.785286Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.05057","last_updated":"2024-08-09T13:26:08Z","snapshot_observed_at":"2026-08-04T23:08:13.853275Z","submitted_at":"2024-08-09T13:26:08Z","title":"SELD-Mamba: Selective State-Space Model for Sound Event Localization and Detection with Source Distance Estimation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.05057","snapshot_observed_at":"2026-08-06T11:54:44.788732Z","title":"Seld- mamba: Selective state-space model for sound event localization and detection with source distance estimation,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.22322","last_updated":"2025-07-30T01:51:38Z","snapshot_observed_at":"2026-08-09T14:00:52.547797Z","submitted_at":"2025-07-30T01:51:38Z","title":"A Two-Step Learning Framework for Enhancing Sound Event Localization and Detection","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-06T11:54:44.788732Z"},"links":{"cited_paper":"/paper/2408.05057","citing_paper":"/paper/2507.22322"},"observation_digest":"sha256:f0f10c7d51cc3a7cd541bdcdace3ed6a84010a713d4872cd1e5d88d02e9b21f7","observation_id":"b060a719-66b5-4885-bf6b-bdd26ad9aa7c","resolution":{"observed_at":"2026-08-06T11:54:44.788732Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T11:54:45.060431Z","title":"Accdoa: Activity-coupled cartesian direction of arrival representation for sound event localization and detection,","venue":null,"work_id":"f78f5d39-f78a-4e35-9026-9c85e449f798","year":2021},"citing_paper":{"arxiv_id":"2507.22322","last_updated":"2025-07-30T01:51:38Z","snapshot_observed_at":"2026-08-09T14:00:52.547797Z","submitted_at":"2025-07-30T01:51:38Z","title":"A Two-Step Learning Framework for Enhancing Sound Event Localization and Detection","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-06T11:54:44.792295Z"},"links":{"citing_paper":"/paper/2507.22322"},"observation_digest":"sha256:26bdbb43c28fbc38c7da1d3eb83ddfbecfa050021340dfa65705f3f08e77712e","observation_id":"2a0af112-3444-4a88-ba60-d135c6a520bf","resolution":{"observed_at":"2026-08-06T11:54:45.062696Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T11:54:45.053914Z","title":"Multi-accdoa: Localizing and detecting over- lapping sounds from the same class with auxiliary duplicating per- mutation invariant training,","venue":null,"work_id":"3bf890d8-5d0b-4af1-9337-df2ecba0d626","year":2022},"citing_paper":{"arxiv_id":"2507.22322","last_updated":"2025-07-30T01:51:38Z","snapshot_observed_at":"2026-08-09T14:00:52.547797Z","submitted_at":"2025-07-30T01:51:38Z","title":"A Two-Step Learning Framework for Enhancing Sound Event Localization and Detection","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-06T11:54:44.794213Z"},"links":{"citing_paper":"/paper/2507.22322"},"observation_digest":"sha256:55cd896ff68dcd45ada6cf88af6d0803c18da128d65caf56ce1d9d92b1276ea4","observation_id":"936d9315-898d-498b-ad71-91a127cba43c","resolution":{"observed_at":"2026-08-06T11:54:45.056267Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T11:54:45.045132Z","title":"An experimental study on sound event localization and detection under realistic testing conditions,","venue":null,"work_id":"eeec34f0-477f-48ea-8527-7e9de36151d3","year":2023},"citing_paper":{"arxiv_id":"2507.22322","last_updated":"2025-07-30T01:51:38Z","snapshot_observed_at":"2026-08-09T14:00:52.547797Z","submitted_at":"2025-07-30T01:51:38Z","title":"A Two-Step Learning Framework for Enhancing Sound Event Localization and Detection","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-06T11:54:44.796783Z"},"links":{"citing_paper":"/paper/2507.22322"},"observation_digest":"sha256:d24bc69bc0b1ab417e1719da3ea103eb88ca1ddbae687b7311566dc56dffc97e","observation_id":"cc9f7f24-d510-4276-9cb8-e21825a952b2","resolution":{"observed_at":"2026-08-06T11:54:45.048498Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T11:54:45.039518Z","title":"Cst-former: Transformer with channel- spectro-temporal attention for sound event localization and detec- tion,","venue":null,"work_id":"7d6f8046-7442-4b15-8f59-49502b962e87","year":2024},"citing_paper":{"arxiv_id":"2507.22322","last_updated":"2025-07-30T01:51:38Z","snapshot_observed_at":"2026-08-09T14:00:52.547797Z","submitted_at":"2025-07-30T01:51:38Z","title":"A Two-Step Learning Framework for Enhancing Sound Event Localization and Detection","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-06T11:54:44.800106Z"},"links":{"citing_paper":"/paper/2507.22322"},"observation_digest":"sha256:92c3a78217ad6bc67eed40c69bce9158a6993e86bb74b92fd2adf1d34e8443a4","observation_id":"66fe431f-2cbe-431f-8110-0123a1c87b14","resolution":{"observed_at":"2026-08-06T11:54:45.041694Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T11:54:45.034248Z","title":"The cocktail party problem,","venue":null,"work_id":"f2e885a5-a11c-4faf-b147-49b152126826","year":1902},"citing_paper":{"arxiv_id":"2507.22322","last_updated":"2025-07-30T01:51:38Z","snapshot_observed_at":"2026-08-09T14:00:52.547797Z","submitted_at":"2025-07-30T01:51:38Z","title":"A Two-Step Learning Framework for Enhancing Sound Event Localization and Detection","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-06T11:54:44.801980Z"},"links":{"citing_paper":"/paper/2507.22322"},"observation_digest":"sha256:6024299a91dcec27429357f4c0e3e80b072b798031b47789eaf6d20ccc882e55","observation_id":"7353efaf-37fd-45c1-a043-9b959490cdbc","resolution":{"observed_at":"2026-08-06T11:54:45.036180Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T11:54:45.028168Z","title":"Doa and event guidance system for sound event localiza- tion and detection with source distance estimation,","venue":null,"work_id":"1d15cd3c-6477-4d77-804c-ecca3745be65","year":2024},"citing_paper":{"arxiv_id":"2507.22322","last_updated":"2025-07-30T01:51:38Z","snapshot_observed_at":"2026-08-09T14:00:52.547797Z","submitted_at":"2025-07-30T01:51:38Z","title":"A Two-Step Learning Framework for Enhancing Sound Event Localization and Detection","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-06T11:54:44.804397Z"},"links":{"citing_paper":"/paper/2507.22322"},"observation_digest":"sha256:8af867a9ac9cdbfff6a0e762593744246b958bebd8609a0acffac8190efb6d8d","observation_id":"511ab1bd-5468-4f6f-bd4c-f90c9d419d62","resolution":{"observed_at":"2026-08-06T11:54:45.030384Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2405.07021","last_updated":"2024-05-11T14:02:15Z","snapshot_observed_at":"2026-08-02T19:32:56.580283Z","submitted_at":"2024-05-11T14:02:15Z","title":"IPDnet: A Universal Direct-Path IPD Estimation Network for Sound Source Localization","version":1},"cited_work":{"arxiv_id":"2405.07021","doi":null,"metadata_source":"pith","pith_arxiv_id":"2405.07021","snapshot_observed_at":"2026-08-06T11:54:44.933974Z","title":"IPDnet: A Universal Direct-Path IPD Estimation Network for Sound Source Localization","venue":"eess.AS","work_id":"8dbd6988-b5f6-41af-b741-377c929e9f77","year":2024},"citing_paper":{"arxiv_id":"2507.22322","last_updated":"2025-07-30T01:51:38Z","snapshot_observed_at":"2026-08-09T14:00:52.547797Z","submitted_at":"2025-07-30T01:51:38Z","title":"A Two-Step Learning Framework for Enhancing Sound Event Localization and Detection","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-06T11:54:44.806457Z"},"links":{"cited_paper":"/paper/2405.07021","citing_paper":"/paper/2507.22322"},"observation_digest":"sha256:cfe1c759495ca6ed5efcf1327637c6863763b6998c00ecbce930d804e0d00441","observation_id":"9e0daaad-51a5-4692-af4b-e68dec8c8b41","resolution":{"observed_at":"2026-08-06T11:54:44.936724Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T11:54:45.022135Z","title":"Fine-tune the pretrained atst model for sound event detection,","venue":null,"work_id":"d6dc15d2-3e20-4d0e-844e-dbdaf1b7a250","year":2024},"citing_paper":{"arxiv_id":"2507.22322","last_updated":"2025-07-30T01:51:38Z","snapshot_observed_at":"2026-08-09T14:00:52.547797Z","submitted_at":"2025-07-30T01:51:38Z","title":"A Two-Step Learning Framework for Enhancing Sound Event Localization and Detection","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-06T11:54:44.809610Z"},"links":{"citing_paper":"/paper/2507.22322"},"observation_digest":"sha256:6c3a4d896b7068caecf9a2e0bdd70e76d8de425b83ca1e98b48717ef34c22433","observation_id":"fa6a3738-c484-4213-a16d-5935aa78cbc1","resolution":{"observed_at":"2026-08-06T11:54:45.024294Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T11:54:45.014881Z","title":"The cone of silence: Speech separation by local- ization,","venue":null,"work_id":"b5c01d65-890e-4af2-96ef-b5d9b05a3875","year":2020},"citing_paper":{"arxiv_id":"2507.22322","last_updated":"2025-07-30T01:51:38Z","snapshot_observed_at":"2026-08-09T14:00:52.547797Z","submitted_at":"2025-07-30T01:51:38Z","title":"A Two-Step Learning Framework for Enhancing Sound Event Localization and Detection","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-06T11:54:44.811492Z"},"links":{"citing_paper":"/paper/2507.22322"},"observation_digest":"sha256:c111d6b38cddb35448ed6ad9bf04f6763103e239e4733eff2f60e9f09a545ef2","observation_id":"55908158-4fbf-437c-b237-63b1b3d3eefa","resolution":{"observed_at":"2026-08-06T11:54:45.017386Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T11:54:45.008612Z","title":"Rezero: Region-customizable sound extrac- tion,","venue":null,"work_id":"ac41b7f2-5581-45bd-adbd-e42b8c330991","year":2024},"citing_paper":{"arxiv_id":"2507.22322","last_updated":"2025-07-30T01:51:38Z","snapshot_observed_at":"2026-08-09T14:00:52.547797Z","submitted_at":"2025-07-30T01:51:38Z","title":"A Two-Step Learning Framework for Enhancing Sound Event Localization and Detection","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-06T11:54:44.813382Z"},"links":{"citing_paper":"/paper/2507.22322"},"observation_digest":"sha256:12af8645a8aec4baae7c7412ff8eda993701d53d13acc9c6a058c24fb1cfc6b7","observation_id":"58d510f3-690c-4dbf-bc85-e016330c3aaf","resolution":{"observed_at":"2026-08-06T11:54:45.010876Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T11:54:45.001122Z","title":"Lavt: Language-aware vision transformer for referring image segmentation,","venue":null,"work_id":"b0b61183-1396-4b2c-9fe2-5b923f6c3d7b","year":2022},"citing_paper":{"arxiv_id":"2507.22322","last_updated":"2025-07-30T01:51:38Z","snapshot_observed_at":"2026-08-09T14:00:52.547797Z","submitted_at":"2025-07-30T01:51:38Z","title":"A Two-Step Learning Framework for Enhancing Sound Event Localization and Detection","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-06T11:54:44.815724Z"},"links":{"citing_paper":"/paper/2507.22322"},"observation_digest":"sha256:6b3e5944daa5b6d52ea447f8a6e3d076921a89ff6bd07987775ae74e2abbef30","observation_id":"b0627f7f-0797-4eed-9d21-b8fdb97182a2","resolution":{"observed_at":"2026-08-06T11:54:45.003267Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T11:54:44.817951Z","title":"Separate and re- construct: Asymmetric encoder-decoder for speech separation,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.22322","last_updated":"2025-07-30T01:51:38Z","snapshot_observed_at":"2026-08-09T14:00:52.547797Z","submitted_at":"2025-07-30T01:51:38Z","title":"A Two-Step Learning Framework for Enhancing Sound Event Localization and Detection","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-06T11:54:44.817951Z"},"links":{"citing_paper":"/paper/2507.22322"},"observation_digest":"sha256:3fb542bffae8d9497eba0b2f614fcb5c4864771d576e8dbb03c03949ff559f11","observation_id":"4e097c79-af86-4a4f-a9c5-b25607286b1b","resolution":{"observed_at":"2026-08-06T11:54:44.817951Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T11:54:44.993849Z","title":"[dcase2022 task 3] synthetic seld mixtures for baseline training,","venue":null,"work_id":"950c323b-4cee-4808-a322-70b494e813cc","year":2022},"citing_paper":{"arxiv_id":"2507.22322","last_updated":"2025-07-30T01:51:38Z","snapshot_observed_at":"2026-08-09T14:00:52.547797Z","submitted_at":"2025-07-30T01:51:38Z","title":"A Two-Step Learning Framework for Enhancing Sound Event Localization and Detection","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-06T11:54:44.819856Z"},"links":{"citing_paper":"/paper/2507.22322"},"observation_digest":"sha256:afc9e1b24c7e9d494ddda2b10825b01461bd8dd1bdd3b930459ccf37324ac23c","observation_id":"cf153140-18a1-4d6b-b640-de3ac9365d2e","resolution":{"observed_at":"2026-08-06T11:54:44.996824Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T11:54:44.987750Z","title":"Conformer-based sound event detection with semi- supervised learning and data augmentation,","venue":null,"work_id":"81280353-ba12-4066-b5d1-b0ad8d7f0afd","year":2020},"citing_paper":{"arxiv_id":"2507.22322","last_updated":"2025-07-30T01:51:38Z","snapshot_observed_at":"2026-08-09T14:00:52.547797Z","submitted_at":"2025-07-30T01:51:38Z","title":"A Two-Step Learning Framework for Enhancing Sound Event Localization and Detection","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-06T11:54:44.821604Z"},"links":{"citing_paper":"/paper/2507.22322"},"observation_digest":"sha256:5b2cec21e3dfcc2d21ac000eb9c5462470395d10032b2587fea2367e7e200f3f","observation_id":"e851e7ac-f7a7-4e67-a3cd-14bd834be6a2","resolution":{"observed_at":"2026-08-06T11:54:44.990011Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2104.01778","last_updated":"2021-07-08T20:16:28Z","snapshot_observed_at":"2026-08-08T11:33:21.735489Z","submitted_at":"2021-04-05T05:26:29Z","title":"AST: Audio Spectrogram Transformer","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2104.01778","snapshot_observed_at":"2026-08-06T11:54:44.824499Z","title":"Ast: Audio spectrogram transformer,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2507.22322","last_updated":"2025-07-30T01:51:38Z","snapshot_observed_at":"2026-08-09T14:00:52.547797Z","submitted_at":"2025-07-30T01:51:38Z","title":"A Two-Step Learning Framework for Enhancing Sound Event Localization and Detection","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-06T11:54:44.824499Z"},"links":{"cited_paper":"/paper/2104.01778","citing_paper":"/paper/2507.22322"},"observation_digest":"sha256:2d5c3f0186c5530fe33c51f3e2c4c145672636a9f1a8c8593c18a600d62d585c","observation_id":"ec3e673b-b559-47b2-9a43-6d0e13f0a606","resolution":{"observed_at":"2026-08-06T11:54:44.824499Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T11:54:44.981174Z","title":"Starss23: Sony-tau realistic spatial soundscapes 2023,","venue":null,"work_id":"5bcfa75c-22c5-4ef6-9123-45ebf139c3a7","year":2023},"citing_paper":{"arxiv_id":"2507.22322","last_updated":"2025-07-30T01:51:38Z","snapshot_observed_at":"2026-08-09T14:00:52.547797Z","submitted_at":"2025-07-30T01:51:38Z","title":"A Two-Step Learning Framework for Enhancing Sound Event Localization and Detection","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-06T11:54:44.827133Z"},"links":{"citing_paper":"/paper/2507.22322"},"observation_digest":"sha256:cc9f4024328f8fb491bfb34c2da00ea11fc19bfc3ec417623425e9ceec36958a","observation_id":"413bcc7e-40ee-467e-956c-eb13dba0422a","resolution":{"observed_at":"2026-08-06T11:54:44.983670Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T11:54:44.974499Z","title":"Permutation invari- ant training of deep models for speaker-independent multi-talker speech separation,","venue":null,"work_id":"1022394f-00ff-42dd-9d43-8c0ed432b5e4","year":2017},"citing_paper":{"arxiv_id":"2507.22322","last_updated":"2025-07-30T01:51:38Z","snapshot_observed_at":"2026-08-09T14:00:52.547797Z","submitted_at":"2025-07-30T01:51:38Z","title":"A Two-Step Learning Framework for Enhancing Sound Event Localization and Detection","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-06T11:54:44.828973Z"},"links":{"citing_paper":"/paper/2507.22322"},"observation_digest":"sha256:d422f9cb3d5e4fb97dc2d59a74dad72b9acb321a7a35722460f34f1b4f4db042","observation_id":"aef31444-26f5-453f-bcde-c688d9e3f0f3","resolution":{"observed_at":"2026-08-06T11:54:44.976916Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T11:54:44.967561Z","title":"Starss23: An audio-visual dataset of spatial recordings of real scenes with spatiotemporal annotations of sound events,","venue":null,"work_id":"6dfa1a49-e977-4224-9c50-46613cadf595","year":2024},"citing_paper":{"arxiv_id":"2507.22322","last_updated":"2025-07-30T01:51:38Z","snapshot_observed_at":"2026-08-09T14:00:52.547797Z","submitted_at":"2025-07-30T01:51:38Z","title":"A Two-Step Learning Framework for Enhancing Sound Event Localization and Detection","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-06T11:54:44.830920Z"},"links":{"citing_paper":"/paper/2507.22322"},"observation_digest":"sha256:1408cdb19fa3c202ca64c3a04b581703028000f48981cf3413ef3f9d2789ba1b","observation_id":"0bc018a2-f39f-4455-85e4-b8d9bb23eea3","resolution":{"observed_at":"2026-08-06T11:54:44.970337Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2306.02591","last_updated":"2023-06-05T04:39:34Z","snapshot_observed_at":"2026-08-08T19:19:50.941531Z","submitted_at":"2023-06-05T04:39:34Z","title":"Divided spectro-temporal attention for sound event localization and detection in real scenes for DCASE2023 challenge","version":1},"cited_work":{"arxiv_id":"2306.02591","doi":null,"metadata_source":"pith","pith_arxiv_id":"2306.02591","snapshot_observed_at":"2026-08-06T11:54:44.853028Z","title":"Divided spectro-temporal attention for sound event localization and detection in real scenes for DCASE2023 challenge","venue":"eess.AS","work_id":"04c5f578-4d72-4f43-8724-f04de89126d3","year":2023},"citing_paper":{"arxiv_id":"2507.22322","last_updated":"2025-07-30T01:51:38Z","snapshot_observed_at":"2026-08-09T14:00:52.547797Z","submitted_at":"2025-07-30T01:51:38Z","title":"A Two-Step Learning Framework for Enhancing Sound Event Localization and Detection","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-06T11:54:44.832800Z"},"links":{"cited_paper":"/paper/2306.02591","citing_paper":"/paper/2507.22322"},"observation_digest":"sha256:3ecc002eb4f3ea89f8600cc684bec55d9604f3e1aaf9487ae38d49000d1818af","observation_id":"a6c897a5-0b8f-4715-9f72-523eb7f94064","resolution":{"observed_at":"2026-08-06T11:54:44.858193Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2507.22322","last_updated":"2025-07-30T01:51:38Z","latest_version":1,"primary_category":"cs.SD","snapshot_observed_at":"2026-08-09T14:00:52.547797Z","submitted_at":"2025-07-30T01:51:38Z","title":"A Two-Step Learning Framework for Enhancing Sound Event Localization and Detection"},"reference_resolution":{"displayed":32,"state_counts":{"malformed_identifier":1,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":6,"verified_exact":3,"verified_fuzzy":22},"total_outbound_references":32},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"thesis":"As of 10 August 2026, this Paper Citation Record lists 32 of 32 outbound references and 1 inbound Pith citation observation for arXiv:2507.22322."}