{"as_of":"2026-08-10T01:50:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:efbfdb9a76df72e76adfa9cccb79948de284b22bf472fe60d07ba032dd75f3e3","coverage":[{"denominator":24,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":24,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-04T18:59:47.482800Z","state":"measured"},{"denominator":24,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":24,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-09T06:31:02.800959+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2509.09526/citation-record","integrity":"/paper/2509.09526/integrity","json":"/paper/2509.09526/citation-record.json","paper":"/paper/2509.09526"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T18:59:47.103509Z","title":"Detection and classification of acoustic scenes and events,","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2509.09526","last_updated":"2025-09-11T15:08:09Z","snapshot_observed_at":"2026-08-09T14:38:23.869513Z","submitted_at":"2025-09-11T15:08:09Z","title":"Region-Specific Audio Tagging for Spatial Sound","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-04T18:59:47.103509Z"},"links":{"citing_paper":"/paper/2509.09526"},"observation_digest":"sha256:30c2fba4080b59c72999390be3db35176691a54f5ada499c1245003b500a6f74","observation_id":"b4b9ed7e-00c9-43f4-b6ef-adc17de4eaac","resolution":{"observed_at":"2026-08-04T18:59:47.103509Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T18:59:47.257145Z","title":"Content-based classifica- tion, search, and retrieval of audio,","venue":null,"work_id":null,"year":1996},"citing_paper":{"arxiv_id":"2509.09526","last_updated":"2025-09-11T15:08:09Z","snapshot_observed_at":"2026-08-09T14:38:23.869513Z","submitted_at":"2025-09-11T15:08:09Z","title":"Region-Specific Audio Tagging for Spatial Sound","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-04T18:59:47.257145Z"},"links":{"citing_paper":"/paper/2509.09526"},"observation_digest":"sha256:51cc84556ba89c89d70cc1f74e3f2f8535d999a52675993f7426cd4fd2d462db","observation_id":"8a256b64-9371-4932-a70b-331b73718d1f","resolution":{"observed_at":"2026-08-04T18:59:47.257145Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T18:59:47.343451Z","title":"PANNs: Large-scale pretrained audio neural networks for audio pattern recognition,","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2509.09526","last_updated":"2025-09-11T15:08:09Z","snapshot_observed_at":"2026-08-09T14:38:23.869513Z","submitted_at":"2025-09-11T15:08:09Z","title":"Region-Specific Audio Tagging for Spatial Sound","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-04T18:59:47.343451Z"},"links":{"citing_paper":"/paper/2509.09526"},"observation_digest":"sha256:7bf27699f282f0821ede7903f697f7b8c00356674fb377d82906d634ab66bc47","observation_id":"67da912f-0a0a-43f5-aeba-b003cef2e562","resolution":{"observed_at":"2026-08-04T18:59:47.343451Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T18:59:47.392927Z","title":"AudioSet: An ontology and human-labeled dataset for audio events,","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2509.09526","last_updated":"2025-09-11T15:08:09Z","snapshot_observed_at":"2026-08-09T14:38:23.869513Z","submitted_at":"2025-09-11T15:08:09Z","title":"Region-Specific Audio Tagging for Spatial Sound","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-04T18:59:47.392927Z"},"links":{"citing_paper":"/paper/2509.09526"},"observation_digest":"sha256:f7a418db067b78a1ca9a41451db04b7f65d09e565e67614a120964e5a7b06a71","observation_id":"feadea4a-b609-4e21-98dd-f1c2e65508da","resolution":{"observed_at":"2026-08-04T18:59:47.392927Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T18:59:47.398015Z","title":"PSLA: Improving audio tagging with pretraining, sampling, labeling, and aggregation,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2509.09526","last_updated":"2025-09-11T15:08:09Z","snapshot_observed_at":"2026-08-09T14:38:23.869513Z","submitted_at":"2025-09-11T15:08:09Z","title":"Region-Specific Audio Tagging for Spatial Sound","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-04T18:59:47.398015Z"},"links":{"citing_paper":"/paper/2509.09526"},"observation_digest":"sha256:4825224e00b04e9829ec6b26cc42f607e47c56c78f792dad565b0585d1c60b2f","observation_id":"a9c8d0b1-e03e-4830-9deb-d4597ce11aae","resolution":{"observed_at":"2026-08-04T18:59:47.398015Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T18:59:47.402778Z","title":"Attention is all you need,","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2509.09526","last_updated":"2025-09-11T15:08:09Z","snapshot_observed_at":"2026-08-09T14:38:23.869513Z","submitted_at":"2025-09-11T15:08:09Z","title":"Region-Specific Audio Tagging for Spatial Sound","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-04T18:59:47.402778Z"},"links":{"citing_paper":"/paper/2509.09526"},"observation_digest":"sha256:5f216851cbd18800bb2260bc225fc52de4c07f64dfd14250de6bd8a5a00ffd21","observation_id":"b19fc332-93a0-4913-a7d7-db09a651e11a","resolution":{"observed_at":"2026-08-04T18:59:47.402778Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2104.01778","last_updated":"2021-07-08T20:16:28Z","snapshot_observed_at":"2026-08-08T11:33:21.735489Z","submitted_at":"2021-04-05T05:26:29Z","title":"AST: Audio Spectrogram Transformer","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2104.01778","snapshot_observed_at":"2026-08-04T18:59:47.408023Z","title":"AST: Audio spectrogram trans- former,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2509.09526","last_updated":"2025-09-11T15:08:09Z","snapshot_observed_at":"2026-08-09T14:38:23.869513Z","submitted_at":"2025-09-11T15:08:09Z","title":"Region-Specific Audio Tagging for Spatial Sound","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-04T18:59:47.408023Z"},"links":{"cited_paper":"/paper/2104.01778","citing_paper":"/paper/2509.09526"},"observation_digest":"sha256:3c4234eb17fb6cd3cdefa2d65872f188183dd26996343a35e79f8a68b9593dc8","observation_id":"5454e27e-3978-4895-b890-ff6d4fdc329f","resolution":{"observed_at":"2026-08-04T18:59:47.408023Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2010.11929","last_updated":"2021-06-03T13:08:56Z","snapshot_observed_at":"2026-08-10T01:12:16.468283Z","submitted_at":"2020-10-22T17:55:59Z","title":"An Image is Worth 16x16 Words: Transformers for Image Recognition at Scale","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2010.11929","snapshot_observed_at":"2026-08-04T18:59:47.412515Z","title":"An image is worth 16x16 words: Transformers for image recognition at scale,","venue":null,"work_id":null,"year":2010},"citing_paper":{"arxiv_id":"2509.09526","last_updated":"2025-09-11T15:08:09Z","snapshot_observed_at":"2026-08-09T14:38:23.869513Z","submitted_at":"2025-09-11T15:08:09Z","title":"Region-Specific Audio Tagging for Spatial Sound","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-04T18:59:47.412515Z"},"links":{"cited_paper":"/paper/2010.11929","citing_paper":"/paper/2509.09526"},"observation_digest":"sha256:bf3c67c1d8328c3eb41a997651fb8c90326e0ee5d7dc2c1d5a76cda893c57d1f","observation_id":"8d944e94-3c4e-4ec2-9e2c-cded43bc4387","resolution":{"observed_at":"2026-08-04T18:59:47.412515Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T18:59:47.417193Z","title":"Convolutional gated recurrent neural network incorporating spatial features for audio tagging,","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2509.09526","last_updated":"2025-09-11T15:08:09Z","snapshot_observed_at":"2026-08-09T14:38:23.869513Z","submitted_at":"2025-09-11T15:08:09Z","title":"Region-Specific Audio Tagging for Spatial Sound","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-04T18:59:47.417193Z"},"links":{"citing_paper":"/paper/2509.09526"},"observation_digest":"sha256:142a9d2e9d22080e9719b127c96d2342786810750266cb930820c0b0bd4c881f","observation_id":"fc43762f-5867-44e0-9ce4-19e789c00a44","resolution":{"observed_at":"2026-08-04T18:59:47.417193Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T18:59:47.421506Z","title":"ATGNN: Audio tagging graph neural network,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.09526","last_updated":"2025-09-11T15:08:09Z","snapshot_observed_at":"2026-08-09T14:38:23.869513Z","submitted_at":"2025-09-11T15:08:09Z","title":"Region-Specific Audio Tagging for Spatial Sound","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-04T18:59:47.421506Z"},"links":{"citing_paper":"/paper/2509.09526"},"observation_digest":"sha256:fef22ec4b28c64b917108c3d420d6379421e556c3b47342de7254ae1044095a2","observation_id":"427de625-b76a-4e05-8d1f-c001433714fb","resolution":{"observed_at":"2026-08-04T18:59:47.421506Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T18:59:47.425516Z","title":"Multi- channel overlapped speech recognition with location guided speech extraction network,","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2509.09526","last_updated":"2025-09-11T15:08:09Z","snapshot_observed_at":"2026-08-09T14:38:23.869513Z","submitted_at":"2025-09-11T15:08:09Z","title":"Region-Specific Audio Tagging for Spatial Sound","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-04T18:59:47.425516Z"},"links":{"citing_paper":"/paper/2509.09526"},"observation_digest":"sha256:2cdc627b9e375c58017f3ac95606154989b83a846145277f9bc893a86bbc37bc","observation_id":"19565f10-8b12-40c8-b725-d8d1b23ca474","resolution":{"observed_at":"2026-08-04T18:59:47.425516Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T18:59:47.430054Z","title":"Multi-modal multi-channel target speech separation,","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2509.09526","last_updated":"2025-09-11T15:08:09Z","snapshot_observed_at":"2026-08-09T14:38:23.869513Z","submitted_at":"2025-09-11T15:08:09Z","title":"Region-Specific Audio Tagging for Spatial Sound","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-04T18:59:47.430054Z"},"links":{"citing_paper":"/paper/2509.09526"},"observation_digest":"sha256:02eb738faa4593ad74948e5f104363c49fdb8b13966c47f9b91b6a7b9ea92769","observation_id":"25ea4942-8741-4c56-816c-dca06507c3d2","resolution":{"observed_at":"2026-08-04T18:59:47.430054Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T18:59:47.434776Z","title":"Rezero: Region-customizable sound extraction,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.09526","last_updated":"2025-09-11T15:08:09Z","snapshot_observed_at":"2026-08-09T14:38:23.869513Z","submitted_at":"2025-09-11T15:08:09Z","title":"Region-Specific Audio Tagging for Spatial Sound","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-04T18:59:47.434776Z"},"links":{"citing_paper":"/paper/2509.09526"},"observation_digest":"sha256:b9f3611059b1f8f0d7e9da65c3d610bb16500f6e6b36024555c94da890d0b45f","observation_id":"5b6a0c2d-20bd-41fd-a358-8761ca12071f","resolution":{"observed_at":"2026-08-04T18:59:47.434776Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T18:59:47.439308Z","title":"An alternative approach to linearly constrained adaptive beamforming,","venue":null,"work_id":null,"year":1982},"citing_paper":{"arxiv_id":"2509.09526","last_updated":"2025-09-11T15:08:09Z","snapshot_observed_at":"2026-08-09T14:38:23.869513Z","submitted_at":"2025-09-11T15:08:09Z","title":"Region-Specific Audio Tagging for Spatial Sound","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-04T18:59:47.439308Z"},"links":{"citing_paper":"/paper/2509.09526"},"observation_digest":"sha256:5f6c1e245c533dcb5db02b60a93c07f94da38e41cfb903fd80d367e932c6c159","observation_id":"805b8483-e4c6-42c2-bf69-6905c359c229","resolution":{"observed_at":"2026-08-04T18:59:47.439308Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.13075","last_updated":"2023-11-22T00:38:06Z","snapshot_observed_at":"2026-08-09T14:51:15.059328Z","submitted_at":"2023-11-22T00:38:06Z","title":"Deep Audio Zooming: Beamwidth-Controllable Neural Beamformer","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.13075","snapshot_observed_at":"2026-08-04T18:59:47.443777Z","title":"Deep audio zooming: Beamwidth-controllable neural beamformer,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2509.09526","last_updated":"2025-09-11T15:08:09Z","snapshot_observed_at":"2026-08-09T14:38:23.869513Z","submitted_at":"2025-09-11T15:08:09Z","title":"Region-Specific Audio Tagging for Spatial Sound","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-04T18:59:47.443777Z"},"links":{"cited_paper":"/paper/2311.13075","citing_paper":"/paper/2509.09526"},"observation_digest":"sha256:0ad5432926adbdd9a207eeebf42eef3d1a99561107c6497c487b113ca718634f","observation_id":"038c2aed-3dd6-4f0d-8f6a-0deabb13dc60","resolution":{"observed_at":"2026-08-04T18:59:47.443777Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T18:59:47.448029Z","title":"Audio inputs for active speaker detection and localization via microphone array,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2509.09526","last_updated":"2025-09-11T15:08:09Z","snapshot_observed_at":"2026-08-09T14:38:23.869513Z","submitted_at":"2025-09-11T15:08:09Z","title":"Region-Specific Audio Tagging for Spatial Sound","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-04T18:59:47.448029Z"},"links":{"citing_paper":"/paper/2509.09526"},"observation_digest":"sha256:15141c84f673dcb1e6dc9b25601a9361c263d127cb024725f17ca7abef3311fb","observation_id":"e132a566-944f-463a-8b7c-8ab2eca1612f","resolution":{"observed_at":"2026-08-04T18:59:47.448029Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.14778","last_updated":"2025-04-13T08:28:06Z","snapshot_observed_at":"2026-08-01T21:27:02.095539Z","submitted_at":"2023-10-23T10:29:33Z","title":"Audio-Visual Speaker Tracking: Progress, Challenges, and Future Directions","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.14778","snapshot_observed_at":"2026-08-04T18:59:47.452738Z","title":"Audio-visual speaker tracking: Progress, challenges, and future directions,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2509.09526","last_updated":"2025-09-11T15:08:09Z","snapshot_observed_at":"2026-08-09T14:38:23.869513Z","submitted_at":"2025-09-11T15:08:09Z","title":"Region-Specific Audio Tagging for Spatial Sound","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-04T18:59:47.452738Z"},"links":{"cited_paper":"/paper/2310.14778","citing_paper":"/paper/2509.09526"},"observation_digest":"sha256:e3fea5d3dc2a8fd7d564f683c209119ab312880ec99d19f1152c3741109d2131","observation_id":"df0f26ab-47a0-4a07-a444-b77d99b1b78a","resolution":{"observed_at":"2026-08-04T18:59:47.452738Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T18:59:47.457412Z","title":"Attention- based end-to-end differentiable particle filter for audio speaker tracking,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.09526","last_updated":"2025-09-11T15:08:09Z","snapshot_observed_at":"2026-08-09T14:38:23.869513Z","submitted_at":"2025-09-11T15:08:09Z","title":"Region-Specific Audio Tagging for Spatial Sound","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-04T18:59:47.457412Z"},"links":{"citing_paper":"/paper/2509.09526"},"observation_digest":"sha256:e18daf52eea8ea535096e26bdba5e539cf049de7851dc8293009c725acf5515d","observation_id":"11f7db23-3624-43f7-a300-c48d0c5c438c","resolution":{"observed_at":"2026-08-04T18:59:47.457412Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T18:59:47.461347Z","title":"On spatial features for supervised speech separation and its application to beamforming and robust ASR,","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2509.09526","last_updated":"2025-09-11T15:08:09Z","snapshot_observed_at":"2026-08-09T14:38:23.869513Z","submitted_at":"2025-09-11T15:08:09Z","title":"Region-Specific Audio Tagging for Spatial Sound","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-04T18:59:47.461347Z"},"links":{"citing_paper":"/paper/2509.09526"},"observation_digest":"sha256:cab9f7dc9ea3c189d8caf31b99cfcab390d6bd84f29051250cb45e0a11229e3e","observation_id":"6362540d-588f-4ca0-aefe-cad83289415c","resolution":{"observed_at":"2026-08-04T18:59:47.461347Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T18:59:47.466371Z","title":"STARSS23: An audio-visual dataset of spatial recordings of real scenes with spatiotemporal annotations of sound events,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.09526","last_updated":"2025-09-11T15:08:09Z","snapshot_observed_at":"2026-08-09T14:38:23.869513Z","submitted_at":"2025-09-11T15:08:09Z","title":"Region-Specific Audio Tagging for Spatial Sound","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-04T18:59:47.466371Z"},"links":{"citing_paper":"/paper/2509.09526"},"observation_digest":"sha256:2191ed7a3c15b603de99a99b24cc25c598ff01d939489d62f485e8c8401e9739","observation_id":"474eef67-3cb4-4aa6-be91-b5c383bfdcd4","resolution":{"observed_at":"2026-08-04T18:59:47.466371Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T18:59:47.470748Z","title":"Spatial Scaper: a library to simulate and augment soundscapes for sound event localization and detection in realistic rooms,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.09526","last_updated":"2025-09-11T15:08:09Z","snapshot_observed_at":"2026-08-09T14:38:23.869513Z","submitted_at":"2025-09-11T15:08:09Z","title":"Region-Specific Audio Tagging for Spatial Sound","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-04T18:59:47.470748Z"},"links":{"citing_paper":"/paper/2509.09526"},"observation_digest":"sha256:8a33e119cb5be2e1a33fbeccbebeb70f0846ea691b351769f7b5febc65d152ba","observation_id":"c8935f05-da37-4449-8816-5f0468b5db27","resolution":{"observed_at":"2026-08-04T18:59:47.470748Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T18:59:47.474786Z","title":"FSD50K: An open dataset of human-labeled sound events,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2509.09526","last_updated":"2025-09-11T15:08:09Z","snapshot_observed_at":"2026-08-09T14:38:23.869513Z","submitted_at":"2025-09-11T15:08:09Z","title":"Region-Specific Audio Tagging for Spatial Sound","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-04T18:59:47.474786Z"},"links":{"citing_paper":"/paper/2509.09526"},"observation_digest":"sha256:fb832155eb1db78927946d3f485b9346e9fdecddc949b6b44c2c33533c8cab47","observation_id":"3908851e-6ad5-4e12-b93d-f8dc334bbaf6","resolution":{"observed_at":"2026-08-04T18:59:47.474786Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T18:59:47.478930Z","title":"A four- stage data augmentation approach to ResNet-Conformer based acoustic modeling for sound event localization and detection,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2509.09526","last_updated":"2025-09-11T15:08:09Z","snapshot_observed_at":"2026-08-09T14:38:23.869513Z","submitted_at":"2025-09-11T15:08:09Z","title":"Region-Specific Audio Tagging for Spatial Sound","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-04T18:59:47.478930Z"},"links":{"citing_paper":"/paper/2509.09526"},"observation_digest":"sha256:836235955aae73c3927881c0375be0149a65cfee0a589518a1c3b9b35a9a31a2","observation_id":"08c98658-c91f-4489-b3e2-d495da8069a2","resolution":{"observed_at":"2026-08-04T18:59:47.478930Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T18:59:47.482800Z","title":"SALSA: Spatial cue-augmented log-spectrogram features for polyphonic sound event localization and detection,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2509.09526","last_updated":"2025-09-11T15:08:09Z","snapshot_observed_at":"2026-08-09T14:38:23.869513Z","submitted_at":"2025-09-11T15:08:09Z","title":"Region-Specific Audio Tagging for Spatial Sound","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-04T18:59:47.482800Z"},"links":{"citing_paper":"/paper/2509.09526"},"observation_digest":"sha256:77806dd5b08f6f3c97d21b9ac78756144bd4293f258f5246f7b66f10e7f7fb04","observation_id":"fccffcaa-9720-41b1-b5d0-5a0c6e5455c9","resolution":{"observed_at":"2026-08-04T18:59:47.482800Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2509.09526","last_updated":"2025-09-11T15:08:09Z","latest_version":1,"primary_category":"eess.AS","snapshot_observed_at":"2026-08-09T14:38:23.869513Z","submitted_at":"2025-09-11T15:08:09Z","title":"Region-Specific Audio Tagging for Spatial Sound"},"reference_resolution":{"displayed":24,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":24,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":24},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"thesis":"As of 10 August 2026, this Paper Citation Record lists 24 of 24 outbound references and 0 inbound Pith citation observations for arXiv:2509.09526."}