{"as_of":"2026-08-23T14:31:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:a1b7d1458078cb68a3f9f0f8469ad21333433efd72ecb0a47724987c4dfc2665","coverage":[{"denominator":59,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":59,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-16T12:29:05.170965Z","state":"measured"},{"denominator":61,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":61,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-23T06:30:58.430688+00:00","state":"measured"},{"denominator":2,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":2,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T00:49:01.950652Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"pith","source_observed_at":"2026-08-05T21:55:00.961516Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2504.12670","last_updated":"2025-04-17T06:03:43Z","snapshot_observed_at":"2026-08-16T12:23:17.817807Z","submitted_at":"2025-04-17T06:03:43Z","title":"Temporal Attention Pooling for Frequency Dynamic Convolution in Sound Event Detection","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.12670","snapshot_observed_at":"2026-08-07T00:49:01.950652Z","title":"Temporal Attention Pooling for Frequency Dynamic Convolution in Sound Event Detection,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.12785","last_updated":"2025-06-15T09:32:16Z","snapshot_observed_at":"2026-08-07T00:40:07.029946Z","submitted_at":"2025-06-15T09:32:16Z","title":"Frequency Dynamic Convolutions for Sound Event Detection","version":1},"reference_index":117,"source":"pdf_text","source_observed_at":"2026-08-07T00:49:01.950652Z"},"links":{"cited_paper":"/paper/2504.12670","citing_paper":"/paper/2506.12785"},"observation_digest":"sha256:2d0f14ec6822e360220948f6603789810fe469170d139b26830955558eee03f7","observation_id":"051786bf-620b-4c3f-a33e-dc3e3948345b","resolution":{"observed_at":"2026-08-07T00:49:01.950652Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.12670","last_updated":"2025-04-17T06:03:43Z","snapshot_observed_at":"2026-08-16T12:23:17.817807Z","submitted_at":"2025-04-17T06:03:43Z","title":"Temporal Attention Pooling for Frequency Dynamic Convolution in Sound Event Detection","version":1},"cited_work":{"arxiv_id":"2504.12670","doi":null,"metadata_source":"pith","pith_arxiv_id":"2504.12670","snapshot_observed_at":"2026-08-05T21:55:00.961516Z","title":"Temporal Attention Pooling for Frequency Dynamic Convolution in Sound Event Detection","venue":"eess.AS","work_id":"38288718-f4f7-440a-972a-57ea6f3fb17f","year":2025},"citing_paper":{"arxiv_id":"2508.07829","last_updated":"2025-08-11T10:25:58Z","snapshot_observed_at":"2026-08-21T12:52:12.200460Z","submitted_at":"2025-08-11T10:25:58Z","title":"Auditory Intelligence: Understanding the World Through Sound","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-05T21:54:59.989934Z"},"links":{"cited_paper":"/paper/2504.12670","citing_paper":"/paper/2508.07829"},"observation_digest":"sha256:f9f72bd58c2241963ed6f5c7353a3fa9fcb0f43bb8afe403441a3188d3ef54c5","observation_id":"72f54b94-765d-44ca-ac9e-ddc6677757af","resolution":{"observed_at":"2026-08-05T21:55:01.067562Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2504.12670/citation-record","integrity":"/paper/2504.12670/integrity","json":"/paper/2504.12670/citation-record.json","paper":"/paper/2504.12670"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T12:29:04.887860Z","title":"Virtanen, M","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2504.12670","last_updated":"2025-04-17T06:03:43Z","snapshot_observed_at":"2026-08-16T12:23:17.817807Z","submitted_at":"2025-04-17T06:03:43Z","title":"Temporal Attention Pooling for Frequency Dynamic Convolution in Sound Event Detection","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-16T12:29:04.887860Z"},"links":{"citing_paper":"/paper/2504.12670"},"observation_digest":"sha256:31f1c8b526a00095fe8e8cc773cee265875132f29a959cdd824f810de64f85ed","observation_id":"4f5e0ce2-fccf-4d6f-be60-b0ab1d6cbab1","resolution":{"observed_at":"2026-08-16T12:29:04.887860Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T12:29:04.892687Z","title":"Sound event detection in domestic environments with weakly labeled data and soundscape synthesis,","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2504.12670","last_updated":"2025-04-17T06:03:43Z","snapshot_observed_at":"2026-08-16T12:23:17.817807Z","submitted_at":"2025-04-17T06:03:43Z","title":"Temporal Attention Pooling for Frequency Dynamic Convolution in Sound Event Detection","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-16T12:29:04.892687Z"},"links":{"citing_paper":"/paper/2504.12670"},"observation_digest":"sha256:10122fefdf95552ce7b0de86be29586b265f48b26bc58fb0b91525c2fac51a4e","observation_id":"40bfabc6-d259-4f9f-b6ea-f92820fa298c","resolution":{"observed_at":"2026-08-16T12:29:04.892687Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T12:29:04.897955Z","title":"Convolutional recurrent neural networks for polyphonic sound event detection,","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2504.12670","last_updated":"2025-04-17T06:03:43Z","snapshot_observed_at":"2026-08-16T12:23:17.817807Z","submitted_at":"2025-04-17T06:03:43Z","title":"Temporal Attention Pooling for Frequency Dynamic Convolution in Sound Event Detection","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-16T12:29:04.897955Z"},"links":{"citing_paper":"/paper/2504.12670"},"observation_digest":"sha256:7ebc451a7ef9ad33d81acae0d4a81fb09f19bd82d0277811612041b67ede1dc1","observation_id":"92f121c3-14de-4453-a156-a310ea5697c5","resolution":{"observed_at":"2026-08-16T12:29:04.897955Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T12:29:05.872624Z","title":"Metrics for polyphonic sound event detection,","venue":null,"work_id":"4b7f2c95-5e91-4787-94e8-279d4dfbf76f","year":2016},"citing_paper":{"arxiv_id":"2504.12670","last_updated":"2025-04-17T06:03:43Z","snapshot_observed_at":"2026-08-16T12:23:17.817807Z","submitted_at":"2025-04-17T06:03:43Z","title":"Temporal Attention Pooling for Frequency Dynamic Convolution in Sound Event Detection","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-16T12:29:04.903301Z"},"links":{"citing_paper":"/paper/2504.12670"},"observation_digest":"sha256:97b02f45ad3383006e07d8de303a7a6da40776a9452ead19df1f2f5c653a81d8","observation_id":"2e014505-42cd-478d-bc09-22b4652421f4","resolution":{"observed_at":"2026-08-16T12:29:05.877191Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T12:29:04.907944Z","title":"A framework for the robust evaluation of sound event detection,","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2504.12670","last_updated":"2025-04-17T06:03:43Z","snapshot_observed_at":"2026-08-16T12:23:17.817807Z","submitted_at":"2025-04-17T06:03:43Z","title":"Temporal Attention Pooling for Frequency Dynamic Convolution in Sound Event Detection","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-16T12:29:04.907944Z"},"links":{"citing_paper":"/paper/2504.12670"},"observation_digest":"sha256:8695d498f7a273d4490e970006900e05b46e8cbf7515ed8562071117b02389b0","observation_id":"f99a866d-ba5d-4c3b-a956-66ed84b559d4","resolution":{"observed_at":"2026-08-16T12:29:04.907944Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T12:29:05.849580Z","title":"Study on frequency dependent convolution methods for sound event detection,","venue":null,"work_id":"ba42b706-6305-47a9-b887-ba1e52b6232f","year":2024},"citing_paper":{"arxiv_id":"2504.12670","last_updated":"2025-04-17T06:03:43Z","snapshot_observed_at":"2026-08-16T12:23:17.817807Z","submitted_at":"2025-04-17T06:03:43Z","title":"Temporal Attention Pooling for Frequency Dynamic Convolution in Sound Event Detection","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-16T12:29:04.912579Z"},"links":{"citing_paper":"/paper/2504.12670"},"observation_digest":"sha256:c01d977f71f462bc559c6b714df5badffb106ffc1cb9cfccf7db7e80291cf453","observation_id":"c503a4c5-cd48-42de-96ab-3fd2fc2d4b3e","resolution":{"observed_at":"2026-08-16T12:29:05.854735Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.20857","last_updated":"2025-02-28T08:55:20Z","snapshot_observed_at":"2026-08-19T06:26:18.551536Z","submitted_at":"2025-02-28T08:55:20Z","title":"JiTTER: Jigsaw Temporal Transformer for Event Reconstruction for Self-Supervised Sound Event Detection","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.20857","snapshot_observed_at":"2026-08-16T12:29:04.917713Z","title":"Jitter: Jigsaw temporal transformer for event reconstruction for self-supervised sound event detection,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2504.12670","last_updated":"2025-04-17T06:03:43Z","snapshot_observed_at":"2026-08-16T12:23:17.817807Z","submitted_at":"2025-04-17T06:03:43Z","title":"Temporal Attention Pooling for Frequency Dynamic Convolution in Sound Event Detection","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-16T12:29:04.917713Z"},"links":{"cited_paper":"/paper/2502.20857","citing_paper":"/paper/2504.12670"},"observation_digest":"sha256:149a0b26af999902a1e99a541ff5e66b423d4f04d99c1554b58c8cc084d128be","observation_id":"10db2a40-44c3-4e01-a2bd-dcc638670598","resolution":{"observed_at":"2026-08-16T12:29:04.917713Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T12:29:04.922419Z","title":"SpecAugment: A Simple Data Augmentation Method for Automatic Speech Recognition,","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2504.12670","last_updated":"2025-04-17T06:03:43Z","snapshot_observed_at":"2026-08-16T12:23:17.817807Z","submitted_at":"2025-04-17T06:03:43Z","title":"Temporal Attention Pooling for Frequency Dynamic Convolution in Sound Event Detection","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-16T12:29:04.922419Z"},"links":{"citing_paper":"/paper/2504.12670"},"observation_digest":"sha256:dca8da1d88f986a356e5efd091943c24977fcf26cfd8d48331852012370dabdd","observation_id":"dbba7e53-9d38-4082-ab4b-ac92853d870a","resolution":{"observed_at":"2026-08-16T12:29:04.922419Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T12:29:04.927241Z","title":"Conformer: Convolution- augmented Transformer for Speech Recognition,","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2504.12670","last_updated":"2025-04-17T06:03:43Z","snapshot_observed_at":"2026-08-16T12:23:17.817807Z","submitted_at":"2025-04-17T06:03:43Z","title":"Temporal Attention Pooling for Frequency Dynamic Convolution in Sound Event Detection","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-16T12:29:04.927241Z"},"links":{"citing_paper":"/paper/2504.12670"},"observation_digest":"sha256:56d86e1d49630caa1e1699b88497723eb210acf5a7fe0da5e7fc7aab9c4f7a15","observation_id":"d6141595-c65e-4a64-8815-72c1bdb740c6","resolution":{"observed_at":"2026-08-16T12:29:04.927241Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T12:29:04.932308Z","title":"Coherence-based phonemic analysis on the ef- fect of reverberation to practical automatic speech recognition,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2504.12670","last_updated":"2025-04-17T06:03:43Z","snapshot_observed_at":"2026-08-16T12:23:17.817807Z","submitted_at":"2025-04-17T06:03:43Z","title":"Temporal Attention Pooling for Frequency Dynamic Convolution in Sound Event Detection","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-16T12:29:04.932308Z"},"links":{"citing_paper":"/paper/2504.12670"},"observation_digest":"sha256:49f77a5c52ff040fd75f22cb2fbe778cd838b07c07ad1f4b29fe246f7b19a654","observation_id":"5380e233-85d6-4bec-b89b-2b6760965ab4","resolution":{"observed_at":"2026-08-16T12:29:04.932308Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T12:29:04.936365Z","title":"wav2vec 2.0: A framework for self-supervised learning of speech representations,","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2504.12670","last_updated":"2025-04-17T06:03:43Z","snapshot_observed_at":"2026-08-16T12:23:17.817807Z","submitted_at":"2025-04-17T06:03:43Z","title":"Temporal Attention Pooling for Frequency Dynamic Convolution in Sound Event Detection","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-16T12:29:04.936365Z"},"links":{"citing_paper":"/paper/2504.12670"},"observation_digest":"sha256:75fa4c2fb146006c04691fdf65e402f0ee2c1fe325ace1f5e1d4635fbbfd054c","observation_id":"e6c38bba-dc1f-4c52-b682-af52fedcb8a5","resolution":{"observed_at":"2026-08-16T12:29:04.936365Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T12:29:04.941244Z","title":"Hubert: Self-supervised speech representation learning by masked prediction of hidden units,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2504.12670","last_updated":"2025-04-17T06:03:43Z","snapshot_observed_at":"2026-08-16T12:23:17.817807Z","submitted_at":"2025-04-17T06:03:43Z","title":"Temporal Attention Pooling for Frequency Dynamic Convolution in Sound Event Detection","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-16T12:29:04.941244Z"},"links":{"citing_paper":"/paper/2504.12670"},"observation_digest":"sha256:55ae8c060baa268df19fde2569908d4aa83c6a551b997d6f26b29d0ed7a57006","observation_id":"4c7015e9-d181-4da3-98b4-d9c239ea996c","resolution":{"observed_at":"2026-08-16T12:29:04.941244Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T12:29:04.945310Z","title":"Attentive statistics pooling for deep speaker embedding,","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2504.12670","last_updated":"2025-04-17T06:03:43Z","snapshot_observed_at":"2026-08-16T12:23:17.817807Z","submitted_at":"2025-04-17T06:03:43Z","title":"Temporal Attention Pooling for Frequency Dynamic Convolution in Sound Event Detection","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-16T12:29:04.945310Z"},"links":{"citing_paper":"/paper/2504.12670"},"observation_digest":"sha256:f03da762170e970d4bd3b5b5935f5dfb496683bbe67ff61701df94b0a3cd1c77","observation_id":"588ef2b3-dd01-447b-9f81-ce14a22409aa","resolution":{"observed_at":"2026-08-16T12:29:04.945310Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T12:29:04.949218Z","title":"Exploring the encoding layer and loss function in end-to-end speaker and language recognition system,","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2504.12670","last_updated":"2025-04-17T06:03:43Z","snapshot_observed_at":"2026-08-16T12:23:17.817807Z","submitted_at":"2025-04-17T06:03:43Z","title":"Temporal Attention Pooling for Frequency Dynamic Convolution in Sound Event Detection","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-16T12:29:04.949218Z"},"links":{"citing_paper":"/paper/2504.12670"},"observation_digest":"sha256:0371f245a91699c23429ecea3ae59d1d3006fff0a0b77d73ab7f3c32bc1785b0","observation_id":"86319428-f555-49b8-9510-dd69c5d7fd93","resolution":{"observed_at":"2026-08-16T12:29:04.949218Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T12:29:05.765871Z","title":"Analysis-based optimization of temporal dynamic convolutional neural network for text-independent speaker verification,","venue":null,"work_id":"5546db12-6936-43b7-911c-593d7be22bc0","year":2023},"citing_paper":{"arxiv_id":"2504.12670","last_updated":"2025-04-17T06:03:43Z","snapshot_observed_at":"2026-08-16T12:23:17.817807Z","submitted_at":"2025-04-17T06:03:43Z","title":"Temporal Attention Pooling for Frequency Dynamic Convolution in Sound Event Detection","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-16T12:29:04.953019Z"},"links":{"citing_paper":"/paper/2504.12670"},"observation_digest":"sha256:3305110245c595f62effdedd2c2620748aed270e5dbd7c36de987af5fcf4bfa5","observation_id":"f764592e-1a79-4649-a721-ca457b568a9e","resolution":{"observed_at":"2026-08-16T12:29:05.771428Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T12:29:04.956850Z","title":"Integrating fre- quency translational invariance in tdnns and frequency positional in- formation in 2d resnets to enhance speaker verification,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2504.12670","last_updated":"2025-04-17T06:03:43Z","snapshot_observed_at":"2026-08-16T12:23:17.817807Z","submitted_at":"2025-04-17T06:03:43Z","title":"Temporal Attention Pooling for Frequency Dynamic Convolution in Sound Event Detection","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-16T12:29:04.956850Z"},"links":{"citing_paper":"/paper/2504.12670"},"observation_digest":"sha256:0a8fec14a000a25392e70ddcb800e58077fcc30325a606bd775e44a1e544a745","observation_id":"f2ff46b5-0814-43b2-b384-3923976512e6","resolution":{"observed_at":"2026-08-16T12:29:04.956850Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T12:29:04.960578Z","title":"Convolution-based channel-frequency atten- tion for text-independent speaker verification,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2504.12670","last_updated":"2025-04-17T06:03:43Z","snapshot_observed_at":"2026-08-16T12:23:17.817807Z","submitted_at":"2025-04-17T06:03:43Z","title":"Temporal Attention Pooling for Frequency Dynamic Convolution in Sound Event Detection","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-16T12:29:04.960578Z"},"links":{"citing_paper":"/paper/2504.12670"},"observation_digest":"sha256:3cd0f51f5dacbeb9e1cc421699584d3bcf8277bc216abbbb36af407b9b418bca","observation_id":"8ec2ff88-6875-462b-b731-54ef436a3858","resolution":{"observed_at":"2026-08-16T12:29:04.960578Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T12:29:04.964387Z","title":"Panns: Large-scale pretrained audio neural networks for audio pattern recognition,","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2504.12670","last_updated":"2025-04-17T06:03:43Z","snapshot_observed_at":"2026-08-16T12:23:17.817807Z","submitted_at":"2025-04-17T06:03:43Z","title":"Temporal Attention Pooling for Frequency Dynamic Convolution in Sound Event Detection","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-16T12:29:04.964387Z"},"links":{"citing_paper":"/paper/2504.12670"},"observation_digest":"sha256:764ef455b30b8b59ad385a3caa6d4be82f6fad56d308afa9e8b523384dd07da3","observation_id":"912dbcc8-fa9d-4549-ba9d-e0196f490060","resolution":{"observed_at":"2026-08-16T12:29:04.964387Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T12:29:04.968729Z","title":"Deep learning based cough detection camera using enhanced features,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2504.12670","last_updated":"2025-04-17T06:03:43Z","snapshot_observed_at":"2026-08-16T12:23:17.817807Z","submitted_at":"2025-04-17T06:03:43Z","title":"Temporal Attention Pooling for Frequency Dynamic Convolution in Sound Event Detection","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-16T12:29:04.968729Z"},"links":{"citing_paper":"/paper/2504.12670"},"observation_digest":"sha256:fdd5745f07378dc708a3238678697e150c9304bd9fc55c38f426ec5a5cf73b99","observation_id":"fd992543-6a42-4cd5-96c5-4ede0e33a35b","resolution":{"observed_at":"2026-08-16T12:29:04.968729Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T12:29:05.709814Z","title":"Real-time sound recognition system for human care robot considering custom sound events,","venue":null,"work_id":"07c2fa42-a7be-4e7b-8c66-97f17d5db5f8","year":2024},"citing_paper":{"arxiv_id":"2504.12670","last_updated":"2025-04-17T06:03:43Z","snapshot_observed_at":"2026-08-16T12:23:17.817807Z","submitted_at":"2025-04-17T06:03:43Z","title":"Temporal Attention Pooling for Frequency Dynamic Convolution in Sound Event Detection","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-16T12:29:04.974079Z"},"links":{"citing_paper":"/paper/2504.12670"},"observation_digest":"sha256:abd19ad69bbbdc822863b80d9742976f2ca8f1c68a62b80608f5803391b1e23c","observation_id":"6e2160ab-26d5-471c-9c02-b8c7130e00f8","resolution":{"observed_at":"2026-08-16T12:29:05.717151Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T12:29:04.979238Z","title":"Ast: Audio spectrogram trans- former,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2504.12670","last_updated":"2025-04-17T06:03:43Z","snapshot_observed_at":"2026-08-16T12:23:17.817807Z","submitted_at":"2025-04-17T06:03:43Z","title":"Temporal Attention Pooling for Frequency Dynamic Convolution in Sound Event Detection","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-16T12:29:04.979238Z"},"links":{"citing_paper":"/paper/2504.12670"},"observation_digest":"sha256:7d402eff7eed64447f75fe3f038743eb3714654953d02fc0d1b5eaeecdaec37f","observation_id":"eb9e4c1b-f00d-492a-b9db-d6a2fd29325b","resolution":{"observed_at":"2026-08-16T12:29:04.979238Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T12:29:04.983161Z","title":"Beats: Audio pre-training with acoustic tokenizers,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2504.12670","last_updated":"2025-04-17T06:03:43Z","snapshot_observed_at":"2026-08-16T12:23:17.817807Z","submitted_at":"2025-04-17T06:03:43Z","title":"Temporal Attention Pooling for Frequency Dynamic Convolution in Sound Event Detection","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-16T12:29:04.983161Z"},"links":{"citing_paper":"/paper/2504.12670"},"observation_digest":"sha256:726fd85b54d2d940920b11519cfe977b6e2335ecd04759a53428013915587061","observation_id":"d18b172f-73de-4c1f-b246-498f53f76e4f","resolution":{"observed_at":"2026-08-16T12:29:04.983161Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T12:29:04.987795Z","title":"Overview and evaluation of sound event localization and detection in dcase 2019,","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2504.12670","last_updated":"2025-04-17T06:03:43Z","snapshot_observed_at":"2026-08-16T12:23:17.817807Z","submitted_at":"2025-04-17T06:03:43Z","title":"Temporal Attention Pooling for Frequency Dynamic Convolution in Sound Event Detection","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-16T12:29:04.987795Z"},"links":{"citing_paper":"/paper/2504.12670"},"observation_digest":"sha256:4abf897aa4877014ae61822d11d88dcf082bc2c537fd5913a9311325ef79de20","observation_id":"d61f1e61-61f9-4a73-b037-764871312acc","resolution":{"observed_at":"2026-08-16T12:29:04.987795Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T12:29:04.992566Z","title":"STARSS22: A dataset of spatial recordings of real scenes with spa- tiotemporal annotations of sound events,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2504.12670","last_updated":"2025-04-17T06:03:43Z","snapshot_observed_at":"2026-08-16T12:23:17.817807Z","submitted_at":"2025-04-17T06:03:43Z","title":"Temporal Attention Pooling for Frequency Dynamic Convolution in Sound Event Detection","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-16T12:29:04.992566Z"},"links":{"citing_paper":"/paper/2504.12670"},"observation_digest":"sha256:56ba3788132e6895c5ea5dfebf59cdef9ec9326b28f119afcf7121f6845fad9a","observation_id":"78f57b4a-746a-49f2-ab02-e3d3ca270816","resolution":{"observed_at":"2026-08-16T12:29:04.992566Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T12:29:04.997197Z","title":"Data augmentation and squeeze-and-excitation network on multiple dimension for sound event localization and detection in real scenes,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2504.12670","last_updated":"2025-04-17T06:03:43Z","snapshot_observed_at":"2026-08-16T12:23:17.817807Z","submitted_at":"2025-04-17T06:03:43Z","title":"Temporal Attention Pooling for Frequency Dynamic Convolution in Sound Event Detection","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-16T12:29:04.997197Z"},"links":{"citing_paper":"/paper/2504.12670"},"observation_digest":"sha256:848e2426ca927924e27c1420fbb1e65e90492f9e23d6a2a6a14f5e18d6338502","observation_id":"ce5a6423-b411-4cfc-a5ed-60800a6bd434","resolution":{"observed_at":"2026-08-16T12:29:04.997197Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T12:29:05.001509Z","title":"Automated audio captioning with recurrent neural networks,","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2504.12670","last_updated":"2025-04-17T06:03:43Z","snapshot_observed_at":"2026-08-16T12:23:17.817807Z","submitted_at":"2025-04-17T06:03:43Z","title":"Temporal Attention Pooling for Frequency Dynamic Convolution in Sound Event Detection","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-16T12:29:05.001509Z"},"links":{"citing_paper":"/paper/2504.12670"},"observation_digest":"sha256:90fabeaff630ef3530863289faeca1f14a3a9acd17eea1219191c7de1e0b26db","observation_id":"9860f108-5bca-48f1-b83b-b0c87b5929c3","resolution":{"observed_at":"2026-08-16T12:29:05.001509Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T12:29:05.005993Z","title":"Clotho: an audio captioning dataset,","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2504.12670","last_updated":"2025-04-17T06:03:43Z","snapshot_observed_at":"2026-08-16T12:23:17.817807Z","submitted_at":"2025-04-17T06:03:43Z","title":"Temporal Attention Pooling for Frequency Dynamic Convolution in Sound Event Detection","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-16T12:29:05.005993Z"},"links":{"citing_paper":"/paper/2504.12670"},"observation_digest":"sha256:aa8b70b1aef9e099f9792c381744bf9cf570db928b6ecb39e46a83e718ae2e5e","observation_id":"5f44df4d-4c94-4e62-803a-e3212869bd8f","resolution":{"observed_at":"2026-08-16T12:29:05.005993Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T12:29:05.011445Z","title":"Chatgpt caption paraphrasing and fense-based caption filtering for automated audio captioning,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2504.12670","last_updated":"2025-04-17T06:03:43Z","snapshot_observed_at":"2026-08-16T12:23:17.817807Z","submitted_at":"2025-04-17T06:03:43Z","title":"Temporal Attention Pooling for Frequency Dynamic Convolution in Sound Event Detection","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-16T12:29:05.011445Z"},"links":{"citing_paper":"/paper/2504.12670"},"observation_digest":"sha256:24664be399d0803f11a46bb9839d118bb49e2f8a9e7bb8b4bb218623daa39957","observation_id":"2a4a560d-125d-47d4-b599-f3b3ed042df2","resolution":{"observed_at":"2026-08-16T12:29:05.011445Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.18638","last_updated":"2024-03-27T14:44:24Z","snapshot_observed_at":"2026-08-16T14:05:51.760460Z","submitted_at":"2024-03-27T14:44:24Z","title":"Mind the Domain Gap: a Systematic Analysis on Bioacoustic Sound Event Detection","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.18638","snapshot_observed_at":"2026-08-16T12:29:05.015644Z","title":"Mind the Domain Gap: a Systematic Analysis on Bioacoustic Sound Event Detection,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2504.12670","last_updated":"2025-04-17T06:03:43Z","snapshot_observed_at":"2026-08-16T12:23:17.817807Z","submitted_at":"2025-04-17T06:03:43Z","title":"Temporal Attention Pooling for Frequency Dynamic Convolution in Sound Event Detection","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-16T12:29:05.015644Z"},"links":{"cited_paper":"/paper/2403.18638","citing_paper":"/paper/2504.12670"},"observation_digest":"sha256:bfb6184167616d879b39e5a7db0ff678f9e299a62014358b6668ca95a719d7c2","observation_id":"25f3e786-769e-4572-8d40-ca5f53346ce3","resolution":{"observed_at":"2026-08-16T12:29:05.015644Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T12:29:05.618376Z","title":"Few-shot bioacoustic event detection utilizing spectro-temporal receptive field,","venue":null,"work_id":"cce47ef0-abf8-4c19-8e00-fff36ad7999a","year":2024},"citing_paper":{"arxiv_id":"2504.12670","last_updated":"2025-04-17T06:03:43Z","snapshot_observed_at":"2026-08-16T12:23:17.817807Z","submitted_at":"2025-04-17T06:03:43Z","title":"Temporal Attention Pooling for Frequency Dynamic Convolution in Sound Event Detection","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-16T12:29:05.020332Z"},"links":{"citing_paper":"/paper/2504.12670"},"observation_digest":"sha256:8c6e4ce7dc5aa57e67bd0b06b932dd061631da3db084f800af73937a97a49c2f","observation_id":"d4381ef1-7a3c-49c1-a679-fdf993545d1d","resolution":{"observed_at":"2026-08-16T12:29:05.624333Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T12:29:05.024724Z","title":"Prtfnet: Hrtf individual- ization for accurate spectral cues using a compact prtf,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2504.12670","last_updated":"2025-04-17T06:03:43Z","snapshot_observed_at":"2026-08-16T12:23:17.817807Z","submitted_at":"2025-04-17T06:03:43Z","title":"Temporal Attention Pooling for Frequency Dynamic Convolution in Sound Event Detection","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-16T12:29:05.024724Z"},"links":{"citing_paper":"/paper/2504.12670"},"observation_digest":"sha256:97b4abd957ef937f0a0ecb1bbd63eaf58bcb60577758f217b6941c1ec6012755","observation_id":"3049eae1-734d-4237-84f6-94f939f6a6b8","resolution":{"observed_at":"2026-08-16T12:29:05.024724Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T12:29:05.589563Z","title":"Filteraugment: An acoustic environmental data augmentation method,","venue":null,"work_id":"2a8bac27-a918-4e64-b564-0ba4a5fabace","year":2022},"citing_paper":{"arxiv_id":"2504.12670","last_updated":"2025-04-17T06:03:43Z","snapshot_observed_at":"2026-08-16T12:23:17.817807Z","submitted_at":"2025-04-17T06:03:43Z","title":"Temporal Attention Pooling for Frequency Dynamic Convolution in Sound Event Detection","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-16T12:29:05.029161Z"},"links":{"citing_paper":"/paper/2504.12670"},"observation_digest":"sha256:7c3ad6346de8e7492a9bda8c700c7e55f97f48095d2de453a604042db429c6ba","observation_id":"9eb716a2-a1d4-4917-89e7-658d3a9d3f64","resolution":{"observed_at":"2026-08-16T12:29:05.594188Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T12:29:05.033195Z","title":"AudioLDM: Text-to-audio generation with latent diffusion models,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2504.12670","last_updated":"2025-04-17T06:03:43Z","snapshot_observed_at":"2026-08-16T12:23:17.817807Z","submitted_at":"2025-04-17T06:03:43Z","title":"Temporal Attention Pooling for Frequency Dynamic Convolution in Sound Event Detection","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-16T12:29:05.033195Z"},"links":{"citing_paper":"/paper/2504.12670"},"observation_digest":"sha256:4b3a6a878bd875288a7c93f6e642627b288419b13eb5a9e5051e32be633e2470","observation_id":"3607d2db-2ade-46b1-a5bb-22a97cecfb94","resolution":{"observed_at":"2026-08-16T12:29:05.033195Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T12:29:05.038003Z","title":"Audiogen: Textually guided audio generation,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2504.12670","last_updated":"2025-04-17T06:03:43Z","snapshot_observed_at":"2026-08-16T12:23:17.817807Z","submitted_at":"2025-04-17T06:03:43Z","title":"Temporal Attention Pooling for Frequency Dynamic Convolution in Sound Event Detection","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-16T12:29:05.038003Z"},"links":{"citing_paper":"/paper/2504.12670"},"observation_digest":"sha256:098eaa5bc986aba65a2a3bc6b24fc7215d7e774f6760b9bf2cf4f4b229d47f22","observation_id":"10e8b2d2-ebab-4da7-b086-0c831edff7e6","resolution":{"observed_at":"2026-08-16T12:29:05.038003Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T12:29:05.042438Z","title":"Vifs: An end-to-end variational inference for foley sound synthesis,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2504.12670","last_updated":"2025-04-17T06:03:43Z","snapshot_observed_at":"2026-08-16T12:23:17.817807Z","submitted_at":"2025-04-17T06:03:43Z","title":"Temporal Attention Pooling for Frequency Dynamic Convolution in Sound Event Detection","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-16T12:29:05.042438Z"},"links":{"citing_paper":"/paper/2504.12670"},"observation_digest":"sha256:3eecec3230988527edf62f0c20fbf86603cc33512a6af1bc981a41fa3cc0d1eb","observation_id":"93dfca2e-be10-4afd-b06b-2336bd5303f0","resolution":{"observed_at":"2026-08-16T12:29:05.042438Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T12:29:05.048029Z","title":"Filteraugment: An acoustic environmental data augmentation method,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2504.12670","last_updated":"2025-04-17T06:03:43Z","snapshot_observed_at":"2026-08-16T12:23:17.817807Z","submitted_at":"2025-04-17T06:03:43Z","title":"Temporal Attention Pooling for Frequency Dynamic Convolution in Sound Event Detection","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-16T12:29:05.048029Z"},"links":{"citing_paper":"/paper/2504.12670"},"observation_digest":"sha256:75882cc362b6558db8d5d0153711f8974d1b33a3fa11024ba3a53deb5234ccdd","observation_id":"b083ad60-d0b5-4fea-8742-eedfd2dc1a1b","resolution":{"observed_at":"2026-08-16T12:29:05.048029Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T12:29:05.055519Z","title":"Frequency Dynamic Convolution: Frequency-Adaptive Pattern Recognition for Sound Event Detection,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2504.12670","last_updated":"2025-04-17T06:03:43Z","snapshot_observed_at":"2026-08-16T12:23:17.817807Z","submitted_at":"2025-04-17T06:03:43Z","title":"Temporal Attention Pooling for Frequency Dynamic Convolution in Sound Event Detection","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-16T12:29:05.055519Z"},"links":{"citing_paper":"/paper/2504.12670"},"observation_digest":"sha256:c18193fd1ae1ecb0ea1add7df6bb38cf1909b786c00e9a1916488bd872ef45d5","observation_id":"20b7b6f7-a674-4ae4-b4d7-aff1bff427c5","resolution":{"observed_at":"2026-08-16T12:29:05.055519Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.07208","last_updated":"2025-08-27T08:09:06Z","snapshot_observed_at":"2026-08-17T02:40:18.869178Z","submitted_at":"2025-02-11T03:07:03Z","title":"Towards Understanding of Frequency Dependence on Sound Event Detection","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.07208","snapshot_observed_at":"2026-08-16T12:29:05.060221Z","title":"Towards understanding of frequency dependence on sound event detection,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2504.12670","last_updated":"2025-04-17T06:03:43Z","snapshot_observed_at":"2026-08-16T12:23:17.817807Z","submitted_at":"2025-04-17T06:03:43Z","title":"Temporal Attention Pooling for Frequency Dynamic Convolution in Sound Event Detection","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-16T12:29:05.060221Z"},"links":{"cited_paper":"/paper/2502.07208","citing_paper":"/paper/2504.12670"},"observation_digest":"sha256:dd5b9c704010dd5234478bcff1ef7a88e322200ea8dd1cb99ba7cbdcde3ce669","observation_id":"908d4601-0a86-40fe-b99e-f2823fcb5176","resolution":{"observed_at":"2026-08-16T12:29:05.060221Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T12:29:05.524140Z","title":"Application of spectro-temporal re- ceptive field on soft labeled sound event detection,","venue":null,"work_id":"4651843e-36be-4a97-9448-9891ab18c8ab","year":2023},"citing_paper":{"arxiv_id":"2504.12670","last_updated":"2025-04-17T06:03:43Z","snapshot_observed_at":"2026-08-16T12:23:17.817807Z","submitted_at":"2025-04-17T06:03:43Z","title":"Temporal Attention Pooling for Frequency Dynamic Convolution in Sound Event Detection","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-16T12:29:05.065264Z"},"links":{"citing_paper":"/paper/2504.12670"},"observation_digest":"sha256:2e604eefd9c7491dd72b145ec5cb524761f6bc2b938c6cad710ad3361515dad1","observation_id":"e709c8a0-0cf9-4c02-bc9f-a3fc8376dce6","resolution":{"observed_at":"2026-08-16T12:29:05.530208Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T12:29:05.509394Z","title":"Auditory neural response inspired sound event detection based on spectro-temporal receptive field,","venue":null,"work_id":"bae8b60e-1d55-451a-880a-c458a1e899df","year":2023},"citing_paper":{"arxiv_id":"2504.12670","last_updated":"2025-04-17T06:03:43Z","snapshot_observed_at":"2026-08-16T12:23:17.817807Z","submitted_at":"2025-04-17T06:03:43Z","title":"Temporal Attention Pooling for Frequency Dynamic Convolution in Sound Event Detection","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-16T12:29:05.070470Z"},"links":{"citing_paper":"/paper/2504.12670"},"observation_digest":"sha256:3c9d657d4fdb80ee6f2a4ff667d0540f62f144e637ceb8597185846c25771f31","observation_id":"9f19373d-446c-4f92-8f9a-674d2be5a9f1","resolution":{"observed_at":"2026-08-16T12:29:05.515048Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T12:29:05.495226Z","title":"Frequency & channel attention for computationally efficient sound event detection,","venue":null,"work_id":"aa35a040-6849-4672-a5d2-5e35d1df9613","year":2023},"citing_paper":{"arxiv_id":"2504.12670","last_updated":"2025-04-17T06:03:43Z","snapshot_observed_at":"2026-08-16T12:23:17.817807Z","submitted_at":"2025-04-17T06:03:43Z","title":"Temporal Attention Pooling for Frequency Dynamic Convolution in Sound Event Detection","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-16T12:29:05.074800Z"},"links":{"citing_paper":"/paper/2504.12670"},"observation_digest":"sha256:1c1902a90d0fea4b7dc07f14bcfc4ae9c513e920160bca69080d80e3ee0b53dc","observation_id":"cc5a81e7-a22f-4192-b989-f95ac06b2491","resolution":{"observed_at":"2026-08-16T12:29:05.499832Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T12:29:05.079274Z","title":"Diversifying and expanding frequency-adaptive convolution kernels for sound event detection,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2504.12670","last_updated":"2025-04-17T06:03:43Z","snapshot_observed_at":"2026-08-16T12:23:17.817807Z","submitted_at":"2025-04-17T06:03:43Z","title":"Temporal Attention Pooling for Frequency Dynamic Convolution in Sound Event Detection","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-16T12:29:05.079274Z"},"links":{"citing_paper":"/paper/2504.12670"},"observation_digest":"sha256:acce549458e5bd146758e26a1c39af8f2ebebe646e55acb78945a848905ba6e3","observation_id":"22af0dc0-2a65-4c0f-a087-f311e1452078","resolution":{"observed_at":"2026-08-16T12:29:05.079274Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.13312","last_updated":"2024-09-20T02:18:47Z","snapshot_observed_at":"2026-08-16T13:41:33.641896Z","submitted_at":"2024-06-19T08:02:02Z","title":"Pushing the Limit of Sound Event Detection with Multi-Dilated Frequency Dynamic Convolution","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.13312","snapshot_observed_at":"2026-08-16T12:29:05.085605Z","title":"Pushing the limit of sound event detec- tion with multi-dilated frequency dynamic convolution,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2504.12670","last_updated":"2025-04-17T06:03:43Z","snapshot_observed_at":"2026-08-16T12:23:17.817807Z","submitted_at":"2025-04-17T06:03:43Z","title":"Temporal Attention Pooling for Frequency Dynamic Convolution in Sound Event Detection","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-16T12:29:05.085605Z"},"links":{"cited_paper":"/paper/2406.13312","citing_paper":"/paper/2504.12670"},"observation_digest":"sha256:46189336efedbf5233970e6f76ed20beca214f95f3a3b1e7e2c1f4ac89770cb3","observation_id":"7b920093-f005-42ef-ac5f-5f967cae0afe","resolution":{"observed_at":"2026-08-16T12:29:05.085605Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T12:29:05.469376Z","title":"Semi-supervised learning-based sound event detection using frequency dynamic convolution with large kernel attention for DCASE challenge 2023 task 4,","venue":null,"work_id":"d8b464eb-62fe-49fd-b8fa-fedf4caa15e1","year":2023},"citing_paper":{"arxiv_id":"2504.12670","last_updated":"2025-04-17T06:03:43Z","snapshot_observed_at":"2026-08-16T12:23:17.817807Z","submitted_at":"2025-04-17T06:03:43Z","title":"Temporal Attention Pooling for Frequency Dynamic Convolution in Sound Event Detection","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-16T12:29:05.090983Z"},"links":{"citing_paper":"/paper/2504.12670"},"observation_digest":"sha256:e353634ab472ceac222beae31a5b649058a2132126871729ebeba07ee6e59e46","observation_id":"15af01e6-6655-4f15-baa8-6e598e2ed489","resolution":{"observed_at":"2026-08-16T12:29:05.475425Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T12:29:05.454918Z","title":"Sound event detection with weak prediction for dcase 2023 challenge task4a,","venue":null,"work_id":"7d28dd59-6f56-44e7-a75b-d80a0e831472","year":2023},"citing_paper":{"arxiv_id":"2504.12670","last_updated":"2025-04-17T06:03:43Z","snapshot_observed_at":"2026-08-16T12:23:17.817807Z","submitted_at":"2025-04-17T06:03:43Z","title":"Temporal Attention Pooling for Frequency Dynamic Convolution in Sound Event Detection","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-16T12:29:05.095659Z"},"links":{"citing_paper":"/paper/2504.12670"},"observation_digest":"sha256:b0fa85c8a029018f42c005320ac6f4910a41fd63faf5ab0d71a358e34c333327","observation_id":"4e362e9a-1689-47fe-a3e4-4b8522984685","resolution":{"observed_at":"2026-08-16T12:29:05.459715Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T12:29:05.439510Z","title":"Improving audio spectrogram transformers for sound event detection through multi- stage training,","venue":null,"work_id":"775805bd-7799-451b-b99d-338f5b8a2351","year":2024},"citing_paper":{"arxiv_id":"2504.12670","last_updated":"2025-04-17T06:03:43Z","snapshot_observed_at":"2026-08-16T12:23:17.817807Z","submitted_at":"2025-04-17T06:03:43Z","title":"Temporal Attention Pooling for Frequency Dynamic Convolution in Sound Event Detection","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-16T12:29:05.100233Z"},"links":{"citing_paper":"/paper/2504.12670"},"observation_digest":"sha256:21952302ea71badf9cac975674d4cdc6babaebe265aedd67ce4052f0710975d2","observation_id":"bf58bda0-c843-4c4f-b811-512f48df98b3","resolution":{"observed_at":"2026-08-16T12:29:05.443998Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T12:29:05.423273Z","title":"Self training and ensembling frequency dependent networks with coarse prediction pooling and sound event bounding boxes,","venue":null,"work_id":"6a785463-5600-4f42-a281-febde08dc8e5","year":2024},"citing_paper":{"arxiv_id":"2504.12670","last_updated":"2025-04-17T06:03:43Z","snapshot_observed_at":"2026-08-16T12:23:17.817807Z","submitted_at":"2025-04-17T06:03:43Z","title":"Temporal Attention Pooling for Frequency Dynamic Convolution in Sound Event Detection","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-16T12:29:05.104778Z"},"links":{"citing_paper":"/paper/2504.12670"},"observation_digest":"sha256:5eb9e5ac1823fd3e492dbb7b0782f995f21079b36f135a89c933d7959b417fdd","observation_id":"d7232c95-ccdd-4039-8685-1ecbecade7ff","resolution":{"observed_at":"2026-08-16T12:29:05.429553Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T12:29:05.406238Z","title":"Mat-sed: A masked audio transformer with masked-reconstruction based pre-training for sound event detection,","venue":null,"work_id":"2845da18-dfe6-4af5-bad7-d23a286c80ac","year":2024},"citing_paper":{"arxiv_id":"2504.12670","last_updated":"2025-04-17T06:03:43Z","snapshot_observed_at":"2026-08-16T12:23:17.817807Z","submitted_at":"2025-04-17T06:03:43Z","title":"Temporal Attention Pooling for Frequency Dynamic Convolution in Sound Event Detection","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-16T12:29:05.110319Z"},"links":{"citing_paper":"/paper/2504.12670"},"observation_digest":"sha256:074f4c070ee26166d1b8c4e2ea87a1818bfb61c1f32900d55ebe6ddb83681372","observation_id":"1df03faf-8fdf-45ac-a1ef-1d3a9764544a","resolution":{"observed_at":"2026-08-16T12:29:05.411529Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2409.17656","last_updated":"2024-09-26T09:07:20Z","snapshot_observed_at":"2026-08-18T06:49:53.689129Z","submitted_at":"2024-09-26T09:07:20Z","title":"Prototype based Masked Audio Model for Self-Supervised Learning of Sound Event Detection","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.17656","snapshot_observed_at":"2026-08-16T12:29:05.118023Z","title":"Prototype based masked audio model for self-supervised learning of sound event detection,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2504.12670","last_updated":"2025-04-17T06:03:43Z","snapshot_observed_at":"2026-08-16T12:23:17.817807Z","submitted_at":"2025-04-17T06:03:43Z","title":"Temporal Attention Pooling for Frequency Dynamic Convolution in Sound Event Detection","version":1},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-16T12:29:05.118023Z"},"links":{"cited_paper":"/paper/2409.17656","citing_paper":"/paper/2504.12670"},"observation_digest":"sha256:3297702fc19b3786600ebc48c56a55549cbd5d25375b256b47c05c12e49c3f6e","observation_id":"7d9cada6-a430-4bd5-8341-0eba1e77e148","resolution":{"observed_at":"2026-08-16T12:29:05.118023Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T12:29:05.389181Z","title":"Convolution-augmented transformer for semi-supervised sound event detection,","venue":null,"work_id":"a72ad556-3bd6-4edc-8eaa-298425203fd3","year":2020},"citing_paper":{"arxiv_id":"2504.12670","last_updated":"2025-04-17T06:03:43Z","snapshot_observed_at":"2026-08-16T12:23:17.817807Z","submitted_at":"2025-04-17T06:03:43Z","title":"Temporal Attention Pooling for Frequency Dynamic Convolution in Sound Event Detection","version":1},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-16T12:29:05.124882Z"},"links":{"citing_paper":"/paper/2504.12670"},"observation_digest":"sha256:0faaa256e7af2a0f59659d5cf34d471de07b5b73339d3edfe441f4c2472dc1d7","observation_id":"a5260876-76bf-424c-a6f0-b76d3c9ca587","resolution":{"observed_at":"2026-08-16T12:29:05.394658Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T12:29:05.372598Z","title":"Zheng ustc team’s submission for dcase2021 task4 – semi-supervised sound event detection,","venue":null,"work_id":"5756fa3b-ee01-4c2a-a0af-e07a51e43d6f","year":2021},"citing_paper":{"arxiv_id":"2504.12670","last_updated":"2025-04-17T06:03:43Z","snapshot_observed_at":"2026-08-16T12:23:17.817807Z","submitted_at":"2025-04-17T06:03:43Z","title":"Temporal Attention Pooling for Frequency Dynamic Convolution in Sound Event Detection","version":1},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-16T12:29:05.129735Z"},"links":{"citing_paper":"/paper/2504.12670"},"observation_digest":"sha256:0d7b3fe3acc3364e9bcb02a7aa5f528db004a46da03f88f433c5e03e31ea263e","observation_id":"4c6d00cb-bc7b-4dc5-a02a-c78d60ce9c58","resolution":{"observed_at":"2026-08-16T12:29:05.377629Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T12:29:05.136052Z","title":"Heavily augmented sound event detection utilizing weak predictions,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2504.12670","last_updated":"2025-04-17T06:03:43Z","snapshot_observed_at":"2026-08-16T12:23:17.817807Z","submitted_at":"2025-04-17T06:03:43Z","title":"Temporal Attention Pooling for Frequency Dynamic Convolution in Sound Event Detection","version":1},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-16T12:29:05.136052Z"},"links":{"citing_paper":"/paper/2504.12670"},"observation_digest":"sha256:e95873d44c1ee12a8e230b958fd90fe433a7d262afcc24ee53765e49597e2d18","observation_id":"510e8b53-dff0-4f63-8987-82187a2e8598","resolution":{"observed_at":"2026-08-16T12:29:05.136052Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T12:29:05.347665Z","title":"Frequency dependent sound event detection for dcase 2022 challenge task 4,","venue":null,"work_id":"20f6dbf3-501a-4ca0-95e9-483af543b78d","year":2022},"citing_paper":{"arxiv_id":"2504.12670","last_updated":"2025-04-17T06:03:43Z","snapshot_observed_at":"2026-08-16T12:23:17.817807Z","submitted_at":"2025-04-17T06:03:43Z","title":"Temporal Attention Pooling for Frequency Dynamic Convolution in Sound Event Detection","version":1},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-16T12:29:05.141219Z"},"links":{"citing_paper":"/paper/2504.12670"},"observation_digest":"sha256:f1c074d316aef7a2632659afe90699e437e1a31f06bd6d767dd98f34c988cd6d","observation_id":"b235a158-00b3-4b3b-9514-f383d6e9254d","resolution":{"observed_at":"2026-08-16T12:29:05.351716Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T12:29:05.332820Z","title":"Multi-dimensional frequency dynamic convolution with confident mean teacher for sound event detection,","venue":null,"work_id":"6ed82674-cd8d-4c55-bf70-9ff00f021676","year":2023},"citing_paper":{"arxiv_id":"2504.12670","last_updated":"2025-04-17T06:03:43Z","snapshot_observed_at":"2026-08-16T12:23:17.817807Z","submitted_at":"2025-04-17T06:03:43Z","title":"Temporal Attention Pooling for Frequency Dynamic Convolution in Sound Event Detection","version":1},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-08-16T12:29:05.147511Z"},"links":{"citing_paper":"/paper/2504.12670"},"observation_digest":"sha256:f9799038662adc4f709d63fc0226c19f197ecbce8ceebc2bbf940e3db6ef4058","observation_id":"d52be8f4-ace0-495d-897e-374070c5b77f","resolution":{"observed_at":"2026-08-16T12:29:05.338755Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T12:29:05.316288Z","title":"How information on soft labels and hard labels mutually benefits sound event detection tasks,","venue":null,"work_id":"e3362823-6c1b-47dd-af0c-ce951a4f0a2b","year":2023},"citing_paper":{"arxiv_id":"2504.12670","last_updated":"2025-04-17T06:03:43Z","snapshot_observed_at":"2026-08-16T12:23:17.817807Z","submitted_at":"2025-04-17T06:03:43Z","title":"Temporal Attention Pooling for Frequency Dynamic Convolution in Sound Event Detection","version":1},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-08-16T12:29:05.153062Z"},"links":{"citing_paper":"/paper/2504.12670"},"observation_digest":"sha256:2b3e1f394f562633862d3af9d591202ebdedcf9d1ca01e4877895f28c0040b8b","observation_id":"722d5bbe-d926-4e4d-8ca7-a097a82a6337","resolution":{"observed_at":"2026-08-16T12:29:05.321931Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T12:29:05.157669Z","title":"Self training and ensembling frequency dependent networks with coarse prediction pooling and sound event bounding boxes,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2504.12670","last_updated":"2025-04-17T06:03:43Z","snapshot_observed_at":"2026-08-16T12:23:17.817807Z","submitted_at":"2025-04-17T06:03:43Z","title":"Temporal Attention Pooling for Frequency Dynamic Convolution in Sound Event Detection","version":1},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-08-16T12:29:05.157669Z"},"links":{"citing_paper":"/paper/2504.12670"},"observation_digest":"sha256:98beaa0d5edf13053f6071a22780b692efa2140842068f5f5b07e7dede764066","observation_id":"d90fe9e0-c445-4479-b2e8-05123e7340ed","resolution":{"observed_at":"2026-08-16T12:29:05.157669Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T12:29:05.293656Z","title":"Mean teachers are better role mod- els: Weight-averaged consistency targets improve semi-supervised deep learning results,","venue":null,"work_id":"cd0bfcf4-304f-4049-afa6-bf54b336c482","year":2017},"citing_paper":{"arxiv_id":"2504.12670","last_updated":"2025-04-17T06:03:43Z","snapshot_observed_at":"2026-08-16T12:23:17.817807Z","submitted_at":"2025-04-17T06:03:43Z","title":"Temporal Attention Pooling for Frequency Dynamic Convolution in Sound Event Detection","version":1},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-08-16T12:29:05.162821Z"},"links":{"citing_paper":"/paper/2504.12670"},"observation_digest":"sha256:d33ad5087e3c4c4161aba84ec63b11cef6fd2215649dc22a5f7bc74dbce4b734","observation_id":"6c85af4a-1028-4ed0-ba9f-7458f062ddf5","resolution":{"observed_at":"2026-08-16T12:29:05.299014Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T12:29:05.166971Z","title":"mixup: Beyond empirical risk minimization,","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2504.12670","last_updated":"2025-04-17T06:03:43Z","snapshot_observed_at":"2026-08-16T12:23:17.817807Z","submitted_at":"2025-04-17T06:03:43Z","title":"Temporal Attention Pooling for Frequency Dynamic Convolution in Sound Event Detection","version":1},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-08-16T12:29:05.166971Z"},"links":{"citing_paper":"/paper/2504.12670"},"observation_digest":"sha256:97f9934924a18c82d087ce17190bd1e9c5d867690d9f799b907383d14ffa585f","observation_id":"9298057f-c611-44c8-8b69-9e4b399ebd74","resolution":{"observed_at":"2026-08-16T12:29:05.166971Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T12:29:05.270849Z","title":"Sound event bounding boxes,","venue":null,"work_id":"1bf09c47-6818-4dcd-a541-8c2b13f8e863","year":2024},"citing_paper":{"arxiv_id":"2504.12670","last_updated":"2025-04-17T06:03:43Z","snapshot_observed_at":"2026-08-16T12:23:17.817807Z","submitted_at":"2025-04-17T06:03:43Z","title":"Temporal Attention Pooling for Frequency Dynamic Convolution in Sound Event Detection","version":1},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-08-16T12:29:05.170965Z"},"links":{"citing_paper":"/paper/2504.12670"},"observation_digest":"sha256:7a5726873e25f3537a20e858914e2bf2c7a620b101fa9a4f53b6842440a093da","observation_id":"18dac49f-1e1f-4ac9-9a61-ac171c9dd56f","resolution":{"observed_at":"2026-08-16T12:29:05.276012Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2504.12670","last_updated":"2025-04-17T06:03:43Z","latest_version":1,"primary_category":"eess.AS","snapshot_observed_at":"2026-08-16T12:23:17.817807Z","submitted_at":"2025-04-17T06:03:43Z","title":"Temporal Attention Pooling for Frequency Dynamic Convolution in Sound Event Detection"},"reference_resolution":{"displayed":59,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":38,"verified_exact":0,"verified_fuzzy":21},"total_outbound_references":59},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"thesis":"As of 23 August 2026, this Paper Citation Record lists 59 of 59 outbound references and 2 inbound Pith citation observations for arXiv:2504.12670."}