{"as_of":"2026-08-18T19:14:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:e3359391721aa0fa70857a8e99a27e50bbd3b79478b54ccdff92a044005b6d76","coverage":[{"denominator":49,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":49,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-09T12:27:19.487461Z","state":"measured"},{"denominator":49,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":49,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-18T06:34:40.430872+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2502.02366/citation-record","integrity":"/paper/2502.02366/integrity","json":"/paper/2502.02366/citation-record.json","paper":"/paper/2502.02366"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T12:27:19.256603Z","title":"PANNs: Large-Scale Pretrained Audio Neural Networks for Audio Pattern Recognition,","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2502.02366","last_updated":"2025-02-04T14:50:12Z","snapshot_observed_at":"2026-08-14T12:24:51.612317Z","submitted_at":"2025-02-04T14:50:12Z","title":"Self-Supervised Convolutional Audio Models are Flexible Acoustic Feature Learners: A Domain Specificity and Transfer-Learning Study","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-09T12:27:19.256603Z"},"links":{"citing_paper":"/paper/2502.02366"},"observation_digest":"sha256:445386281fd5eb1bca41b7626fb7ba7d9adae96f3d8e46565538f7e549fbac79","observation_id":"f22b93c6-b266-49fe-8059-01aa1f00697d","resolution":{"observed_at":"2026-08-09T12:27:19.256603Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T12:27:21.154400Z","title":"Embeddings for up to 2000 random samples from the validation partition of select datasets representing speech, non-speech and VAD audio domains","venue":null,"work_id":"5155e186-110b-4e65-8752-bf4fa5b75a12","year":2000},"citing_paper":{"arxiv_id":"2502.02366","last_updated":"2025-02-04T14:50:12Z","snapshot_observed_at":"2026-08-14T12:24:51.612317Z","submitted_at":"2025-02-04T14:50:12Z","title":"Self-Supervised Convolutional Audio Models are Flexible Acoustic Feature Learners: A Domain Specificity and Transfer-Learning Study","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-09T12:27:19.250437Z"},"links":{"citing_paper":"/paper/2502.02366"},"observation_digest":"sha256:7734b81ef031de198c152c9468636b081ef17b901709a361bc06bdb1b7987034","observation_id":"42358cba-21a7-4453-9d26-22cddc5d4bff","resolution":{"observed_at":"2026-08-09T12:27:21.159538Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T12:27:19.271776Z","title":"Using State of the Art Speaker Recognition and Natural Language Processing Technologies to Detect Alzheimer’s Disease and Assess its Severity,","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2502.02366","last_updated":"2025-02-04T14:50:12Z","snapshot_observed_at":"2026-08-14T12:24:51.612317Z","submitted_at":"2025-02-04T14:50:12Z","title":"Self-Supervised Convolutional Audio Models are Flexible Acoustic Feature Learners: A Domain Specificity and Transfer-Learning Study","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-09T12:27:19.271776Z"},"links":{"citing_paper":"/paper/2502.02366"},"observation_digest":"sha256:c2f8eb23ee6cedc9feb22c7f138b5c255a3e126c99a12e554ad10d6eaa067750","observation_id":"e57ecd9a-7554-4c9d-bcd5-aafea976dbb3","resolution":{"observed_at":"2026-08-09T12:27:19.271776Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T12:27:21.137813Z","title":"wav2vec 2.0: A Framework for Self-Supervised Learning of Speech Representations,","venue":null,"work_id":"27b7f179-f0aa-4757-913e-92307aefa3b3","year":2020},"citing_paper":{"arxiv_id":"2502.02366","last_updated":"2025-02-04T14:50:12Z","snapshot_observed_at":"2026-08-14T12:24:51.612317Z","submitted_at":"2025-02-04T14:50:12Z","title":"Self-Supervised Convolutional Audio Models are Flexible Acoustic Feature Learners: A Domain Specificity and Transfer-Learning Study","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-09T12:27:19.261659Z"},"links":{"citing_paper":"/paper/2502.02366"},"observation_digest":"sha256:41d3af93c016c4e6365b924631d389f88b0afc7c007459ea04ebf8c902650664","observation_id":"dc4165f4-1aa9-41f7-bc33-719a3bbcde75","resolution":{"observed_at":"2026-08-09T12:27:21.143137Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.1073/pnas.2004702117","metadata_source":"openalex","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T05:30:23.456663Z","title":"Characterizing soundscapes across diverse ecosystems using a universal acoustic feature set,","venue":"Proceedings of the National Academy of Sciences","work_id":"6f3bb9c0-a8d0-4d10-bfc7-b4bd7d0878ba","year":2020},"citing_paper":{"arxiv_id":"2502.02366","last_updated":"2025-02-04T14:50:12Z","snapshot_observed_at":"2026-08-14T12:24:51.612317Z","submitted_at":"2025-02-04T14:50:12Z","title":"Self-Supervised Convolutional Audio Models are Flexible Acoustic Feature Learners: A Domain Specificity and Transfer-Learning Study","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-09T12:27:19.282694Z"},"links":{"citing_paper":"/paper/2502.02366"},"observation_digest":"sha256:921cab3b24d31a064f5ac59620ce8eb0aec2f498d29d0231dd5d3c02d3332dfd","observation_id":"d362b1a4-41e5-4904-8248-60c7a41cf417","resolution":{"observed_at":"2026-08-09T12:27:20.051458Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T12:27:19.287723Z","title":"Soundscapes and deep learning enable tracking biodiversity recovery in tropical forests,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2502.02366","last_updated":"2025-02-04T14:50:12Z","snapshot_observed_at":"2026-08-14T12:24:51.612317Z","submitted_at":"2025-02-04T14:50:12Z","title":"Self-Supervised Convolutional Audio Models are Flexible Acoustic Feature Learners: A Domain Specificity and Transfer-Learning Study","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-09T12:27:19.287723Z"},"links":{"citing_paper":"/paper/2502.02366"},"observation_digest":"sha256:3757b4b1582c1d6bc1dac881831fa5384a88d3fb97df797271bfb4e9dad55b52","observation_id":"26e6edd9-68e2-4b4d-b8e1-86c32ed79e01","resolution":{"observed_at":"2026-08-09T12:27:19.287723Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T12:27:19.277150Z","title":"Using X-Vectors to Automatically Detect Parkinson’s Disease from Speech,","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2502.02366","last_updated":"2025-02-04T14:50:12Z","snapshot_observed_at":"2026-08-14T12:24:51.612317Z","submitted_at":"2025-02-04T14:50:12Z","title":"Self-Supervised Convolutional Audio Models are Flexible Acoustic Feature Learners: A Domain Specificity and Transfer-Learning Study","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-09T12:27:19.277150Z"},"links":{"citing_paper":"/paper/2502.02366"},"observation_digest":"sha256:a913d3e8b23a36dd910314b71e1e0f867226a994d12a6d79c9a22ac4095dc286","observation_id":"0ed909f8-a55a-4391-8c4e-b41ddafeec3d","resolution":{"observed_at":"2026-08-09T12:27:19.277150Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1807.03748","last_updated":"2019-01-22T18:47:12Z","snapshot_observed_at":"2026-08-14T18:53:38.574749Z","submitted_at":"2018-07-10T16:52:11Z","title":"Representation Learning with Contrastive Predictive Coding","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1807.03748","snapshot_observed_at":"2026-08-09T12:27:19.297365Z","title":"Representation Learning with Contrastive Predictive Coding,","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2502.02366","last_updated":"2025-02-04T14:50:12Z","snapshot_observed_at":"2026-08-14T12:24:51.612317Z","submitted_at":"2025-02-04T14:50:12Z","title":"Self-Supervised Convolutional Audio Models are Flexible Acoustic Feature Learners: A Domain Specificity and Transfer-Learning Study","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-09T12:27:19.297365Z"},"links":{"cited_paper":"/paper/1807.03748","citing_paper":"/paper/2502.02366"},"observation_digest":"sha256:bff3c382320b9e56abbcefe3eea9d6eb99372c9811cb7ae3351656991fd1f2c0","observation_id":"249558b5-4a6a-4e15-af5e-751f385b1726","resolution":{"observed_at":"2026-08-09T12:27:19.297365Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2006.13979","last_updated":"2020-12-15T23:19:19Z","snapshot_observed_at":"2026-08-13T17:50:33.934751Z","submitted_at":"2020-06-24T18:25:05Z","title":"Unsupervised Cross-lingual Representation Learning for Speech Recognition","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2006.13979","snapshot_observed_at":"2026-08-09T12:27:19.302520Z","title":"Unsupervised Cross-lingual Representation Learning for Speech Recognition,","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2502.02366","last_updated":"2025-02-04T14:50:12Z","snapshot_observed_at":"2026-08-14T12:24:51.612317Z","submitted_at":"2025-02-04T14:50:12Z","title":"Self-Supervised Convolutional Audio Models are Flexible Acoustic Feature Learners: A Domain Specificity and Transfer-Learning Study","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-09T12:27:19.302520Z"},"links":{"cited_paper":"/paper/2006.13979","citing_paper":"/paper/2502.02366"},"observation_digest":"sha256:9804e1e942fa40e0d8ec99ffa7ae4ecc6639a916480525cd949f95623fd8b65f","observation_id":"53867186-9827-4bb7-a66c-f5990b2fb264","resolution":{"observed_at":"2026-08-09T12:27:19.302520Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2104.01027","last_updated":"2021-09-08T04:12:36Z","snapshot_observed_at":"2026-08-17T15:33:14.058250Z","submitted_at":"2021-04-02T12:53:15Z","title":"Robust wav2vec 2.0: Analyzing Domain Shift in Self-Supervised Pre-Training","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2104.01027","snapshot_observed_at":"2026-08-09T12:27:19.292513Z","title":"Robust wav2vec 2.0: Analyzing Domain Shift in Self-Supervised Pre-Training,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2502.02366","last_updated":"2025-02-04T14:50:12Z","snapshot_observed_at":"2026-08-14T12:24:51.612317Z","submitted_at":"2025-02-04T14:50:12Z","title":"Self-Supervised Convolutional Audio Models are Flexible Acoustic Feature Learners: A Domain Specificity and Transfer-Learning Study","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-09T12:27:19.292513Z"},"links":{"cited_paper":"/paper/2104.01027","citing_paper":"/paper/2502.02366"},"observation_digest":"sha256:abd23926a151991ed4fb984b0655c770aaaf0b694513c40661544e4b1b36d8d2","observation_id":"6293db8b-5677-47ad-92ae-2d5f5b9d0681","resolution":{"observed_at":"2026-08-09T12:27:19.292513Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T12:27:19.312022Z","title":"BYOL for Audio: Exploring Pre-Trained General-Purpose Audio Representations,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2502.02366","last_updated":"2025-02-04T14:50:12Z","snapshot_observed_at":"2026-08-14T12:24:51.612317Z","submitted_at":"2025-02-04T14:50:12Z","title":"Self-Supervised Convolutional Audio Models are Flexible Acoustic Feature Learners: A Domain Specificity and Transfer-Learning Study","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-09T12:27:19.312022Z"},"links":{"citing_paper":"/paper/2502.02366"},"observation_digest":"sha256:0b763122778b33be3f5954f971a2632e21a5340396bf43ff4448467576fb4e16","observation_id":"7cf3e73f-78d9-450d-b054-e0a62a91c99a","resolution":{"observed_at":"2026-08-09T12:27:19.312022Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2103.06695","last_updated":"2021-04-21T01:06:44Z","snapshot_observed_at":"2026-08-16T18:39:36.951766Z","submitted_at":"2021-03-11T14:32:33Z","title":"BYOL for Audio: Self-Supervised Learning for General-Purpose Audio Representation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2103.06695","snapshot_observed_at":"2026-08-09T12:27:19.316685Z","title":"BYOL for Audio: Self-Supervised Learning for General-Purpose Audio Representation,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2502.02366","last_updated":"2025-02-04T14:50:12Z","snapshot_observed_at":"2026-08-14T12:24:51.612317Z","submitted_at":"2025-02-04T14:50:12Z","title":"Self-Supervised Convolutional Audio Models are Flexible Acoustic Feature Learners: A Domain Specificity and Transfer-Learning Study","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-09T12:27:19.316685Z"},"links":{"cited_paper":"/paper/2103.06695","citing_paper":"/paper/2502.02366"},"observation_digest":"sha256:d97fc2f0deb0329f70cf2932d71c129d5c5f14cf231ca41ae2f14ea5a1f743b8","observation_id":"fd418345-df05-42d9-9378-9c66edf65639","resolution":{"observed_at":"2026-08-09T12:27:19.316685Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.48550/arxiv.2110.13900","metadata_source":"openalex","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T05:30:23.456663Z","title":"WavLM: Large-Scale Self-Supervised Pre-Training for Full Stack Speech Processing,","venue":"arXiv (Cornell University)","work_id":"7b3b9b7f-e7a5-43f6-a4ff-71be1c0859dc","year":2022},"citing_paper":{"arxiv_id":"2502.02366","last_updated":"2025-02-04T14:50:12Z","snapshot_observed_at":"2026-08-14T12:24:51.612317Z","submitted_at":"2025-02-04T14:50:12Z","title":"Self-Supervised Convolutional Audio Models are Flexible Acoustic Feature Learners: A Domain Specificity and Transfer-Learning Study","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-09T12:27:19.307198Z"},"links":{"citing_paper":"/paper/2502.02366"},"observation_digest":"sha256:bb81b12cdb6b86520d2037a704917fa56f6790438f4f5f946462e5949e262d12","observation_id":"ff44cd45-6874-4b15-ba76-f18e5df4f0e0","resolution":{"observed_at":"2026-08-09T12:27:19.973418Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1803.10609","last_updated":"2018-03-28T13:51:09Z","snapshot_observed_at":"2026-08-17T14:58:06.597034Z","submitted_at":"2018-03-28T13:51:09Z","title":"The fifth 'CHiME' Speech Separation and Recognition Challenge: Dataset, task and baselines","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1803.10609","snapshot_observed_at":"2026-08-09T12:27:19.333240Z","title":"The fifth ‘CHiME’ Speech Separation and Recognition Challenge: Dataset, task and baselines,","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2502.02366","last_updated":"2025-02-04T14:50:12Z","snapshot_observed_at":"2026-08-14T12:24:51.612317Z","submitted_at":"2025-02-04T14:50:12Z","title":"Self-Supervised Convolutional Audio Models are Flexible Acoustic Feature Learners: A Domain Specificity and Transfer-Learning Study","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-09T12:27:19.333240Z"},"links":{"cited_paper":"/paper/1803.10609","citing_paper":"/paper/2502.02366"},"observation_digest":"sha256:e82795c63294919d924b8e708a8bc843312b0c699ff515a99a12b1a3a31b5332","observation_id":"1f9be9d3-9ac4-4bfe-8c11-f17534111143","resolution":{"observed_at":"2026-08-09T12:27:19.333240Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.1007/s10579-007-9040-x","metadata_source":"openalex","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T05:30:23.456663Z","title":"Unleashing the killer corpus: experiences in creating the multi-everything AMI Meeting Corpus,","venue":"Computers and the Humanities","work_id":"57917be8-708d-429e-bb5b-5090ddf29eee","year":2007},"citing_paper":{"arxiv_id":"2502.02366","last_updated":"2025-02-04T14:50:12Z","snapshot_observed_at":"2026-08-14T12:24:51.612317Z","submitted_at":"2025-02-04T14:50:12Z","title":"Self-Supervised Convolutional Audio Models are Flexible Acoustic Feature Learners: A Domain Specificity and Transfer-Learning Study","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-09T12:27:19.339153Z"},"links":{"citing_paper":"/paper/2502.02366"},"observation_digest":"sha256:0fdcce959fe133935e6ac58fa9b94405fb2608e47d803c81b7f5202d93f0e3c8","observation_id":"e7bbcfef-e100-4020-833b-67ce9bf0711c","resolution":{"observed_at":"2026-08-09T12:27:19.857230Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T12:27:21.103054Z","title":"Common Voice: A Massively-Multilingual Speech Corpus,","venue":null,"work_id":"7e48aef2-7961-460d-8382-dba34af9a01f","year":2020},"citing_paper":{"arxiv_id":"2502.02366","last_updated":"2025-02-04T14:50:12Z","snapshot_observed_at":"2026-08-14T12:24:51.612317Z","submitted_at":"2025-02-04T14:50:12Z","title":"Self-Supervised Convolutional Audio Models are Flexible Acoustic Feature Learners: A Domain Specificity and Transfer-Learning Study","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-09T12:27:19.322091Z"},"links":{"citing_paper":"/paper/2502.02366"},"observation_digest":"sha256:2a90636cd658394675191b3829f0ff39b1916bdfe0b674582f405e36e5508539","observation_id":"ff13feae-5940-4199-94fc-d8c14ac8c2c5","resolution":{"observed_at":"2026-08-09T12:27:21.108393Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T12:27:21.086851Z","title":"Available: https://aclanthology.org/2020.lrec-1.520","venue":null,"work_id":"cc2353dc-b61a-4f5b-ae06-be6811b69517","year":2020},"citing_paper":{"arxiv_id":"2502.02366","last_updated":"2025-02-04T14:50:12Z","snapshot_observed_at":"2026-08-14T12:24:51.612317Z","submitted_at":"2025-02-04T14:50:12Z","title":"Self-Supervised Convolutional Audio Models are Flexible Acoustic Feature Learners: A Domain Specificity and Transfer-Learning Study","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-09T12:27:19.326958Z"},"links":{"citing_paper":"/paper/2502.02366"},"observation_digest":"sha256:00987d88a7f71495dfdf88ef5f0d7cb0332bf56a10a019e7441a3744cc4046cf","observation_id":"0b8535c4-248a-4dd8-b80e-e720f53b3633","resolution":{"observed_at":"2026-08-09T12:27:21.092504Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2007.44301","doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T12:27:20.649830Z","title":"Recognition and understanding of meetings the AMI and AMIDA projects,","venue":null,"work_id":"589ba9c8-158d-4032-87be-1e63f05c7c6d","year":2007},"citing_paper":{"arxiv_id":"2502.02366","last_updated":"2025-02-04T14:50:12Z","snapshot_observed_at":"2026-08-14T12:24:51.612317Z","submitted_at":"2025-02-04T14:50:12Z","title":"Self-Supervised Convolutional Audio Models are Flexible Acoustic Feature Learners: A Domain Specificity and Transfer-Learning Study","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-09T12:27:19.353246Z"},"links":{"citing_paper":"/paper/2502.02366"},"observation_digest":"sha256:cf71cd0afa10f882913c433385a46c8de3e8448800361778edad1be58b250a52","observation_id":"520a4489-9a03-4f98-a9f0-79822b649030","resolution":{"observed_at":"2026-08-09T12:27:20.657531Z","resolver_source":"raw_fallback","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T12:27:21.070181Z","title":"Enhancing the TED-LIUM Corpus with Selected Data for Language Modeling and More TED Talks,","venue":null,"work_id":"48f73ca2-3295-4520-94e8-7ed86b85b02f","year":2014},"citing_paper":{"arxiv_id":"2502.02366","last_updated":"2025-02-04T14:50:12Z","snapshot_observed_at":"2026-08-14T12:24:51.612317Z","submitted_at":"2025-02-04T14:50:12Z","title":"Self-Supervised Convolutional Audio Models are Flexible Acoustic Feature Learners: A Domain Specificity and Transfer-Learning Study","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-09T12:27:19.358039Z"},"links":{"citing_paper":"/paper/2502.02366"},"observation_digest":"sha256:b8b849354c37496a68d6da38a858ee93c3ae53ff327b9bf47a7562f0ff900449","observation_id":"74dc6609-6f2d-4697-a419-2495e7c30850","resolution":{"observed_at":"2026-08-09T12:27:21.075801Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T12:27:19.343966Z","title":"VoxCeleb: A Large-Scale Speaker Identification Dataset,","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2502.02366","last_updated":"2025-02-04T14:50:12Z","snapshot_observed_at":"2026-08-14T12:24:51.612317Z","submitted_at":"2025-02-04T14:50:12Z","title":"Self-Supervised Convolutional Audio Models are Flexible Acoustic Feature Learners: A Domain Specificity and Transfer-Learning Study","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-09T12:27:19.343966Z"},"links":{"citing_paper":"/paper/2502.02366"},"observation_digest":"sha256:e5e9e187ba048764310ffc2fee22fd6a882ca75d69fc045b392ce7041b760d5d","observation_id":"314f1b96-be1f-498b-bb11-68e5e25b1745","resolution":{"observed_at":"2026-08-09T12:27:19.343966Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T12:27:19.348655Z","title":"Librispeech: An ASR corpus based on public domain audio books,","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2502.02366","last_updated":"2025-02-04T14:50:12Z","snapshot_observed_at":"2026-08-14T12:24:51.612317Z","submitted_at":"2025-02-04T14:50:12Z","title":"Self-Supervised Convolutional Audio Models are Flexible Acoustic Feature Learners: A Domain Specificity and Transfer-Learning Study","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-09T12:27:19.348655Z"},"links":{"citing_paper":"/paper/2502.02366"},"observation_digest":"sha256:793fdc87a9af87a15dcddcb0213cf3576f1b00bb5679cc8a184c565783df7f67","observation_id":"b2a82536-1475-4947-9d6a-5802f59c35bd","resolution":{"observed_at":"2026-08-09T12:27:19.348655Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1807.09902","last_updated":"2018-10-07T02:25:28Z","snapshot_observed_at":"2026-08-17T14:02:58.750016Z","submitted_at":"2018-07-26T00:30:54Z","title":"General-purpose Tagging of Freesound Audio with AudioSet Labels: Task Description, Dataset, and Baseline","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1807.09902","snapshot_observed_at":"2026-08-09T12:27:19.373247Z","title":"General-purpose Tagging of Freesound Audio with AudioSet Labels: Task Description, Dataset, and Baseline,","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2502.02366","last_updated":"2025-02-04T14:50:12Z","snapshot_observed_at":"2026-08-14T12:24:51.612317Z","submitted_at":"2025-02-04T14:50:12Z","title":"Self-Supervised Convolutional Audio Models are Flexible Acoustic Feature Learners: A Domain Specificity and Transfer-Learning Study","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-09T12:27:19.373247Z"},"links":{"cited_paper":"/paper/1807.09902","citing_paper":"/paper/2502.02366"},"observation_digest":"sha256:b7ae451a1a7f2f251186598f651e59c9ec782dc4283bf2f2247b5f6bd6cdba8b","observation_id":"c0bbf53d-9141-497d-9450-cb929aabf208","resolution":{"observed_at":"2026-08-09T12:27:19.373247Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1906.02975","last_updated":"2020-01-20T00:26:57Z","snapshot_observed_at":"2026-08-14T16:19:22.195382Z","submitted_at":"2019-06-07T09:09:56Z","title":"Audio tagging with noisy labels and minimal supervision","version":4},"cited_work":{"arxiv_id":"1906.02975","doi":"10.48550/arxiv.1906.02975","metadata_source":"pith","pith_arxiv_id":"1906.02975","snapshot_observed_at":"2026-08-09T18:16:18.150856Z","title":"Audio tagging with noisy labels and minimal supervision","venue":"cs.SD","work_id":"3a39602d-c009-4ed3-8fb2-5a07bda8c5ab","year":2019},"citing_paper":{"arxiv_id":"2502.02366","last_updated":"2025-02-04T14:50:12Z","snapshot_observed_at":"2026-08-14T12:24:51.612317Z","submitted_at":"2025-02-04T14:50:12Z","title":"Self-Supervised Convolutional Audio Models are Flexible Acoustic Feature Learners: A Domain Specificity and Transfer-Learning Study","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-09T12:27:19.378879Z"},"links":{"cited_paper":"/paper/1906.02975","citing_paper":"/paper/2502.02366"},"observation_digest":"sha256:3c1720690c166cf11e2e062757bdc9608e7f62e5aff11ded0267e85208f37da5","observation_id":"86254a16-ab1c-4f01-99ba-f180d0b9b32a","resolution":{"observed_at":"2026-08-09T12:27:19.765128Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2102.01757","last_updated":"2021-06-15T03:36:12Z","snapshot_observed_at":"2026-08-16T18:48:10.996670Z","submitted_at":"2021-02-02T21:16:25Z","title":"The Multilingual TEDx Corpus for Speech Recognition and Translation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2102.01757","snapshot_observed_at":"2026-08-09T12:27:19.362872Z","title":"The Multilingual TEDx Corpus for Speech Recognition and Translation,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2502.02366","last_updated":"2025-02-04T14:50:12Z","snapshot_observed_at":"2026-08-14T12:24:51.612317Z","submitted_at":"2025-02-04T14:50:12Z","title":"Self-Supervised Convolutional Audio Models are Flexible Acoustic Feature Learners: A Domain Specificity and Transfer-Learning Study","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-09T12:27:19.362872Z"},"links":{"cited_paper":"/paper/2102.01757","citing_paper":"/paper/2502.02366"},"observation_digest":"sha256:d8df25e61a4409471078dea49e58d8e441759192b6010b2f6d5b97c6c4ec0af8","observation_id":"36c1e223-ea52-4c08-8b1e-ae6e318c66bd","resolution":{"observed_at":"2026-08-09T12:27:19.362872Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2009.05188","last_updated":"2020-09-11T01:19:12Z","snapshot_observed_at":"2026-08-17T16:41:50.962224Z","submitted_at":"2020-09-11T01:19:12Z","title":"SONYC-UST-V2: An Urban Sound Tagging Dataset with Spatiotemporal Context","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2009.05188","snapshot_observed_at":"2026-08-09T12:27:19.367959Z","title":"SONYC-UST-V2: An Urban Sound Tagging Dataset with Spatiotemporal Context,","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2502.02366","last_updated":"2025-02-04T14:50:12Z","snapshot_observed_at":"2026-08-14T12:24:51.612317Z","submitted_at":"2025-02-04T14:50:12Z","title":"Self-Supervised Convolutional Audio Models are Flexible Acoustic Feature Learners: A Domain Specificity and Transfer-Learning Study","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-09T12:27:19.367959Z"},"links":{"cited_paper":"/paper/2009.05188","citing_paper":"/paper/2502.02366"},"observation_digest":"sha256:5c28080bcfbb98bb4a78edf0c1e2d79ecc64e213254ace6dd0d85d288a1d15ea","observation_id":"2d3bd654-f1e8-4874-a971-b446dc5715f2","resolution":{"observed_at":"2026-08-09T12:27:19.367959Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1510.08484","last_updated":"2015-10-28T20:59:04Z","snapshot_observed_at":"2026-08-18T07:31:38.105834Z","submitted_at":"2015-10-28T20:59:04Z","title":"MUSAN: A Music, Speech, and Noise Corpus","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1510.08484","snapshot_observed_at":"2026-08-09T12:27:19.393622Z","title":"MUSAN: A Music, Speech, and Noise Corpus,","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2502.02366","last_updated":"2025-02-04T14:50:12Z","snapshot_observed_at":"2026-08-14T12:24:51.612317Z","submitted_at":"2025-02-04T14:50:12Z","title":"Self-Supervised Convolutional Audio Models are Flexible Acoustic Feature Learners: A Domain Specificity and Transfer-Learning Study","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-09T12:27:19.393622Z"},"links":{"cited_paper":"/paper/1510.08484","citing_paper":"/paper/2502.02366"},"observation_digest":"sha256:bdd63476a03ec06a6bfba66c7bbc4739737dca0847f290f3bee46fd09e49b249","observation_id":"c54c481e-8447-4f99-aa94-9734d26c196a","resolution":{"observed_at":"2026-08-09T12:27:19.393622Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1309.5275","last_updated":"2013-10-01T21:29:13Z","snapshot_observed_at":"2026-08-15T00:02:26.895672Z","submitted_at":"2013-09-20T14:12:04Z","title":"An open dataset for research on audio field recording archives: freefield1010","version":2},"cited_work":{"arxiv_id":"1309.5275","doi":"10.48550/arxiv.1309.5275","metadata_source":"pith","pith_arxiv_id":"1309.5275","snapshot_observed_at":"2026-08-10T05:30:23.456663Z","title":"An open dataset for research on audio field recording archives: freefield1010","venue":"cs.SD","work_id":"4f8722e1-0aea-4692-92bc-46d9b203e2de","year":2013},"citing_paper":{"arxiv_id":"2502.02366","last_updated":"2025-02-04T14:50:12Z","snapshot_observed_at":"2026-08-14T12:24:51.612317Z","submitted_at":"2025-02-04T14:50:12Z","title":"Self-Supervised Convolutional Audio Models are Flexible Acoustic Feature Learners: A Domain Specificity and Transfer-Learning Study","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-09T12:27:19.399285Z"},"links":{"cited_paper":"/paper/1309.5275","citing_paper":"/paper/2502.02366"},"observation_digest":"sha256:c9a527235f47b6c9dec45e938d65fb5dc541272d4e98134350971bd63730f494","observation_id":"14668544-0e06-48e2-a15d-8450110aadbb","resolution":{"observed_at":"2026-08-09T12:27:19.720639Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T12:27:19.384159Z","title":"FSD50K: An Open Dataset of Human-Labeled Sound Events,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2502.02366","last_updated":"2025-02-04T14:50:12Z","snapshot_observed_at":"2026-08-14T12:24:51.612317Z","submitted_at":"2025-02-04T14:50:12Z","title":"Self-Supervised Convolutional Audio Models are Flexible Acoustic Feature Learners: A Domain Specificity and Transfer-Learning Study","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-09T12:27:19.384159Z"},"links":{"citing_paper":"/paper/2502.02366"},"observation_digest":"sha256:62cc434cd1d9773ff08aa61761fc5911420ffbbc7a817894d1f98402e1c4d2b3","observation_id":"110d69d4-f231-4a14-aa5d-bfa7b7d19866","resolution":{"observed_at":"2026-08-09T12:27:19.384159Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T12:27:21.171913Z","title":null,"venue":null,"work_id":"1a448f2b-9fdc-4889-abd8-18da215a5530","year":null},"citing_paper":{"arxiv_id":"2502.02366","last_updated":"2025-02-04T14:50:12Z","snapshot_observed_at":"2026-08-14T12:24:51.612317Z","submitted_at":"2025-02-04T14:50:12Z","title":"Self-Supervised Convolutional Audio Models are Flexible Acoustic Feature Learners: A Domain Specificity and Transfer-Learning Study","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-09T12:27:19.244016Z"},"links":{"citing_paper":"/paper/2502.02366"},"observation_digest":"sha256:6994c51523281777762984d107d9ded6cea59c0745ea744f41cb6332cd85d889","observation_id":"1b64d332-ca61-423a-9c36-6ce02c484be4","resolution":{"observed_at":"2026-08-09T12:27:21.176477Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T12:27:19.388827Z","title":"Audio Set: An ontology and human-labeled dataset for audio events,","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2502.02366","last_updated":"2025-02-04T14:50:12Z","snapshot_observed_at":"2026-08-14T12:24:51.612317Z","submitted_at":"2025-02-04T14:50:12Z","title":"Self-Supervised Convolutional Audio Models are Flexible Acoustic Feature Learners: A Domain Specificity and Transfer-Learning Study","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-09T12:27:19.388827Z"},"links":{"citing_paper":"/paper/2502.02366"},"observation_digest":"sha256:128d690c9402403b2d27aeee475435a4f3304160bf15ca4b0d8e0eeeb52c751b","observation_id":"9b592abc-a6af-4bd6-a354-5a2856c81cb5","resolution":{"observed_at":"2026-08-09T12:27:19.388827Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T12:27:19.418526Z","title":"CNN architectures for large-scale audio classification,","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2502.02366","last_updated":"2025-02-04T14:50:12Z","snapshot_observed_at":"2026-08-14T12:24:51.612317Z","submitted_at":"2025-02-04T14:50:12Z","title":"Self-Supervised Convolutional Audio Models are Flexible Acoustic Feature Learners: A Domain Specificity and Transfer-Learning Study","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-09T12:27:19.418526Z"},"links":{"citing_paper":"/paper/2502.02366"},"observation_digest":"sha256:05378943528cf374b301a283d47778a33c2ab63e58c55cb4d522f8c4dcffebf8","observation_id":"20a62922-1eda-4a1f-ae5d-c67e70a5b59f","resolution":{"observed_at":"2026-08-09T12:27:19.418526Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1907.01160","last_updated":"2019-07-02T04:27:55Z","snapshot_observed_at":"2026-07-06T08:04:17.909965Z","submitted_at":"2019-07-02T04:27:55Z","title":"WHAM!: Extending Speech Separation to Noisy Environments","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1907.01160","snapshot_observed_at":"2026-08-09T12:27:19.404632Z","title":"WHAM!: Extending Speech Separation to Noisy Environments,","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2502.02366","last_updated":"2025-02-04T14:50:12Z","snapshot_observed_at":"2026-08-14T12:24:51.612317Z","submitted_at":"2025-02-04T14:50:12Z","title":"Self-Supervised Convolutional Audio Models are Flexible Acoustic Feature Learners: A Domain Specificity and Transfer-Learning Study","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-09T12:27:19.404632Z"},"links":{"cited_paper":"/paper/1907.01160","citing_paper":"/paper/2502.02366"},"observation_digest":"sha256:518c797ca232c260c98fc3cd1fb0c8fe50a4335ea1f18390053e0ae4867727e9","observation_id":"fb81c49d-4cbf-4b1e-9247-254b030e661e","resolution":{"observed_at":"2026-08-09T12:27:19.404632Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T12:27:21.052252Z","title":"Bootstrap your own latent a new approach to self-supervised learning,","venue":null,"work_id":"c6052e01-2377-420b-bc64-57f16deec155","year":2020},"citing_paper":{"arxiv_id":"2502.02366","last_updated":"2025-02-04T14:50:12Z","snapshot_observed_at":"2026-08-14T12:24:51.612317Z","submitted_at":"2025-02-04T14:50:12Z","title":"Self-Supervised Convolutional Audio Models are Flexible Acoustic Feature Learners: A Domain Specificity and Transfer-Learning Study","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-09T12:27:19.409636Z"},"links":{"citing_paper":"/paper/2502.02366"},"observation_digest":"sha256:5d3e492069be84e815f2cc4a4a28275b9e6d4678435090ff7ac852ed1182d328","observation_id":"8433630e-532e-4569-8d87-47c260851edb","resolution":{"observed_at":"2026-08-09T12:27:21.057812Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T12:27:19.413855Z","title":"MatchboxNet: 1D Time-Channel Separable Convolutional Neural Network Architecture for Speech Commands Recognition,","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2502.02366","last_updated":"2025-02-04T14:50:12Z","snapshot_observed_at":"2026-08-14T12:24:51.612317Z","submitted_at":"2025-02-04T14:50:12Z","title":"Self-Supervised Convolutional Audio Models are Flexible Acoustic Feature Learners: A Domain Specificity and Transfer-Learning Study","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-09T12:27:19.413855Z"},"links":{"citing_paper":"/paper/2502.02366"},"observation_digest":"sha256:042e38e92804d2077599b3b5546976da16cee312044acf173cb8346506522bf1","observation_id":"ec4dd20b-a7e9-4b7e-95c4-6c7677caec9e","resolution":{"observed_at":"2026-08-09T12:27:19.413855Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1804.03209","last_updated":"2018-04-09T19:58:17Z","snapshot_observed_at":"2026-08-15T16:28:51.252929Z","submitted_at":"2018-04-09T19:58:17Z","title":"Speech Commands: A Dataset for Limited-Vocabulary Speech Recognition","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1804.03209","snapshot_observed_at":"2026-08-09T12:27:19.436477Z","title":"Speech Commands: A Dataset for Limited-Vocabulary Speech Recognition,","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2502.02366","last_updated":"2025-02-04T14:50:12Z","snapshot_observed_at":"2026-08-14T12:24:51.612317Z","submitted_at":"2025-02-04T14:50:12Z","title":"Self-Supervised Convolutional Audio Models are Flexible Acoustic Feature Learners: A Domain Specificity and Transfer-Learning Study","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-09T12:27:19.436477Z"},"links":{"cited_paper":"/paper/1804.03209","citing_paper":"/paper/2502.02366"},"observation_digest":"sha256:570fda91b9ff78d2db3702e30331d9d3888d432e323e33ace76ded7a82632193","observation_id":"074a7df4-19ee-43f9-94eb-87bcdb907136","resolution":{"observed_at":"2026-08-09T12:27:19.436477Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2015.73243","doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T12:27:20.313976Z","title":"Environmental sound classification with convolutional neural networks,","venue":null,"work_id":"92384e6a-3ae0-40ea-88f0-7e00686a9fa1","year":2015},"citing_paper":{"arxiv_id":"2502.02366","last_updated":"2025-02-04T14:50:12Z","snapshot_observed_at":"2026-08-14T12:24:51.612317Z","submitted_at":"2025-02-04T14:50:12Z","title":"Self-Supervised Convolutional Audio Models are Flexible Acoustic Feature Learners: A Domain Specificity and Transfer-Learning Study","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-09T12:27:19.422945Z"},"links":{"citing_paper":"/paper/2502.02366"},"observation_digest":"sha256:d20519f3d85752693b68b2c05fb4dbbc636d8d3b57e94f3700b10c700255d94b","observation_id":"acd3b149-c1c7-4a2a-ab38-61d016f7b473","resolution":{"observed_at":"2026-08-09T12:27:20.321447Z","resolver_source":"raw_fallback","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T12:27:19.427052Z","title":"A Dataset and Taxonomy for Urban Sound Research,","venue":null,"work_id":null,"year":2014},"citing_paper":{"arxiv_id":"2502.02366","last_updated":"2025-02-04T14:50:12Z","snapshot_observed_at":"2026-08-14T12:24:51.612317Z","submitted_at":"2025-02-04T14:50:12Z","title":"Self-Supervised Convolutional Audio Models are Flexible Acoustic Feature Learners: A Domain Specificity and Transfer-Learning Study","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-09T12:27:19.427052Z"},"links":{"citing_paper":"/paper/2502.02366"},"observation_digest":"sha256:48f8cc5e058b521fa287a1f69176a9d385dc73cf28d22b171a672baa317e34b2","observation_id":"fe80b230-89ce-445f-9f8f-7be5761927af","resolution":{"observed_at":"2026-08-09T12:27:19.427052Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T12:27:21.034787Z","title":"Neural Audio Synthesis of Musical Notes with WaveNet Autoencoders,","venue":null,"work_id":"d217edef-1ef2-4d95-8051-af070f0378a7","year":2017},"citing_paper":{"arxiv_id":"2502.02366","last_updated":"2025-02-04T14:50:12Z","snapshot_observed_at":"2026-08-14T12:24:51.612317Z","submitted_at":"2025-02-04T14:50:12Z","title":"Self-Supervised Convolutional Audio Models are Flexible Acoustic Feature Learners: A Domain Specificity and Transfer-Learning Study","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-09T12:27:19.431944Z"},"links":{"citing_paper":"/paper/2502.02366"},"observation_digest":"sha256:c34896ca116cbe749fcdddb59a060db672113a540340bbbf59e47950c83d3648","observation_id":"0ca4c5ec-044d-4176-8293-d70414a0651d","resolution":{"observed_at":"2026-08-09T12:27:21.040629Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T12:27:19.441197Z","title":"CSTR VCTK Corpus: English Multi-speaker Corpus for CSTR Voice Cloning Toolkit (version 0.92),","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2502.02366","last_updated":"2025-02-04T14:50:12Z","snapshot_observed_at":"2026-08-14T12:24:51.612317Z","submitted_at":"2025-02-04T14:50:12Z","title":"Self-Supervised Convolutional Audio Models are Flexible Acoustic Feature Learners: A Domain Specificity and Transfer-Learning Study","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-09T12:27:19.441197Z"},"links":{"citing_paper":"/paper/2502.02366"},"observation_digest":"sha256:00bc9df7509d1880d90930a3905fab8cd4c90340d73ac48e13aebae7088e8ba3","observation_id":"53af1c20-6702-4b24-af27-330b3785cc1b","resolution":{"observed_at":"2026-08-09T12:27:19.441197Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1808.00606","last_updated":"2018-08-23T23:28:38Z","snapshot_observed_at":"2026-08-14T18:45:18.361006Z","submitted_at":"2018-08-02T00:13:11Z","title":"AVA-Speech: A Densely Labeled Dataset of Speech Activity in Movies","version":2},"cited_work":{"arxiv_id":"1808.00606","doi":"10.48550/arxiv.1808.00606","metadata_source":"pith","pith_arxiv_id":"1808.00606","snapshot_observed_at":"2026-08-10T05:30:23.456663Z","title":"AVA-Speech: A Densely Labeled Dataset of Speech Activity in Movies","venue":"cs.SD","work_id":"34ebf499-f10c-46c2-9b4a-3ef4a9534ce8","year":2018},"citing_paper":{"arxiv_id":"2502.02366","last_updated":"2025-02-04T14:50:12Z","snapshot_observed_at":"2026-08-14T12:24:51.612317Z","submitted_at":"2025-02-04T14:50:12Z","title":"Self-Supervised Convolutional Audio Models are Flexible Acoustic Feature Learners: A Domain Specificity and Transfer-Learning Study","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-09T12:27:19.446594Z"},"links":{"cited_paper":"/paper/1808.00606","citing_paper":"/paper/2502.02366"},"observation_digest":"sha256:1fc363c3722ea9d1fb8d142b4936180d36023cb5a73b38116120d0d5ea27bede","observation_id":"4c5150ae-374a-4d78-a102-d8f1a92e5417","resolution":{"observed_at":"2026-08-09T12:27:19.631797Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T12:27:19.451806Z","title":"Representational geometry: integrating cognition, computation, and the brain,","venue":null,"work_id":null,"year":2013},"citing_paper":{"arxiv_id":"2502.02366","last_updated":"2025-02-04T14:50:12Z","snapshot_observed_at":"2026-08-14T12:24:51.612317Z","submitted_at":"2025-02-04T14:50:12Z","title":"Self-Supervised Convolutional Audio Models are Flexible Acoustic Feature Learners: A Domain Specificity and Transfer-Learning Study","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-09T12:27:19.451806Z"},"links":{"citing_paper":"/paper/2502.02366"},"observation_digest":"sha256:8b71b8660ec5e8d6a5ec52d9287d09831f96227d4e8002cafbc164a3d275e7de","observation_id":"956c6d5a-f35a-423e-912e-b1bfa9ea51ad","resolution":{"observed_at":"2026-08-09T12:27:19.451806Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T12:27:19.456940Z","title":"The Timbre Toolbox: Extracting audio descriptors from musical signals,","venue":null,"work_id":null,"year":2011},"citing_paper":{"arxiv_id":"2502.02366","last_updated":"2025-02-04T14:50:12Z","snapshot_observed_at":"2026-08-14T12:24:51.612317Z","submitted_at":"2025-02-04T14:50:12Z","title":"Self-Supervised Convolutional Audio Models are Flexible Acoustic Feature Learners: A Domain Specificity and Transfer-Learning Study","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-09T12:27:19.456940Z"},"links":{"citing_paper":"/paper/2502.02366"},"observation_digest":"sha256:b0198c28baf9a9591e997ce0696c0b4eff57aafe1653e45ccd25b68079666d78","observation_id":"9a4ce4d0-467c-4015-a675-305a16683bf3","resolution":{"observed_at":"2026-08-09T12:27:19.456940Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.1371/journal.pcbi.1000302","metadata_source":"openalex","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T05:30:23.456663Z","title":"The Modulation Transfer Function for Speech Intelligibility,","venue":"PLoS Computational Biology","work_id":"e6557f39-2b94-4426-b04b-c315f64d8650","year":2009},"citing_paper":{"arxiv_id":"2502.02366","last_updated":"2025-02-04T14:50:12Z","snapshot_observed_at":"2026-08-14T12:24:51.612317Z","submitted_at":"2025-02-04T14:50:12Z","title":"Self-Supervised Convolutional Audio Models are Flexible Acoustic Feature Learners: A Domain Specificity and Transfer-Learning Study","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-09T12:27:19.462136Z"},"links":{"citing_paper":"/paper/2502.02366"},"observation_digest":"sha256:0e773ad084e595f8f95485f9b862a6ad6073124b3c29fd86652d74ae882cb1a9","observation_id":"d43fedd3-434b-4923-a10c-709ec2a3479b","resolution":{"observed_at":"2026-08-09T12:27:19.586295Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T12:27:19.467070Z","title":"YIN, a fundamental frequency estimator for speech and music,","venue":null,"work_id":null,"year":1917},"citing_paper":{"arxiv_id":"2502.02366","last_updated":"2025-02-04T14:50:12Z","snapshot_observed_at":"2026-08-14T12:24:51.612317Z","submitted_at":"2025-02-04T14:50:12Z","title":"Self-Supervised Convolutional Audio Models are Flexible Acoustic Feature Learners: A Domain Specificity and Transfer-Learning Study","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-09T12:27:19.467070Z"},"links":{"citing_paper":"/paper/2502.02366"},"observation_digest":"sha256:b2b6ccc9876dde0c614654e5d799f91f31032b4fa395d9537ba5cc44c25bd46f","observation_id":"8992706d-8d5d-49cc-bf50-e2ddb1370209","resolution":{"observed_at":"2026-08-09T12:27:19.467070Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T12:27:19.472186Z","title":"Acoustic Event Detection Using Speaker Recognition Techniques: Model Optimization and Explainable Features,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2502.02366","last_updated":"2025-02-04T14:50:12Z","snapshot_observed_at":"2026-08-14T12:24:51.612317Z","submitted_at":"2025-02-04T14:50:12Z","title":"Self-Supervised Convolutional Audio Models are Flexible Acoustic Feature Learners: A Domain Specificity and Transfer-Learning Study","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-09T12:27:19.472186Z"},"links":{"citing_paper":"/paper/2502.02366"},"observation_digest":"sha256:4ddb8e15500a2b4ee4bbd9926f671dc2f5aa3becd2c5ae06dcc70f540fb5a11b","observation_id":"6fdc6041-464b-43b8-8394-9cc7d6ab7f27","resolution":{"observed_at":"2026-08-09T12:27:19.472186Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2019.01594","doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T12:27:20.142002Z","title":"Acoustic Correlates of Auditory Object and Event Perception: Speakers, Musical Timbres, and Environmental Sounds,","venue":null,"work_id":"2dd9da46-eff0-4981-867a-d9729abcf003","year":2019},"citing_paper":{"arxiv_id":"2502.02366","last_updated":"2025-02-04T14:50:12Z","snapshot_observed_at":"2026-08-14T12:24:51.612317Z","submitted_at":"2025-02-04T14:50:12Z","title":"Self-Supervised Convolutional Audio Models are Flexible Acoustic Feature Learners: A Domain Specificity and Transfer-Learning Study","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-09T12:27:19.477019Z"},"links":{"citing_paper":"/paper/2502.02366"},"observation_digest":"sha256:2f879d6afb836fbc5156709ef1013fba76bcbff8037683c9e2fef208430d6a11","observation_id":"4323c434-8026-43df-94e6-1aba819f9913","resolution":{"observed_at":"2026-08-09T12:27:20.150848Z","resolver_source":"raw_fallback","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2210.14493","last_updated":"2022-10-26T05:38:50Z","snapshot_observed_at":"2026-08-16T16:21:04.946280Z","submitted_at":"2022-10-26T05:38:50Z","title":"AVES: Animal Vocalization Encoder based on Self-Supervision","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2210.14493","snapshot_observed_at":"2026-08-09T12:27:19.482197Z","title":"AVES: Animal Vocalization Encoder based on Self-Supervision,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2502.02366","last_updated":"2025-02-04T14:50:12Z","snapshot_observed_at":"2026-08-14T12:24:51.612317Z","submitted_at":"2025-02-04T14:50:12Z","title":"Self-Supervised Convolutional Audio Models are Flexible Acoustic Feature Learners: A Domain Specificity and Transfer-Learning Study","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-09T12:27:19.482197Z"},"links":{"cited_paper":"/paper/2210.14493","citing_paper":"/paper/2502.02366"},"observation_digest":"sha256:b158139d20a3f417fcc9e4f0bda96fbcee983a49a1f10d1d88a42e0886fcd6cc","observation_id":"aca9b87a-2b79-439c-849e-90e5273d74cb","resolution":{"observed_at":"2026-08-09T12:27:19.482197Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2104.02133","last_updated":"2021-04-27T13:23:27Z","snapshot_observed_at":"2026-08-18T11:04:01.689399Z","submitted_at":"2021-04-05T20:13:36Z","title":"SpeechStew: Simply Mix All Available Speech Recognition Data to Train One Large Neural Network","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2104.02133","snapshot_observed_at":"2026-08-09T12:27:19.487461Z","title":"SpeechStew: Simply Mix All Available Speech Recognition Data to Train One Large Neural Network,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2502.02366","last_updated":"2025-02-04T14:50:12Z","snapshot_observed_at":"2026-08-14T12:24:51.612317Z","submitted_at":"2025-02-04T14:50:12Z","title":"Self-Supervised Convolutional Audio Models are Flexible Acoustic Feature Learners: A Domain Specificity and Transfer-Learning Study","version":1},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-09T12:27:19.487461Z"},"links":{"cited_paper":"/paper/2104.02133","citing_paper":"/paper/2502.02366"},"observation_digest":"sha256:6d6073a626a38dee929b2a39d856137aa1faeac0aeda50906b43245e62c9640c","observation_id":"1d76a4ec-b7cf-4bbe-82ce-6e655527bbe9","resolution":{"observed_at":"2026-08-09T12:27:19.487461Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T12:27:21.120552Z","title":"Available: https://proceedings.neurips.cc/paper/2020/hash/92d1e1eb1cd6f9fba3227870bb6d7f07-Abstract.html","venue":null,"work_id":"5401b0fe-83b7-4627-9e0f-966c7297449b","year":2020},"citing_paper":{"arxiv_id":"2502.02366","last_updated":"2025-02-04T14:50:12Z","snapshot_observed_at":"2026-08-14T12:24:51.612317Z","submitted_at":"2025-02-04T14:50:12Z","title":"Self-Supervised Convolutional Audio Models are Flexible Acoustic Feature Learners: A Domain Specificity and Transfer-Learning Study","version":1},"reference_index":2024,"source":"pdf_text","source_observed_at":"2026-08-09T12:27:19.266785Z"},"links":{"citing_paper":"/paper/2502.02366"},"observation_digest":"sha256:a4a5ff611a8ec993690043805489f5749fadd3b0eb1850a8b6ff03da0d3882f4","observation_id":"a6dbf56d-3d40-4535-a098-7f095a33addc","resolution":{"observed_at":"2026-08-09T12:27:21.126288Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2502.02366","last_updated":"2025-02-04T14:50:12Z","latest_version":1,"primary_category":"eess.AS","snapshot_observed_at":"2026-08-14T12:24:51.612317Z","submitted_at":"2025-02-04T14:50:12Z","title":"Self-Supervised Convolutional Audio Models are Flexible Acoustic Feature Learners: A Domain Specificity and Transfer-Learning Study"},"reference_resolution":{"displayed":49,"state_counts":{"malformed_identifier":0,"metadata_mismatch":2,"parse_uncertain":0,"unresolved":31,"verified_exact":8,"verified_fuzzy":8},"total_outbound_references":49},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"thesis":"As of 18 August 2026, this Paper Citation Record lists 49 of 49 outbound references and 0 inbound Pith citation observations for arXiv:2502.02366."}