{"as_of":"2026-08-16T11:28:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:e4093ee33deb6d9774e279fbe6ddff85f75f1c7d437daaf9796b836228dc3b05","coverage":[{"denominator":35,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":35,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-10T14:27:09.170151Z","state":"measured"},{"denominator":36,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":36,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-16T06:30:59.297886+00:00","state":"measured"},{"denominator":1,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":1,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-06T16:13:20.213020Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"pith","source_observed_at":"2026-08-06T16:13:20.931322Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2501.15302","last_updated":"2025-01-25T18:56:40Z","snapshot_observed_at":"2026-08-15T07:52:08.510292Z","submitted_at":"2025-01-25T18:56:40Z","title":"The ICME 2025 Audio Encoder Capability Challenge","version":1},"cited_work":{"arxiv_id":"2501.15302","doi":null,"metadata_source":"pith","pith_arxiv_id":"2501.15302","snapshot_observed_at":"2026-08-06T16:13:20.931322Z","title":"The ICME 2025 Audio Encoder Capability Challenge","venue":"cs.SD","work_id":"044573d7-fc54-4fbb-bd1d-f240d412dc32","year":2025},"citing_paper":{"arxiv_id":"2507.14129","last_updated":"2026-07-13T00:23:40Z","snapshot_observed_at":"2026-08-13T08:54:20.630927Z","submitted_at":"2025-07-18T17:57:46Z","title":"OpenBEATs: A Fully Open-Source General-Purpose Audio Encoder","version":2},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-06T16:13:20.213020Z"},"links":{"cited_paper":"/paper/2501.15302","citing_paper":"/paper/2507.14129"},"observation_digest":"sha256:4e6b48e06b197e9728c526af4d894a39f61ab7e0e093da74bab16960ddf1d7ee","observation_id":"ee2596fe-f80a-466a-af9c-fdd960cdf5e5","resolution":{"observed_at":"2026-08-06T16:13:20.989094Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2501.15302/citation-record","integrity":"/paper/2501.15302/integrity","json":"/paper/2501.15302/citation-record.json","paper":"/paper/2501.15302"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T14:27:09.722328Z","title":"Neural discrete representation learning,","venue":null,"work_id":"1941879b-8f74-4268-8e58-95dbbb90835d","year":2017},"citing_paper":{"arxiv_id":"2501.15302","last_updated":"2025-01-25T18:56:40Z","snapshot_observed_at":"2026-08-15T07:52:08.510292Z","submitted_at":"2025-01-25T18:56:40Z","title":"The ICME 2025 Audio Encoder Capability Challenge","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-10T14:27:09.007976Z"},"links":{"citing_paper":"/paper/2501.15302"},"observation_digest":"sha256:6b4f1fb1203e5378f53783618254bb98ada51ed2664bdc1dcf122e8d03758ba8","observation_id":"d5742c54-78ce-439f-acd9-f4858c731762","resolution":{"observed_at":"2026-08-10T14:27:09.727024Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2309.15505","last_updated":"2023-10-12T07:55:05Z","snapshot_observed_at":"2026-07-06T16:24:17.829828Z","submitted_at":"2023-09-27T09:13:40Z","title":"Finite Scalar Quantization: VQ-VAE Made Simple","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.15505","snapshot_observed_at":"2026-08-10T14:27:09.014071Z","title":"Finit e scalar quantization: Vq-vae made simple,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2501.15302","last_updated":"2025-01-25T18:56:40Z","snapshot_observed_at":"2026-08-15T07:52:08.510292Z","submitted_at":"2025-01-25T18:56:40Z","title":"The ICME 2025 Audio Encoder Capability Challenge","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-10T14:27:09.014071Z"},"links":{"cited_paper":"/paper/2309.15505","citing_paper":"/paper/2501.15302"},"observation_digest":"sha256:b0898e7443a28766c22ce21875060c4519b4392f059edece5d3d87a3c46dcbc6","observation_id":"483913b3-fe05-46f2-a617-e6a317fdf08d","resolution":{"observed_at":"2026-08-10T14:27:09.014071Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T14:27:09.708006Z","title":"High-ﬁdelity audio compression with improved rvqgan,","venue":null,"work_id":"7a984704-a000-409a-8e46-7abd413b83c3","year":2024},"citing_paper":{"arxiv_id":"2501.15302","last_updated":"2025-01-25T18:56:40Z","snapshot_observed_at":"2026-08-15T07:52:08.510292Z","submitted_at":"2025-01-25T18:56:40Z","title":"The ICME 2025 Audio Encoder Capability Challenge","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-10T14:27:09.019677Z"},"links":{"citing_paper":"/paper/2501.15302"},"observation_digest":"sha256:2228258b69daf529a61dc81a993108f698d5a4836963b9e43b4c4af89916dfff","observation_id":"b299c320-1e63-46ff-8682-f3701a879f4d","resolution":{"observed_at":"2026-08-10T14:27:09.712327Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.14411","last_updated":"2024-10-18T12:24:05Z","snapshot_observed_at":"2026-08-15T13:29:54.873940Z","submitted_at":"2024-10-18T12:24:05Z","title":"SNAC: Multi-Scale Neural Audio Codec","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.14411","snapshot_observed_at":"2026-08-10T14:27:09.024591Z","title":"Snac: M ulti-scale neural audio codec,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.15302","last_updated":"2025-01-25T18:56:40Z","snapshot_observed_at":"2026-08-15T07:52:08.510292Z","submitted_at":"2025-01-25T18:56:40Z","title":"The ICME 2025 Audio Encoder Capability Challenge","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-10T14:27:09.024591Z"},"links":{"cited_paper":"/paper/2410.14411","citing_paper":"/paper/2501.15302"},"observation_digest":"sha256:3208cd1491e785881255ce0b1fcc3ec31e46e823cb3b64d38508235471be5e58","observation_id":"1c30ab33-fb6e-44df-9604-748d76e9988f","resolution":{"observed_at":"2026-08-10T14:27:09.024591Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.00037","last_updated":"2024-10-02T09:11:45Z","snapshot_observed_at":"2026-07-30T10:21:14.474746Z","submitted_at":"2024-09-17T17:55:39Z","title":"Moshi: a speech-text foundation model for real-time dialogue","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.00037","snapshot_observed_at":"2026-08-10T14:27:09.030098Z","title":"Moshi: a speech-text foundation model for real-time dialogue,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.15302","last_updated":"2025-01-25T18:56:40Z","snapshot_observed_at":"2026-08-15T07:52:08.510292Z","submitted_at":"2025-01-25T18:56:40Z","title":"The ICME 2025 Audio Encoder Capability Challenge","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-10T14:27:09.030098Z"},"links":{"cited_paper":"/paper/2410.00037","citing_paper":"/paper/2501.15302"},"observation_digest":"sha256:73fbeb9bdcea541ece790f119b01c46313ee902433c6c21d1b48a574834a4f4a","observation_id":"ecdc0d7a-ce59-4dab-8e7a-cf9320779054","resolution":{"observed_at":"2026-08-10T14:27:09.030098Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2411.08742","last_updated":"2024-11-13T16:20:20Z","snapshot_observed_at":"2026-08-16T05:45:09.735060Z","submitted_at":"2024-11-13T16:20:20Z","title":"A Comparative Study of Discrete Speech Tokens for Semantic-Related Tasks with Large Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.08742","snapshot_observed_at":"2026-08-10T14:27:09.035252Z","title":"A comparative s tudy of discrete speech tokens for semantic-related tasks with large language models,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.15302","last_updated":"2025-01-25T18:56:40Z","snapshot_observed_at":"2026-08-15T07:52:08.510292Z","submitted_at":"2025-01-25T18:56:40Z","title":"The ICME 2025 Audio Encoder Capability Challenge","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-10T14:27:09.035252Z"},"links":{"cited_paper":"/paper/2411.08742","citing_paper":"/paper/2501.15302"},"observation_digest":"sha256:54f1158eaac2b71e23d9efe88e98f232216f826c827c583a60a51a77cba1d102","observation_id":"cf075be4-d900-495b-b85f-80164947a406","resolution":{"observed_at":"2026-08-10T14:27:09.035252Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.07919","last_updated":"2023-12-21T10:20:42Z","snapshot_observed_at":"2026-08-07T10:17:55.688598Z","submitted_at":"2023-11-14T05:34:50Z","title":"Qwen-Audio: Advancing Universal Audio Understanding via Unified Large-Scale Audio-Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.07919","snapshot_observed_at":"2026-08-10T14:27:09.041296Z","title":"Qwen-audio: Ad- vancing universal audio understanding via uniﬁed large-scale audio- language models,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2501.15302","last_updated":"2025-01-25T18:56:40Z","snapshot_observed_at":"2026-08-15T07:52:08.510292Z","submitted_at":"2025-01-25T18:56:40Z","title":"The ICME 2025 Audio Encoder Capability Challenge","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-10T14:27:09.041296Z"},"links":{"cited_paper":"/paper/2311.07919","citing_paper":"/paper/2501.15302"},"observation_digest":"sha256:804728782f29aa0b56088747f643cb1ad4a8e05f87238621f8cc2a19d2681fad","observation_id":"dc7dbac0-f5eb-4f43-a2e6-060590170c4a","resolution":{"observed_at":"2026-08-10T14:27:09.041296Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.16725","last_updated":"2024-11-05T02:24:18Z","snapshot_observed_at":"2026-08-15T15:02:34.870602Z","submitted_at":"2024-08-29T17:18:53Z","title":"Mini-Omni: Language Models Can Hear, Talk While Thinking in Streaming","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.16725","snapshot_observed_at":"2026-08-10T14:27:09.046367Z","title":"Mini-omni: Language models can hear, talk while th inking in streaming,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.15302","last_updated":"2025-01-25T18:56:40Z","snapshot_observed_at":"2026-08-15T07:52:08.510292Z","submitted_at":"2025-01-25T18:56:40Z","title":"The ICME 2025 Audio Encoder Capability Challenge","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-10T14:27:09.046367Z"},"links":{"cited_paper":"/paper/2408.16725","citing_paper":"/paper/2501.15302"},"observation_digest":"sha256:b0609338098322610418785cefb2728e2cdd07c5630732c86737703b8e1525ec","observation_id":"4297e96e-970e-4e22-817e-13e50c59578a","resolution":{"observed_at":"2026-08-10T14:27:09.046367Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2411.18138","last_updated":"2024-11-27T08:38:57Z","snapshot_observed_at":"2026-08-15T15:48:23.103519Z","submitted_at":"2024-11-27T08:38:57Z","title":"SALMONN-omni: A Codec-free LLM for Full-duplex Speech Understanding and Generation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.18138","snapshot_observed_at":"2026-08-10T14:27:09.051470Z","title":"Salmonn-omni: A codec-free llm for full-duplex speech understand ing and generation,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.15302","last_updated":"2025-01-25T18:56:40Z","snapshot_observed_at":"2026-08-15T07:52:08.510292Z","submitted_at":"2025-01-25T18:56:40Z","title":"The ICME 2025 Audio Encoder Capability Challenge","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-10T14:27:09.051470Z"},"links":{"cited_paper":"/paper/2411.18138","citing_paper":"/paper/2501.15302"},"observation_digest":"sha256:c89e32f1e748cafd3ba6850a2b1d0a3f631e371187b474c5a5f9840f2d73e93c","observation_id":"14e6393b-9283-46b5-b13f-bf5f6b465aad","resolution":{"observed_at":"2026-08-10T14:27:09.051470Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T14:27:09.694761Z","title":"wav2vec 2.0: A fr amework for self-supervised learning of speech representations,","venue":null,"work_id":"72df578b-8540-42d3-a5a7-e7beb80c52ad","year":2020},"citing_paper":{"arxiv_id":"2501.15302","last_updated":"2025-01-25T18:56:40Z","snapshot_observed_at":"2026-08-15T07:52:08.510292Z","submitted_at":"2025-01-25T18:56:40Z","title":"The ICME 2025 Audio Encoder Capability Challenge","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-10T14:27:09.056593Z"},"links":{"citing_paper":"/paper/2501.15302"},"observation_digest":"sha256:b05e988ca1dcecfb6ccfbe6ba64ccf2f80d5560603695e6907885a16d1061378","observation_id":"ea4c6619-997a-4f60-90dc-9ae8e2f9b9c8","resolution":{"observed_at":"2026-08-10T14:27:09.698860Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T14:27:09.680400Z","title":"Data2 vec: A general framework for self- supervised learning in speech, vision and language,","venue":null,"work_id":"50cbbbcf-2781-436a-a6d1-133e2e5fea09","year":2022},"citing_paper":{"arxiv_id":"2501.15302","last_updated":"2025-01-25T18:56:40Z","snapshot_observed_at":"2026-08-15T07:52:08.510292Z","submitted_at":"2025-01-25T18:56:40Z","title":"The ICME 2025 Audio Encoder Capability Challenge","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-10T14:27:09.061310Z"},"links":{"citing_paper":"/paper/2501.15302"},"observation_digest":"sha256:6f969ea967dde99e93cb63c5731a3495438be00b6eaed0a60762d87114516956","observation_id":"c48c1a4a-613b-485f-b7d1-b28ec87a461e","resolution":{"observed_at":"2026-08-10T14:27:09.685160Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T14:27:09.665790Z","title":"Sc aling up masked audio encoder learning for general audio classiﬁcation,","venue":null,"work_id":"79154b45-340d-4a7d-8a72-7cf4a4afd2fc","year":2024},"citing_paper":{"arxiv_id":"2501.15302","last_updated":"2025-01-25T18:56:40Z","snapshot_observed_at":"2026-08-15T07:52:08.510292Z","submitted_at":"2025-01-25T18:56:40Z","title":"The ICME 2025 Audio Encoder Capability Challenge","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-10T14:27:09.066268Z"},"links":{"citing_paper":"/paper/2501.15302"},"observation_digest":"sha256:6e984db9cbf05fc57125ffde3054e7dfc8ee86994cf033962039d310b132e9ac","observation_id":"6d92c814-716c-4c51-9d5c-ee968146577a","resolution":{"observed_at":"2026-08-10T14:27:09.670843Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T14:27:09.651355Z","title":"HEAR: Holistic evaluation of audio representations,","venue":null,"work_id":"ca0a14bd-3250-4f1a-9775-137c15fc73be","year":2021},"citing_paper":{"arxiv_id":"2501.15302","last_updated":"2025-01-25T18:56:40Z","snapshot_observed_at":"2026-08-15T07:52:08.510292Z","submitted_at":"2025-01-25T18:56:40Z","title":"The ICME 2025 Audio Encoder Capability Challenge","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-10T14:27:09.071436Z"},"links":{"citing_paper":"/paper/2501.15302"},"observation_digest":"sha256:ec0d79d64a450a3d7ff48ef59f4cbde9908576e564efeded846b0d94d6c17d91","observation_id":"b609f98e-8786-4cfa-9002-31e146495105","resolution":{"observed_at":"2026-08-10T14:27:09.656081Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T14:27:09.636663Z","title":"SUPERB: Speech processing universal performance benchmar k,","venue":null,"work_id":"c586105d-d099-4fbb-ad75-e19dc4413f32","year":2021},"citing_paper":{"arxiv_id":"2501.15302","last_updated":"2025-01-25T18:56:40Z","snapshot_observed_at":"2026-08-15T07:52:08.510292Z","submitted_at":"2025-01-25T18:56:40Z","title":"The ICME 2025 Audio Encoder Capability Challenge","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-10T14:27:09.076302Z"},"links":{"citing_paper":"/paper/2501.15302"},"observation_digest":"sha256:acfcbdd94d57d8aa43804f3f05e5a005706059403fa9224edeaba91343bbfb1f","observation_id":"f699b613-476e-400b-81ac-938993fe15d6","resolution":{"observed_at":"2026-08-10T14:27:09.641396Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.14294","last_updated":"2026-04-21T15:27:17Z","snapshot_observed_at":"2026-07-30T17:14:02.349402Z","submitted_at":"2024-06-20T13:23:27Z","title":"DASB - Discrete Audio and Speech Benchmark","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.14294","snapshot_observed_at":"2026-08-10T14:27:09.081166Z","title":"DASB–discrete audio and speech benchmark,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.15302","last_updated":"2025-01-25T18:56:40Z","snapshot_observed_at":"2026-08-15T07:52:08.510292Z","submitted_at":"2025-01-25T18:56:40Z","title":"The ICME 2025 Audio Encoder Capability Challenge","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-10T14:27:09.081166Z"},"links":{"cited_paper":"/paper/2406.14294","citing_paper":"/paper/2501.15302"},"observation_digest":"sha256:a83f5cd03e381d8e6b17b29fb9dc8bfcfc9d6562b524ed23d08c46676dd7fccf","observation_id":"eac09b7b-2251-4600-8aea-229613780c1a","resolution":{"observed_at":"2026-08-10T14:27:09.081166Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1804.03209","last_updated":"2018-04-09T19:58:17Z","snapshot_observed_at":"2026-08-15T16:28:51.252929Z","submitted_at":"2018-04-09T19:58:17Z","title":"Speech Commands: A Dataset for Limited-Vocabulary Speech Recognition","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1804.03209","snapshot_observed_at":"2026-08-10T14:27:09.086029Z","title":"Speech commands: A dataset for limited-vocabula ry speech recognition,","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2501.15302","last_updated":"2025-01-25T18:56:40Z","snapshot_observed_at":"2026-08-15T07:52:08.510292Z","submitted_at":"2025-01-25T18:56:40Z","title":"The ICME 2025 Audio Encoder Capability Challenge","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-10T14:27:09.086029Z"},"links":{"cited_paper":"/paper/1804.03209","citing_paper":"/paper/2501.15302"},"observation_digest":"sha256:856efb231f9448424cfabe50d2c53f17f31a5c382ae2a7f89c74b9d5beb94fa2","observation_id":"2c95c848-6575-4f2f-b5a5-d8a8e783cf0f","resolution":{"observed_at":"2026-08-10T14:27:09.086029Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T14:27:09.621746Z","title":"Lib ricount, a dataset for speaker count estima- tion,","venue":null,"work_id":"95c68232-85a7-4c54-8ae2-7f3695d4371e","year":2018},"citing_paper":{"arxiv_id":"2501.15302","last_updated":"2025-01-25T18:56:40Z","snapshot_observed_at":"2026-08-15T07:52:08.510292Z","submitted_at":"2025-01-25T18:56:40Z","title":"The ICME 2025 Audio Encoder Capability Challenge","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-10T14:27:09.090811Z"},"links":{"citing_paper":"/paper/2501.15302"},"observation_digest":"sha256:caf827a0415675c7b382f4868ec7ddb94f12f2aefc075b44ed74bcbe35e67535","observation_id":"70681049-0a50-4aa7-bd9c-6ebbec8e85f1","resolution":{"observed_at":"2026-08-10T14:27:09.626585Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T14:27:09.606848Z","title":"Voxlingua107: a dataset for spoken lan guage recognition,","venue":null,"work_id":"3fe44325-33f5-4541-a041-1daa1763a77c","year":2021},"citing_paper":{"arxiv_id":"2501.15302","last_updated":"2025-01-25T18:56:40Z","snapshot_observed_at":"2026-08-15T07:52:08.510292Z","submitted_at":"2025-01-25T18:56:40Z","title":"The ICME 2025 Audio Encoder Capability Challenge","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-10T14:27:09.094633Z"},"links":{"citing_paper":"/paper/2501.15302"},"observation_digest":"sha256:e598b6eddfa2b5f66ef284679bbce392077f8012c8b2949656a67e6d9f4849d3","observation_id":"60ec8637-d5dc-464a-829a-f0eb4faa7e4b","resolution":{"observed_at":"2026-08-10T14:27:09.611650Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T14:27:09.591664Z","title":"Voxceleb: L arge-scale speaker veriﬁcation in the wild,","venue":null,"work_id":"de318fb3-75cd-48a7-b52b-40052df0b36a","year":2020},"citing_paper":{"arxiv_id":"2501.15302","last_updated":"2025-01-25T18:56:40Z","snapshot_observed_at":"2026-08-15T07:52:08.510292Z","submitted_at":"2025-01-25T18:56:40Z","title":"The ICME 2025 Audio Encoder Capability Challenge","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-10T14:27:09.098417Z"},"links":{"citing_paper":"/paper/2501.15302"},"observation_digest":"sha256:f6a3b64ccd4d5aa5e9a41ad76d658245a9fdf48c49ff3df3c343383836f448d8","observation_id":"d4049d2a-85e2-4917-b84b-02feaa2f07a7","resolution":{"observed_at":"2026-08-10T14:27:09.596567Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T14:27:09.576980Z","title":"Librisp eech: an asr corpus based on public domain audio books,","venue":null,"work_id":"a2302e8b-67ed-44c3-a794-ff08704dd85a","year":2015},"citing_paper":{"arxiv_id":"2501.15302","last_updated":"2025-01-25T18:56:40Z","snapshot_observed_at":"2026-08-15T07:52:08.510292Z","submitted_at":"2025-01-25T18:56:40Z","title":"The ICME 2025 Audio Encoder Capability Challenge","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-10T14:27:09.102379Z"},"links":{"citing_paper":"/paper/2501.15302"},"observation_digest":"sha256:94c94c649b6b19fd31bfb3934aeb38d3cc036f67991d41086fb5d58b326e2a07","observation_id":"4bfa7132-234c-4247-bc62-793d83ec73ea","resolution":{"observed_at":"2026-08-10T14:27:09.581761Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1904.03670","last_updated":"2019-07-25T17:56:23Z","snapshot_observed_at":"2026-08-14T16:50:26.755237Z","submitted_at":"2019-04-07T15:24:32Z","title":"Speech Model Pre-training for End-to-End Spoken Language Understanding","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1904.03670","snapshot_observed_at":"2026-08-10T14:27:09.106687Z","title":"Speech model pre-training for end-to-end spoken language understanding,","venue":null,"work_id":null,"year":1904},"citing_paper":{"arxiv_id":"2501.15302","last_updated":"2025-01-25T18:56:40Z","snapshot_observed_at":"2026-08-15T07:52:08.510292Z","submitted_at":"2025-01-25T18:56:40Z","title":"The ICME 2025 Audio Encoder Capability Challenge","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-10T14:27:09.106687Z"},"links":{"cited_paper":"/paper/1904.03670","citing_paper":"/paper/2501.15302"},"observation_digest":"sha256:bc8eac31f406027a8dabe54579f011d7e56028361a2e948fd562e49ad657cfbf","observation_id":"08bbda33-2a61-404b-9116-d7ce1ba5c64b","resolution":{"observed_at":"2026-08-10T14:27:09.106687Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T14:27:09.561965Z","title":"Vocalsound: A dataset for impro ving human vocal sounds recognition,","venue":null,"work_id":"177a948b-a2cb-4f9b-aeb9-4651214b2983","year":2022},"citing_paper":{"arxiv_id":"2501.15302","last_updated":"2025-01-25T18:56:40Z","snapshot_observed_at":"2026-08-15T07:52:08.510292Z","submitted_at":"2025-01-25T18:56:40Z","title":"The ICME 2025 Audio Encoder Capability Challenge","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-10T14:27:09.111099Z"},"links":{"citing_paper":"/paper/2501.15302"},"observation_digest":"sha256:ab0cf48ef2accc3641c07ef2506929a9aaf128d4a19d823238781183d6c7d148","observation_id":"9a89e309-af28-4ec2-b079-a918ad385d20","resolution":{"observed_at":"2026-08-10T14:27:09.567012Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T14:27:09.546089Z","title":"Crema-d: Crowd- sourced emotional multimodal actors dataset,","venue":null,"work_id":"d8bd32b4-412e-4634-8d42-152876dbf97e","year":2014},"citing_paper":{"arxiv_id":"2501.15302","last_updated":"2025-01-25T18:56:40Z","snapshot_observed_at":"2026-08-15T07:52:08.510292Z","submitted_at":"2025-01-25T18:56:40Z","title":"The ICME 2025 Audio Encoder Capability Challenge","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-10T14:27:09.115119Z"},"links":{"citing_paper":"/paper/2501.15302"},"observation_digest":"sha256:18b89fbbb258f252243a725b368c2bf8afbe05abc26439c4aec720fbacdb8128","observation_id":"a1f097c8-add5-43fd-81b5-2c4f1967fcb2","resolution":{"observed_at":"2026-08-10T14:27:09.551485Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T14:27:09.530680Z","title":"spee- chocean762: An open-source non-native english speech corpus f or pronunciation assessment,","venue":null,"work_id":"79e3ce00-d225-4032-92d0-1082849adcca","year":2021},"citing_paper":{"arxiv_id":"2501.15302","last_updated":"2025-01-25T18:56:40Z","snapshot_observed_at":"2026-08-15T07:52:08.510292Z","submitted_at":"2025-01-25T18:56:40Z","title":"The ICME 2025 Audio Encoder Capability Challenge","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-10T14:27:09.118950Z"},"links":{"citing_paper":"/paper/2501.15302"},"observation_digest":"sha256:c1623f2502c3875812f21b028245b3dabe7470eabf5d08df00c2b6db10e94ad3","observation_id":"b199aac7-ee97-4346-ac42-95719c2825ad","resolution":{"observed_at":"2026-08-10T14:27:09.535715Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T14:27:09.516871Z","title":"Autom atic speaker veriﬁcation spooﬁng and countermeasures challenge (asvspoof 2015) database,","venue":null,"work_id":"f7ed87ff-8cf9-4ed9-beb7-4f040d69114e","year":2015},"citing_paper":{"arxiv_id":"2501.15302","last_updated":"2025-01-25T18:56:40Z","snapshot_observed_at":"2026-08-15T07:52:08.510292Z","submitted_at":"2025-01-25T18:56:40Z","title":"The ICME 2025 Audio Encoder Capability Challenge","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-10T14:27:09.123480Z"},"links":{"citing_paper":"/paper/2501.15302"},"observation_digest":"sha256:61d124cd8347d0c141e345c427d3ceb1300347d41a0973353df27dc636a8f441","observation_id":"f72d2a44-6b37-4c5e-a149-b16d19d43ef7","resolution":{"observed_at":"2026-08-10T14:27:09.521154Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T14:27:09.502138Z","title":"Esc: Dataset for environmental sound classiﬁc ation,","venue":null,"work_id":"651dfcd3-a18f-4070-aa6d-5d2a7d800d59","year":2015},"citing_paper":{"arxiv_id":"2501.15302","last_updated":"2025-01-25T18:56:40Z","snapshot_observed_at":"2026-08-15T07:52:08.510292Z","submitted_at":"2025-01-25T18:56:40Z","title":"The ICME 2025 Audio Encoder Capability Challenge","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-10T14:27:09.128144Z"},"links":{"citing_paper":"/paper/2501.15302"},"observation_digest":"sha256:39a43d797b57eb995068262f7749e7effe9ebd4a96bc58ff8ab0cd570bc47953","observation_id":"60ee67fa-45d4-45b6-b882-cf47dccb327d","resolution":{"observed_at":"2026-08-10T14:27:09.506592Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T14:27:09.486894Z","title":"Fsd 50k: an open dataset of human-labeled sound events,","venue":null,"work_id":"788dd459-b956-4f85-9b54-a2cfe6e3e6f9","year":2021},"citing_paper":{"arxiv_id":"2501.15302","last_updated":"2025-01-25T18:56:40Z","snapshot_observed_at":"2026-08-15T07:52:08.510292Z","submitted_at":"2025-01-25T18:56:40Z","title":"The ICME 2025 Audio Encoder Capability Challenge","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-10T14:27:09.132952Z"},"links":{"citing_paper":"/paper/2501.15302"},"observation_digest":"sha256:f69b84148bb51f6e90474086b0833ceccdd0916079a720d822f63452c78f03a9","observation_id":"647aa645-ec38-4b94-a432-7f7004b675eb","resolution":{"observed_at":"2026-08-10T14:27:09.491604Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T14:27:09.470290Z","title":"A dataset and taxonom y for urban sound research,","venue":null,"work_id":"739cf661-5197-4bb6-811a-677ff7076ccb","year":2014},"citing_paper":{"arxiv_id":"2501.15302","last_updated":"2025-01-25T18:56:40Z","snapshot_observed_at":"2026-08-15T07:52:08.510292Z","submitted_at":"2025-01-25T18:56:40Z","title":"The ICME 2025 Audio Encoder Capability Challenge","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-10T14:27:09.137432Z"},"links":{"citing_paper":"/paper/2501.15302"},"observation_digest":"sha256:5854638fd3f2b05aad2e43ed6edb23e928f32d7af992e9621f8af6cf2c55c6f7","observation_id":"734b0a95-283c-4511-8f8e-c31e0a3e67a5","resolution":{"observed_at":"2026-08-10T14:27:09.475397Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T14:27:09.454405Z","title":"Sound eve nt detection in domestic environments with weakly labeled data and soundscape synthesis,","venue":null,"work_id":"eb10e364-5794-4d99-a418-6e9c51a5fbea","year":2019},"citing_paper":{"arxiv_id":"2501.15302","last_updated":"2025-01-25T18:56:40Z","snapshot_observed_at":"2026-08-15T07:52:08.510292Z","submitted_at":"2025-01-25T18:56:40Z","title":"The ICME 2025 Audio Encoder Capability Challenge","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-10T14:27:09.142173Z"},"links":{"citing_paper":"/paper/2501.15302"},"observation_digest":"sha256:06e1e6982f7701f0cd4df398f9d6d9f0ddce8bfc19aa1e59dccef5cb2774b78f","observation_id":"0a8327d8-ad6c-4706-b9b9-af6b735cb42c","resolution":{"observed_at":"2026-08-10T14:27:09.459336Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1807.09902","last_updated":"2018-10-07T02:25:28Z","snapshot_observed_at":"2026-08-14T18:47:40.122043Z","submitted_at":"2018-07-26T00:30:54Z","title":"General-purpose Tagging of Freesound Audio with AudioSet Labels: Task Description, Dataset, and Baseline","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1807.09902","snapshot_observed_at":"2026-08-10T14:27:09.146676Z","title":"General-purpose tag- ging of freesound audio with audioset labels: Task description, data set, and baseline,","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2501.15302","last_updated":"2025-01-25T18:56:40Z","snapshot_observed_at":"2026-08-15T07:52:08.510292Z","submitted_at":"2025-01-25T18:56:40Z","title":"The ICME 2025 Audio Encoder Capability Challenge","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-10T14:27:09.146676Z"},"links":{"cited_paper":"/paper/1807.09902","citing_paper":"/paper/2501.15302"},"observation_digest":"sha256:33ec289ed9dd8cdd73f1a9f4f4d33cb739965bdeb8d51571399785b11d63c10b","observation_id":"e0152afd-8583-423a-bc21-81ae392ac2b9","resolution":{"observed_at":"2026-08-10T14:27:09.146676Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T14:27:09.438912Z","title":"Clotho: An audio capt ioning dataset,","venue":null,"work_id":"76a32974-1328-4d7b-a700-617e7915cd13","year":2020},"citing_paper":{"arxiv_id":"2501.15302","last_updated":"2025-01-25T18:56:40Z","snapshot_observed_at":"2026-08-15T07:52:08.510292Z","submitted_at":"2025-01-25T18:56:40Z","title":"The ICME 2025 Audio Encoder Capability Challenge","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-10T14:27:09.151378Z"},"links":{"citing_paper":"/paper/2501.15302"},"observation_digest":"sha256:cec8b5ab77ad905ebad4cafafc99ce4d0eac625509046ad9f5f04f48bf3953f0","observation_id":"4dd00642-a5e3-4629-bdde-1c92b4c6867d","resolution":{"observed_at":"2026-08-10T14:27:09.443976Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T14:27:09.422688Z","title":"Enabling factorized piano music modeling and generation with the MAESTRO dataset,","venue":null,"work_id":"b42d6f77-1865-47ee-81ee-bbee1f3eb544","year":2019},"citing_paper":{"arxiv_id":"2501.15302","last_updated":"2025-01-25T18:56:40Z","snapshot_observed_at":"2026-08-15T07:52:08.510292Z","submitted_at":"2025-01-25T18:56:40Z","title":"The ICME 2025 Audio Encoder Capability Challenge","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-10T14:27:09.155999Z"},"links":{"citing_paper":"/paper/2501.15302"},"observation_digest":"sha256:cb129ad8a828e97f708b0d371dc451afa3ee74176e0acf4ee7133483b64c01f3","observation_id":"99504da6-da4d-46c3-a1b1-a46ae6aebb4f","resolution":{"observed_at":"2026-08-10T14:27:09.427914Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1306.1461","last_updated":"2013-06-07T16:57:39Z","snapshot_observed_at":"2026-08-16T01:06:52.373567Z","submitted_at":"2013-06-06T16:30:44Z","title":"The GTZAN dataset: Its contents, its faults, their effects on evaluation, and its future use","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1306.1461","snapshot_observed_at":"2026-08-10T14:27:09.160670Z","title":"The gtzan dataset: Its contents, its faults, t heir eﬀects on evaluation, and its future use,","venue":null,"work_id":null,"year":2013},"citing_paper":{"arxiv_id":"2501.15302","last_updated":"2025-01-25T18:56:40Z","snapshot_observed_at":"2026-08-15T07:52:08.510292Z","submitted_at":"2025-01-25T18:56:40Z","title":"The ICME 2025 Audio Encoder Capability Challenge","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-10T14:27:09.160670Z"},"links":{"cited_paper":"/paper/1306.1461","citing_paper":"/paper/2501.15302"},"observation_digest":"sha256:b662a848c5c0a12452fcd411ac58695b536b94eada27f54e3814091aa3357bc5","observation_id":"c7b1239c-9c2c-4c2b-b75e-5b5ea524e3e7","resolution":{"observed_at":"2026-08-10T14:27:09.160670Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T14:27:09.404278Z","title":"Neural audio synthesis of musical notes with wavenet autoencoders,","venue":null,"work_id":"607695cd-a4c9-4a13-8742-6472ed9ef517","year":2017},"citing_paper":{"arxiv_id":"2501.15302","last_updated":"2025-01-25T18:56:40Z","snapshot_observed_at":"2026-08-15T07:52:08.510292Z","submitted_at":"2025-01-25T18:56:40Z","title":"The ICME 2025 Audio Encoder Capability Challenge","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-10T14:27:09.165586Z"},"links":{"citing_paper":"/paper/2501.15302"},"observation_digest":"sha256:d35fec0b83f6badfaa06544e4548588c61a9d1be8355363819841138377dd1c8","observation_id":"28403eb4-d70b-49f0-9d15-1e0ec430e1a5","resolution":{"observed_at":"2026-08-10T14:27:09.411329Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1612.01840","last_updated":"2017-09-05T18:38:33Z","snapshot_observed_at":"2026-08-14T21:26:53.042056Z","submitted_at":"2016-12-06T14:58:59Z","title":"FMA: A Dataset For Music Analysis","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1612.01840","snapshot_observed_at":"2026-08-10T14:27:09.170151Z","title":"Fma: A dataset for music analysis,","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2501.15302","last_updated":"2025-01-25T18:56:40Z","snapshot_observed_at":"2026-08-15T07:52:08.510292Z","submitted_at":"2025-01-25T18:56:40Z","title":"The ICME 2025 Audio Encoder Capability Challenge","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-10T14:27:09.170151Z"},"links":{"cited_paper":"/paper/1612.01840","citing_paper":"/paper/2501.15302"},"observation_digest":"sha256:4ff5931e1ebeede30f962425d132911d5f1d3d1b141d06b9b2737b089cb054db","observation_id":"f443ba02-0d14-4007-91a0-ad1005d83722","resolution":{"observed_at":"2026-08-10T14:27:09.170151Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2501.15302","last_updated":"2025-01-25T18:56:40Z","latest_version":1,"primary_category":"cs.SD","snapshot_observed_at":"2026-08-15T07:52:08.510292Z","submitted_at":"2025-01-25T18:56:40Z","title":"The ICME 2025 Audio Encoder Capability Challenge"},"reference_resolution":{"displayed":35,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":13,"verified_exact":0,"verified_fuzzy":22},"total_outbound_references":35},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"thesis":"As of 16 August 2026, this Paper Citation Record lists 35 of 35 outbound references and 1 inbound Pith citation observation for arXiv:2501.15302."}