{"as_of":"2026-08-12T08:02:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:cc61d906fff717f221348c57111066af0f6f90fdbd783e5b2c12e2f9b6a2dc51","coverage":[{"denominator":53,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":53,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T15:05:16.177062Z","state":"measured"},{"denominator":57,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":57,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-12T06:34:41.77262+00:00","state":"measured"},{"denominator":4,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":4,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T15:05:12.925006Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-07-02T14:17:03.115400Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2505.16369","last_updated":"2025-05-27T06:49:39Z","snapshot_observed_at":"2026-08-10T20:32:56.847856Z","submitted_at":"2025-05-22T08:23:54Z","title":"X-ARES: A Comprehensive Framework for Assessing Audio Encoder Performance","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.16369","snapshot_observed_at":"2026-08-07T15:05:12.925006Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.16369","last_updated":"2025-05-27T06:49:39Z","snapshot_observed_at":"2026-08-10T20:32:56.847856Z","submitted_at":"2025-05-22T08:23:54Z","title":"X-ARES: A Comprehensive Framework for Assessing Audio Encoder Performance","version":2},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-07T15:05:12.925006Z"},"links":{"cited_paper":"/paper/2505.16369","citing_paper":"/paper/2505.16369"},"observation_digest":"sha256:5094a7fcaa2b1cd2e5881dc523a78e45f58acadddc0c8854e4200dd1af5273bf","observation_id":"2f11c02f-2ad4-4b77-9ca6-58eae6c42276","resolution":{"observed_at":"2026-08-07T15:05:12.925006Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.16369","last_updated":"2025-05-27T06:49:39Z","snapshot_observed_at":"2026-08-10T20:32:56.847856Z","submitted_at":"2025-05-22T08:23:54Z","title":"X-ARES: A Comprehensive Framework for Assessing Audio Encoder Performance","version":2},"cited_work":{"arxiv_id":"2505.16369","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2505.16369","snapshot_observed_at":"2026-07-02T14:17:03.115400Z","title":"Lianmin Zheng, Wei-Lin Chiang, Ying Sheng, Siyuan Zhuang, Zhanghao Wu, Yonghao Zhuang, Zi Lin, Zhuohan Li, Dacheng Li, Eric Xing, et al","venue":null,"work_id":"03e78c36-e3f4-4a63-bae1-e03871402bcf","year":2025},"citing_paper":{"arxiv_id":"2509.08031","last_updated":"2026-05-11T14:29:23Z","snapshot_observed_at":"2026-08-11T22:10:01.080802Z","submitted_at":"2025-09-09T15:30:40Z","title":"AU-Harness: An Open-Source Toolkit for Holistic Evaluation of Audio LLMs","version":3},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-05-18T18:07:01.257126Z"},"links":{"cited_paper":"/paper/2505.16369","citing_paper":"/paper/2509.08031"},"observation_digest":"sha256:068326088c02260a7ab989bd108e9b03c81d423e91f93a4bc703eb2d2f9d7f77","observation_id":"054cc496-1d59-4e3e-8e16-1c7faa9956a9","resolution":{"observed_at":"2026-05-18T18:11:43.145790Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.16369","last_updated":"2025-05-27T06:49:39Z","snapshot_observed_at":"2026-08-10T20:32:56.847856Z","submitted_at":"2025-05-22T08:23:54Z","title":"X-ARES: A Comprehensive Framework for Assessing Audio Encoder Performance","version":2},"cited_work":{"arxiv_id":"2505.16369","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2505.16369","snapshot_observed_at":"2026-07-02T14:17:03.115400Z","title":"Lianmin Zheng, Wei-Lin Chiang, Ying Sheng, Siyuan Zhuang, Zhanghao Wu, Yonghao Zhuang, Zi Lin, Zhuohan Li, Dacheng Li, Eric Xing, et al","venue":null,"work_id":"03e78c36-e3f4-4a63-bae1-e03871402bcf","year":2025},"citing_paper":{"arxiv_id":"2606.05544","last_updated":"2026-07-16T00:44:34Z","snapshot_observed_at":"2026-08-02T19:37:00.359300Z","submitted_at":"2026-06-04T00:58:16Z","title":"Probing Spatial Structure in Pretrained Audio Representations","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-06-28T00:34:43.472094Z"},"links":{"cited_paper":"/paper/2505.16369","citing_paper":"/paper/2606.05544"},"observation_digest":"sha256:d87ce9d8ca9a8615fc2fa373bd95f994bbfb76e29e47e5382ea6f60d6b6653f3","observation_id":"50834e18-e74a-4b31-a36e-a43cb59cea13","resolution":{"observed_at":"2026-07-02T14:17:03.116783Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.16369","last_updated":"2025-05-27T06:49:39Z","snapshot_observed_at":"2026-08-10T20:32:56.847856Z","submitted_at":"2025-05-22T08:23:54Z","title":"X-ARES: A Comprehensive Framework for Assessing Audio Encoder Performance","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.16369","snapshot_observed_at":"2026-08-02T12:23:45.341806Z","title":"X-ares: A comprehensive framework for assessing audio encoder performance,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2606.05544","last_updated":"2026-07-16T00:44:34Z","snapshot_observed_at":"2026-08-02T19:37:00.359300Z","submitted_at":"2026-06-04T00:58:16Z","title":"Probing Spatial Structure in Pretrained Audio Representations","version":2},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-02T12:23:45.341806Z"},"links":{"cited_paper":"/paper/2505.16369","citing_paper":"/paper/2606.05544"},"observation_digest":"sha256:c8f003aa55127f7e97b291e4f5f1aa6fd05f7cadcce6f97bdec2c767cb2252b9","observation_id":"ed45fb58-73c8-4f9a-baa7-ded281058537","resolution":{"observed_at":"2026-08-02T12:23:45.341806Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2505.16369/citation-record","integrity":"/paper/2505.16369/integrity","json":"/paper/2505.16369/citation-record.json","paper":"/paper/2505.16369"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:05:22.453061Z","title":null,"venue":null,"work_id":"0f650921-5898-4a5b-ae57-b64c4ed6e86e","year":null},"citing_paper":{"arxiv_id":"2505.16369","last_updated":"2025-05-27T06:49:39Z","snapshot_observed_at":"2026-08-10T20:32:56.847856Z","submitted_at":"2025-05-22T08:23:54Z","title":"X-ARES: A Comprehensive Framework for Assessing Audio Encoder Performance","version":2},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-07T15:05:12.633476Z"},"links":{"citing_paper":"/paper/2505.16369"},"observation_digest":"sha256:19f39c9c349facdaca6d2a796a26076bc2db193a46a3cc0c60c11e89c0f8ced7","observation_id":"5c036217-80f1-4122-bc8b-f229c44341d8","resolution":{"observed_at":"2026-08-07T15:05:22.508548Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:05:22.324165Z","title":null,"venue":null,"work_id":"6483cced-4c14-4a55-8bcb-8aa70cf43ed6","year":null},"citing_paper":{"arxiv_id":"2505.16369","last_updated":"2025-05-27T06:49:39Z","snapshot_observed_at":"2026-08-10T20:32:56.847856Z","submitted_at":"2025-05-22T08:23:54Z","title":"X-ARES: A Comprehensive Framework for Assessing Audio Encoder Performance","version":2},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-07T15:05:12.686723Z"},"links":{"citing_paper":"/paper/2505.16369"},"observation_digest":"sha256:0412189fb9d3ba5faa5aa2e3401e3b946cce158d38a39e7f07f494a25078d014","observation_id":"dbca00b5-4be5-4ff5-8913-45f65a97eef7","resolution":{"observed_at":"2026-08-07T15:05:22.385652Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:05:22.248923Z","title":null,"venue":null,"work_id":"1fb87342-11f9-4d3c-a69e-4988f92410b1","year":null},"citing_paper":{"arxiv_id":"2505.16369","last_updated":"2025-05-27T06:49:39Z","snapshot_observed_at":"2026-08-10T20:32:56.847856Z","submitted_at":"2025-05-22T08:23:54Z","title":"X-ARES: A Comprehensive Framework for Assessing Audio Encoder Performance","version":2},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-07T15:05:12.760031Z"},"links":{"citing_paper":"/paper/2505.16369"},"observation_digest":"sha256:c050cda2e4cd2641033b72ead066ed48e5588b4e01b8e643d5f91f62394df168","observation_id":"c4a2c8fe-1142-42e7-879a-c8299e39c340","resolution":{"observed_at":"2026-08-07T15:05:22.274533Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:05:22.148551Z","title":null,"venue":null,"work_id":"06c92da8-92ce-4862-9db8-54aeecadd101","year":null},"citing_paper":{"arxiv_id":"2505.16369","last_updated":"2025-05-27T06:49:39Z","snapshot_observed_at":"2026-08-10T20:32:56.847856Z","submitted_at":"2025-05-22T08:23:54Z","title":"X-ARES: A Comprehensive Framework for Assessing Audio Encoder Performance","version":2},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-07T15:05:12.846604Z"},"links":{"citing_paper":"/paper/2505.16369"},"observation_digest":"sha256:0ce72e8643f60729e189dd954164b2ae21b7add1b29d2756b5248cf6b525346a","observation_id":"b1232899-2511-4dea-b526-3db91cf0a0a5","resolution":{"observed_at":"2026-08-07T15:05:22.183876Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:05:21.988083Z","title":null,"venue":null,"work_id":"ad99a161-4480-4897-8bb1-84f00647554d","year":null},"citing_paper":{"arxiv_id":"2505.16369","last_updated":"2025-05-27T06:49:39Z","snapshot_observed_at":"2026-08-10T20:32:56.847856Z","submitted_at":"2025-05-22T08:23:54Z","title":"X-ARES: A Comprehensive Framework for Assessing Audio Encoder Performance","version":2},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-07T15:05:12.882556Z"},"links":{"citing_paper":"/paper/2505.16369"},"observation_digest":"sha256:6f9579e1d2a3ee0d194101580be4ad723a03218324c375149b979e27db74ad5c","observation_id":"704ada23-c0ac-4b4b-86a8-cd5792e6c03c","resolution":{"observed_at":"2026-08-07T15:05:22.060727Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.16369","last_updated":"2025-05-27T06:49:39Z","snapshot_observed_at":"2026-08-10T20:32:56.847856Z","submitted_at":"2025-05-22T08:23:54Z","title":"X-ARES: A Comprehensive Framework for Assessing Audio Encoder Performance","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.16369","snapshot_observed_at":"2026-08-07T15:05:12.925006Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.16369","last_updated":"2025-05-27T06:49:39Z","snapshot_observed_at":"2026-08-10T20:32:56.847856Z","submitted_at":"2025-05-22T08:23:54Z","title":"X-ARES: A Comprehensive Framework for Assessing Audio Encoder Performance","version":2},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-07T15:05:12.925006Z"},"links":{"cited_paper":"/paper/2505.16369","citing_paper":"/paper/2505.16369"},"observation_digest":"sha256:5094a7fcaa2b1cd2e5881dc523a78e45f58acadddc0c8854e4200dd1af5273bf","observation_id":"2f11c02f-2ad4-4b77-9ca6-58eae6c42276","resolution":{"observed_at":"2026-08-07T15:05:12.925006Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:05:21.742706Z","title":null,"venue":null,"work_id":"dc4f7c2a-8405-4185-b18f-9d8c82826078","year":null},"citing_paper":{"arxiv_id":"2505.16369","last_updated":"2025-05-27T06:49:39Z","snapshot_observed_at":"2026-08-10T20:32:56.847856Z","submitted_at":"2025-05-22T08:23:54Z","title":"X-ARES: A Comprehensive Framework for Assessing Audio Encoder Performance","version":2},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-07T15:05:12.997487Z"},"links":{"citing_paper":"/paper/2505.16369"},"observation_digest":"sha256:e854caf4158d2928190363cb0a7752ee6122dbec8060b563ed716cb6cbfb3a01","observation_id":"993755cc-6b45-4341-9d80-3e9e0a935380","resolution":{"observed_at":"2026-08-07T15:05:21.858774Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:05:21.548834Z","title":"Speech tasks in X-ARES assess both linguistic content (e.g., speech content, word spotting) and paralinguistic features (e.g., emotion, speaker identity, accent)","venue":null,"work_id":"15d7ddb4-104f-4194-b9a2-0b527aebe943","year":null},"citing_paper":{"arxiv_id":"2505.16369","last_updated":"2025-05-27T06:49:39Z","snapshot_observed_at":"2026-08-10T20:32:56.847856Z","submitted_at":"2025-05-22T08:23:54Z","title":"X-ARES: A Comprehensive Framework for Assessing Audio Encoder Performance","version":2},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-07T15:05:13.082562Z"},"links":{"citing_paper":"/paper/2505.16369"},"observation_digest":"sha256:9c7f759e97897fabb97008ded8bf2c95a495ce28b1bef7f46a401bea9e8560a2","observation_id":"dc18be9a-6119-47be-887e-83e6eed81894","resolution":{"observed_at":"2026-08-07T15:05:21.622695Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:05:21.318218Z","title":"Task-Specific Metrics A summary of all metrics used in X-ARES is provided in Ta- ble 1","venue":null,"work_id":"b9f6a840-b158-40ea-8984-d476fffd95b2","year":null},"citing_paper":{"arxiv_id":"2505.16369","last_updated":"2025-05-27T06:49:39Z","snapshot_observed_at":"2026-08-10T20:32:56.847856Z","submitted_at":"2025-05-22T08:23:54Z","title":"X-ARES: A Comprehensive Framework for Assessing Audio Encoder Performance","version":2},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-07T15:05:13.139877Z"},"links":{"citing_paper":"/paper/2505.16369"},"observation_digest":"sha256:d59d115b415a5ee4277ebd15e57cfa481e785cbca79f4c781358f9b763649d9b","observation_id":"2dfd6b30-c20b-4582-962b-d9c6eec7a980","resolution":{"observed_at":"2026-08-07T15:05:21.406287Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:05:21.157042Z","title":"First, speech encoders such as data2vec [3], HuBERT [35], wav2vec2- large [2], WavLM [36] and Whisper-base [37]","venue":null,"work_id":"13f57284-1e57-485d-89bc-d13ce123705a","year":null},"citing_paper":{"arxiv_id":"2505.16369","last_updated":"2025-05-27T06:49:39Z","snapshot_observed_at":"2026-08-10T20:32:56.847856Z","submitted_at":"2025-05-22T08:23:54Z","title":"X-ARES: A Comprehensive Framework for Assessing Audio Encoder Performance","version":2},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-07T15:05:13.192515Z"},"links":{"citing_paper":"/paper/2505.16369"},"observation_digest":"sha256:333af2c21ae2972a87ed8c11b3d213d228af67769b7520c9d4e897e24d653b6c","observation_id":"4e4da20e-5f83-48ab-8ee3-207cda013197","resolution":{"observed_at":"2026-08-07T15:05:21.207688Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:05:21.026467Z","title":null,"venue":null,"work_id":"53028f36-9b27-4303-8994-85448d1a6314","year":null},"citing_paper":{"arxiv_id":"2505.16369","last_updated":"2025-05-27T06:49:39Z","snapshot_observed_at":"2026-08-10T20:32:56.847856Z","submitted_at":"2025-05-22T08:23:54Z","title":"X-ARES: A Comprehensive Framework for Assessing Audio Encoder Performance","version":2},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-07T15:05:13.266033Z"},"links":{"citing_paper":"/paper/2505.16369"},"observation_digest":"sha256:dca84cc183a282272da8d321e5977bd2744d13a92acad881ba3396d19ea69129","observation_id":"19e6f7d6-df6b-4ca8-86f1-4b048b78bcca","resolution":{"observed_at":"2026-08-07T15:05:21.070057Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:05:20.903637Z","title":"Scal- ing up masked audio encoder learning for general audio classifica- tion,","venue":null,"work_id":"7bb81c16-06a2-43bb-825f-21a9bd2baf9f","year":2024},"citing_paper":{"arxiv_id":"2505.16369","last_updated":"2025-05-27T06:49:39Z","snapshot_observed_at":"2026-08-10T20:32:56.847856Z","submitted_at":"2025-05-22T08:23:54Z","title":"X-ARES: A Comprehensive Framework for Assessing Audio Encoder Performance","version":2},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-07T15:05:13.321211Z"},"links":{"citing_paper":"/paper/2505.16369"},"observation_digest":"sha256:bbc28b116663c78526e37475df411b2b1743c057d920554878485cf465279ab6","observation_id":"1527872a-4813-475c-ae7b-70f75ee2c235","resolution":{"observed_at":"2026-08-07T15:05:20.948278Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:05:13.409608Z","title":"wav2vec 2.0: A framework for self-supervised learning of speech representations,","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2505.16369","last_updated":"2025-05-27T06:49:39Z","snapshot_observed_at":"2026-08-10T20:32:56.847856Z","submitted_at":"2025-05-22T08:23:54Z","title":"X-ARES: A Comprehensive Framework for Assessing Audio Encoder Performance","version":2},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-07T15:05:13.409608Z"},"links":{"citing_paper":"/paper/2505.16369"},"observation_digest":"sha256:def2d38582e7c55facde5d058f93f1e4877d5df9b61dba7697e530dff13ad2c5","observation_id":"06656f89-cb63-4e21-a1d1-0c6d306a15f6","resolution":{"observed_at":"2026-08-07T15:05:13.409608Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:05:13.477073Z","title":"Data2vec: A general framework for self-supervised learning in speech, vision and language,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2505.16369","last_updated":"2025-05-27T06:49:39Z","snapshot_observed_at":"2026-08-10T20:32:56.847856Z","submitted_at":"2025-05-22T08:23:54Z","title":"X-ARES: A Comprehensive Framework for Assessing Audio Encoder Performance","version":2},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-07T15:05:13.477073Z"},"links":{"citing_paper":"/paper/2505.16369"},"observation_digest":"sha256:d677654eca7cf2df5a55fc71b2e28623efeb4741295b82416c1458e245c96dda","observation_id":"f1ed79dd-3a94-4892-9e2d-c850a7aee805","resolution":{"observed_at":"2026-08-07T15:05:13.477073Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.07919","last_updated":"2023-12-21T10:20:42Z","snapshot_observed_at":"2026-08-07T10:17:55.688598Z","submitted_at":"2023-11-14T05:34:50Z","title":"Qwen-Audio: Advancing Universal Audio Understanding via Unified Large-Scale Audio-Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.07919","snapshot_observed_at":"2026-08-07T15:05:13.546494Z","title":"Qwen-audio: Advancing universal audio understand- ing via unified large-scale audio-language models,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.16369","last_updated":"2025-05-27T06:49:39Z","snapshot_observed_at":"2026-08-10T20:32:56.847856Z","submitted_at":"2025-05-22T08:23:54Z","title":"X-ARES: A Comprehensive Framework for Assessing Audio Encoder Performance","version":2},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-07T15:05:13.546494Z"},"links":{"cited_paper":"/paper/2311.07919","citing_paper":"/paper/2505.16369"},"observation_digest":"sha256:4baa3f4e150c0ce7713b95d7821f59bbe2511800b2cd99f18cca7cea40915063","observation_id":"439a7da9-d5ea-410b-b0ae-9e61248b5594","resolution":{"observed_at":"2026-08-07T15:05:13.546494Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:05:20.784235Z","title":"Moshi: a speech-text foundation model for real-time dialogue,","venue":null,"work_id":"36141bc2-b954-48d9-9526-0d8ceb6960d4","year":2024},"citing_paper":{"arxiv_id":"2505.16369","last_updated":"2025-05-27T06:49:39Z","snapshot_observed_at":"2026-08-10T20:32:56.847856Z","submitted_at":"2025-05-22T08:23:54Z","title":"X-ARES: A Comprehensive Framework for Assessing Audio Encoder Performance","version":2},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-07T15:05:13.634240Z"},"links":{"citing_paper":"/paper/2505.16369"},"observation_digest":"sha256:dd28052b9ce64ff727569265e8ae530d189130a2bd5b45b4f2802bbd4803bdfd","observation_id":"2ac3bb46-8cea-453b-a5b0-f256e9e01d9a","resolution":{"observed_at":"2026-08-07T15:05:20.842042Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2411.08742","last_updated":"2024-11-13T16:20:20Z","snapshot_observed_at":"2026-08-10T03:38:30.459521Z","submitted_at":"2024-11-13T16:20:20Z","title":"A Comparative Study of Discrete Speech Tokens for Semantic-Related Tasks with Large Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.08742","snapshot_observed_at":"2026-08-07T15:05:13.708782Z","title":"A comparative study of discrete speech tokens for semantic-related tasks with large language models,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.16369","last_updated":"2025-05-27T06:49:39Z","snapshot_observed_at":"2026-08-10T20:32:56.847856Z","submitted_at":"2025-05-22T08:23:54Z","title":"X-ARES: A Comprehensive Framework for Assessing Audio Encoder Performance","version":2},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-07T15:05:13.708782Z"},"links":{"cited_paper":"/paper/2411.08742","citing_paper":"/paper/2505.16369"},"observation_digest":"sha256:dd9a1cf8744d68fda5b45d614b8efd92da84254e504658fab349cea5c6f12e90","observation_id":"f5f248cf-2e0c-4431-ace5-6751d1a27ea2","resolution":{"observed_at":"2026-08-07T15:05:13.708782Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:05:20.531519Z","title":"HEAR: Holistic evaluation of audio representations,","venue":null,"work_id":"728edb43-53a6-4f3f-a6c5-a7f604f99fa1","year":2021},"citing_paper":{"arxiv_id":"2505.16369","last_updated":"2025-05-27T06:49:39Z","snapshot_observed_at":"2026-08-10T20:32:56.847856Z","submitted_at":"2025-05-22T08:23:54Z","title":"X-ARES: A Comprehensive Framework for Assessing Audio Encoder Performance","version":2},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-07T15:05:13.750037Z"},"links":{"citing_paper":"/paper/2505.16369"},"observation_digest":"sha256:c752e3f7b8dd3252990fa349107058b7fc9fdc40110847513ac6878cd5710d75","observation_id":"2e52c619-c6af-46ad-b5c9-5343f2bac86d","resolution":{"observed_at":"2026-08-07T15:05:20.642237Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:05:20.385000Z","title":"SUPERB: Speech processing universal performance benchmark,","venue":null,"work_id":"a81698e2-e7b7-4093-a96f-202deecfde3a","year":2021},"citing_paper":{"arxiv_id":"2505.16369","last_updated":"2025-05-27T06:49:39Z","snapshot_observed_at":"2026-08-10T20:32:56.847856Z","submitted_at":"2025-05-22T08:23:54Z","title":"X-ARES: A Comprehensive Framework for Assessing Audio Encoder Performance","version":2},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-07T15:05:13.786047Z"},"links":{"citing_paper":"/paper/2505.16369"},"observation_digest":"sha256:b70f1ec24975f2fdb1eb8fe4a57713cfe89c3fa32934d4099e24890d28f2ad5f","observation_id":"c729de9a-d587-4aad-9f1a-e3fed0156598","resolution":{"observed_at":"2026-08-07T15:05:20.446806Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.14294","last_updated":"2026-04-21T15:27:17Z","snapshot_observed_at":"2026-07-30T17:14:02.349402Z","submitted_at":"2024-06-20T13:23:27Z","title":"DASB - Discrete Audio and Speech Benchmark","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.14294","snapshot_observed_at":"2026-08-07T15:05:13.887958Z","title":"DASB–discrete audio and speech benchmark,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.16369","last_updated":"2025-05-27T06:49:39Z","snapshot_observed_at":"2026-08-10T20:32:56.847856Z","submitted_at":"2025-05-22T08:23:54Z","title":"X-ARES: A Comprehensive Framework for Assessing Audio Encoder Performance","version":2},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-07T15:05:13.887958Z"},"links":{"cited_paper":"/paper/2406.14294","citing_paper":"/paper/2505.16369"},"observation_digest":"sha256:5a894d5f240ccb6ba48b2aa514a8752f26407694582697a17d0b81e2760d04ff","observation_id":"dcec1deb-46c5-4495-bcb4-7b79390f6993","resolution":{"observed_at":"2026-08-07T15:05:13.887958Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:05:20.138048Z","title":"Webdataset: A library for efficient loading of large-scale datasets,","venue":null,"work_id":"e703213a-49b7-4ca2-899d-090e5136ace6","year":2021},"citing_paper":{"arxiv_id":"2505.16369","last_updated":"2025-05-27T06:49:39Z","snapshot_observed_at":"2026-08-10T20:32:56.847856Z","submitted_at":"2025-05-22T08:23:54Z","title":"X-ARES: A Comprehensive Framework for Assessing Audio Encoder Performance","version":2},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-07T15:05:13.947177Z"},"links":{"citing_paper":"/paper/2505.16369"},"observation_digest":"sha256:d94d9e75b5a4621124d3cc4d5150215a833d525f926a4df308adc3de75f07847","observation_id":"c9c21023-6c9d-4848-b8e6-0289d70ae5fa","resolution":{"observed_at":"2026-08-07T15:05:20.262234Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2411.18138","last_updated":"2024-11-27T08:38:57Z","snapshot_observed_at":"2026-08-09T02:58:40.541098Z","submitted_at":"2024-11-27T08:38:57Z","title":"SALMONN-omni: A Codec-free LLM for Full-duplex Speech Understanding and Generation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.18138","snapshot_observed_at":"2026-08-07T15:05:13.993912Z","title":"Salmonn-omni: A codec-free llm for full-duplex speech understanding and generation,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.16369","last_updated":"2025-05-27T06:49:39Z","snapshot_observed_at":"2026-08-10T20:32:56.847856Z","submitted_at":"2025-05-22T08:23:54Z","title":"X-ARES: A Comprehensive Framework for Assessing Audio Encoder Performance","version":2},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-07T15:05:13.993912Z"},"links":{"cited_paper":"/paper/2411.18138","citing_paper":"/paper/2505.16369"},"observation_digest":"sha256:b44f0b3c49f9606e7b901741618916880aadd199dae5a814ad4fc28cf2eb9a79","observation_id":"73c8ef13-d7cc-4755-9169-6b8a683ff4b4","resolution":{"observed_at":"2026-08-07T15:05:13.993912Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:05:19.911434Z","title":"Auto- matic speaker verification spoofing and countermeasures challenge (asvspoof 2015) database,","venue":null,"work_id":"1d988fc1-a8a0-4942-ad80-2e473cfddf68","year":2015},"citing_paper":{"arxiv_id":"2505.16369","last_updated":"2025-05-27T06:49:39Z","snapshot_observed_at":"2026-08-10T20:32:56.847856Z","submitted_at":"2025-05-22T08:23:54Z","title":"X-ARES: A Comprehensive Framework for Assessing Audio Encoder Performance","version":2},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-07T15:05:14.053402Z"},"links":{"citing_paper":"/paper/2505.16369"},"observation_digest":"sha256:6120209ab080e9c6b7a31691eb82eec200ab0025d6da8b9db3d10bfed6fc0c02","observation_id":"771974a9-2a03-491a-86a7-4004fae0a578","resolution":{"observed_at":"2026-08-07T15:05:19.995656Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:05:19.570425Z","title":"Crema-d: Crowd-sourced emotional multimodal actors dataset,","venue":null,"work_id":"41eff5bb-a3cd-4630-8246-fbc903a0ba89","year":2014},"citing_paper":{"arxiv_id":"2505.16369","last_updated":"2025-05-27T06:49:39Z","snapshot_observed_at":"2026-08-10T20:32:56.847856Z","submitted_at":"2025-05-22T08:23:54Z","title":"X-ARES: A Comprehensive Framework for Assessing Audio Encoder Performance","version":2},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-07T15:05:14.145115Z"},"links":{"citing_paper":"/paper/2505.16369"},"observation_digest":"sha256:c1b115be9c462fecfa44790d3e6481abe38ab9d0a19332bccaddae509aa233fe","observation_id":"a866a237-3e77-4dbc-898b-87660ba7ee8c","resolution":{"observed_at":"2026-08-07T15:05:19.743695Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1904.03670","last_updated":"2019-07-25T17:56:23Z","snapshot_observed_at":"2026-07-06T07:44:28.011439Z","submitted_at":"2019-04-07T15:24:32Z","title":"Speech Model Pre-training for End-to-End Spoken Language Understanding","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1904.03670","snapshot_observed_at":"2026-08-07T15:05:14.197126Z","title":"Speech model pre-training for end-to-end spoken language under- standing,","venue":null,"work_id":null,"year":1904},"citing_paper":{"arxiv_id":"2505.16369","last_updated":"2025-05-27T06:49:39Z","snapshot_observed_at":"2026-08-10T20:32:56.847856Z","submitted_at":"2025-05-22T08:23:54Z","title":"X-ARES: A Comprehensive Framework for Assessing Audio Encoder Performance","version":2},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-07T15:05:14.197126Z"},"links":{"cited_paper":"/paper/1904.03670","citing_paper":"/paper/2505.16369"},"observation_digest":"sha256:869276e89c6a5eb8853b1619fcef2114e5229cb5a737c1968b2cfecd43b2bfce","observation_id":"d5e70fa5-877b-462d-8c31-0932f4dfd7eb","resolution":{"observed_at":"2026-08-07T15:05:14.197126Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:05:19.297084Z","title":"Libricount, a dataset for speaker count estimation,","venue":null,"work_id":"c1cc5428-4f9f-4e98-b8c6-890fe49b95e4","year":2018},"citing_paper":{"arxiv_id":"2505.16369","last_updated":"2025-05-27T06:49:39Z","snapshot_observed_at":"2026-08-10T20:32:56.847856Z","submitted_at":"2025-05-22T08:23:54Z","title":"X-ARES: A Comprehensive Framework for Assessing Audio Encoder Performance","version":2},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-07T15:05:14.245520Z"},"links":{"citing_paper":"/paper/2505.16369"},"observation_digest":"sha256:9670778f29b65c8d35376ba8c1f9deff60dc64d810737b36d478713f7ee5d6cc","observation_id":"14ffa220-145d-49d7-b987-8b9d6fc74cfa","resolution":{"observed_at":"2026-08-07T15:05:19.411970Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:05:19.107386Z","title":"Librispeech: an asr corpus based on public domain audio books,","venue":null,"work_id":"861a8da0-7fc8-4af2-b675-8fd73bd27f9c","year":2015},"citing_paper":{"arxiv_id":"2505.16369","last_updated":"2025-05-27T06:49:39Z","snapshot_observed_at":"2026-08-10T20:32:56.847856Z","submitted_at":"2025-05-22T08:23:54Z","title":"X-ARES: A Comprehensive Framework for Assessing Audio Encoder Performance","version":2},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-07T15:05:14.314108Z"},"links":{"citing_paper":"/paper/2505.16369"},"observation_digest":"sha256:9a659cc529a7fcaa24413719aa6e314b5663ef5d5376c0ae57bcac772ad7ee63","observation_id":"9a8b808b-fa75-4ebb-b7db-3ae814e7ac6e","resolution":{"observed_at":"2026-08-07T15:05:19.185013Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:05:18.858069Z","title":"The ryerson audio-visual database of emotional speech and song (ravdess): A dynamic, mul- timodal set of facial and vocal expressions in north american en- glish,","venue":null,"work_id":"43c4729a-0b98-4103-860f-f51f633a629e","year":2018},"citing_paper":{"arxiv_id":"2505.16369","last_updated":"2025-05-27T06:49:39Z","snapshot_observed_at":"2026-08-10T20:32:56.847856Z","submitted_at":"2025-05-22T08:23:54Z","title":"X-ARES: A Comprehensive Framework for Assessing Audio Encoder Performance","version":2},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-07T15:05:14.351157Z"},"links":{"citing_paper":"/paper/2505.16369"},"observation_digest":"sha256:363c99932b587e0eec5761ca3150afd38b26aedc125537bb0c7888473031a424","observation_id":"965c1ea6-0086-4115-af28-0b07ec0223a9","resolution":{"observed_at":"2026-08-07T15:05:18.938845Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:05:18.730081Z","title":"V ocalsound: A dataset for improving human vocal sounds recognition,","venue":null,"work_id":"bf9d71d2-831e-4a74-9251-221c81a80fa5","year":2022},"citing_paper":{"arxiv_id":"2505.16369","last_updated":"2025-05-27T06:49:39Z","snapshot_observed_at":"2026-08-10T20:32:56.847856Z","submitted_at":"2025-05-22T08:23:54Z","title":"X-ARES: A Comprehensive Framework for Assessing Audio Encoder Performance","version":2},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-07T15:05:14.413893Z"},"links":{"citing_paper":"/paper/2505.16369"},"observation_digest":"sha256:6938efaf2dad231dcc97ec8db00fe7f9adf68659945b6af7cc4726d7a16a8fb1","observation_id":"fa3a3cd7-6b1c-4d24-acea-f2532c1d4aaa","resolution":{"observed_at":"2026-08-07T15:05:18.775240Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1804.03209","last_updated":"2018-04-09T19:58:17Z","snapshot_observed_at":"2026-07-06T06:32:32.083176Z","submitted_at":"2018-04-09T19:58:17Z","title":"Speech Commands: A Dataset for Limited-Vocabulary Speech Recognition","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1804.03209","snapshot_observed_at":"2026-08-07T15:05:14.453341Z","title":"Speech commands: A dataset for limited-vocabulary speech recognition,","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2505.16369","last_updated":"2025-05-27T06:49:39Z","snapshot_observed_at":"2026-08-10T20:32:56.847856Z","submitted_at":"2025-05-22T08:23:54Z","title":"X-ARES: A Comprehensive Framework for Assessing Audio Encoder Performance","version":2},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-07T15:05:14.453341Z"},"links":{"cited_paper":"/paper/1804.03209","citing_paper":"/paper/2505.16369"},"observation_digest":"sha256:ede0dffd8735548f709ed716597c458872a03e05507b30c6a7e8b918706f6468","observation_id":"de60e614-7968-4087-ac1d-bcad00f2d2b5","resolution":{"observed_at":"2026-08-07T15:05:14.453341Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:05:18.578462Z","title":"V oxceleb: Large-scale speaker verification in the wild,","venue":null,"work_id":"3ccf637c-23de-476c-91a9-410e33e8a9d0","year":2020},"citing_paper":{"arxiv_id":"2505.16369","last_updated":"2025-05-27T06:49:39Z","snapshot_observed_at":"2026-08-10T20:32:56.847856Z","submitted_at":"2025-05-22T08:23:54Z","title":"X-ARES: A Comprehensive Framework for Assessing Audio Encoder Performance","version":2},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-07T15:05:14.500431Z"},"links":{"citing_paper":"/paper/2505.16369"},"observation_digest":"sha256:6c27178b5c3d44840b07d839806f4003be5d6d7935fbd0d5beb7b66d4d056477","observation_id":"aed14a54-584f-4ce3-936f-e8b78d8d23da","resolution":{"observed_at":"2026-08-07T15:05:18.633665Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:05:18.429538Z","title":"V oxlingua107: a dataset for spoken lan- guage recognition,","venue":null,"work_id":"5e0ff778-e936-4046-a7d9-4ddd94612451","year":2021},"citing_paper":{"arxiv_id":"2505.16369","last_updated":"2025-05-27T06:49:39Z","snapshot_observed_at":"2026-08-10T20:32:56.847856Z","submitted_at":"2025-05-22T08:23:54Z","title":"X-ARES: A Comprehensive Framework for Assessing Audio Encoder Performance","version":2},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-07T15:05:14.602751Z"},"links":{"citing_paper":"/paper/2505.16369"},"observation_digest":"sha256:b5c457924e765f3abf75d0074bbfd0bc36f8e3da5dc9ba465a7352f788102630","observation_id":"9a978da9-62e7-4c3f-aadd-e26ad02fa055","resolution":{"observed_at":"2026-08-07T15:05:18.497605Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:05:18.266962Z","title":"Clotho: An audio cap- tioning dataset,","venue":null,"work_id":"4352c69b-76c1-4aa9-a2e2-581728445ed3","year":2020},"citing_paper":{"arxiv_id":"2505.16369","last_updated":"2025-05-27T06:49:39Z","snapshot_observed_at":"2026-08-10T20:32:56.847856Z","submitted_at":"2025-05-22T08:23:54Z","title":"X-ARES: A Comprehensive Framework for Assessing Audio Encoder Performance","version":2},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-07T15:05:14.683701Z"},"links":{"citing_paper":"/paper/2505.16369"},"observation_digest":"sha256:1083999260344144201404ed0e9a189aa7c821dcfceffa57a0599779bcfd4060","observation_id":"9c1653dc-7cf2-4660-8f5b-24600d37b9a4","resolution":{"observed_at":"2026-08-07T15:05:18.346780Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:05:14.729698Z","title":"Sound event detection in domestic environments with weakly labeled data and soundscape synthesis,","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2505.16369","last_updated":"2025-05-27T06:49:39Z","snapshot_observed_at":"2026-08-10T20:32:56.847856Z","submitted_at":"2025-05-22T08:23:54Z","title":"X-ARES: A Comprehensive Framework for Assessing Audio Encoder Performance","version":2},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-07T15:05:14.729698Z"},"links":{"citing_paper":"/paper/2505.16369"},"observation_digest":"sha256:40247bb613e4a54fd3908c1f286af011990b12704c9372fdc010b3546f1d9271","observation_id":"5aa12670-3ac5-4565-b519-cc23cd978ad0","resolution":{"observed_at":"2026-08-07T15:05:14.729698Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:05:18.167322Z","title":"Esc: Dataset for environmental sound classification,","venue":null,"work_id":"87f1e35f-ade6-4535-bdcc-8b6dc6926c86","year":2015},"citing_paper":{"arxiv_id":"2505.16369","last_updated":"2025-05-27T06:49:39Z","snapshot_observed_at":"2026-08-10T20:32:56.847856Z","submitted_at":"2025-05-22T08:23:54Z","title":"X-ARES: A Comprehensive Framework for Assessing Audio Encoder Performance","version":2},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-07T15:05:14.791640Z"},"links":{"citing_paper":"/paper/2505.16369"},"observation_digest":"sha256:64a5d80326925845f566c9d3accd17019a072786dbcf13e7280613d9701c3f37","observation_id":"f338b51a-d029-47c9-b170-a18b304474ff","resolution":{"observed_at":"2026-08-07T15:05:18.209463Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1807.09902","last_updated":"2018-10-07T02:25:28Z","snapshot_observed_at":"2026-07-06T06:52:21.185384Z","submitted_at":"2018-07-26T00:30:54Z","title":"General-purpose Tagging of Freesound Audio with AudioSet Labels: Task Description, Dataset, and Baseline","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1807.09902","snapshot_observed_at":"2026-08-07T15:05:14.851891Z","title":"General-purpose tagging of freesound audio with audioset labels: Task description, dataset, and baseline,","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2505.16369","last_updated":"2025-05-27T06:49:39Z","snapshot_observed_at":"2026-08-10T20:32:56.847856Z","submitted_at":"2025-05-22T08:23:54Z","title":"X-ARES: A Comprehensive Framework for Assessing Audio Encoder Performance","version":2},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-07T15:05:14.851891Z"},"links":{"cited_paper":"/paper/1807.09902","citing_paper":"/paper/2505.16369"},"observation_digest":"sha256:118f83b7ffb8b0a32c5713f93b0515ca1146ced092a26d8de6133faf05a80351","observation_id":"634f069f-c613-4450-af48-f650ef6c26d0","resolution":{"observed_at":"2026-08-07T15:05:14.851891Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:05:18.037391Z","title":"Fsd50k: an open dataset of human-labeled sound events,","venue":null,"work_id":"c48e9ec9-a2ee-4029-8f9c-cf832198c389","year":2021},"citing_paper":{"arxiv_id":"2505.16369","last_updated":"2025-05-27T06:49:39Z","snapshot_observed_at":"2026-08-10T20:32:56.847856Z","submitted_at":"2025-05-22T08:23:54Z","title":"X-ARES: A Comprehensive Framework for Assessing Audio Encoder Performance","version":2},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-07T15:05:14.894548Z"},"links":{"citing_paper":"/paper/2505.16369"},"observation_digest":"sha256:da6ca5abcb6023488a8afaef064f79b5551fe41eb946db5f731432b7d84cda5e","observation_id":"81afb060-0127-4091-84d4-bcf206baac7b","resolution":{"observed_at":"2026-08-07T15:05:18.105386Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:05:17.912691Z","title":"A dataset and taxonomy for urban sound research,","venue":null,"work_id":"5761ba0f-9abe-4c6f-8a3b-0b1a315bce83","year":2014},"citing_paper":{"arxiv_id":"2505.16369","last_updated":"2025-05-27T06:49:39Z","snapshot_observed_at":"2026-08-10T20:32:56.847856Z","submitted_at":"2025-05-22T08:23:54Z","title":"X-ARES: A Comprehensive Framework for Assessing Audio Encoder Performance","version":2},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-07T15:05:15.015691Z"},"links":{"citing_paper":"/paper/2505.16369"},"observation_digest":"sha256:e6fc2eae53d39927834409f62ad54637fb6dcc57134ce9422d7c624640b5ada1","observation_id":"4f14be62-c8e4-40b2-a172-651dbe937d78","resolution":{"observed_at":"2026-08-07T15:05:17.967320Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:05:17.781039Z","title":"V ocal imitation set: a dataset of vocally imitated sound events using the audioset ontol- ogy","venue":null,"work_id":"d07f5aec-c10f-4966-a9e5-20ee426e3bc8","year":2018},"citing_paper":{"arxiv_id":"2505.16369","last_updated":"2025-05-27T06:49:39Z","snapshot_observed_at":"2026-08-10T20:32:56.847856Z","submitted_at":"2025-05-22T08:23:54Z","title":"X-ARES: A Comprehensive Framework for Assessing Audio Encoder Performance","version":2},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-07T15:05:15.076689Z"},"links":{"citing_paper":"/paper/2505.16369"},"observation_digest":"sha256:1290f31dc7fa4549cc33094d990a8ce3859531ae4f5b407ad28386e69045c5cb","observation_id":"68e2ddd3-4fc4-4647-8672-3c4caa763074","resolution":{"observed_at":"2026-08-07T15:05:17.835492Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1612.01840","last_updated":"2017-09-05T18:38:33Z","snapshot_observed_at":"2026-07-06T05:21:33.309016Z","submitted_at":"2016-12-06T14:58:59Z","title":"FMA: A Dataset For Music Analysis","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1612.01840","snapshot_observed_at":"2026-08-07T15:05:15.124215Z","title":"Fma: A dataset for music analysis,","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2505.16369","last_updated":"2025-05-27T06:49:39Z","snapshot_observed_at":"2026-08-10T20:32:56.847856Z","submitted_at":"2025-05-22T08:23:54Z","title":"X-ARES: A Comprehensive Framework for Assessing Audio Encoder Performance","version":2},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-07T15:05:15.124215Z"},"links":{"cited_paper":"/paper/1612.01840","citing_paper":"/paper/2505.16369"},"observation_digest":"sha256:c437d1af01c214985db51712bae9f5d7a2242743f90604be87b06e993348640a","observation_id":"ed313b6f-be7c-49e9-9de2-3c4aff4b2c79","resolution":{"observed_at":"2026-08-07T15:05:15.124215Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1306.1461","last_updated":"2013-06-07T16:57:39Z","snapshot_observed_at":"2026-07-06T03:15:15.663270Z","submitted_at":"2013-06-06T16:30:44Z","title":"The GTZAN dataset: Its contents, its faults, their effects on evaluation, and its future use","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1306.1461","snapshot_observed_at":"2026-08-07T15:05:15.172725Z","title":"The gtzan dataset: Its contents, its faults, their effects on evaluation, and its future use,","venue":null,"work_id":null,"year":2013},"citing_paper":{"arxiv_id":"2505.16369","last_updated":"2025-05-27T06:49:39Z","snapshot_observed_at":"2026-08-10T20:32:56.847856Z","submitted_at":"2025-05-22T08:23:54Z","title":"X-ARES: A Comprehensive Framework for Assessing Audio Encoder Performance","version":2},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-07T15:05:15.172725Z"},"links":{"cited_paper":"/paper/1306.1461","citing_paper":"/paper/2505.16369"},"observation_digest":"sha256:0e7a4f9528e32d9ca08f274350dce44d6069b8204a86d0849923b165eea22a0f","observation_id":"4cab7c97-93df-4044-a300-c21eb5f64746","resolution":{"observed_at":"2026-08-07T15:05:15.172725Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:05:17.651821Z","title":"Enabling factorized piano music modeling and generation with the MAESTRO dataset,","venue":null,"work_id":"6fa66406-fd7b-420c-8c9e-d31677f5099f","year":2019},"citing_paper":{"arxiv_id":"2505.16369","last_updated":"2025-05-27T06:49:39Z","snapshot_observed_at":"2026-08-10T20:32:56.847856Z","submitted_at":"2025-05-22T08:23:54Z","title":"X-ARES: A Comprehensive Framework for Assessing Audio Encoder Performance","version":2},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-07T15:05:15.268363Z"},"links":{"citing_paper":"/paper/2505.16369"},"observation_digest":"sha256:1f12a24136d3178ccfb836fbec61ff98c062d20a352c73f42f620545f3d0c87d","observation_id":"08233fbb-8c66-45fb-9510-c75134e287b1","resolution":{"observed_at":"2026-08-07T15:05:17.698556Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:05:15.328284Z","title":"Neural audio synthesis of musical notes with wavenet autoencoders,","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2505.16369","last_updated":"2025-05-27T06:49:39Z","snapshot_observed_at":"2026-08-10T20:32:56.847856Z","submitted_at":"2025-05-22T08:23:54Z","title":"X-ARES: A Comprehensive Framework for Assessing Audio Encoder Performance","version":2},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-07T15:05:15.328284Z"},"links":{"citing_paper":"/paper/2505.16369"},"observation_digest":"sha256:deaad4739225059f4caaff8a59eeb7745a6335e7aea777d2eff9ecf4ed9457e2","observation_id":"92b1ddae-ce78-4abb-be0c-85afeef3dcd3","resolution":{"observed_at":"2026-08-07T15:05:15.328284Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1908.08962","last_updated":"2019-09-25T22:55:20Z","snapshot_observed_at":"2026-08-10T01:19:36.052302Z","submitted_at":"2019-08-23T18:02:05Z","title":"Well-Read Students Learn Better: On the Importance of Pre-training Compact Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1908.08962","snapshot_observed_at":"2026-08-07T15:05:15.374000Z","title":"Well-read stu- dents learn better: On the importance of pre-training compact mod- els,","venue":null,"work_id":null,"year":1908},"citing_paper":{"arxiv_id":"2505.16369","last_updated":"2025-05-27T06:49:39Z","snapshot_observed_at":"2026-08-10T20:32:56.847856Z","submitted_at":"2025-05-22T08:23:54Z","title":"X-ARES: A Comprehensive Framework for Assessing Audio Encoder Performance","version":2},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-07T15:05:15.374000Z"},"links":{"cited_paper":"/paper/1908.08962","citing_paper":"/paper/2505.16369"},"observation_digest":"sha256:19794ef2bacb8961845e4631ecf60a147fd562363cdcd75f2f278194641794ca","observation_id":"f79a4b8a-b26f-42a1-b1b4-ab7a545d4d09","resolution":{"observed_at":"2026-08-07T15:05:15.374000Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.15115","last_updated":"2025-01-03T02:18:21Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-12-19T17:56:09Z","title":"Qwen2.5 Technical Report","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.15115","snapshot_observed_at":"2026-08-07T15:05:15.440207Z","title":"Qwen2. 5 technical report,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.16369","last_updated":"2025-05-27T06:49:39Z","snapshot_observed_at":"2026-08-10T20:32:56.847856Z","submitted_at":"2025-05-22T08:23:54Z","title":"X-ARES: A Comprehensive Framework for Assessing Audio Encoder Performance","version":2},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-07T15:05:15.440207Z"},"links":{"cited_paper":"/paper/2412.15115","citing_paper":"/paper/2505.16369"},"observation_digest":"sha256:94a30abaa0fb50b2b8d8c516c2e039cb9a60efcf5e260f27783c43cec65f80d1","observation_id":"3d4c6043-9121-43c0-bad2-bdb496a44859","resolution":{"observed_at":"2026-08-07T15:05:15.440207Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:05:17.518490Z","title":"Hubert: Self-supervised speech represen- tation learning by masked prediction of hidden units,","venue":null,"work_id":"aae07e43-9ac6-47c3-9bc6-ba747c463742","year":2021},"citing_paper":{"arxiv_id":"2505.16369","last_updated":"2025-05-27T06:49:39Z","snapshot_observed_at":"2026-08-10T20:32:56.847856Z","submitted_at":"2025-05-22T08:23:54Z","title":"X-ARES: A Comprehensive Framework for Assessing Audio Encoder Performance","version":2},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-07T15:05:15.523038Z"},"links":{"citing_paper":"/paper/2505.16369"},"observation_digest":"sha256:6531afba27871d947752e0c4f6ddee70598850393041fcb6549b82876c466c78","observation_id":"499d38d2-16dd-4216-a0c9-77f8f2d873a0","resolution":{"observed_at":"2026-08-07T15:05:17.574285Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:05:17.365800Z","title":"Wavlm: Large-scale self-supervised pre-training for full stack speech processing,","venue":null,"work_id":"43b55aec-6921-4807-929c-70e3e2950871","year":2022},"citing_paper":{"arxiv_id":"2505.16369","last_updated":"2025-05-27T06:49:39Z","snapshot_observed_at":"2026-08-10T20:32:56.847856Z","submitted_at":"2025-05-22T08:23:54Z","title":"X-ARES: A Comprehensive Framework for Assessing Audio Encoder Performance","version":2},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-07T15:05:15.629508Z"},"links":{"citing_paper":"/paper/2505.16369"},"observation_digest":"sha256:7866c86665dd49a79951a0652a565673aaf8c7a3a248db54891d6da09593e051","observation_id":"2369ea91-14c9-4942-917f-7a350be7f87a","resolution":{"observed_at":"2026-08-07T15:05:17.410927Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:05:15.693579Z","title":"Robust speech recognition via large-scale weak supervision,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.16369","last_updated":"2025-05-27T06:49:39Z","snapshot_observed_at":"2026-08-10T20:32:56.847856Z","submitted_at":"2025-05-22T08:23:54Z","title":"X-ARES: A Comprehensive Framework for Assessing Audio Encoder Performance","version":2},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-07T15:05:15.693579Z"},"links":{"citing_paper":"/paper/2505.16369"},"observation_digest":"sha256:08890736e4df0f41d6c1c60b8fbaa5afb57ada83a54e90ab998d4538811f97a4","observation_id":"38afb6aa-897c-41a8-8494-e6cc89f06562","resolution":{"observed_at":"2026-08-07T15:05:15.693579Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2212.09058","last_updated":"2022-12-18T10:41:55Z","snapshot_observed_at":"2026-08-07T22:06:19.360625Z","submitted_at":"2022-12-18T10:41:55Z","title":"BEATs: Audio Pre-Training with Acoustic Tokenizers","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2212.09058","snapshot_observed_at":"2026-08-07T15:05:15.772955Z","title":"Beats: Audio pre-training with acoustic tokenizers,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2505.16369","last_updated":"2025-05-27T06:49:39Z","snapshot_observed_at":"2026-08-10T20:32:56.847856Z","submitted_at":"2025-05-22T08:23:54Z","title":"X-ARES: A Comprehensive Framework for Assessing Audio Encoder Performance","version":2},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-07T15:05:15.772955Z"},"links":{"cited_paper":"/paper/2212.09058","citing_paper":"/paper/2505.16369"},"observation_digest":"sha256:721f53fffd7174902c9ef4d3e5aed058638c76f4102c75425bdd8b5988450dc8","observation_id":"7beb06ff-c36e-4a0f-a60f-e687ac17af26","resolution":{"observed_at":"2026-08-07T15:05:15.772955Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:05:17.213385Z","title":"Byol-s: Learning self-supervised speech representations by bootstrapping,","venue":null,"work_id":"b65e0010-cff4-401d-b395-4174ebb28fc1","year":2022},"citing_paper":{"arxiv_id":"2505.16369","last_updated":"2025-05-27T06:49:39Z","snapshot_observed_at":"2026-08-10T20:32:56.847856Z","submitted_at":"2025-05-22T08:23:54Z","title":"X-ARES: A Comprehensive Framework for Assessing Audio Encoder Performance","version":2},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-07T15:05:15.912386Z"},"links":{"citing_paper":"/paper/2505.16369"},"observation_digest":"sha256:6c17de76c25ec8fc8cbf8770473856753b4ff072e1ae42ccfceb133cf4884298","observation_id":"ba6b32bd-cf43-428a-b26f-4614cd7e9644","resolution":{"observed_at":"2026-08-07T15:05:17.268704Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:05:17.018756Z","title":"Ced: Consis- tent ensemble distillation for audio tagging,","venue":null,"work_id":"94221435-9cb8-442b-9786-df3375e7b8fd","year":2024},"citing_paper":{"arxiv_id":"2505.16369","last_updated":"2025-05-27T06:49:39Z","snapshot_observed_at":"2026-08-10T20:32:56.847856Z","submitted_at":"2025-05-22T08:23:54Z","title":"X-ARES: A Comprehensive Framework for Assessing Audio Encoder Performance","version":2},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-07T15:05:15.978730Z"},"links":{"citing_paper":"/paper/2505.16369"},"observation_digest":"sha256:040e7d0f0ec7f079a3d55a6950cf6820b5d109e885d0906edd1d480259993584","observation_id":"d91046c1-1e72-4745-9417-b1265cd2227b","resolution":{"observed_at":"2026-08-07T15:05:17.114721Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:05:16.844968Z","title":"Self-supervised audio teacher-student transformer for both clip-level and frame-level tasks,","venue":null,"work_id":"a504b455-fbc1-4a01-bfa4-e41f1bb9483c","year":2024},"citing_paper":{"arxiv_id":"2505.16369","last_updated":"2025-05-27T06:49:39Z","snapshot_observed_at":"2026-08-10T20:32:56.847856Z","submitted_at":"2025-05-22T08:23:54Z","title":"X-ARES: A Comprehensive Framework for Assessing Audio Encoder Performance","version":2},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-07T15:05:16.094160Z"},"links":{"citing_paper":"/paper/2505.16369"},"observation_digest":"sha256:9cad87e31f49e0586d595962fe7abcbf9e560c5da09f47748bbc13e77e38bbd1","observation_id":"042f13fe-47ea-4425-8537-3c102c889efe","resolution":{"observed_at":"2026-08-07T15:05:16.908635Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:05:16.669372Z","title":"Masked modeling duo: Learning representations by encouraging both networks to model the input,","venue":null,"work_id":"986eae23-8fbd-45e3-9baa-c16a4f2777b9","year":2023},"citing_paper":{"arxiv_id":"2505.16369","last_updated":"2025-05-27T06:49:39Z","snapshot_observed_at":"2026-08-10T20:32:56.847856Z","submitted_at":"2025-05-22T08:23:54Z","title":"X-ARES: A Comprehensive Framework for Assessing Audio Encoder Performance","version":2},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-07T15:05:16.177062Z"},"links":{"citing_paper":"/paper/2505.16369"},"observation_digest":"sha256:d4a53339c89bfe380093d89a4a33eabf04310dfd59419b470181a40db5a6120b","observation_id":"4c617c87-c424-4433-88e4-a67a9575db48","resolution":{"observed_at":"2026-08-07T15:05:16.754608Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2505.16369","last_updated":"2025-05-27T06:49:39Z","latest_version":2,"primary_category":"cs.SD","snapshot_observed_at":"2026-08-10T20:32:56.847856Z","submitted_at":"2025-05-22T08:23:54Z","title":"X-ARES: A Comprehensive Framework for Assessing Audio Encoder Performance"},"reference_resolution":{"displayed":53,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":25,"verified_exact":0,"verified_fuzzy":28},"total_outbound_references":53},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"thesis":"As of 12 August 2026, this Paper Citation Record lists 53 of 53 outbound references and 4 inbound Pith citation observations for arXiv:2505.16369."}