Pith. sign in

Paper Citation Record · LEDGER

X-ARES: A Comprehensive Framework for Assessing Audio Encoder Performance

As of 18 August 2026, this Paper Citation Record lists 53 of 53 outbound references and 4 inbound Pith citation observations for arXiv:2505.16369.

A citation records a reference. It does not transfer a finding from one paper to another.

pith.paper-citation-record.v1
2505.16369 v2

Coverage vector

measured 53 of 53 reference resolution

Typed states for the displayed outbound observations.

Source: paper_references, paper_reference_links, observed 2026-08-07T15:05:16.177062Z

measured 57 of 57 standing notices

One-hop event checks from named stored sources.

Source: scholarly_work_events, retraction_status_cache, observed 2026-08-18T06:34:40.430872+00:00

measured 4 of 4 inbound itemization

Pith citing papers itemized under the disclosed page cap.

Source: paper_references, paper_reference_links, observed 2026-08-07T15:05:12.925006Z

measured 0 of 1 external citation measurements

A source-named dated measurement, never combined with another source.

Source: arxiv_reference, observed 2026-07-02T14:17:03.115400Z

Reference resolution

53 of 53 outbound references displayed

  • verified exact0
  • verified fuzzy28
  • unresolved25
  • parse uncertain0
  • malformed identifier0
  • metadata mismatch0

External citation measurements

No source-named external measurement is stored.

Outbound references

Observation 5c036217-80f1-4122-bc8b-f229c44341d8 · outbound

This paper cites an unresolved cited work.

X-ARES: A Comprehensive Framework for Assessing Audio Encoder Performance Unresolved cited work

Reference 1

Resolution
unresolved
raw_fallback, observed 2026-08-07T15:05:22.508548Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.

source=pdf_text observed=2026-08-07T15:05:12.633476Z digest=sha256:262c4e1ecefe5427992d343c1a451f57c000b198d83314354d12b13de6ce0c48

Observation dbca00b5-4be5-4ff5-8913-45f65a97eef7 · outbound

This paper cites an unresolved cited work.

X-ARES: A Comprehensive Framework for Assessing Audio Encoder Performance Unresolved cited work

Reference 2

Resolution
unresolved
raw_fallback, observed 2026-08-07T15:05:22.385652Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.

source=pdf_text observed=2026-08-07T15:05:12.686723Z digest=sha256:d9cf69443e8b5c84ff508283489c95349636fe1a308172c0995ac5efa1226602

Observation c4a2c8fe-1142-42e7-879a-c8299e39c340 · outbound

This paper cites an unresolved cited work.

X-ARES: A Comprehensive Framework for Assessing Audio Encoder Performance Unresolved cited work

Reference 3

Resolution
unresolved
raw_fallback, observed 2026-08-07T15:05:22.274533Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.

source=pdf_text observed=2026-08-07T15:05:12.760031Z digest=sha256:6f08312830d584bb652a8b62f192bfcc3242e96d09650b8d7070caa779243821

Observation b1232899-2511-4dea-b526-3db91cf0a0a5 · outbound

This paper cites an unresolved cited work.

X-ARES: A Comprehensive Framework for Assessing Audio Encoder Performance Unresolved cited work

Reference 4

Resolution
unresolved
raw_fallback, observed 2026-08-07T15:05:22.183876Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.

source=pdf_text observed=2026-08-07T15:05:12.846604Z digest=sha256:a7c0e42c3e95ed2fbf58d3f63156a3ec337e20efb22e448433d45da6dc06cad2

Observation 704ada23-c0ac-4b4b-86a8-cd5792e6c03c · outbound

This paper cites an unresolved cited work.

X-ARES: A Comprehensive Framework for Assessing Audio Encoder Performance Unresolved cited work

Reference 5

Resolution
unresolved
raw_fallback, observed 2026-08-07T15:05:22.060727Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.

source=pdf_text observed=2026-08-07T15:05:12.882556Z digest=sha256:cf2097a25753db6ba2c4cdf95dd8df6447caa4235cc96179f93555c52b63e770

Observation 2f11c02f-2ad4-4b77-9ca6-58eae6c42276 · outbound

This paper cites X-ARES: A Comprehensive Framework for Assessing Audio Encoder Performance.

X-ARES: A Comprehensive Framework for Assessing Audio Encoder Performance X-ARES: A Comprehensive Framework for Assessing Audio Encoder Performance

Reference 6

Resolution
unresolved
no resolver link, observed 2026-08-07T15:05:12.925006Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T15:05:12.925006Z digest=sha256:f611178ec2af928091dda3d9ed914223bd6b53279b4eff73c739b2f9a4bd5bd4

Observation 993755cc-6b45-4341-9d80-3e9e0a935380 · outbound

This paper cites an unresolved cited work.

X-ARES: A Comprehensive Framework for Assessing Audio Encoder Performance Unresolved cited work

Reference 7

Resolution
unresolved
raw_fallback, observed 2026-08-07T15:05:21.858774Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.

source=pdf_text observed=2026-08-07T15:05:12.997487Z digest=sha256:2d5c890ad6888dce246e49579b1d2db7a1a269fa1eaad8aa75a7e5da9921bb3d

Observation dc18be9a-6119-47be-887e-83e6eed81894 · outbound

This paper cites Speech tasks in X-ARES assess both linguistic content (e.g., speech content, word spotting) and paralinguistic features (e.g., emotion, speaker identity, accent).

X-ARES: A Comprehensive Framework for Assessing Audio Encoder Performance Speech tasks in X-ARES assess both linguistic content (e.g., speech content, word spotting) and paralinguistic features (e.g., emotion, speaker identity, accent)

Reference 8

Resolution
verified fuzzy
raw_fallback, observed 2026-08-07T15:05:21.622695Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.

source=pdf_text observed=2026-08-07T15:05:13.082562Z digest=sha256:247b88621848a2c94944605c927b44e9e714362a3625248fbe778de5fb487183

Observation 2dfd6b30-c20b-4582-962b-d9c6eec7a980 · outbound

This paper cites Task-Specific Metrics A summary of all metrics used in X-ARES is provided in Ta- ble 1.

X-ARES: A Comprehensive Framework for Assessing Audio Encoder Performance Task-Specific Metrics A summary of all metrics used in X-ARES is provided in Ta- ble 1

Reference 9

Resolution
verified fuzzy
raw_fallback, observed 2026-08-07T15:05:21.406287Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.

source=pdf_text observed=2026-08-07T15:05:13.139877Z digest=sha256:7a33bfddee6defd120204a9ed5e5b687cfd64f42f6d096627fdd13120a26e0b0

Observation 4e4da20e-5f83-48ab-8ee3-207cda013197 · outbound

This paper cites First, speech encoders such as data2vec [3], HuBERT [35], wav2vec2- large [2], WavLM [36] and Whisper-base [37].

X-ARES: A Comprehensive Framework for Assessing Audio Encoder Performance First, speech encoders such as data2vec [3], HuBERT [35], wav2vec2- large [2], WavLM [36] and Whisper-base [37]

Reference 10

Resolution
verified fuzzy
raw_fallback, observed 2026-08-07T15:05:21.207688Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.

source=pdf_text observed=2026-08-07T15:05:13.192515Z digest=sha256:096be86dca56538dded2d26aff97bdcc249369a9970f507f91ed7bb40108bc04

Observation 19e6f7d6-df6b-4ca8-86f1-4b048b78bcca · outbound

This paper cites an unresolved cited work.

X-ARES: A Comprehensive Framework for Assessing Audio Encoder Performance Unresolved cited work

Reference 11

Resolution
unresolved
raw_fallback, observed 2026-08-07T15:05:21.070057Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.

source=pdf_text observed=2026-08-07T15:05:13.266033Z digest=sha256:37eed5fe3df4233a9e45504d3d569486a01e3bd678defc60bcdcef01195cb37a

Observation 1527872a-4813-475c-ae7b-70f75ee2c235 · outbound

This paper cites Scal- ing up masked audio encoder learning for general audio classifica- tion,.

X-ARES: A Comprehensive Framework for Assessing Audio Encoder Performance Scal- ing up masked audio encoder learning for general audio classifica- tion,

Reference 12

Resolution
verified fuzzy
raw_fallback, observed 2026-08-07T15:05:20.948278Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.

source=pdf_text observed=2026-08-07T15:05:13.321211Z digest=sha256:08b461dcd9d41451bda87f0db1499b75f1b080d196b230717f21320b902c9e21

Observation 06656f89-cb63-4e21-a1d1-0c6d306a15f6 · outbound

This paper cites wav2vec 2.0: A framework for self-supervised learning of speech representations,.

X-ARES: A Comprehensive Framework for Assessing Audio Encoder Performance wav2vec 2.0: A framework for self-supervised learning of speech representations,

Reference 13

Resolution
unresolved
no resolver link, observed 2026-08-07T15:05:13.409608Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T15:05:13.409608Z digest=sha256:0d3aab17217afe3cc9d2aad6f3b74ee3ac52ab918031b898ff78a727f8844ad8

Observation f1ed79dd-3a94-4892-9e2d-c850a7aee805 · outbound

This paper cites Data2vec: A general framework for self-supervised learning in speech, vision and language,.

X-ARES: A Comprehensive Framework for Assessing Audio Encoder Performance Data2vec: A general framework for self-supervised learning in speech, vision and language,

Reference 14

Resolution
unresolved
no resolver link, observed 2026-08-07T15:05:13.477073Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T15:05:13.477073Z digest=sha256:6ddf4db9bf61f45931db77934fa727b14e5bd1119944072a06b9fb2adfc1dd31

Observation 439a7da9-d5ea-410b-b0ae-9e61248b5594 · outbound

This paper cites Qwen-Audio: Advancing Universal Audio Understanding via Unified Large-Scale Audio-Language Models.

X-ARES: A Comprehensive Framework for Assessing Audio Encoder Performance Qwen-Audio: Advancing Universal Audio Understanding via Unified Large-Scale Audio-Language Models

Reference 15

Resolution
unresolved
no resolver link, observed 2026-08-07T15:05:13.546494Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T15:05:13.546494Z digest=sha256:e6a83ac037ab72414c663580890f2f24f48b0665dd2003eb1dd0af1d6b99a167

Observation 2ac3bb46-8cea-453b-a5b0-f256e9e01d9a · outbound

This paper cites Moshi: a speech-text foundation model for real-time dialogue,.

X-ARES: A Comprehensive Framework for Assessing Audio Encoder Performance Moshi: a speech-text foundation model for real-time dialogue,

Reference 16

Resolution
verified fuzzy
raw_fallback, observed 2026-08-07T15:05:20.842042Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.

source=pdf_text observed=2026-08-07T15:05:13.634240Z digest=sha256:dd644e09f869e36f555b404f27e486f9b4f7ea732d81a876b55c841d3eed1e7f

Observation f5f248cf-2e0c-4431-ace5-6751d1a27ea2 · outbound

This paper cites A Comparative Study of Discrete Speech Tokens for Semantic-Related Tasks with Large Language Models.

X-ARES: A Comprehensive Framework for Assessing Audio Encoder Performance A Comparative Study of Discrete Speech Tokens for Semantic-Related Tasks with Large Language Models

Reference 17

Resolution
unresolved
no resolver link, observed 2026-08-07T15:05:13.708782Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T15:05:13.708782Z digest=sha256:c20e60b2f658fd8bebd103a7aa9e8477bd8bf95ddb80a31b94a39ae0eb333cba

Observation 2e52c619-c6af-46ad-b5c9-5343f2bac86d · outbound

This paper cites HEAR: Holistic evaluation of audio representations,.

X-ARES: A Comprehensive Framework for Assessing Audio Encoder Performance HEAR: Holistic evaluation of audio representations,

Reference 18

Resolution
verified fuzzy
raw_fallback, observed 2026-08-07T15:05:20.642237Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.

source=pdf_text observed=2026-08-07T15:05:13.750037Z digest=sha256:c36491fcc06bedda86a14728a858cc48d843dee96c452691489c8e1f416665a2

Observation c729de9a-d587-4aad-9f1a-e3fed0156598 · outbound

This paper cites SUPERB: Speech processing universal performance benchmark,.

X-ARES: A Comprehensive Framework for Assessing Audio Encoder Performance SUPERB: Speech processing universal performance benchmark,

Reference 19

Resolution
verified fuzzy
raw_fallback, observed 2026-08-07T15:05:20.446806Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.

source=pdf_text observed=2026-08-07T15:05:13.786047Z digest=sha256:620e7a7ded4328a2e879fc338c08b4dae44f70737e33355ac6a64bbbe26bb1f6

Observation dcec1deb-46c5-4495-bcb4-7b79390f6993 · outbound

This paper cites DASB - Discrete Audio and Speech Benchmark.

X-ARES: A Comprehensive Framework for Assessing Audio Encoder Performance DASB - Discrete Audio and Speech Benchmark

Reference 20

Resolution
unresolved
no resolver link, observed 2026-08-07T15:05:13.887958Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T15:05:13.887958Z digest=sha256:768c5c8cc4b30abbeba17dae9586262d829f81cc785296896b3050713853377d

Observation c9c21023-6c9d-4848-b8e6-0289d70ae5fa · outbound

This paper cites Webdataset: A library for efficient loading of large-scale datasets,.

X-ARES: A Comprehensive Framework for Assessing Audio Encoder Performance Webdataset: A library for efficient loading of large-scale datasets,

Reference 21

Resolution
verified fuzzy
raw_fallback, observed 2026-08-07T15:05:20.262234Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.

source=pdf_text observed=2026-08-07T15:05:13.947177Z digest=sha256:33a5b25a0b12c3834a01bf875e126f5866921ec095479b98abbe4a6d25913387

Observation 73c8ef13-d7cc-4755-9169-6b8a683ff4b4 · outbound

This paper cites SALMONN-omni: A Codec-free LLM for Full-duplex Speech Understanding and Generation.

X-ARES: A Comprehensive Framework for Assessing Audio Encoder Performance SALMONN-omni: A Codec-free LLM for Full-duplex Speech Understanding and Generation

Reference 22

Resolution
unresolved
no resolver link, observed 2026-08-07T15:05:13.993912Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T15:05:13.993912Z digest=sha256:bf8e50590c7c9c417406be81276ba2dcb01bb011866e42d7af224441052caf57

Observation 771974a9-2a03-491a-86a7-4004fae0a578 · outbound

This paper cites Auto- matic speaker verification spoofing and countermeasures challenge (asvspoof 2015) database,.

X-ARES: A Comprehensive Framework for Assessing Audio Encoder Performance Auto- matic speaker verification spoofing and countermeasures challenge (asvspoof 2015) database,

Reference 23

Resolution
verified fuzzy
raw_fallback, observed 2026-08-07T15:05:19.995656Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.

source=pdf_text observed=2026-08-07T15:05:14.053402Z digest=sha256:75baf57b38854c1cbacb025883d7f39e2d06a3574eb431fdcd80a05a41e9954b

Observation a866a237-3e77-4dbc-898b-87660ba7ee8c · outbound

This paper cites Crema-d: Crowd-sourced emotional multimodal actors dataset,.

X-ARES: A Comprehensive Framework for Assessing Audio Encoder Performance Crema-d: Crowd-sourced emotional multimodal actors dataset,

Reference 24

Resolution
verified fuzzy
raw_fallback, observed 2026-08-07T15:05:19.743695Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.

source=pdf_text observed=2026-08-07T15:05:14.145115Z digest=sha256:14f042f72f178711d5a345dddfef1dcbda5a7d859d927fe163d81dfdfe6d7097

Observation d5e70fa5-877b-462d-8c31-0932f4dfd7eb · outbound

This paper cites Speech Model Pre-training for End-to-End Spoken Language Understanding.

X-ARES: A Comprehensive Framework for Assessing Audio Encoder Performance Speech Model Pre-training for End-to-End Spoken Language Understanding

Reference 25

Resolution
unresolved
no resolver link, observed 2026-08-07T15:05:14.197126Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T15:05:14.197126Z digest=sha256:8837a91cb4da50c3cfb466262c16f6cee7dd77517ce0ad92995ed0678971e9e8

Observation 14ffa220-145d-49d7-b987-8b9d6fc74cfa · outbound

This paper cites Libricount, a dataset for speaker count estimation,.

X-ARES: A Comprehensive Framework for Assessing Audio Encoder Performance Libricount, a dataset for speaker count estimation,

Reference 26

Resolution
verified fuzzy
raw_fallback, observed 2026-08-07T15:05:19.411970Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.

source=pdf_text observed=2026-08-07T15:05:14.245520Z digest=sha256:83c0f9958f3bafc5f9252f089cbd31510522fa277168b62efcb440eb1f6c03fc

Observation 9a8b808b-fa75-4ebb-b7db-3ae814e7ac6e · outbound

This paper cites Librispeech: an asr corpus based on public domain audio books,.

X-ARES: A Comprehensive Framework for Assessing Audio Encoder Performance Librispeech: an asr corpus based on public domain audio books,

Reference 27

Resolution
verified fuzzy
raw_fallback, observed 2026-08-07T15:05:19.185013Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.

source=pdf_text observed=2026-08-07T15:05:14.314108Z digest=sha256:07a4d183c704da7fee516df4b23538b476fdd52f478b2163a1eb8e699f07092a

Observation 965c1ea6-0086-4115-af28-0b07ec0223a9 · outbound

This paper cites The ryerson audio-visual database of emotional speech and song (ravdess): A dynamic, mul- timodal set of facial and vocal expressions in north american en- glish,.

X-ARES: A Comprehensive Framework for Assessing Audio Encoder Performance The ryerson audio-visual database of emotional speech and song (ravdess): A dynamic, mul- timodal set of facial and vocal expressions in north american en- glish,

Reference 28

Resolution
verified fuzzy
raw_fallback, observed 2026-08-07T15:05:18.938845Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.

source=pdf_text observed=2026-08-07T15:05:14.351157Z digest=sha256:ee4fc0948e5a3331a2ce29c6b4463aa0065ae87a739650973bd2ad2bb6d73397

Observation fa3a3cd7-6b1c-4d24-acea-f2532c1d4aaa · outbound

This paper cites V ocalsound: A dataset for improving human vocal sounds recognition,.

X-ARES: A Comprehensive Framework for Assessing Audio Encoder Performance V ocalsound: A dataset for improving human vocal sounds recognition,

Reference 29

Resolution
verified fuzzy
raw_fallback, observed 2026-08-07T15:05:18.775240Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.

source=pdf_text observed=2026-08-07T15:05:14.413893Z digest=sha256:b8767bf43e8f2e38d595a6761876e765343fc38604e23cb83912f0a0b7aa55b2

Observation de60e614-7968-4087-ac1d-bcad00f2d2b5 · outbound

This paper cites Speech Commands: A Dataset for Limited-Vocabulary Speech Recognition.

X-ARES: A Comprehensive Framework for Assessing Audio Encoder Performance Speech Commands: A Dataset for Limited-Vocabulary Speech Recognition

Reference 30

Resolution
unresolved
no resolver link, observed 2026-08-07T15:05:14.453341Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T15:05:14.453341Z digest=sha256:d3bf88e3df07c289d538b43aa5a1ac20adeb0f5f37f5fd241d34100bb12af515

Observation aed14a54-584f-4ce3-936f-e8b78d8d23da · outbound

This paper cites V oxceleb: Large-scale speaker verification in the wild,.

X-ARES: A Comprehensive Framework for Assessing Audio Encoder Performance V oxceleb: Large-scale speaker verification in the wild,

Reference 31

Resolution
verified fuzzy
raw_fallback, observed 2026-08-07T15:05:18.633665Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.

source=pdf_text observed=2026-08-07T15:05:14.500431Z digest=sha256:23268830f66d1f220e546ffadfa25b9a7d5633f60fe6f1ce145c49cba19fb311

Observation 9a978da9-62e7-4c3f-aadd-e26ad02fa055 · outbound

This paper cites V oxlingua107: a dataset for spoken lan- guage recognition,.

X-ARES: A Comprehensive Framework for Assessing Audio Encoder Performance V oxlingua107: a dataset for spoken lan- guage recognition,

Reference 32

Resolution
verified fuzzy
raw_fallback, observed 2026-08-07T15:05:18.497605Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.

source=pdf_text observed=2026-08-07T15:05:14.602751Z digest=sha256:7762959e281a85e3af30eebb91fc0af1d1ead910200ee5a60afbba6152b11e87

Observation 9c1653dc-7cf2-4660-8f5b-24600d37b9a4 · outbound

This paper cites Clotho: An audio cap- tioning dataset,.

X-ARES: A Comprehensive Framework for Assessing Audio Encoder Performance Clotho: An audio cap- tioning dataset,

Reference 33

Resolution
verified fuzzy
raw_fallback, observed 2026-08-07T15:05:18.346780Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.

source=pdf_text observed=2026-08-07T15:05:14.683701Z digest=sha256:688725d83ded0972e77bffaede7f2820e1612ff8c41a5ca0b9f8527ab406870f

Observation 5aa12670-3ac5-4565-b519-cc23cd978ad0 · outbound

This paper cites Sound event detection in domestic environments with weakly labeled data and soundscape synthesis,.

X-ARES: A Comprehensive Framework for Assessing Audio Encoder Performance Sound event detection in domestic environments with weakly labeled data and soundscape synthesis,

Reference 34

Resolution
unresolved
no resolver link, observed 2026-08-07T15:05:14.729698Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T15:05:14.729698Z digest=sha256:2e0cbd1e086ca647dc8dc653a1c3a3fbbd8714713a287e19f48407425f9db8fe

Observation f338b51a-d029-47c9-b170-a18b304474ff · outbound

This paper cites Esc: Dataset for environmental sound classification,.

X-ARES: A Comprehensive Framework for Assessing Audio Encoder Performance Esc: Dataset for environmental sound classification,

Reference 35

Resolution
verified fuzzy
raw_fallback, observed 2026-08-07T15:05:18.209463Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.

source=pdf_text observed=2026-08-07T15:05:14.791640Z digest=sha256:d31d738014c85fbd56fb02758b082741dae11295304c717a73318edc2bcb54d6

Observation 634f069f-c613-4450-af48-f650ef6c26d0 · outbound

This paper cites General-purpose Tagging of Freesound Audio with AudioSet Labels: Task Description, Dataset, and Baseline.

X-ARES: A Comprehensive Framework for Assessing Audio Encoder Performance General-purpose Tagging of Freesound Audio with AudioSet Labels: Task Description, Dataset, and Baseline

Reference 36

Resolution
unresolved
no resolver link, observed 2026-08-07T15:05:14.851891Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T15:05:14.851891Z digest=sha256:effd16dd8d4d6730ea47d639f890955cae04157e6afc51cf1593b1b68f00f6fd

Observation 81afb060-0127-4091-84d4-bcf206baac7b · outbound

This paper cites Fsd50k: an open dataset of human-labeled sound events,.

X-ARES: A Comprehensive Framework for Assessing Audio Encoder Performance Fsd50k: an open dataset of human-labeled sound events,

Reference 37

Resolution
verified fuzzy
raw_fallback, observed 2026-08-07T15:05:18.105386Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.

source=pdf_text observed=2026-08-07T15:05:14.894548Z digest=sha256:70db2377f9a31077f3427273363f7e845307fce902a811e8388c8daadb07c64e

Observation 4f14be62-c8e4-40b2-a172-651dbe937d78 · outbound

This paper cites A dataset and taxonomy for urban sound research,.

X-ARES: A Comprehensive Framework for Assessing Audio Encoder Performance A dataset and taxonomy for urban sound research,

Reference 38

Resolution
verified fuzzy
raw_fallback, observed 2026-08-07T15:05:17.967320Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.

source=pdf_text observed=2026-08-07T15:05:15.015691Z digest=sha256:4f34cac62945c58f8daea640ea630a9ae0892ecadf1af79298ab5186ed973f23

Observation 68e2ddd3-4fc4-4647-8672-3c4caa763074 · outbound

This paper cites V ocal imitation set: a dataset of vocally imitated sound events using the audioset ontol- ogy.

X-ARES: A Comprehensive Framework for Assessing Audio Encoder Performance V ocal imitation set: a dataset of vocally imitated sound events using the audioset ontol- ogy

Reference 39

Resolution
verified fuzzy
raw_fallback, observed 2026-08-07T15:05:17.835492Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.

source=pdf_text observed=2026-08-07T15:05:15.076689Z digest=sha256:cb8d55809aea7e7d2e972f640ddbc6fff0ddad4438cc95e082358db52a0d6869

Observation ed313b6f-be7c-49e9-9de2-3c4aff4b2c79 · outbound

This paper cites FMA: A Dataset For Music Analysis.

X-ARES: A Comprehensive Framework for Assessing Audio Encoder Performance FMA: A Dataset For Music Analysis

Reference 40

Resolution
unresolved
no resolver link, observed 2026-08-07T15:05:15.124215Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T15:05:15.124215Z digest=sha256:04e1a1f7fc055d47ef7ba400586c74566e7712250f09ad7cde0eb594b7f99002

Observation 4cab7c97-93df-4044-a300-c21eb5f64746 · outbound

This paper cites The GTZAN dataset: Its contents, its faults, their effects on evaluation, and its future use.

X-ARES: A Comprehensive Framework for Assessing Audio Encoder Performance The GTZAN dataset: Its contents, its faults, their effects on evaluation, and its future use

Reference 41

Resolution
unresolved
no resolver link, observed 2026-08-07T15:05:15.172725Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T15:05:15.172725Z digest=sha256:dad50f73c97c9a717be75f2bf975d3285b991034921cfc55daba118ed7d3a316

Observation 08233fbb-8c66-45fb-9510-c75134e287b1 · outbound

This paper cites Enabling factorized piano music modeling and generation with the MAESTRO dataset,.

X-ARES: A Comprehensive Framework for Assessing Audio Encoder Performance Enabling factorized piano music modeling and generation with the MAESTRO dataset,

Reference 42

Resolution
verified fuzzy
raw_fallback, observed 2026-08-07T15:05:17.698556Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.

source=pdf_text observed=2026-08-07T15:05:15.268363Z digest=sha256:1e9f0bffa40928c3773408c3bc2c5f33f931d97c5b59195444ae9fc591c6a1a4

Observation 92b1ddae-ce78-4abb-be0c-85afeef3dcd3 · outbound

This paper cites Neural audio synthesis of musical notes with wavenet autoencoders,.

X-ARES: A Comprehensive Framework for Assessing Audio Encoder Performance Neural audio synthesis of musical notes with wavenet autoencoders,

Reference 43

Resolution
unresolved
no resolver link, observed 2026-08-07T15:05:15.328284Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T15:05:15.328284Z digest=sha256:bd89ba34ea94358f16635f50bc09dbabaf4b60673c5483119d4e7167dc276a97

Observation f79a4b8a-b26f-42a1-b1b4-ab7a545d4d09 · outbound

This paper cites Well-Read Students Learn Better: On the Importance of Pre-training Compact Models.

X-ARES: A Comprehensive Framework for Assessing Audio Encoder Performance Well-Read Students Learn Better: On the Importance of Pre-training Compact Models

Reference 44

Resolution
unresolved
no resolver link, observed 2026-08-07T15:05:15.374000Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T15:05:15.374000Z digest=sha256:0c4977d7bc98df29ccbceacf80b863333a40d978329871b3a69199ac6ece6811

Observation 3d4c6043-9121-43c0-bad2-bdb496a44859 · outbound

This paper cites Qwen2.5 Technical Report.

X-ARES: A Comprehensive Framework for Assessing Audio Encoder Performance Qwen2.5 Technical Report

Reference 45

Resolution
unresolved
no resolver link, observed 2026-08-07T15:05:15.440207Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T15:05:15.440207Z digest=sha256:80651e245fcb49df8215176777c79bb6f38c0f827729fc2287d4c43df54c61f5

Observation 499d38d2-16dd-4216-a0c9-77f8f2d873a0 · outbound

This paper cites Hubert: Self-supervised speech represen- tation learning by masked prediction of hidden units,.

X-ARES: A Comprehensive Framework for Assessing Audio Encoder Performance Hubert: Self-supervised speech represen- tation learning by masked prediction of hidden units,

Reference 46

Resolution
verified fuzzy
raw_fallback, observed 2026-08-07T15:05:17.574285Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.

source=pdf_text observed=2026-08-07T15:05:15.523038Z digest=sha256:49cafb562c6e9608d912303cceecb8d9109818fbcd1bc3584d13492fa711debc

Observation 2369ea91-14c9-4942-917f-7a350be7f87a · outbound

This paper cites Wavlm: Large-scale self-supervised pre-training for full stack speech processing,.

X-ARES: A Comprehensive Framework for Assessing Audio Encoder Performance Wavlm: Large-scale self-supervised pre-training for full stack speech processing,

Reference 47

Resolution
verified fuzzy
raw_fallback, observed 2026-08-07T15:05:17.410927Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.

source=pdf_text observed=2026-08-07T15:05:15.629508Z digest=sha256:0378b786c103075a600909339b6f08d9bc6ca2bb2a73083396a74d192c75ae93

Observation 38afb6aa-897c-41a8-8494-e6cc89f06562 · outbound

This paper cites Robust speech recognition via large-scale weak supervision,.

X-ARES: A Comprehensive Framework for Assessing Audio Encoder Performance Robust speech recognition via large-scale weak supervision,

Reference 48

Resolution
unresolved
no resolver link, observed 2026-08-07T15:05:15.693579Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T15:05:15.693579Z digest=sha256:c80ad56064cd283d2dded23e3110ebd4ad9d4e9c48347936dc73fae44a85bc06

Observation 7beb06ff-c36e-4a0f-a60f-e687ac17af26 · outbound

This paper cites BEATs: Audio Pre-Training with Acoustic Tokenizers.

X-ARES: A Comprehensive Framework for Assessing Audio Encoder Performance BEATs: Audio Pre-Training with Acoustic Tokenizers

Reference 49

Resolution
unresolved
no resolver link, observed 2026-08-07T15:05:15.772955Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T15:05:15.772955Z digest=sha256:4c44fe7259bffbb7400e73b71a858321ad12c45b4d657f30b7c087a40d9d82cd

Observation ba6b32bd-cf43-428a-b26f-4614cd7e9644 · outbound

This paper cites Byol-s: Learning self-supervised speech representations by bootstrapping,.

X-ARES: A Comprehensive Framework for Assessing Audio Encoder Performance Byol-s: Learning self-supervised speech representations by bootstrapping,

Reference 50

Resolution
verified fuzzy
raw_fallback, observed 2026-08-07T15:05:17.268704Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.

source=pdf_text observed=2026-08-07T15:05:15.912386Z digest=sha256:8fbef69b021497c6afa438fe9985187bfb301b7af8cb47407fa9a179ff5cb7b1

Observation d91046c1-1e72-4745-9417-b1265cd2227b · outbound

This paper cites Ced: Consis- tent ensemble distillation for audio tagging,.

X-ARES: A Comprehensive Framework for Assessing Audio Encoder Performance Ced: Consis- tent ensemble distillation for audio tagging,

Reference 51

Resolution
verified fuzzy
raw_fallback, observed 2026-08-07T15:05:17.114721Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.

source=pdf_text observed=2026-08-07T15:05:15.978730Z digest=sha256:f3ff886ca40bb6c76f6e9d5da44fa0a82ecca50701a4b538ef766a02202a4c61

Observation 042f13fe-47ea-4425-8537-3c102c889efe · outbound

This paper cites Self-supervised audio teacher-student transformer for both clip-level and frame-level tasks,.

X-ARES: A Comprehensive Framework for Assessing Audio Encoder Performance Self-supervised audio teacher-student transformer for both clip-level and frame-level tasks,

Reference 52

Resolution
verified fuzzy
raw_fallback, observed 2026-08-07T15:05:16.908635Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.

source=pdf_text observed=2026-08-07T15:05:16.094160Z digest=sha256:e34cdbc5518c38e45651bb63c686aced671cd148c10599cbfdc94cb229a68c78

Observation 4c617c87-c424-4433-88e4-a67a9575db48 · outbound

This paper cites Masked modeling duo: Learning representations by encouraging both networks to model the input,.

X-ARES: A Comprehensive Framework for Assessing Audio Encoder Performance Masked modeling duo: Learning representations by encouraging both networks to model the input,

Reference 53

Resolution
verified fuzzy
raw_fallback, observed 2026-08-07T15:05:16.754608Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.

source=pdf_text observed=2026-08-07T15:05:16.177062Z digest=sha256:50eab1f91c8e3ee07f1b5c31730d4633e954eb7b9c851faf78f207566789b39c

Pith citing papers

Observation 2f11c02f-2ad4-4b77-9ca6-58eae6c42276 · inbound

X-ARES: A Comprehensive Framework for Assessing Audio Encoder Performance cites this paper.

X-ARES: A Comprehensive Framework for Assessing Audio Encoder Performance X-ARES: A Comprehensive Framework for Assessing Audio Encoder Performance

Reference 6

Resolution
unresolved
no resolver link, observed 2026-08-07T15:05:12.925006Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T15:05:12.925006Z digest=sha256:f611178ec2af928091dda3d9ed914223bd6b53279b4eff73c739b2f9a4bd5bd4

Observation 054cc496-1d59-4e3e-8e16-1c7faa9956a9 · inbound

AU-Harness: An Open-Source Toolkit for Holistic Evaluation of Audio LLMs cites this paper.

AU-Harness: An Open-Source Toolkit for Holistic Evaluation of Audio LLMs X-ARES: A Comprehensive Framework for Assessing Audio Encoder Performance

Reference 20

Resolution
verified exact
arxiv_id, observed 2026-05-18T18:11:43.145790Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.

source=pdf_text observed=2026-05-18T18:07:01.257126Z digest=sha256:4fe96c2b9e3a934500bc8b7fe210657ebbd0a3d3559b8bcd4580a1abd57add9d

Observation 50834e18-e74a-4b31-a36e-a43cb59cea13 · inbound

Probing Spatial Structure in Pretrained Audio Representations cites this paper.

Probing Spatial Structure in Pretrained Audio Representations X-ARES: A Comprehensive Framework for Assessing Audio Encoder Performance

Reference 15

Resolution
metadata mismatch
arxiv_id, observed 2026-07-02T14:17:03.116783Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.

source=pdf_text observed=2026-06-28T00:34:43.472094Z digest=sha256:a47b9ae0e2c68e6290151aaa2594e57a0a26d36bb9eda9ad59785f6bb4830c8f

Observation ed45fb58-73c8-4f9a-baa7-ded281058537 · inbound

Probing Spatial Structure in Pretrained Audio Representations cites this paper.

Probing Spatial Structure in Pretrained Audio Representations X-ARES: A Comprehensive Framework for Assessing Audio Encoder Performance

Reference 15

Resolution
unresolved
no resolver link, observed 2026-08-02T12:23:45.341806Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-02T12:23:45.341806Z digest=sha256:5e32ed32382bb2c370cb68e0d4f4c4aefe92787094e9692d578932ae0d1f2a04