Pith. sign in

Paper Citation Record · LEDGER

X-ARES: A Comprehensive Framework for Assessing Audio Encoder Performance

As of 8 August 2026, this Paper Citation Record lists 53 of 53 outbound references and 4 inbound Pith citation observations for arXiv:2505.16369.

A citation records a reference. It does not transfer a finding from one paper to another.

pith.paper-citation-record.v1
2505.16369 v2

Coverage vector

measured 53 of 53 reference resolution

Typed states for the displayed outbound observations.

Source: paper_references, paper_reference_links, observed 2026-08-07T15:05:16.177062Z

measured 57 of 57 standing notices

One-hop event checks from named stored sources.

Source: scholarly_work_events, retraction_status_cache, observed 2026-08-07T06:34:17.273281+00:00

measured 4 of 4 inbound itemization

Pith citing papers itemized under the disclosed page cap.

Source: paper_references, paper_reference_links, observed 2026-08-07T15:05:12.925006Z

measured 0 of 1 external citation measurements

A source-named dated measurement, never combined with another source.

Source: arxiv_reference, observed 2026-07-02T14:17:03.115400Z

Reference resolution

53 of 53 outbound references displayed

  • verified exact0
  • verified fuzzy28
  • unresolved25
  • parse uncertain0
  • malformed identifier0
  • metadata mismatch0

External citation measurements

No source-named external measurement is stored.

Outbound references

Observation 5c036217-80f1-4122-bc8b-f229c44341d8 · outbound

This paper cites an unresolved cited work.

X-ARES: A Comprehensive Framework for Assessing Audio Encoder Performance Unresolved cited work

Reference 1

Resolution
unresolved
raw_fallback, observed 2026-08-07T15:05:22.508548Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.

source=pdf_text observed=2026-08-07T15:05:12.633476Z digest=sha256:68ec45b039f683b37b5163d682340298b6d73906abd1c2166a1ee6d0fb2cbaff

Observation dbca00b5-4be5-4ff5-8913-45f65a97eef7 · outbound

This paper cites an unresolved cited work.

X-ARES: A Comprehensive Framework for Assessing Audio Encoder Performance Unresolved cited work

Reference 2

Resolution
unresolved
raw_fallback, observed 2026-08-07T15:05:22.385652Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.

source=pdf_text observed=2026-08-07T15:05:12.686723Z digest=sha256:e8ba2ee54135dcecd136777039ea1259b6e4f3097b9616a419caf71d8c31f6d4

Observation c4a2c8fe-1142-42e7-879a-c8299e39c340 · outbound

This paper cites an unresolved cited work.

X-ARES: A Comprehensive Framework for Assessing Audio Encoder Performance Unresolved cited work

Reference 3

Resolution
unresolved
raw_fallback, observed 2026-08-07T15:05:22.274533Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.

source=pdf_text observed=2026-08-07T15:05:12.760031Z digest=sha256:831975b8450abf48c7ab2844005adf70c482c41578f894d90ba2a937ec62cf13

Observation b1232899-2511-4dea-b526-3db91cf0a0a5 · outbound

This paper cites an unresolved cited work.

X-ARES: A Comprehensive Framework for Assessing Audio Encoder Performance Unresolved cited work

Reference 4

Resolution
unresolved
raw_fallback, observed 2026-08-07T15:05:22.183876Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.

source=pdf_text observed=2026-08-07T15:05:12.846604Z digest=sha256:8b43c59becdd9f3eacce7244a553cdbeddaad501fe7ac42bc9427bdac54bda31

Observation 704ada23-c0ac-4b4b-86a8-cd5792e6c03c · outbound

This paper cites an unresolved cited work.

X-ARES: A Comprehensive Framework for Assessing Audio Encoder Performance Unresolved cited work

Reference 5

Resolution
unresolved
raw_fallback, observed 2026-08-07T15:05:22.060727Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.

source=pdf_text observed=2026-08-07T15:05:12.882556Z digest=sha256:2b19b4d83efdff1debf60eae9850efd577dacc3db9006a91a2aee907dd813062

Observation 2f11c02f-2ad4-4b77-9ca6-58eae6c42276 · outbound

This paper cites X-ARES: A Comprehensive Framework for Assessing Audio Encoder Performance.

X-ARES: A Comprehensive Framework for Assessing Audio Encoder Performance X-ARES: A Comprehensive Framework for Assessing Audio Encoder Performance

Reference 6

Resolution
unresolved
no resolver link, observed 2026-08-07T15:05:12.925006Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T15:05:12.925006Z digest=sha256:dc8950d8c6bfeccd9f27a88b9b7277f1b82b143ea9d4beef12fe283d65c841c9

Observation 993755cc-6b45-4341-9d80-3e9e0a935380 · outbound

This paper cites an unresolved cited work.

X-ARES: A Comprehensive Framework for Assessing Audio Encoder Performance Unresolved cited work

Reference 7

Resolution
unresolved
raw_fallback, observed 2026-08-07T15:05:21.858774Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.

source=pdf_text observed=2026-08-07T15:05:12.997487Z digest=sha256:6369adedc5f3ea4942a02689a7320154546ff62c5c2925c4b53938c773602b8f

Observation dc18be9a-6119-47be-887e-83e6eed81894 · outbound

This paper cites Speech tasks in X-ARES assess both linguistic content (e.g., speech content, word spotting) and paralinguistic features (e.g., emotion, speaker identity, accent).

X-ARES: A Comprehensive Framework for Assessing Audio Encoder Performance Speech tasks in X-ARES assess both linguistic content (e.g., speech content, word spotting) and paralinguistic features (e.g., emotion, speaker identity, accent)

Reference 8

Resolution
verified fuzzy
raw_fallback, observed 2026-08-07T15:05:21.622695Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.

source=pdf_text observed=2026-08-07T15:05:13.082562Z digest=sha256:98cf5347d29ad045633a99fa5e83e70e00f4890bd221a25c565df2e618affe4d

Observation 2dfd6b30-c20b-4582-962b-d9c6eec7a980 · outbound

This paper cites Task-Specific Metrics A summary of all metrics used in X-ARES is provided in Ta- ble 1.

X-ARES: A Comprehensive Framework for Assessing Audio Encoder Performance Task-Specific Metrics A summary of all metrics used in X-ARES is provided in Ta- ble 1

Reference 9

Resolution
verified fuzzy
raw_fallback, observed 2026-08-07T15:05:21.406287Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.

source=pdf_text observed=2026-08-07T15:05:13.139877Z digest=sha256:fdefe47d7d5dd731cde66be1869e7b8e1fa4158252f5ef8c203ea84c5e563373

Observation 4e4da20e-5f83-48ab-8ee3-207cda013197 · outbound

This paper cites First, speech encoders such as data2vec [3], HuBERT [35], wav2vec2- large [2], WavLM [36] and Whisper-base [37].

X-ARES: A Comprehensive Framework for Assessing Audio Encoder Performance First, speech encoders such as data2vec [3], HuBERT [35], wav2vec2- large [2], WavLM [36] and Whisper-base [37]

Reference 10

Resolution
verified fuzzy
raw_fallback, observed 2026-08-07T15:05:21.207688Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.

source=pdf_text observed=2026-08-07T15:05:13.192515Z digest=sha256:803fa24015a01c9fd05dc1b22a47954ef955c798904dc1b1b775a3fab002dce1

Observation 19e6f7d6-df6b-4ca8-86f1-4b048b78bcca · outbound

This paper cites an unresolved cited work.

X-ARES: A Comprehensive Framework for Assessing Audio Encoder Performance Unresolved cited work

Reference 11

Resolution
unresolved
raw_fallback, observed 2026-08-07T15:05:21.070057Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.

source=pdf_text observed=2026-08-07T15:05:13.266033Z digest=sha256:d082b4de7e1a181e6bd26e6d639aed7b8f3b76e17fd0500ed1fb7be789e7b847

Observation 1527872a-4813-475c-ae7b-70f75ee2c235 · outbound

This paper cites Scal- ing up masked audio encoder learning for general audio classifica- tion,.

X-ARES: A Comprehensive Framework for Assessing Audio Encoder Performance Scal- ing up masked audio encoder learning for general audio classifica- tion,

Reference 12

Resolution
verified fuzzy
raw_fallback, observed 2026-08-07T15:05:20.948278Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.

source=pdf_text observed=2026-08-07T15:05:13.321211Z digest=sha256:593aed6da5d641d46291a64d3b97263288cbc8a80f9cc5d7a2e4bbc94eadac02

Observation 06656f89-cb63-4e21-a1d1-0c6d306a15f6 · outbound

This paper cites wav2vec 2.0: A framework for self-supervised learning of speech representations,.

X-ARES: A Comprehensive Framework for Assessing Audio Encoder Performance wav2vec 2.0: A framework for self-supervised learning of speech representations,

Reference 13

Resolution
unresolved
no resolver link, observed 2026-08-07T15:05:13.409608Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T15:05:13.409608Z digest=sha256:2851556bba2478515ede62ca2e504e1bf29d614c6fd609c53352e510275fe303

Observation f1ed79dd-3a94-4892-9e2d-c850a7aee805 · outbound

This paper cites Data2vec: A general framework for self-supervised learning in speech, vision and language,.

X-ARES: A Comprehensive Framework for Assessing Audio Encoder Performance Data2vec: A general framework for self-supervised learning in speech, vision and language,

Reference 14

Resolution
unresolved
no resolver link, observed 2026-08-07T15:05:13.477073Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T15:05:13.477073Z digest=sha256:e7e923633b5d7a5283eb92dec33e1675ee7718c216fb0b1a002e665762a2e84a

Observation 439a7da9-d5ea-410b-b0ae-9e61248b5594 · outbound

This paper cites Qwen-Audio: Advancing Universal Audio Understanding via Unified Large-Scale Audio-Language Models.

X-ARES: A Comprehensive Framework for Assessing Audio Encoder Performance Qwen-Audio: Advancing Universal Audio Understanding via Unified Large-Scale Audio-Language Models

Reference 15

Resolution
unresolved
no resolver link, observed 2026-08-07T15:05:13.546494Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T15:05:13.546494Z digest=sha256:168568f8a18a05f3775161f322798d36b441ce143d1a71feb8cbd12d5df668e4

Observation 2ac3bb46-8cea-453b-a5b0-f256e9e01d9a · outbound

This paper cites Moshi: a speech-text foundation model for real-time dialogue,.

X-ARES: A Comprehensive Framework for Assessing Audio Encoder Performance Moshi: a speech-text foundation model for real-time dialogue,

Reference 16

Resolution
verified fuzzy
raw_fallback, observed 2026-08-07T15:05:20.842042Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.

source=pdf_text observed=2026-08-07T15:05:13.634240Z digest=sha256:be8656dc685d2acbebec77e8e6895b28a8cd3a90bf309c649a08ea830ade51e4

Observation f5f248cf-2e0c-4431-ace5-6751d1a27ea2 · outbound

This paper cites A Comparative Study of Discrete Speech Tokens for Semantic-Related Tasks with Large Language Models.

X-ARES: A Comprehensive Framework for Assessing Audio Encoder Performance A Comparative Study of Discrete Speech Tokens for Semantic-Related Tasks with Large Language Models

Reference 17

Resolution
unresolved
no resolver link, observed 2026-08-07T15:05:13.708782Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T15:05:13.708782Z digest=sha256:e03aba31458f4e6c5868426e97881618729deec2d73a91c7ef31e5144b94976c

Observation 2e52c619-c6af-46ad-b5c9-5343f2bac86d · outbound

This paper cites HEAR: Holistic evaluation of audio representations,.

X-ARES: A Comprehensive Framework for Assessing Audio Encoder Performance HEAR: Holistic evaluation of audio representations,

Reference 18

Resolution
verified fuzzy
raw_fallback, observed 2026-08-07T15:05:20.642237Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.

source=pdf_text observed=2026-08-07T15:05:13.750037Z digest=sha256:6bd3bf604d8a7c20b3b4f348e50b8276b63b1ebe349e1a510beb18a111f36e1e

Observation c729de9a-d587-4aad-9f1a-e3fed0156598 · outbound

This paper cites SUPERB: Speech processing universal performance benchmark,.

X-ARES: A Comprehensive Framework for Assessing Audio Encoder Performance SUPERB: Speech processing universal performance benchmark,

Reference 19

Resolution
verified fuzzy
raw_fallback, observed 2026-08-07T15:05:20.446806Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.

source=pdf_text observed=2026-08-07T15:05:13.786047Z digest=sha256:ef9158e9e42385cfc506ef69cdaf0fb5744529404b1d4929d09607b37608abc3

Observation dcec1deb-46c5-4495-bcb4-7b79390f6993 · outbound

This paper cites DASB - Discrete Audio and Speech Benchmark.

X-ARES: A Comprehensive Framework for Assessing Audio Encoder Performance DASB - Discrete Audio and Speech Benchmark

Reference 20

Resolution
unresolved
no resolver link, observed 2026-08-07T15:05:13.887958Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T15:05:13.887958Z digest=sha256:851a18bd13f65e58ac40d8992470bc746cbf9d91f1e8cf0d003c4f0da776f015

Observation c9c21023-6c9d-4848-b8e6-0289d70ae5fa · outbound

This paper cites Webdataset: A library for efficient loading of large-scale datasets,.

X-ARES: A Comprehensive Framework for Assessing Audio Encoder Performance Webdataset: A library for efficient loading of large-scale datasets,

Reference 21

Resolution
verified fuzzy
raw_fallback, observed 2026-08-07T15:05:20.262234Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.

source=pdf_text observed=2026-08-07T15:05:13.947177Z digest=sha256:3d0bde636c77cb3dcbb49a1417fccca8dab177731fc68fe565b406cbfda3a617

Observation 73c8ef13-d7cc-4755-9169-6b8a683ff4b4 · outbound

This paper cites SALMONN-omni: A Codec-free LLM for Full-duplex Speech Understanding and Generation.

X-ARES: A Comprehensive Framework for Assessing Audio Encoder Performance SALMONN-omni: A Codec-free LLM for Full-duplex Speech Understanding and Generation

Reference 22

Resolution
unresolved
no resolver link, observed 2026-08-07T15:05:13.993912Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T15:05:13.993912Z digest=sha256:10f3cf490f665343eb6e67004985a4d84a7dbdd724a243740cd9b6b815ba04e0

Observation 771974a9-2a03-491a-86a7-4004fae0a578 · outbound

This paper cites Auto- matic speaker verification spoofing and countermeasures challenge (asvspoof 2015) database,.

X-ARES: A Comprehensive Framework for Assessing Audio Encoder Performance Auto- matic speaker verification spoofing and countermeasures challenge (asvspoof 2015) database,

Reference 23

Resolution
verified fuzzy
raw_fallback, observed 2026-08-07T15:05:19.995656Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.

source=pdf_text observed=2026-08-07T15:05:14.053402Z digest=sha256:c08412f2a69e0f78f131a94b48cdf27071f6ec1185b14f484f5b073df13f0d52

Observation a866a237-3e77-4dbc-898b-87660ba7ee8c · outbound

This paper cites Crema-d: Crowd-sourced emotional multimodal actors dataset,.

X-ARES: A Comprehensive Framework for Assessing Audio Encoder Performance Crema-d: Crowd-sourced emotional multimodal actors dataset,

Reference 24

Resolution
verified fuzzy
raw_fallback, observed 2026-08-07T15:05:19.743695Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.

source=pdf_text observed=2026-08-07T15:05:14.145115Z digest=sha256:f4711a974301326aca1428448f153c3fff912b653e3b660d7b4187c6658afce3

Observation d5e70fa5-877b-462d-8c31-0932f4dfd7eb · outbound

This paper cites Speech Model Pre-training for End-to-End Spoken Language Understanding.

X-ARES: A Comprehensive Framework for Assessing Audio Encoder Performance Speech Model Pre-training for End-to-End Spoken Language Understanding

Reference 25

Resolution
unresolved
no resolver link, observed 2026-08-07T15:05:14.197126Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T15:05:14.197126Z digest=sha256:e50f615931823ad87cde385d81a9763258d7d071f53f83a63a2b4cce4e4febca

Observation 14ffa220-145d-49d7-b987-8b9d6fc74cfa · outbound

This paper cites Libricount, a dataset for speaker count estimation,.

X-ARES: A Comprehensive Framework for Assessing Audio Encoder Performance Libricount, a dataset for speaker count estimation,

Reference 26

Resolution
verified fuzzy
raw_fallback, observed 2026-08-07T15:05:19.411970Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.

source=pdf_text observed=2026-08-07T15:05:14.245520Z digest=sha256:b86ceafe9640930c89526be5375b7f8406dc19fccebd9b3fa0057c8cacb1888e

Observation 9a8b808b-fa75-4ebb-b7db-3ae814e7ac6e · outbound

This paper cites Librispeech: an asr corpus based on public domain audio books,.

X-ARES: A Comprehensive Framework for Assessing Audio Encoder Performance Librispeech: an asr corpus based on public domain audio books,

Reference 27

Resolution
verified fuzzy
raw_fallback, observed 2026-08-07T15:05:19.185013Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.

source=pdf_text observed=2026-08-07T15:05:14.314108Z digest=sha256:39deb61b3d027d2dd20a348c780e064222b026449b3602494c95c4b61affd370

Observation 965c1ea6-0086-4115-af28-0b07ec0223a9 · outbound

This paper cites The ryerson audio-visual database of emotional speech and song (ravdess): A dynamic, mul- timodal set of facial and vocal expressions in north american en- glish,.

X-ARES: A Comprehensive Framework for Assessing Audio Encoder Performance The ryerson audio-visual database of emotional speech and song (ravdess): A dynamic, mul- timodal set of facial and vocal expressions in north american en- glish,

Reference 28

Resolution
verified fuzzy
raw_fallback, observed 2026-08-07T15:05:18.938845Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.

source=pdf_text observed=2026-08-07T15:05:14.351157Z digest=sha256:8e8b8f796b91520807d8b93b4f9aa78de20137fe02ba5a1e39923409241b7b62

Observation fa3a3cd7-6b1c-4d24-acea-f2532c1d4aaa · outbound

This paper cites V ocalsound: A dataset for improving human vocal sounds recognition,.

X-ARES: A Comprehensive Framework for Assessing Audio Encoder Performance V ocalsound: A dataset for improving human vocal sounds recognition,

Reference 29

Resolution
verified fuzzy
raw_fallback, observed 2026-08-07T15:05:18.775240Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.

source=pdf_text observed=2026-08-07T15:05:14.413893Z digest=sha256:2f16108f43624f88b6569c249f60a3e4fbac801728ce37b302fd07ac1dccd11e

Observation de60e614-7968-4087-ac1d-bcad00f2d2b5 · outbound

This paper cites Speech Commands: A Dataset for Limited-Vocabulary Speech Recognition.

X-ARES: A Comprehensive Framework for Assessing Audio Encoder Performance Speech Commands: A Dataset for Limited-Vocabulary Speech Recognition

Reference 30

Resolution
unresolved
no resolver link, observed 2026-08-07T15:05:14.453341Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T15:05:14.453341Z digest=sha256:58c021c7f00c28ed2837d16f987622601d755bd078d8ded9631d4e33c279f3b5

Observation aed14a54-584f-4ce3-936f-e8b78d8d23da · outbound

This paper cites V oxceleb: Large-scale speaker verification in the wild,.

X-ARES: A Comprehensive Framework for Assessing Audio Encoder Performance V oxceleb: Large-scale speaker verification in the wild,

Reference 31

Resolution
verified fuzzy
raw_fallback, observed 2026-08-07T15:05:18.633665Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.

source=pdf_text observed=2026-08-07T15:05:14.500431Z digest=sha256:85b9f0b72a7796aae148179f7dd10966da85a18a5e1d0acce20078af86d69191

Observation 9a978da9-62e7-4c3f-aadd-e26ad02fa055 · outbound

This paper cites V oxlingua107: a dataset for spoken lan- guage recognition,.

X-ARES: A Comprehensive Framework for Assessing Audio Encoder Performance V oxlingua107: a dataset for spoken lan- guage recognition,

Reference 32

Resolution
verified fuzzy
raw_fallback, observed 2026-08-07T15:05:18.497605Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.

source=pdf_text observed=2026-08-07T15:05:14.602751Z digest=sha256:6d395b71c1a090f0ad5d354cb04bc42768307c4b64908ccb4880f5c02845e810

Observation 9c1653dc-7cf2-4660-8f5b-24600d37b9a4 · outbound

This paper cites Clotho: An audio cap- tioning dataset,.

X-ARES: A Comprehensive Framework for Assessing Audio Encoder Performance Clotho: An audio cap- tioning dataset,

Reference 33

Resolution
verified fuzzy
raw_fallback, observed 2026-08-07T15:05:18.346780Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.

source=pdf_text observed=2026-08-07T15:05:14.683701Z digest=sha256:050a4f89647bb04e1c8d041e7e2430a18d0e240aff87b96a0be79f78ccd1ac87

Observation 5aa12670-3ac5-4565-b519-cc23cd978ad0 · outbound

This paper cites Sound event detection in domestic environments with weakly labeled data and soundscape synthesis,.

X-ARES: A Comprehensive Framework for Assessing Audio Encoder Performance Sound event detection in domestic environments with weakly labeled data and soundscape synthesis,

Reference 34

Resolution
unresolved
no resolver link, observed 2026-08-07T15:05:14.729698Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T15:05:14.729698Z digest=sha256:cb8366ba04f6027f79b4725c7268a27b98061eab2c1863b401a32083d106f6b7

Observation f338b51a-d029-47c9-b170-a18b304474ff · outbound

This paper cites Esc: Dataset for environmental sound classification,.

X-ARES: A Comprehensive Framework for Assessing Audio Encoder Performance Esc: Dataset for environmental sound classification,

Reference 35

Resolution
verified fuzzy
raw_fallback, observed 2026-08-07T15:05:18.209463Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.

source=pdf_text observed=2026-08-07T15:05:14.791640Z digest=sha256:7e1ae142c7f2340519e26efa88e190733cffd3c3d7840b2ecbfad698d334b590

Observation 634f069f-c613-4450-af48-f650ef6c26d0 · outbound

This paper cites General-purpose Tagging of Freesound Audio with AudioSet Labels: Task Description, Dataset, and Baseline.

X-ARES: A Comprehensive Framework for Assessing Audio Encoder Performance General-purpose Tagging of Freesound Audio with AudioSet Labels: Task Description, Dataset, and Baseline

Reference 36

Resolution
unresolved
no resolver link, observed 2026-08-07T15:05:14.851891Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T15:05:14.851891Z digest=sha256:1ab730885da71794f70a5c75f6633199101b4bdd101d17fab41f3bcdb04fc289

Observation 81afb060-0127-4091-84d4-bcf206baac7b · outbound

This paper cites Fsd50k: an open dataset of human-labeled sound events,.

X-ARES: A Comprehensive Framework for Assessing Audio Encoder Performance Fsd50k: an open dataset of human-labeled sound events,

Reference 37

Resolution
verified fuzzy
raw_fallback, observed 2026-08-07T15:05:18.105386Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.

source=pdf_text observed=2026-08-07T15:05:14.894548Z digest=sha256:54a5452223b462a9f4cab20af5e6d9d9259082cf79bd4f29df1c09ec512c35d4

Observation 4f14be62-c8e4-40b2-a172-651dbe937d78 · outbound

This paper cites A dataset and taxonomy for urban sound research,.

X-ARES: A Comprehensive Framework for Assessing Audio Encoder Performance A dataset and taxonomy for urban sound research,

Reference 38

Resolution
verified fuzzy
raw_fallback, observed 2026-08-07T15:05:17.967320Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.

source=pdf_text observed=2026-08-07T15:05:15.015691Z digest=sha256:f68e22c5370ec0b678348dced5a602131388d8806cfd9d8eab5278ac8d074ebc

Observation 68e2ddd3-4fc4-4647-8672-3c4caa763074 · outbound

This paper cites V ocal imitation set: a dataset of vocally imitated sound events using the audioset ontol- ogy.

X-ARES: A Comprehensive Framework for Assessing Audio Encoder Performance V ocal imitation set: a dataset of vocally imitated sound events using the audioset ontol- ogy

Reference 39

Resolution
verified fuzzy
raw_fallback, observed 2026-08-07T15:05:17.835492Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.

source=pdf_text observed=2026-08-07T15:05:15.076689Z digest=sha256:57556d48a37a5dc8691bc734b0ecf971b7aaad6a37ae274afae2f3f337bf2a8d

Observation ed313b6f-be7c-49e9-9de2-3c4aff4b2c79 · outbound

This paper cites FMA: A Dataset For Music Analysis.

X-ARES: A Comprehensive Framework for Assessing Audio Encoder Performance FMA: A Dataset For Music Analysis

Reference 40

Resolution
unresolved
no resolver link, observed 2026-08-07T15:05:15.124215Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T15:05:15.124215Z digest=sha256:00c953e6dadb05b699d165a0cd19bde4ddd46d927446bf46047aae7bf0a054af

Observation 4cab7c97-93df-4044-a300-c21eb5f64746 · outbound

This paper cites The GTZAN dataset: Its contents, its faults, their effects on evaluation, and its future use.

X-ARES: A Comprehensive Framework for Assessing Audio Encoder Performance The GTZAN dataset: Its contents, its faults, their effects on evaluation, and its future use

Reference 41

Resolution
unresolved
no resolver link, observed 2026-08-07T15:05:15.172725Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T15:05:15.172725Z digest=sha256:de3ed5e171135e61e326b2ab019cbdcd75d6d858ce887bfb724123cb4642d614

Observation 08233fbb-8c66-45fb-9510-c75134e287b1 · outbound

This paper cites Enabling factorized piano music modeling and generation with the MAESTRO dataset,.

X-ARES: A Comprehensive Framework for Assessing Audio Encoder Performance Enabling factorized piano music modeling and generation with the MAESTRO dataset,

Reference 42

Resolution
verified fuzzy
raw_fallback, observed 2026-08-07T15:05:17.698556Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.

source=pdf_text observed=2026-08-07T15:05:15.268363Z digest=sha256:364154942e67f1ab0e2394a10b5cfec932cea82c3e2b3e19d417b567d722609f

Observation 92b1ddae-ce78-4abb-be0c-85afeef3dcd3 · outbound

This paper cites Neural audio synthesis of musical notes with wavenet autoencoders,.

X-ARES: A Comprehensive Framework for Assessing Audio Encoder Performance Neural audio synthesis of musical notes with wavenet autoencoders,

Reference 43

Resolution
unresolved
no resolver link, observed 2026-08-07T15:05:15.328284Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T15:05:15.328284Z digest=sha256:3b42322cf929de57977e6078af6d63ae815143301c3e1440a691cd67d09edb37

Observation f79a4b8a-b26f-42a1-b1b4-ab7a545d4d09 · outbound

This paper cites Well-Read Students Learn Better: On the Importance of Pre-training Compact Models.

X-ARES: A Comprehensive Framework for Assessing Audio Encoder Performance Well-Read Students Learn Better: On the Importance of Pre-training Compact Models

Reference 44

Resolution
unresolved
no resolver link, observed 2026-08-07T15:05:15.374000Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T15:05:15.374000Z digest=sha256:618b9ec73aa7cd6c6604ae046903a2caf7bd6550a6399fac000686027c584595

Observation 3d4c6043-9121-43c0-bad2-bdb496a44859 · outbound

This paper cites Qwen2.5 Technical Report.

X-ARES: A Comprehensive Framework for Assessing Audio Encoder Performance Qwen2.5 Technical Report

Reference 45

Resolution
unresolved
no resolver link, observed 2026-08-07T15:05:15.440207Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T15:05:15.440207Z digest=sha256:8280974e416dfcace1d79777ff290b1588742cb0bed8be764de09248a02bd7b4

Observation 499d38d2-16dd-4216-a0c9-77f8f2d873a0 · outbound

This paper cites Hubert: Self-supervised speech represen- tation learning by masked prediction of hidden units,.

X-ARES: A Comprehensive Framework for Assessing Audio Encoder Performance Hubert: Self-supervised speech represen- tation learning by masked prediction of hidden units,

Reference 46

Resolution
verified fuzzy
raw_fallback, observed 2026-08-07T15:05:17.574285Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.

source=pdf_text observed=2026-08-07T15:05:15.523038Z digest=sha256:86689aea5d21fc81e2b3894165252bf41af4fc092440b33021f0168c3a74d57a

Observation 2369ea91-14c9-4942-917f-7a350be7f87a · outbound

This paper cites Wavlm: Large-scale self-supervised pre-training for full stack speech processing,.

X-ARES: A Comprehensive Framework for Assessing Audio Encoder Performance Wavlm: Large-scale self-supervised pre-training for full stack speech processing,

Reference 47

Resolution
verified fuzzy
raw_fallback, observed 2026-08-07T15:05:17.410927Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.

source=pdf_text observed=2026-08-07T15:05:15.629508Z digest=sha256:548fae102e17261ee4466bdee66d863eb875a7a9b85b9889f7590817839485ae

Observation 38afb6aa-897c-41a8-8494-e6cc89f06562 · outbound

This paper cites Robust speech recognition via large-scale weak supervision,.

X-ARES: A Comprehensive Framework for Assessing Audio Encoder Performance Robust speech recognition via large-scale weak supervision,

Reference 48

Resolution
unresolved
no resolver link, observed 2026-08-07T15:05:15.693579Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T15:05:15.693579Z digest=sha256:1f0c8266f7ab1273d8e468e2aa020c263f0766ab0efa5f1f179b6e5b852e8d35

Observation 7beb06ff-c36e-4a0f-a60f-e687ac17af26 · outbound

This paper cites BEATs: Audio Pre-Training with Acoustic Tokenizers.

X-ARES: A Comprehensive Framework for Assessing Audio Encoder Performance BEATs: Audio Pre-Training with Acoustic Tokenizers

Reference 49

Resolution
unresolved
no resolver link, observed 2026-08-07T15:05:15.772955Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T15:05:15.772955Z digest=sha256:d253ad5c81656ead06e0059ef74903391166238bee700d07abde73029e6ba482

Observation ba6b32bd-cf43-428a-b26f-4614cd7e9644 · outbound

This paper cites Byol-s: Learning self-supervised speech representations by bootstrapping,.

X-ARES: A Comprehensive Framework for Assessing Audio Encoder Performance Byol-s: Learning self-supervised speech representations by bootstrapping,

Reference 50

Resolution
verified fuzzy
raw_fallback, observed 2026-08-07T15:05:17.268704Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.

source=pdf_text observed=2026-08-07T15:05:15.912386Z digest=sha256:d8ae3f3e60d2609106d71ae07c7c65213ed59a529f6c80b223123d1c406814a8

Observation d91046c1-1e72-4745-9417-b1265cd2227b · outbound

This paper cites Ced: Consis- tent ensemble distillation for audio tagging,.

X-ARES: A Comprehensive Framework for Assessing Audio Encoder Performance Ced: Consis- tent ensemble distillation for audio tagging,

Reference 51

Resolution
verified fuzzy
raw_fallback, observed 2026-08-07T15:05:17.114721Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.

source=pdf_text observed=2026-08-07T15:05:15.978730Z digest=sha256:0393f363808c644dc7b7c768b281f6cb4e8f975731a135fbb945ce67d8f18f87

Observation 042f13fe-47ea-4425-8537-3c102c889efe · outbound

This paper cites Self-supervised audio teacher-student transformer for both clip-level and frame-level tasks,.

X-ARES: A Comprehensive Framework for Assessing Audio Encoder Performance Self-supervised audio teacher-student transformer for both clip-level and frame-level tasks,

Reference 52

Resolution
verified fuzzy
raw_fallback, observed 2026-08-07T15:05:16.908635Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.

source=pdf_text observed=2026-08-07T15:05:16.094160Z digest=sha256:c9d989659864c545694894040ab7e9450e88a188003e29b7932829d715e7077c

Observation 4c617c87-c424-4433-88e4-a67a9575db48 · outbound

This paper cites Masked modeling duo: Learning representations by encouraging both networks to model the input,.

X-ARES: A Comprehensive Framework for Assessing Audio Encoder Performance Masked modeling duo: Learning representations by encouraging both networks to model the input,

Reference 53

Resolution
verified fuzzy
raw_fallback, observed 2026-08-07T15:05:16.754608Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.

source=pdf_text observed=2026-08-07T15:05:16.177062Z digest=sha256:ef430051b96687274a7dbfd1e7b488859ce9cdf282f86e9cb7fc93bf7141bd51

Pith citing papers

Observation 2f11c02f-2ad4-4b77-9ca6-58eae6c42276 · inbound

X-ARES: A Comprehensive Framework for Assessing Audio Encoder Performance cites this paper.

X-ARES: A Comprehensive Framework for Assessing Audio Encoder Performance X-ARES: A Comprehensive Framework for Assessing Audio Encoder Performance

Reference 6

Resolution
unresolved
no resolver link, observed 2026-08-07T15:05:12.925006Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T15:05:12.925006Z digest=sha256:dc8950d8c6bfeccd9f27a88b9b7277f1b82b143ea9d4beef12fe283d65c841c9

Observation 054cc496-1d59-4e3e-8e16-1c7faa9956a9 · inbound

AU-Harness: An Open-Source Toolkit for Holistic Evaluation of Audio LLMs cites this paper.

AU-Harness: An Open-Source Toolkit for Holistic Evaluation of Audio LLMs X-ARES: A Comprehensive Framework for Assessing Audio Encoder Performance

Reference 20

Resolution
verified exact
arxiv_id, observed 2026-05-18T18:11:43.145790Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.

source=pdf_text observed=2026-05-18T18:07:01.257126Z digest=sha256:f298f8935da38d17d15d26f462be1a7e7778c0a1574d7dbcd4b68dc91c819d32

Observation 50834e18-e74a-4b31-a36e-a43cb59cea13 · inbound

Probing Spatial Structure in Pretrained Audio Representations cites this paper.

Probing Spatial Structure in Pretrained Audio Representations X-ARES: A Comprehensive Framework for Assessing Audio Encoder Performance

Reference 15

Resolution
metadata mismatch
arxiv_id, observed 2026-07-02T14:17:03.116783Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.

source=pdf_text observed=2026-06-28T00:34:43.472094Z digest=sha256:037b7f2e658220b566679f6abc34a3ca186fe8f7908200544820081bdd20dddd

Observation ed45fb58-73c8-4f9a-baa7-ded281058537 · inbound

Probing Spatial Structure in Pretrained Audio Representations cites this paper.

Probing Spatial Structure in Pretrained Audio Representations X-ARES: A Comprehensive Framework for Assessing Audio Encoder Performance

Reference 15

Resolution
unresolved
no resolver link, observed 2026-08-02T12:23:45.341806Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-02T12:23:45.341806Z digest=sha256:abdcf0de30b970b2a29efb308fdab230a276da29bb80515c730ff82dc0d1049f