Pith. sign in

Paper Citation Record · LEDGER

S2SBench: A Benchmark for Quantifying Intelligence Degradation in Speech-to-Speech Large Language Models

As of 17 August 2026, this Paper Citation Record lists 13 of 13 outbound references and 1 inbound Pith citation observation for arXiv:2505.14438.

A citation records a reference. It does not transfer a finding from one paper to another.

pith.paper-citation-record.v1
2505.14438 v1

Coverage vector

measured 13 of 13 reference resolution

Typed states for the displayed outbound observations.

Source: paper_references, paper_reference_links, observed 2026-08-07T15:38:38.037256Z

measured 14 of 14 standing notices

One-hop event checks from named stored sources.

Source: scholarly_work_events, retraction_status_cache, observed 2026-08-17T06:30:58.91139+00:00

measured 1 of 1 inbound itemization

Pith citing papers itemized under the disclosed page cap.

Source: paper_references, paper_reference_links, observed 2026-08-01T07:12:17.845741Z

measured 0 of 1 external citation measurements

A source-named dated measurement, never combined with another source.

Source: cited_works

Reference resolution

13 of 13 outbound references displayed

  • verified exact0
  • verified fuzzy0
  • unresolved13
  • parse uncertain0
  • malformed identifier0
  • metadata mismatch0

External citation measurements

No source-named external measurement is stored.

Outbound references

Observation 3213cf7d-783c-4901-a0b7-31d4ee3c087c · outbound

This paper cites Moshi: a speech-text foundation model for real-time dialogue.

S2SBench: A Benchmark for Quantifying Intelligence Degradation in Speech-to-Speech Large Language Models Moshi: a speech-text foundation model for real-time dialogue

Reference 3

Resolution
unresolved
no resolver link, observed 2026-08-07T15:38:36.810867Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T15:38:36.810867Z digest=sha256:87e5070a5b8807f9f082cb384be323f144c0891940f2223fe0d4dc2dd749102b

Observation 507fb53f-1c52-4fb5-81b3-7edc9f0ec53b · outbound

This paper cites LLaMA-Omni: Seamless Speech Interaction with Large Language Models.

S2SBench: A Benchmark for Quantifying Intelligence Degradation in Speech-to-Speech Large Language Models LLaMA-Omni: Seamless Speech Interaction with Large Language Models

Reference 4

Resolution
unresolved
no resolver link, observed 2026-08-07T15:38:36.938679Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T15:38:36.938679Z digest=sha256:9893f282c89153e10ecf4ddd28d209de739e855b1906175c39eb838f2d022fc6

Observation 93c89ea9-8d31-4ec7-a4ef-826470f1eab9 · outbound

This paper cites CMMLU: Measuring massive multitask language understanding in Chinese.

S2SBench: A Benchmark for Quantifying Intelligence Degradation in Speech-to-Speech Large Language Models CMMLU: Measuring massive multitask language understanding in Chinese

Reference 6

Resolution
unresolved
no resolver link, observed 2026-08-07T15:38:37.106067Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T15:38:37.106067Z digest=sha256:3386c663f7a3eae1f793a5fe0dcb3e0f157a05354894cd668cac026aa51b90bb

Observation 3fe741c6-d071-41b1-9000-f47f5998c79a · outbound

This paper cites Baichuan-Audio: A Unified Framework for End-to-End Speech Interaction.

S2SBench: A Benchmark for Quantifying Intelligence Degradation in Speech-to-Speech Large Language Models Baichuan-Audio: A Unified Framework for End-to-End Speech Interaction

Reference 7

Resolution
unresolved
no resolver link, observed 2026-08-07T15:38:37.251024Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T15:38:37.251024Z digest=sha256:b4c3a3479626ade3c00ced865c9894b555d20d4188679e434277e44b39bf5ad9

Observation c357c432-2126-4bdf-96cc-8bd74c059147 · outbound

This paper cites arXiv preprint arXiv:2410.08565, 3(7).

S2SBench: A Benchmark for Quantifying Intelligence Degradation in Speech-to-Speech Large Language Models arXiv preprint arXiv:2410.08565, 3(7)

Reference 8

Resolution
unresolved
no resolver link, observed 2026-08-07T15:38:37.377467Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T15:38:37.377467Z digest=sha256:4553f4b9d7166823a2cc345bbed4a876fa6f9284bd19507df54937a8559c6278

Observation 2d67f1ad-f1b1-4df9-9161-fdfc34304504 · outbound

This paper cites Video-LLaVA: Learning United Visual Representation by Alignment Before Projection.

S2SBench: A Benchmark for Quantifying Intelligence Degradation in Speech-to-Speech Large Language Models Video-LLaVA: Learning United Visual Representation by Alignment Before Projection

Reference 9

Resolution
unresolved
no resolver link, observed 2026-08-07T15:38:37.460005Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T15:38:37.460005Z digest=sha256:f7881c42be3c90a8884de997b547c96b7c186b9004783bf0cdceb3033b129ca0

Observation 3a11c5e6-f77b-451c-aef3-26e810aafb47 · outbound

This paper cites Qwen2.5 Technical Report.

S2SBench: A Benchmark for Quantifying Intelligence Degradation in Speech-to-Speech Large Language Models Qwen2.5 Technical Report

Reference 10

Resolution
unresolved
no resolver link, observed 2026-08-07T15:38:37.597535Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T15:38:37.597535Z digest=sha256:dba02f53d24bed36f0113b37b1e0376b43bd88b9a98b991f0b41fbec7b23ee2a

Observation 1847bc0e-6b6c-46ae-b58f-46a59b596cdb · outbound

This paper cites MiniCPM-V: A GPT-4V Level MLLM on Your Phone.

S2SBench: A Benchmark for Quantifying Intelligence Degradation in Speech-to-Speech Large Language Models MiniCPM-V: A GPT-4V Level MLLM on Your Phone

Reference 11

Resolution
unresolved
no resolver link, observed 2026-08-07T15:38:37.759717Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T15:38:37.759717Z digest=sha256:a9e382f5b1076dd9b5656c66c7b074a2c3ced8f58e586be9153c456ea70893d2

Observation c030018a-e74c-41e5-9bd8-e5fe1bfa002f · outbound

This paper cites SALMONN-omni: A Codec-free LLM for Full-duplex Speech Understanding and Generation.

S2SBench: A Benchmark for Quantifying Intelligence Degradation in Speech-to-Speech Large Language Models SALMONN-omni: A Codec-free LLM for Full-duplex Speech Understanding and Generation

Reference 12

Resolution
unresolved
no resolver link, observed 2026-08-07T15:38:37.904851Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T15:38:37.904851Z digest=sha256:e1874f7fe87262f05d53a1088ce6e0056cce660fe60ed5514909f2f9c80a2c85

Observation 72888da8-50f9-4add-9bb4-6f751b1f8573 · outbound

This paper cites GLM-4-Voice: Towards Intelligent and Human-Like End-to-End Spoken Chatbot.

S2SBench: A Benchmark for Quantifying Intelligence Degradation in Speech-to-Speech Large Language Models GLM-4-Voice: Towards Intelligent and Human-Like End-to-End Spoken Chatbot

Reference 13

Resolution
unresolved
no resolver link, observed 2026-08-07T15:38:38.037256Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T15:38:38.037256Z digest=sha256:e46ad11f45afd65ff27b8611a989c6a6c6e758b5109687f95469616bbd71e11f

Observation 2565e616-6a06-46cb-a16f-6710b9e6830b · outbound

This paper cites GPT-4 Technical Report.

S2SBench: A Benchmark for Quantifying Intelligence Degradation in Speech-to-Speech Large Language Models GPT-4 Technical Report

Reference 2023

Resolution
unresolved
no resolver link, observed 2026-08-07T15:38:36.517629Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T15:38:36.517629Z digest=sha256:48f85719e3a42ebc93f69ccbcf4e2ccb280c750547f72e1e390b28ed46ca660c

Observation 692ab65b-9305-455a-ad14-67ae6b376ef5 · outbound

This paper cites Qwen2-Audio Technical Report.

S2SBench: A Benchmark for Quantifying Intelligence Degradation in Speech-to-Speech Large Language Models Qwen2-Audio Technical Report

Reference 2024

Resolution
unresolved
no resolver link, observed 2026-08-07T15:38:36.638097Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T15:38:36.638097Z digest=sha256:2edab78465319e48b42b32bf82f5112fb42d5e3c29c79785b59a720a8d4e9a87

Observation 679aa329-f2a4-4154-838a-1f7a5350dc2f · outbound

This paper cites VITA-1.5: Towards GPT-4o Level Real-Time Vision and Speech Interaction.

S2SBench: A Benchmark for Quantifying Intelligence Degradation in Speech-to-Speech Large Language Models VITA-1.5: Towards GPT-4o Level Real-Time Vision and Speech Interaction

Reference 2025

Resolution
unresolved
no resolver link, observed 2026-08-07T15:38:37.006815Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T15:38:37.006815Z digest=sha256:1f10bba8f67c6ec18cf269610b522d3e8c905c2376f80109cf39a9024ab14e33

Pith citing papers

Observation 6d26307d-677b-447f-b4c8-743580ef4d4f · inbound

X$^3$-OPD: Distilling Reasoning into Large Audio-Language Models via On-Policy Alignment cites this paper.

X$^3$-OPD: Distilling Reasoning into Large Audio-Language Models via On-Policy Alignment S2SBench: A Benchmark for Quantifying Intelligence Degradation in Speech-to-Speech Large Language Models

Reference 205

Resolution
unresolved
no resolver link, observed 2026-08-01T07:12:17.845741Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-01T07:12:17.845741Z digest=sha256:f41cbf071c30b4270d9062b30dabcdba5807ede36f67d834699aba7125497da2