Pith. sign in

Paper Citation Record · LEDGER

Reinforcement Learning Outperforms Supervised Fine-Tuning: A Case Study on Audio Question Answering

As of 15 August 2026, this Paper Citation Record lists 0 of 0 outbound references and 26 inbound Pith citation observations for arXiv:2503.11197.

A citation records a reference. It does not transfer a finding from one paper to another.

pith.paper-citation-record.v1
2503.11197 v4

Coverage vector

measured 0 of 0 reference resolution

Typed states for the displayed outbound observations.

Source: paper_references, paper_reference_links

measured 26 of 26 standing notices

One-hop event checks from named stored sources.

Source: scholarly_work_events, retraction_status_cache, observed 2026-08-15T06:32:42.880941+00:00

measured 26 of 26 inbound itemization

Pith citing papers itemized under the disclosed page cap.

Source: paper_references, paper_reference_links, observed 2026-08-15T20:25:12.623362Z

measured 0 of 1 external citation measurements

A source-named dated measurement, never combined with another source.

Source: arxiv_reference, observed 2026-07-02T20:07:21.344787Z

Reference resolution

0 of 0 outbound references displayed

  • verified exact0
  • verified fuzzy0
  • unresolved0
  • parse uncertain0
  • malformed identifier0
  • metadata mismatch0

External citation measurements

No source-named external measurement is stored.

Outbound references

No outbound reference observations are available for this paper version.

Pith citing papers

Observation 9f43c0ce-d66c-4ef9-a17f-0fc807f4c018 · inbound

From System 1 to System 2: A Survey of Reasoning Large Language Models cites this paper.

From System 1 to System 2: A Survey of Reasoning Large Language Models Reinforcement Learning Outperforms Supervised Fine-Tuning: A Case Study on Audio Question Answering

Reference 292

Resolution
verified exact
arxiv_id, observed 2026-05-13T01:36:24.508679Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.

source=pdf_text observed=2026-05-13T01:36:23.845366Z digest=sha256:5950b384e11dd61fa0ebefb18300ea429260c6e911aef9ed3391e634a0f82e72

Observation 8e25e845-1cab-46ec-85be-132f87241b82 · inbound

MMAR: A Challenging Benchmark for Deep Reasoning in Speech, Audio, Music, and Their Mix cites this paper.

MMAR: A Challenging Benchmark for Deep Reasoning in Speech, Audio, Music, and Their Mix Reinforcement Learning Outperforms Supervised Fine-Tuning: A Case Study on Audio Question Answering

Reference 18

Resolution
unresolved
no resolver link, observed 2026-08-15T20:25:12.623362Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-15T20:25:12.623362Z digest=sha256:67171ea8631bfe15f30bcad915e0b3644596eae6d08c9de0c66cd1d130e717a5

Observation 7b9ad463-7fbf-40ee-8a5f-8390c59237f0 · inbound

Reinforcement Fine-Tuning Powers Reasoning Capability of Multimodal Large Language Models cites this paper.

Reinforcement Fine-Tuning Powers Reasoning Capability of Multimodal Large Language Models Reinforcement Learning Outperforms Supervised Fine-Tuning: A Case Study on Audio Question Answering

Reference 48

Resolution
unresolved
no resolver link, observed 2026-08-07T14:31:13.461419Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T14:31:13.461419Z digest=sha256:e7e519fc3106227a6f1f7e534551fe718596bd54ed47e5fc08d4057ad8748c15

Observation 02f72257-f736-4ef4-9ac9-4788cfbaf892 · inbound

Audio Flamingo 3: Advancing Audio Intelligence with Fully Open Large Audio Language Models cites this paper.

Audio Flamingo 3: Advancing Audio Intelligence with Fully Open Large Audio Language Models Reinforcement Learning Outperforms Supervised Fine-Tuning: A Case Study on Audio Question Answering

Reference 73

Resolution
verified exact
arxiv_id, observed 2026-05-15T03:42:45.293345Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.

source=pdf_text observed=2026-05-15T03:42:44.523919Z digest=sha256:4daa68f56a57fe36c36f9401d3ae53688b453fc3a970a9fbf58728ec1ca1fa18

Observation 08b7bb0e-fa30-455a-9a89-729280f973ba · inbound

Empowering Multimodal LLMs with External Tools: A Comprehensive Survey cites this paper.

Empowering Multimodal LLMs with External Tools: A Comprehensive Survey Reinforcement Learning Outperforms Supervised Fine-Tuning: A Case Study on Audio Question Answering

Reference 171

Resolution
unresolved
no resolver link, observed 2026-08-05T20:28:59.977640Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-05T20:28:59.977640Z digest=sha256:f52e616cd450b5376d8436bb8154ab77d6fc62268fc24b97a7210901f9160d8e

Observation 6a3b6bae-50c7-4904-b015-a960435a0c0e · inbound

Group Relative Policy Optimization for Speech Recognition cites this paper.

Group Relative Policy Optimization for Speech Recognition Reinforcement Learning Outperforms Supervised Fine-Tuning: A Case Study on Audio Question Answering

Reference 31

Resolution
unresolved
no resolver link, observed 2026-08-05T12:07:21.394981Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-05T12:07:21.394981Z digest=sha256:2688226ed75e4ce7b2a539ed61e879074413b67908fbd315c0766cc7cfd27ce1

Observation 9b56048b-e90a-4405-b888-06f9d163bd80 · inbound

The Landscape of Agentic Reinforcement Learning for LLMs: A Survey cites this paper.

The Landscape of Agentic Reinforcement Learning for LLMs: A Survey Reinforcement Learning Outperforms Supervised Fine-Tuning: A Case Study on Audio Question Answering

Reference 262

Resolution
verified exact
arxiv_id, observed 2026-05-18T19:21:48.171376Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.

source=pdf_text observed=2026-05-18T19:19:36.427337Z digest=sha256:02ff63c540bfe409626d0293f0fe77f4884ec142951b4d3498136d1bb0dbfa19

Observation 513d9acc-d37d-431a-9187-d31604016403 · inbound

AQA-TTRL: Self-Adaptation in Audio Question Answering with Test-Time Reinforcement Learning cites this paper.

AQA-TTRL: Self-Adaptation in Audio Question Answering with Test-Time Reinforcement Learning Reinforcement Learning Outperforms Supervised Fine-Tuning: A Case Study on Audio Question Answering

Reference 14

Resolution
unresolved
no resolver link, observed 2026-08-04T11:23:18.440292Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-04T11:23:18.440292Z digest=sha256:d55839e0bd44eb9dd0cd1cb62cf00e1d27629e8299e8a7cbd37e6ed7432749a2

Observation 1e30c90c-79f5-444e-a87c-a4d8b13e6018 · inbound

Mind-Paced Speaking: A Dual-Brain Approach to Real-Time Reasoning in Spoken Language Models cites this paper.

Mind-Paced Speaking: A Dual-Brain Approach to Real-Time Reasoning in Spoken Language Models Reinforcement Learning Outperforms Supervised Fine-Tuning: A Case Study on Audio Question Answering

Reference 23

Resolution
verified exact
arxiv_id, observed 2026-05-18T07:46:03.575240Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.

source=pdf_text observed=2026-05-18T07:43:23.913399Z digest=sha256:727773c1173863de4215d986105571aecefbafd8ed080753fc05d81a92a3de9d

Observation 8f292c1d-1083-4035-b4a8-109329d1dec2 · inbound

LongVT: Incentivizing "Thinking with Long Videos" via Native Tool Calling cites this paper.

LongVT: Incentivizing "Thinking with Long Videos" via Native Tool Calling Reinforcement Learning Outperforms Supervised Fine-Tuning: A Case Study on Audio Question Answering

Reference 21

Resolution
verified exact
arxiv_id, observed 2026-05-22T12:31:32.069649Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.

source=pdf_text observed=2026-05-22T12:26:35.347190Z digest=sha256:e59cfbb59cd574b38d964d8d80738221b8927247b432e02d7a2b477649f51ea5

Observation 946b3ddd-5e8a-452d-8d87-9c6b7ded12a0 · inbound

VERITAS: A Multi-Agent Co-Scientist for Verifiable Image-Derived Hypothesis Testing cites this paper.

VERITAS: A Multi-Agent Co-Scientist for Verifiable Image-Derived Hypothesis Testing Reinforcement Learning Outperforms Supervised Fine-Tuning: A Case Study on Audio Question Answering

Reference 16

Resolution
unresolved
no resolver link, observed 2026-07-12T21:34:30.078813Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-07-12T21:34:30.078813Z digest=sha256:8bbd151d028b6ad84fc6110a6a3b22ef679f21080a3f4c2d9604cce1525c215b

Observation 8293b213-4cda-4579-b637-2a6d80e6fd61 · inbound

Why Your Tokenizer Fails in Information Fusion: A Timing-Aware Pre-Quantization Fusion for Video-Enhanced Audio Tokenization cites this paper.

Why Your Tokenizer Fails in Information Fusion: A Timing-Aware Pre-Quantization Fusion for Video-Enhanced Audio Tokenization Reinforcement Learning Outperforms Supervised Fine-Tuning: A Case Study on Audio Question Answering

Reference 16

Resolution
verified exact
arxiv_id, observed 2026-05-11T11:31:01.814073Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.

source=pdf_text observed=2026-05-10T14:49:51.481873Z digest=sha256:917d260021663fbb9b2c1e7230d1865d3682db800c211be8bca45f449e9ba3b0

Observation aceb0ce8-818d-4344-8794-de122493689c · inbound

TinyMU: A Compact Audio-Language Model for Music Understanding cites this paper.

TinyMU: A Compact Audio-Language Model for Music Understanding Reinforcement Learning Outperforms Supervised Fine-Tuning: A Case Study on Audio Question Answering

Reference 16

Resolution
verified exact
arxiv_id, observed 2026-05-10T08:17:36.954358Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.

source=pdf_text observed=2026-05-10T08:17:23.740979Z digest=sha256:a18285da562cf437cb2ef457209d6515127fae8a0fdda718dba66985fb4f2e2f

Observation e4d01878-c041-45ed-a53e-f627b8b95a83 · inbound

Audio-DeepThinker: Progressive Reasoning-Aware Reinforcement Learning for High-Quality Chain-of-Thought Emergence in Audio Language Models cites this paper.

Audio-DeepThinker: Progressive Reasoning-Aware Reinforcement Learning for High-Quality Chain-of-Thought Emergence in Audio Language Models Reinforcement Learning Outperforms Supervised Fine-Tuning: A Case Study on Audio Question Answering

Reference 17

Resolution
verified exact
arxiv_id, observed 2026-05-11T12:26:04.051187Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.

source=pdf_text observed=2026-05-10T03:41:27.425176Z digest=sha256:fd91517c57df76decd597cd3a8296ba420648975cbcf522d9238789d1d50c6e5

Observation 044e02f1-1000-4e55-9cbb-922572d725cf · inbound

Omni-Persona: Systematic Benchmarking and Improving Omnimodal Personalization cites this paper.

Omni-Persona: Systematic Benchmarking and Improving Omnimodal Personalization Reinforcement Learning Outperforms Supervised Fine-Tuning: A Case Study on Audio Question Answering

Reference 30

Resolution
verified exact
arxiv_id, observed 2026-05-12T06:46:25.869198Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.

source=pdf_text observed=2026-05-12T04:01:23.060562Z digest=sha256:1472c10d9460b42ed91cee9ad35135d1172ee625003a758c6cd1eb0f712c9439

Observation cf1683a5-dbf9-4766-9b64-1d903fbb5bdf · inbound

Beyond Content: A Comprehensive Speech Toxicity Dataset and Detection Framework Incorporating Paralinguistic Cues cites this paper.

Beyond Content: A Comprehensive Speech Toxicity Dataset and Detection Framework Incorporating Paralinguistic Cues Reinforcement Learning Outperforms Supervised Fine-Tuning: A Case Study on Audio Question Answering

Reference 12

Resolution
metadata mismatch
arxiv_id, observed 2026-05-19T18:37:42.814418Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.

source=arxiv_source observed=2026-05-19T18:36:34.351533Z digest=sha256:c0899e31601ccee7498407a32a0bd802c94aaebc6452f24374e53eb12d1a75f7

Observation 7e39656b-afa1-4cab-afec-3ed85f069a99 · inbound

A Survey of Audio Reasoning in Multimodal Foundation Models cites this paper.

A Survey of Audio Reasoning in Multimodal Foundation Models Reinforcement Learning Outperforms Supervised Fine-Tuning: A Case Study on Audio Question Answering

Reference 49

Resolution
verified exact
arxiv_id, observed 2026-05-21T02:09:24.292449Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.

source=pdf_text observed=2026-05-21T02:08:06.976461Z digest=sha256:1c0c1fa31af84beccb3ea3f2b32a35d971d4c34599b779994b89bbe0dc178fe2

Observation ff16a0b4-21dd-4882-99d2-2b437f8372ca · inbound

Learning When to Think While Listening in Large Audio-Language Models cites this paper.

Learning When to Think While Listening in Large Audio-Language Models Reinforcement Learning Outperforms Supervised Fine-Tuning: A Case Study on Audio Question Answering

Reference 28

Resolution
verified exact
arxiv_id, observed 2026-06-29T18:43:50.737960Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.

source=pdf_text observed=2026-06-29T18:37:34.409802Z digest=sha256:1de16fdcfe92e8e375cea2b5f8f8f84d82e5181c4e6b7be4e2b2ffef37afde7c

Observation 4399527a-8e7c-4c25-82d8-6525afc60902 · inbound

LaSR: Context-Aware Speech Recognition via Latent Reasoning cites this paper.

LaSR: Context-Aware Speech Recognition via Latent Reasoning Reinforcement Learning Outperforms Supervised Fine-Tuning: A Case Study on Audio Question Answering

Reference 4

Resolution
metadata mismatch
arxiv_id, observed 2026-06-28T19:22:34.992549Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.

source=arxiv_source observed=2026-06-28T19:12:59.843096Z digest=sha256:c69fcb97b2f98aa29fbaa196825b951dbf77bb1b5d62d42da43b65be207a4a8d

Observation 908f10dc-06eb-4515-9197-97752fbe235a · inbound

FSA-GRPO: Teaching Auditory LLMs to Use Few-shot Demonstrations cites this paper.

FSA-GRPO: Teaching Auditory LLMs to Use Few-shot Demonstrations Reinforcement Learning Outperforms Supervised Fine-Tuning: A Case Study on Audio Question Answering

Reference 43

Resolution
metadata mismatch
arxiv_id, observed 2026-07-01T16:05:49.453256Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.

source=arxiv_source observed=2026-07-01T16:02:03.730543Z digest=sha256:caf68c5d52d473caad4e4f686f80bd9dde4b66086daba74b18a4dfb61b89b60d

Observation 7cfff068-1d25-4f50-8ef7-0f8da95b5d03 · inbound

VISA: A Visual Information Strengthened Audio-Reasoning System for the Interspeech 2026 ARC Agent Track cites this paper.

VISA: A Visual Information Strengthened Audio-Reasoning System for the Interspeech 2026 ARC Agent Track Reinforcement Learning Outperforms Supervised Fine-Tuning: A Case Study on Audio Question Answering

Reference 29

Resolution
verified exact
arxiv_id, observed 2026-07-02T20:07:21.346714Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.

source=pdf_text observed=2026-06-27T21:02:19.300441Z digest=sha256:877d446da07da09ab4a638b4e6ff90ef4f23bab05f4fdd177cf1df0735eca5b9

Observation 1b580945-e9cd-485e-94c7-0b3bb827eaf8 · inbound

Audio-Visual Flamingo: Open Audio-Visual Intelligence for Long and Complex Videos cites this paper.

Audio-Visual Flamingo: Open Audio-Visual Intelligence for Long and Complex Videos Reinforcement Learning Outperforms Supervised Fine-Tuning: A Case Study on Audio Question Answering

Reference 31

Resolution
unresolved
no resolver link, observed 2026-08-01T21:22:42.917716Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-01T21:22:42.917716Z digest=sha256:36811c725cf04836f3322e1e20394e782da7316215c1928547b62479ce161880

Observation 5924d362-6311-4e55-906c-f7e5c3a8e008 · inbound

Audio-Zero: Label-Free Self-Evolution for Fine-Grained Audio Reasoning cites this paper.

Audio-Zero: Label-Free Self-Evolution for Fine-Grained Audio Reasoning Reinforcement Learning Outperforms Supervised Fine-Tuning: A Case Study on Audio Question Answering

Reference 9

Resolution
unresolved
no resolver link, observed 2026-08-01T10:40:25.897788Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-01T10:40:25.897788Z digest=sha256:95a30cae62cab7f06ccb6330eb65eb8885866bec9e0891481515e1f5407a39f5

Observation 18352f4d-a462-4945-a5a9-133ff75fc6eb · inbound

X$^3$-OPD: Distilling Reasoning into Large Audio-Language Models via On-Policy Alignment cites this paper.

X$^3$-OPD: Distilling Reasoning into Large Audio-Language Models via On-Policy Alignment Reinforcement Learning Outperforms Supervised Fine-Tuning: A Case Study on Audio Question Answering

Reference 91

Resolution
unresolved
no resolver link, observed 2026-08-01T07:12:16.661745Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-01T07:12:16.661745Z digest=sha256:0a2ea879f6a0bbe86591804668cbdf6b2c3e8205d1fada5a534dd17f180bdb22

Observation 6f8e5bc0-3f3e-42a5-aa65-05b8214630aa · inbound

Weak-to-Strong On-Policy Distillation cites this paper.

Weak-to-Strong On-Policy Distillation Reinforcement Learning Outperforms Supervised Fine-Tuning: A Case Study on Audio Question Answering

Reference 129

Resolution
unresolved
no resolver link, observed 2026-08-01T00:26:30.612742Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-01T00:26:30.612742Z digest=sha256:eb5dce98baa7b973a54f016c9cb05a1635183c6dba01c462ae14dafe688067ed

Observation 1827b252-7810-415f-8faa-4cc420b239e4 · inbound

Reinforcement Learning with Evolving Rubrics as Rewards for Audio Reasoning cites this paper.

Reinforcement Learning with Evolving Rubrics as Rewards for Audio Reasoning Reinforcement Learning Outperforms Supervised Fine-Tuning: A Case Study on Audio Question Answering

Reference 87

Resolution
unresolved
no resolver link, observed 2026-08-15T15:03:20.714065Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-15T15:03:20.714065Z digest=sha256:4447130e7494dba1c2caa362695cd8234e157945f097fa611f8b9f275a946af8