Simple direct-answer fine-tuning matches or beats chain-of-thought reasoning models for social audio-visual QA, and a question-independent caption performs as well as full video and audio input.
In: The Fourteenth Inter- national Conference on Learning Representations (2026),https://openreview
1 Pith paper cite this work. Polarity classification is still indexing.
1
Pith paper citing it
fields
cs.CV 1years
2026 1verdicts
CONDITIONAL 1representative citing papers
citing papers explorer
-
Reasoning for Social Audio-Visual Question Answering: Where Do We Stand?
Simple direct-answer fine-tuning matches or beats chain-of-thought reasoning models for social audio-visual QA, and a question-independent caption performs as well as full video and audio input.