Retrieving a large model's step-by-step reasoning improves small models' accuracy on new science multiple-choice questions, sometimes above GPT-4 on an expert exam.
Title resolution pending
1 Pith paper cite this work, alongside 4 external citations. Polarity classification is still indexing.
1
Pith paper citing it
4
external citations · OpenAlex
fields
cs.CL 1years
2025 1verdicts
CONDITIONAL 1representative citing papers
citing papers explorer
-
Automated MCQA Benchmarking at Scale: Evaluating Reasoning Traces as Retrieval Sources for Domain Adaptation of Small Language Models
Retrieving a large model's step-by-step reasoning improves small models' accuracy on new science multiple-choice questions, sometimes above GPT-4 on an expert exam.