BNPO dynamically normalizes binary rewards using a Beta distribution with parameters adapted from the current batch, claiming reduced gradient variance and state-of-the-art math reasoning performance.
Amc problems and solutions, 2025 b
1 Pith paper cite this work. Polarity classification is still indexing.
1
Pith paper citing it
fields
cs.LG 1years
2025 1verdicts
REJECT 1representative citing papers
citing papers explorer
-
BNPO: Beta Normalization Policy Optimization
BNPO dynamically normalizes binary rewards using a Beta distribution with parameters adapted from the current batch, claiming reduced gradient variance and state-of-the-art math reasoning performance.