Pith. sign in

← back to paper

Review history

arxiv: 2506.17828 · 2 revisions

Aligning Frozen LLMs by Reinforcement Learning: An Iterative Reweight-then-Optimize Approach

  1. 2026-08-15 CONDITIONAL MODERATE v1.4.0-alltime-deepseek-medium novelty 6.0
    169465 ms 47446 in 16909 out 2026-08-15T19:00:48.190428+00:00
  2. 2026-08-06 CONDITIONAL MODERATE v1.4.0-alltime-deepseek-medium novelty 5.0
    205011 ms 47692 in 18021 out 2026-08-06T23:24:56.937271+00:00