Pith. sign in

← back to paper

Review history

arxiv: 2607.28076 · 2 revisions

Group-Reflective Self-Distillation for Agentic Reinforcement Learning

  1. 2026-08-04 CONDITIONAL MODERATE v1.3.0-alltime-deepseek novelty 6.0
    365891 ms 24405 in 13912 out 2026-08-04T03:15:48.229201+00:00
  2. 2026-07-31 CONDITIONAL MODERATE v1.2.0-daily-grok45 novelty 6.0
    73091 ms 30364 in 3545 out 2026-07-31T18:33:43.842504+00:00