Pith. sign in

Reinforcement learning fine-tuning enhances activation intensity and diversity in the internal circuitry of llms,

2 Pith papers cite this work. Polarity classification is still indexing.

2 Pith papers citing it

fields

cs.LG 2

years

2026 2

representative citing papers

OISD: On-Policy Internal Self-Distillation of Language Models

cs.LG · 2026-05-27 · unverdicted · novelty 6.0

OISD improves mathematical reasoning in language models by using the final layer as an internal teacher to align logits and attention patterns in selected intermediate layers via signed advantage-weighted Jensen-Shannon divergence during GRPO optimization.

citing papers explorer

Showing 2 of 2 citing papers.