Papers

Rethinking On-Policy Self-Distillation for Thinking Models
Self-Distillation Zero: Self-Revision Turns Binary Rewards into Dense Supervision
How Does RL Post-training Induce Skill Composition? A Case Study on Countdown
Instruct-SkillMix: A Powerful Pipeline for LLM Instruction Tuning
Can Models Learn Skill Composition from Examples?
Skill-Mix: a Flexible and Expandable Family of Evaluations for AI models
Disentangling the Mechanisms Behind Implicit Regularization in SGD
On the Maximum Hessian Eigenvalue and Generalization