Multi-Teacher On-Policy Distillation: A New Post-Training Primitive | Notion
How frontier AI labs use multi-teacher on-policy distillation to merge capabilities, recover from RL forgetting, and scale post-training across MiMo-V2-Flash, GLM-5, Nemotron-Cascade 2, and DeepSeek-V4.