On-Policy Distillation
On-Policy Distillation сочетает достоинства SFT и RL:
- ученик сам генерирует траектории (on-policy — решает проблему несоответствия распределений);
- более сильный учитель даёт пословное распределение на каждом шаге (плотный сигнал вместо разреженной награды в конце).
В ~10 раз меньше шагов обучения, чем чистый RL.
Учитель оценивает не «правильно/неправильно», а полное распределение «с какой вероятностью каждый токен».
Требование: достаточно реалистичная среда, чтобы ученик исследовал в распределении развёртывания.
Связано: Самодистилляция OPSD, GRPO, Три этапа постобучения