On-Policy Distillation

On-Policy Distillation сочетает достоинства SFT и RL: ученик сам генерирует траектории (on-policy — решает проблему несоответствия распределений), а более сильный учитель даёт пословное распределение на каждом шаге (плотный сигнал вместо разреженной награды в конце). В ~10 раз меньше шагов обучения, чем чистый RL. Учитель оценивает не «правильно/неправильно», а полное распределение «с какой вероятностью каждый токен». Требование: достаточно реалистичная среда, чтобы ученик исследовал в распределении развёртывания.

Связано: Самодистилляция OPSD, GRPO, Три этапа постобучения