On-Policy Distillation

On-Policy Distillation сочетает достоинства SFT и RL:

  • ученик сам генерирует траектории (on-policy — решает проблему несоответствия распределений);
  • более сильный учитель даёт пословное распределение на каждом шаге (плотный сигнал вместо разреженной награды в конце).

В ~10 раз меньше шагов обучения, чем чистый RL.

Учитель оценивает не «правильно/неправильно», а полное распределение «с какой вероятностью каждый токен».

Требование: достаточно реалистичная среда, чтобы ученик исследовал в распределении развёртывания.

Связано: Самодистилляция OPSD, GRPO, Три этапа постобучения