SFT запоминает - RL обобщает
- SFT оптимизирует «похоже ли на эталон» (максимальное правдоподобие) — выучивает жёсткое отображение вход→выход и запоминает: при изменении правил среды применяет старый ответ.
- RL оптимизирует «насколько хорош результат» (ожидаемая награда) — выучивает переносимую стратегию и обобщает: применяет тот же процесс к новым условиям.
Эксперимент GeneralPoints: при изменении правил (J/Q/K = 11/12/13 вместо 10) расширение SFT падает на 5–8%, расширение RL растёт на +3–17%.
Корень: mass-covering (SFT охватывает все паттерны) против mode-seeking (RL концентрируется на лучших пиках).
Связано: Три этапа постобучения, Сначала SFT потом RL, On-Policy Distillation