SFT запоминает - RL обобщает

SFT оптимизирует «похоже ли на эталон» (максимальное правдоподобие) — выучивает жёсткое отображение вход→выход и запоминает: при изменении правил среды применяет старый ответ. RL оптимизирует «насколько хорош результат» (ожидаемая награда) — выучивает переносимую стратегию и обобщает: применяет тот же процесс к новым условиям. Эксперимент GeneralPoints: при изменении правил (J/Q/K = 11/12/13 вместо 10) расширение SFT падает на 5-8%, расширение RL растёт на +3-17%. Корень: mass-covering (SFT охватывает все паттерны) против mode-seeking (RL концентрируется на лучших пиках).

Связано: Три этапа постобучения, Сначала SFT потом RL, On-Policy Distillation