Сначала SFT потом RL
RL требует парсируемого вывода: если модель выдаёт хаотичный текст вместо JSON, функция вознаграждения не может ничего посчитать — учиться не на чем. SFT играет роль «сначала научить говорить внятно»: небольшое число демонстраций стабилизирует формат. Обратный порядок не работает — сигнал награды превращается в шум. Границы правила: при достаточно сильной базовой модели можно сразу RL (DeepSeek-R1-Zero), но ценой читаемости — поэтому в R1 всё же добавили холодный старт SFT. Сначала форма, потом дух.
Связано: Три этапа постобучения, SFT запоминает - RL обобщает