Три этапа постобучения

Возможности модели формируются в три этапа-конвейера: предобучение — «прочитать десять тысяч книг» (предсказание следующего токена на интернет-текстах, знания и язык); SFT — «учитель показывает эталонное решение» (тысячи пар вход-выход, формат и протокол, дёшево и быстро); RL — «самому решать задачи через пробы и ошибки» (стратегия и обобщение, дорого). SFT математически та же задача предсказания токена, только на других данных и с потерей только на ответе. Порядок не произволен: сначала форма, потом дух.

Связано: SFT запоминает - RL обобщает, Сначала SFT потом RL, Данные и среда важнее алгоритма