Данные и среда важнее алгоритма

Самый контринтуитивный опыт индустрии: готовые алгоритмы RL достаточно уметь применять; успех определяют достоверность симуляционной среды, качество данных и возможности базовой модели. Если среда искажена — политика выучит «стратегию для экзамена». Качество данных важнее алгоритма: грязные данные SFT закрепят шум; смещённая награда уведёт RL не туда. Во многих сценариях при качественных данных SFT достаточно — RL вообще не нужен. Порядок усилий: сильная базовая модель → среда и данные → затем маргинальная оптимизация алгоритма.

Связано: Симуляционная среда, Три этапа постобучения, Награда за процесс и награда за результат