KL - mode-seeking против mass-covering
KL-дивергенция несимметрична, и направление важно. Обратная KL KL(πθ‖πref) штрафует уход политики туда, где референсная модель даёт почти ноль, — она mode-seeking: концентрирует вероятность на нескольких лучших пиках и отбрасывает остальное. Прямая KL — mass-covering: заставляет охватывать все паттерны референса. Этим объясняется, почему ответы после RL звучат увереннее и менее разнообразно: модель сохраняет стратегии высокого качества и решительно отбрасывает остальные. Максимальное правдоподобие SFT — чистый mass-covering.
Связано: RLHF, SFT запоминает - RL обобщает