KL - mode-seeking против mass-covering
KL-дивергенция несимметрична, и направление важно.
- Обратная KL KL(πθ‖πref) штрафует уход политики туда, где референсная модель даёт почти ноль, — она mode-seeking: концентрирует вероятность на нескольких лучших пиках и отбрасывает остальное.
- Прямая KL — mass-covering: заставляет охватывать все паттерны референса.
Этим объясняется, почему ответы после RL звучат увереннее и менее разнообразно: модель сохраняет стратегии высокого качества и решительно отбрасывает остальные.
Максимальное правдоподобие SFT — чистый mass-covering.
Связано: RLHF, SFT запоминает - RL обобщает