RLHF

RLHF — обучение с подкреплением от обратной связи человека. Трёхэтапный пайплайн InstructGPT: SFT на демонстрациях → модель вознаграждения на парных сравнениях людей (по Брэдли-Терри: сравнивать «что лучше» надёжнее абсолютных оценок) → PPO с оценкой RM. KL-штраф удерживает политику вблизи референсной модели: не отходить слишком далеко, иначе оценка RM — необоснованная экстраполяция. Обратная KL — mode-seeking: сохраняет несколько пиков высокой награды. Переоптимизация RM: суррогатная награда растёт, реальное качество сначала растёт, потом падает (закон Гудхарта).

Связано: KL - mode-seeking против mass-covering, Награда за процесс и награда за результат, Три этапа постобучения