RLHF

RLHF — обучение с подкреплением от обратной связи человека.

Трёхэтапный пайплайн InstructGPT:

  1. SFT на демонстрациях;
  2. модель вознаграждения на парных сравнениях людей (по Брэдли-Терри: сравнивать «что лучше» надёжнее абсолютных оценок);
  3. PPO с оценкой RM.

KL-штраф удерживает политику вблизи референсной модели: не отходить слишком далеко, иначе оценка RM — необоснованная экстраполяция. Обратная KL — mode-seeking: сохраняет несколько пиков высокой награды.

Переоптимизация RM: суррогатная награда растёт, реальное качество сначала растёт, потом падает (закон Гудхарта).

Связано: KL - mode-seeking против mass-covering, Награда за процесс и награда за результат, Три этапа постобучения