Награда за процесс и награда за результат

Ключевой выбор для многошаговых задач:

  • награда за результат — только в конце: максимум свободы исследования, но разреженный сигнал;
  • процессная награда — каждый шаг: проще обучение, но риск ограничить инновации.

Компромисс «награждаем результат, ограничиваем процесс» (RLVP): R = O + β·Φ, где Φ — верифицируемый сигнал пути: штраф за каждое проверяемое нарушение и частичная награда за достижимый прогресс.

Плотный сигнал спасает группы сплошных неудач (нулевая дисперсия в GRPO → нет градиента).

Штраф — универсально применим; награда за прогресс — только когда прогресс достижим.

Связано: Четыре принципа рубрики, RLVR и проверяемые награды, GRPO