Награда за процесс и награда за результат
Ключевой выбор для многошаговых задач:
- награда за результат — только в конце: максимум свободы исследования, но разреженный сигнал;
- процессная награда — каждый шаг: проще обучение, но риск ограничить инновации.
Компромисс «награждаем результат, ограничиваем процесс» (RLVP): R = O + β·Φ, где Φ — верифицируемый сигнал пути: штраф за каждое проверяемое нарушение и частичная награда за достижимый прогресс.
Плотный сигнал спасает группы сплошных неудач (нулевая дисперсия в GRPO → нет градиента).
Штраф — универсально применим; награда за прогресс — только когда прогресс достижим.
Связано: Четыре принципа рубрики, RLVR и проверяемые награды, GRPO