Награда за процесс и награда за результат
Ключевой выбор для многошаговых задач: награда за результат (только в конце, максимум свободы исследования, но разреженный сигнал) или процессная награда (каждый шаг, проще обучение, но риск ограничить инновации). Компромисс «награждаем результат, ограничиваем процесс» (RLVP): R = O + β·Φ, где Φ — верифицируемый сигнал пути: штраф за каждое проверяемое нарушение и частичная награда за достижимый прогресс. Плотный сигнал спасает группы сплошных неудач (нулевая дисперсия в GRPO → нет градиента). Штраф — универсально применим; награда за прогресс — только когда прогресс достижим.
Связано: Четыре принципа рубрики, RLVR и проверяемые награды, GRPO