GRPO
GRPO (Group Relative Policy Optimization) отказывается от сети ценности: для одного вопроса сэмплируется группа траекторий, преимущество каждой — её относительная позиция внутри группы ((ri − mean)/std).
«Лучше среднего по группе — плюс, хуже — минус.»
Дешевле PPO (нет critic).
Ограничение: преимущество распределяется по всему ответу равномерно — грубое распределение вклада, размывает сигнал в длинных многошаговых задачах; там PPO с сетью ценности или распределение на уровне ходов.
Симметричное отсечение ограничивает величину обновления за шаг.
Связано: Награда за процесс и награда за результат, On-Policy Distillation, Данные и среда важнее алгоритма