GRPO

GRPO (Group Relative Policy Optimization) отказывается от сети ценности: для одного вопроса сэмплируется группа траекторий, преимущество каждой — её относительная позиция внутри группы ((ri − mean)/std).

«Лучше среднего по группе — плюс, хуже — минус.»

Дешевле PPO (нет critic).

Ограничение: преимущество распределяется по всему ответу равномерно — грубое распределение вклада, размывает сигнал в длинных многошаговых задачах; там PPO с сетью ценности или распределение на уровне ходов.

Симметричное отсечение ограничивает величину обновления за шаг.

Связано: Награда за процесс и награда за результат, On-Policy Distillation, Данные и среда важнее алгоритма