GRPO
GRPO (Group Relative Policy Optimization) отказывается от сети ценности: для одного вопроса сэмплируется группа траекторий, преимущество каждой — её относительная позиция внутри группы ((ri − mean)/std). «Лучше среднего по группе — плюс, хуже — минус». Дешевле PPO (нет critic). Ограничение: преимущество распределяется по всему ответу равномерно — грубое распределение вклада, размывает сигнал в длинных многошаговых задачах; там PPO с сетью ценности или распределение на уровне ходов. Симметричное отсечение ограничивает величину обновления за шаг.
Связано: Награда за процесс и награда за результат, On-Policy Distillation, Данные и среда важнее алгоритма