RLVR и проверяемые награды
RLVR — обучение с подкреплением с проверяемыми наградами: сигнал выдаёт правило-верификатор (прошёл ли тест, верен ли ответ), а не обученная модель. Задачи агентов в большинстве проверяемы — поэтому RLVR основная линия. Частный случай общей схемы: модель вознаграждения может быть детерминированным кодом, когда правильность определима правилом. Асимметрия проверки и генерации («проверить проще, чем сделать») — фундаментальная причина, по которой RL способен превзойти любого демонстратора.
Связано: Награда за процесс и награда за результат, RLHF, Данные и среда важнее алгоритма