LLM-as-a-Judge

LLM-as-a-Judge — модель судит по экспертной рубрике: баланс масштаба автоматизации и качества человеческого суждения для открытых задач. Ограничения: смещение к длине, нестабильность повторных оценок. Решение — многоисточниковое гетерогенное суждение: несколько LLM разных семейств (предубеждения ортогональны, закон Гудхарта). Калибровка судьи обязательна: золотой набор с человеческой разметкой, порог согласия (kappa > 0,7), повторная калибровка при обновлении. Позиционное смещение лечится оценкой в обоих порядках.

Связано: Четыре принципа рубрики, Метрики оценки агентов, Три уровня системы оценки