LLM-as-a-Judge
LLM-as-a-Judge — модель судит по экспертной рубрике: баланс масштаба автоматизации и качества человеческого суждения для открытых задач.
Ограничения: смещение к длине, нестабильность повторных оценок. Решение — многоисточниковое гетерогенное суждение: несколько LLM разных семейств (предубеждения ортогональны, закон Гудхарта).
Калибровка судьи обязательна:
- золотой набор с человеческой разметкой;
- порог согласия (kappa > 0,7);
- повторная калибровка при обновлении.
Позиционное смещение лечится оценкой в обоих порядках.
Связано: Четыре принципа рубрики, Метрики оценки агентов, Три уровня системы оценки