LLM-as-a-Judge

LLM-as-a-Judge — модель судит по экспертной рубрике: баланс масштаба автоматизации и качества человеческого суждения для открытых задач.

Ограничения: смещение к длине, нестабильность повторных оценок. Решение — многоисточниковое гетерогенное суждение: несколько LLM разных семейств (предубеждения ортогональны, закон Гудхарта).

Калибровка судьи обязательна:

  • золотой набор с человеческой разметкой;
  • порог согласия (kappa > 0,7);
  • повторная калибровка при обновлении.

Позиционное смещение лечится оценкой в обоих порядках.

Связано: Четыре принципа рубрики, Метрики оценки агентов, Три уровня системы оценки