Три уровня системы оценки

Система оценки строится на трёх уровнях:

  1. среда оценки — где тестировать (инструментальная, человеко-машинная, симуляционная);
  2. методы — как судить (дизайн датасета, метрики, LLM-as-a-Judge, парные сравнения);
  3. решения — что делать с результатами (выбор модели, оптимизация архитектуры, непрерывная итерация).

Оценивать нужно не модель саму по себе, а комбинацию модели и Harness.

Два способа диагностики:

  • абляция — отключить компонент Harness;
  • замена модели — узкое место в модели или в Harness?

Нет измерения — нет улучшения.

Связано: Harness-инженерия, LLM-as-a-Judge, Метрики оценки агентов