Три уровня системы оценки

Система оценки строится на трёх уровнях: (1) среда оценки — где тестировать (инструментальная, человеко-машинная, симуляционная); (2) методы — как судить (дизайн датасета, метрики, LLM-as-a-Judge, парные сравнения); (3) решения — что делать с результатами (выбор модели, оптимизация архитектуры, непрерывная итерация). Оценивать нужно не модель саму по себе, а комбинацию модели и Harness. Два способа диагностики: абляция (отключить компонент Harness) и замена модели (узкое место в модели или в Harness?). Нет измерения — нет улучшения.

Связано: Harness-инженерия, LLM-as-a-Judge, Метрики оценки агентов