От бенчмарка к улучшениям

Методология:

наблюдение → гипотеза → эксперимент → решение → итерация

Чтение отчёта: таблица по задачам + матрица меток способностей раскрывают структурные слабости (сбои в transcription, mathcounting, complexui — разные симптомы разных дефектов).

Гипотезы трёх уровней:

  • поверхностные — промпт;
  • средние — конвейер ввода, размышление;
  • глубокие — смена модели, дерево элементов UI.

Решение — не «принять всё эффективное», а анализ затрат и выгод: глобальное размышление даёт +3% успеха ценой тройной задержки для 8% задач — отклонить.

Сначала проверь саму систему оценки, потом трогай агента.

Связано: Три уровня системы оценки, Статистическая значимость оценки, Наблюдаемость агента