От бенчмарка к улучшениям

Методология: наблюдение → гипотеза → эксперимент → решение → итерация. Чтение отчёта: таблица по задачам + матрица меток способностей раскрывают структурные слабости (сбои в transcription, mathcounting, complexui — разные симптомы разных дефектов). Гипотезы трёх уровней: поверхностные (промпт), средние (конвейер ввода, размышление), глубокие (смена модели, дерево элементов UI). Решение — не «принять всё эффективное», а анализ затрат и выгод: глобальное размышление даёт +3% успеха ценой тройной задержки для 8% задач — отклонить. Сначала проверь саму систему оценки, потом трогай агента.

Связано: Три уровня системы оценки, Статистическая значимость оценки, Наблюдаемость агента