От бенчмарка к улучшениям
Методология:
наблюдение → гипотеза → эксперимент → решение → итерация
Чтение отчёта: таблица по задачам + матрица меток способностей раскрывают структурные слабости (сбои в transcription, mathcounting, complexui — разные симптомы разных дефектов).
Гипотезы трёх уровней:
- поверхностные — промпт;
- средние — конвейер ввода, размышление;
- глубокие — смена модели, дерево элементов UI.
Решение — не «принять всё эффективное», а анализ затрат и выгод: глобальное размышление даёт +3% успеха ценой тройной задержки для 8% задач — отклонить.
Сначала проверь саму систему оценки, потом трогай агента.
Связано: Три уровня системы оценки, Статистическая значимость оценки, Наблюдаемость агента