Среды оценки

Две основные парадигмы сред: инструментальная (Verifiers) — агент вызывает инструменты, проверка исполняемыми критериями (тесты, совпадение ответа), без человека и LLM-судьи; человеко-машинная (τ-bench) — другая LLM играет пользователя. Ключевой принцип человеко-машинной оценки — прогрессивное раскрытие информации: реальные пользователи не формулируют потребность сразу чётко, агент должен уточнять вопросами, и симулятор раскрывает информацию постепенно по сценарию. τ²-bench добавляет двойной контроль (пользователь тоже действует в среде) и параметризованную генерацию задач.

Связано: Три уровня системы оценки, LLM-as-a-Judge, Симуляционная среда