Среды оценки
Две основные парадигмы сред:
- инструментальная (Verifiers) — агент вызывает инструменты, проверка исполняемыми критериями (тесты, совпадение ответа), без человека и LLM-судьи;
- человеко-машинная (τ-bench) — другая LLM играет пользователя.
Ключевой принцип человеко-машинной оценки — прогрессивное раскрытие информации: реальные пользователи не формулируют потребность сразу чётко, агент должен уточнять вопросами, и симулятор раскрывает информацию постепенно по сценарию.
τ²-bench добавляет двойной контроль (пользователь тоже действует в среде) и параметризованную генерацию задач.
Связано: Три уровня системы оценки, LLM-as-a-Judge, Симуляционная среда