Среды оценки

Две основные парадигмы сред:

  • инструментальная (Verifiers) — агент вызывает инструменты, проверка исполняемыми критериями (тесты, совпадение ответа), без человека и LLM-судьи;
  • человеко-машинная (τ-bench) — другая LLM играет пользователя.

Ключевой принцип человеко-машинной оценки — прогрессивное раскрытие информации: реальные пользователи не формулируют потребность сразу чётко, агент должен уточнять вопросами, и симулятор раскрывает информацию постепенно по сценарию.

τ²-bench добавляет двойной контроль (пользователь тоже действует в среде) и параметризованную генерацию задач.

Связано: Три уровня системы оценки, LLM-as-a-Judge, Симуляционная среда