Глоссарий

Ключевые термины книги в одну строку; детали и контекст — в заметке по ссылке.

Архитектура агента

  • ReAct — цикл рассуждение → действие → наблюдение, основной режим работы агента. Цикл ReAct
  • Harness — инфраструктура вокруг модели: контекст, инструменты и три защитных слоя (ограничение, проверка, исправление). Harness-инженерия
  • MCP — Model Context Protocol, открытый стандарт подключения инструментов и данных к моделям. Протокол MCP
  • Sidecar — лёгкий параллельный вызов LLM, шлюзующий каждый вызов инструмента по структурированным данным. Механизм Sidecar
  • A2A — Agent2Agent (Google, 2025): протокол взаимодействия агента с агентом через задачи и артефакты. Протокол A2A
  • Computer Use — агент управляет графическим интерфейсом как человек: скриншот → рассуждение → действие. Computer Use
  • VLA — зрение-язык-действие: модель для роботов, медленное планирование плюс быстрое управление. VLA-модели

Контекст и поиск

  • KV Cache — кэш вычисленных пар ключ-значение механизма внимания: прошлые токены не пересчитываются на каждом шаге. KV Cache
  • Prompt Cache — межзапросный кэш одинакового префикса промпта на уровне API. Prompt Cache
  • Chat Template — преобразует сообщения API в линейный поток токенов со служебными метками. Chat Template
  • RAG — генерация с дополнением поиском: ретривер находит фрагменты базы знаний, генератор отвечает по ним. RAG
  • Эмбеддинг — отображение текста в векторное пространство, где семантически близкое оказывается рядом. Плотный эмбеддинг
  • BM25 — разреженный поиск по точному совпадению слов: насыщение частоты термина и нормировка длины документа. Разреженный поиск BM25
  • Гибридный поиск — плотный и разреженный движки параллельно, слияние рангов и нейронное переранжирование. Гибридный поиск
  • GraphRAG — знания как граф сущностей и отношений: многошаговый вывод и разрешение неоднозначности. GraphRAG

Обучение и оценка

  • LLM-as-a-Judge — модель оценивает качество по экспертной рубрике; обязательна калибровка на золотом наборе. LLM-as-a-Judge
  • RLHF — обучение с подкреплением от обратной связи человека: SFT → модель вознаграждения → PPO с KL-штрафом. RLHF
  • GRPO — RL без сети ценности: преимущество траектории — её позиция внутри сэмплированной группы. GRPO
  • RLVR — RL с проверяемыми наградами: сигнал выдаёт правило-верификатор, а не обученная модель. RLVR и проверяемые награды

Связано: Агент = LLM + Контекст + Инструменты, Формула агента, Инженерия контекста