Глоссарий
Ключевые термины книги в одну строку; детали и контекст — в заметке по ссылке.
Архитектура агента
- ReAct — цикл рассуждение → действие → наблюдение, основной режим работы агента. Цикл ReAct
- Harness — инфраструктура вокруг модели: контекст, инструменты и три защитных слоя (ограничение, проверка, исправление). Harness-инженерия
- MCP — Model Context Protocol, открытый стандарт подключения инструментов и данных к моделям. Протокол MCP
- Sidecar — лёгкий параллельный вызов LLM, шлюзующий каждый вызов инструмента по структурированным данным. Механизм Sidecar
- A2A — Agent2Agent (Google, 2025): протокол взаимодействия агента с агентом через задачи и артефакты. Протокол A2A
- Computer Use — агент управляет графическим интерфейсом как человек: скриншот → рассуждение → действие. Computer Use
- VLA — зрение-язык-действие: модель для роботов, медленное планирование плюс быстрое управление. VLA-модели
Контекст и поиск
- KV Cache — кэш вычисленных пар ключ-значение механизма внимания: прошлые токены не пересчитываются на каждом шаге. KV Cache
- Prompt Cache — межзапросный кэш одинакового префикса промпта на уровне API. Prompt Cache
- Chat Template — преобразует сообщения API в линейный поток токенов со служебными метками. Chat Template
- RAG — генерация с дополнением поиском: ретривер находит фрагменты базы знаний, генератор отвечает по ним. RAG
- Эмбеддинг — отображение текста в векторное пространство, где семантически близкое оказывается рядом. Плотный эмбеддинг
- BM25 — разреженный поиск по точному совпадению слов: насыщение частоты термина и нормировка длины документа. Разреженный поиск BM25
- Гибридный поиск — плотный и разреженный движки параллельно, слияние рангов и нейронное переранжирование. Гибридный поиск
- GraphRAG — знания как граф сущностей и отношений: многошаговый вывод и разрешение неоднозначности. GraphRAG
Обучение и оценка
- LLM-as-a-Judge — модель оценивает качество по экспертной рубрике; обязательна калибровка на золотом наборе. LLM-as-a-Judge
- RLHF — обучение с подкреплением от обратной связи человека: SFT → модель вознаграждения → PPO с KL-штрафом. RLHF
- GRPO — RL без сети ценности: преимущество траектории — её позиция внутри сэмплированной группы. GRPO
- RLVR — RL с проверяемыми наградами: сигнал выдаёт правило-верификатор, а не обученная модель. RLVR и проверяемые награды
Связано: Агент = LLM + Контекст + Инструменты, Формула агента, Инженерия контекста