Агент = LLM + Контекст + Инструменты
Карта атомарных заметок по книге «Глубокое понимание AI Agent» (Ли Боцзе). Книга разворачивает формулу агента на четырёх уровнях: построение → оценка и эволюция → взаимодействие и сотрудничество.
01 Основы агентов (глава 1)
- Формула агента
- Пространства наблюдений и действий
- Контекст как глаза агента
- Пять категорий инструментов
- Вызов инструментов
- Цикл ReAct
- Агентный цикл в коде
- Три уровня обновления способностей
- Harness-инженерия
- Пять функций Harness
- Эволюция инженерных парадигм
- Оркестрация - рабочий процесс и автономный агент
- Ограждения
- Проектирование ACI
02 Инженерия контекста (глава 2)
- Инженерия контекста
- Пять компонентов контекста
- Четыре роли сообщений API
- KV Cache
- Prompt Cache
- Три правила дружественности к KV Cache
- Chat Template
- Инженерия промптов
- Инъекция промпта
- Agent Skills
- Строка состояния агента
- Сжатие контекста
03 Память пользователя и база знаний (глава 3)
- Трёхуровневая оценка памяти
- Иерархия памяти
- Форматы памяти пользователя
- User as Code
- Когнитивные типы памяти
- RAG
- Разбиение документов
- Плотный эмбеддинг
- Разреженный поиск BM25
- Гибридный поиск
- Структурированная индексация
- RAPTOR
- GraphRAG
- Агентный RAG
- Контекстно-зависимый поиск
04 Инструменты (глава 4)
- Классификация инструментов
- Специализированный инструмент против Skill
- Баланс гранулярности инструментов
- Искусство описания инструментов
- Достоверность передачи параметров
- Протокол MCP
- Риски безопасности MCP
- Механизм Sidecar
- Предложитель-рецензент
- Человек в контуре
- Событийно-управляемый асинхронный агент
- Прерывание и заполнители
- Проактивное обнаружение инструментов
- Динамическая загрузка инструментов
05 Кодинг-агент и генерация кода (глава 5)
- Семь базовых инструментов
- Файловая система как центр агента
- Парадигма файловой системы для знаний
- Sessionless
- Код как метаспособность
- Код как инструмент мышления
- Код как ограничение бизнес-правил
- Генеративный UI
- Самозагрузка агента
- Смертельная триада
- Лояльность агента
- Семантический разбор команд
- Сбои и восстановление
06 Оценка агентов (глава 6)
- Три уровня системы оценки
- Среды оценки
- Метрики оценки агентов
- LLM-as-a-Judge
- Четыре принципа рубрики
- Статистическая значимость оценки
- Анализ стоимости агента
- От бенчмарка к улучшениям
- Наблюдаемость агента
- Симуляционная среда
07 Постобучение модели (глава 7)
- Три этапа постобучения
- SFT запоминает - RL обобщает
- Сначала SFT потом RL
- Данные и среда важнее алгоритма
- RLHF
- KL - mode-seeking против mass-covering
- RLVR и проверяемые награды
- Награда за процесс и награда за результат
- GRPO
- On-Policy Distillation
- Самодистилляция OPSD
08 Непрерывная эволюция агентов (глава 8)
- Непрерывная эволюция агента
- Обучающие сигналы из траекторий
- Четыре носителя обновления
- От опыта к знаниям
- Обновление Prompt и Skill
- От опыта к программам
- Обновление параметров модели
- Два контура эволюции
- Проверка - выпуск - откат
- Границы безопасности самомодификации
- Обучение во сне
09 Мультимодальность и реальное время (глава 9)
- Голосовые парадигмы
- Каскадный голосовой конвейер
- Потоковое речевое восприятие
- Полный дуплекс
- Архитектура мышления быстрое и медленное
- Синтез речи подобный человеку
- Computer Use
- Визуальная локализация GUI
- VLA-модели
- Двухуровневая архитектура планирование-управление
- Sim2Real
10 Мультиагентное взаимодействие (глава 10)
- Общий и раздельный контекст
- Топологии взаимодействия
- Межагентная коммуникация
- Мультиагентная смена ролей
- Мультиагентное взаимодействие без общего контекста
- Файловая система в мультиагентных системах
- Запрос состояния и персистентность траектории
- Модель оркестрации
- Децентрализованная модель и handoff
- Протокол A2A
- Мультиагентность против одного агента
- Режимы отказа мультиагентных систем
- Эмерджентное поведение агентов
- Общество агентов