Агент = LLM + Контекст + Инструменты
Карта атомарных заметок по книге «Глубокое понимание AI Agent» (Ли Боцзе). Книга разворачивает формулу агента на четырёх уровнях: построение → оценка и эволюция → взаимодействие и сотрудничество.
База знаний по AI-агентам на русском: 130+ атомарных заметок, одна заметка — одна идея, связанная с остальными в единую сеть. Как ориентироваться: разделы и поиск — в сайдбаре слева, вся сеть связей — на карте всего сайта, каналы Telegram — по значку ✈ у разделов.
📚 Разделы сайта
- 📖 Wiki — все 11 глав книги: список ниже, термины — в Глоссарий
- 🎓 Обучение — мини-курсы и пошаговые гайды
- 🛠️ Инструменты — каталоги моделей и шаблоны агентов
- 📰 Блог — обзоры моделей и новости
- 👤 О проекте — миссия и контакты
🚀 С чего начать
Три маршрута — каждая следующая заметка продолжает предыдущую.
- Новичок — что такое агент: Формула агента → Пространства наблюдений и действий → Агентный цикл в коде
- Разработчик — строить на практике: Протокол MCP → RAG → Гибридный поиск → Код как инструмент мышления
- Исследователь — оценка и улучшение агентов: Три уровня системы оценки → GRPO → Непрерывная эволюция агента → Общество агентов
- Незнакомый термин — смотри 📖 Глоссарий
🕒 Последние обновления
- 24 августа 2026 — в разделе «Обучение» стартовал мини-курс «Агент с нуля»: 5 уроков — теория с блок-схемами и кодом на Python/JS, итог — свой CLI-агент
- 24 августа 2026 — открыты разделы «Обучение», «Инструменты», «Блог» и «О проекте»; добавлен Глоссарий — 19 терминов одной строкой
01 Основы агентов (глава 1)
Формула агента, цикл ReAct, Harness и ограждения — как агент устроен изнутри.
- Формула агента
- Пространства наблюдений и действий
- Контекст как глаза агента
- Пять категорий инструментов
- Вызов инструментов
- Цикл ReAct
- Агентный цикл в коде
- Три уровня обновления способностей
- Harness-инженерия
- Пять функций Harness
- Эволюция инженерных парадигм
- Оркестрация - рабочий процесс и автономный агент
- Ограждения
- Проектирование ACI
02 Инженерия контекста (глава 2)
Из чего состоит контекст, KV Cache и Prompt Cache, chat-шаблоны и промпты.
- Инженерия контекста
- Пять компонентов контекста
- Четыре роли сообщений API
- KV Cache
- Prompt Cache
- Три правила дружественности к KV Cache
- Chat Template
- Инженерия промптов
- Инъекция промпта
- Agent Skills
- Строка состояния агента
- Сжатие контекста
03 Память пользователя и база знаний (глава 3)
Иерархии памяти, RAG, эмбеддинги, гибридный поиск и GraphRAG.
- Трёхуровневая оценка памяти
- Иерархия памяти
- Форматы памяти пользователя
- User as Code
- Когнитивные типы памяти
- RAG
- Разбиение документов
- Плотный эмбеддинг
- Разреженный поиск BM25
- Гибридный поиск
- Структурированная индексация
- RAPTOR
- GraphRAG
- Агентный RAG
- Контекстно-зависимый поиск
04 Инструменты (глава 4)
Классификация и описание инструментов, MCP, Sidecar и человек в контуре.
- Классификация инструментов
- Специализированный инструмент против Skill
- Баланс гранулярности инструментов
- Искусство описания инструментов
- Достоверность передачи параметров
- Протокол MCP
- Риски безопасности MCP
- Механизм Sidecar
- Предложитель-рецензент
- Человек в контуре
- Событийно-управляемый асинхронный агент
- Прерывание и заполнители
- Проактивное обнаружение инструментов
- Динамическая загрузка инструментов
05 Кодинг-агент и генерация кода (глава 5)
Файловая система как центр агента, код как способность и как ограничение.
- Семь базовых инструментов
- Файловая система как центр агента
- Парадигма файловой системы для знаний
- Sessionless
- Код как метаспособность
- Код как инструмент мышления
- Код как ограничение бизнес-правил
- Генеративный UI
- Самозагрузка агента
- Смертельная триада
- Лояльность агента
- Семантический разбор команд
- Сбои и восстановление
06 Оценка агентов (глава 6)
Метрики, LLM-as-a-Judge, стоимость и наблюдаемость агентов.
- Три уровня системы оценки
- Среды оценки
- Метрики оценки агентов
- LLM-as-a-Judge
- Четыре принципа рубрики
- Статистическая значимость оценки
- Анализ стоимости агента
- От бенчмарка к улучшениям
- Наблюдаемость агента
- Симуляционная среда
07 Постобучение модели (глава 7)
SFT, RLHF, GRPO, RLVR и дистилляция.
- Три этапа постобучения
- SFT запоминает - RL обобщает
- Сначала SFT потом RL
- Данные и среда важнее алгоритма
- RLHF
- KL - mode-seeking против mass-covering
- RLVR и проверяемые награды
- Награда за процесс и награда за результат
- GRPO
- On-Policy Distillation
- Самодистилляция OPSD
08 Непрерывная эволюция агентов (глава 8)
Обучение из траекторий, контуры обновления, безопасность самомодификации.
- Непрерывная эволюция агента
- Обучающие сигналы из траекторий
- Четыре носителя обновления
- От опыта к знаниям
- Обновление Prompt и Skill
- От опыта к программам
- Обновление параметров модели
- Два контура эволюции
- Проверка - выпуск - откат
- Границы безопасности самомодификации
- Обучение во сне
09 Мультимодальность и реальное время (глава 9)
Голосовые агенты, Computer Use и роботы (VLA, Sim2Real).
- Голосовые парадигмы
- Каскадный голосовой конвейер
- Потоковое речевое восприятие
- Полный дуплекс
- Архитектура мышления быстрое и медленное
- Синтез речи подобный человеку
- Computer Use
- Визуальная локализация GUI
- VLA-модели
- Двухуровневая архитектура планирование-управление
- Sim2Real
10 Мультиагентное взаимодействие (глава 10)
Топологии, оркестрация, протокол A2A и общество агентов.
- Общий и раздельный контекст
- Топологии взаимодействия
- Межагентная коммуникация
- Мультиагентная смена ролей
- Мультиагентное взаимодействие без общего контекста
- Файловая система в мультиагентных системах
- Запрос состояния и персистентность траектории
- Модель оркестрации
- Децентрализованная модель и handoff
- Протокол A2A
- Мультиагентность против одного агента
- Режимы отказа мультиагентных систем
- Эмерджентное поведение агентов
- Общество агентов
11 Послесловие
Прогнозы: куда движется поле агентов.