Содержание
-
Агент = LLM + Контекст + Инструменты
Карта атомарных заметок по книге «Глубокое понимание AI Agent» (Ли Боцзе). Книга разворачивает формулу агента на четырёх уровнях: построение → оценка и эволюция → взаимодействие и сотрудничество. ## 0…
-
Harness-инженерия
Harness — вся инфраструктура вокруг модели: контекст и инструменты плюс три защитных слоя — ограничения (что нельзя), проверка (правильно ли сделано), исправление (как восстановить). Расширенная форму…
-
Агентный цикл в коде
Ядро агента — цикл while: если модель вернула tool_calls — выполнить инструменты, добавить результаты в список messages и продолжить; если tool_calls нет — вывести ответ и завершиться. Список messages…
-
Вызов инструментов
Вызов инструментов (tool calling) — четырёхшаговый процесс: (1) в контексте объявлены доступные инструменты; (2) модель сама решает, какой инструмент вызвать и с какими параметрами; (3) фреймворк выпо…
-
Контекст как глаза агента
Контекст — вся информация, которую агент видит в каждой точке принятия решения: системный промпт, определения инструментов, история диалога, результаты инструментов, память и состояние. Окно контекста…
-
Ограждения
Ограждения — многоуровневая защита по месту применения: входные (классификатор релевантности, обнаружение джейлбрейка и инъекций, модерация, правила), исполнительные (оценка риска инструмента перед вы…
-
Оркестрация - рабочий процесс и автономный агент
Рабочий процесс — детерминированный путь, заданный кодом: строгий контроль и безопасность, но нет гибкости. Автономный агент — путь формируется динамически по обратной связи среды: гибок, но дороже и …
-
Проектирование ACI
ACI (Agent-Computer Interface) — проектирование интерфейса с точки зрения агента, а не программиста. Имена и параметры должны быть интуитивны, а места, где легко ошибиться, спроектированы так, чтобы о…
-
Пространства наблюдений и действий
Пространства наблюдений и действий образуют интерфейс между моделью и средой (аналог ISA в архитектуре компьютеров). Информация, не попавшая в пространство наблюдений, для модели не существует; операц…
-
Пять категорий инструментов
Инструменты классифицируются по направлению вызова и объекту воздействия: (1) восприятия — получение информации; (2) выполнения — изменение внешнего мира; (3) сотрудничества — взаимодействие с другими…
-
Пять функций Harness
Пять функций Harness образуют замкнутый цикл: контекст (достаточность информации), инструменты (ясность интерфейса), ограничения (безопасность по умолчанию при сбое), проверка (изоляция входных данных…
-
Архитектура агента — сводка
Эта заметка собрана из других через `![[ ]]` — встроены иллюстрация и целиком две соседние заметки. ![[harness.svg|Агент = Модель + Harness]] ## Формула ![[Формула агента]] ## Harness
-
Три уровня обновления способностей
Поведение агента меняется тремя взаимодополняющими способами: (1) контекстная адаптация внутри задачи — мгновенно, но исчезает с сессией; (2) обновление внешних артефактов между задачами — знания, про…
-
Формула агента
Суть современного агента: Агент = LLM + Контекст + Инструменты. Ни один из трёх компонентов нельзя убрать. Интуитивная аналогия: мозг + глаза + руки-ноги. На языке обучения с подкреплением: LLM — поли…
-
Цикл ReAct
ReAct (Reasoning + Acting) — основной режим работы агента: рассуждение → действие (вызов инструмента) → наблюдение результата → снова рассуждение. Цикл повторяется, пока задача не выполнена. Траектори…
-
Эволюция инженерных парадигм
Дуга эволюции: инженерия промптов → инженерия контекста → Harness-инженерия → Loop-инженерия → Graph-инженерия. Каждый слой не заменяет предыдущий, а включает его: промпты — подмножество контекста, ко…
-
Agent Skills
Agent Skills — модули знаний, загружаемые по требованию, вместо раздувания системного промпта. Три уровня прогрессивного раскрытия: (1) метаданные — name + description всех Skills постоянно в контекст…
-
Chat Template
Chat Template преобразует структурированные сообщения API в линейный поток токенов со специальными метками (например, <|im_start|>, <|im_end|>). Отсюда два следствия: (1) нельзя подменять роли — если …
-
KV Cache
KV Cache кэширует уже вычисленные пары ключ-значение (K и V механизма внимания) предыдущих токенов, чтобы не пересчитывать их на каждом шаге генерации. Кэш работает по префиксу: если изменён хотя бы о…
-
Prompt Cache
Prompt Cache — межзапросный кэш на уровне API: одинаковый префикс разных запросов переиспользует уже вычисленный KV Cache. Чтение из кэша в разы дешевле (у Anthropic и DeepSeek примерно в 10 раз). Раз…
-
Инженерия контекста
Контекст определяет предел возможностей агента: модель среднего уровня с тщательно организованным контекстом часто превосходит топовую модель, блуждающую вслепую. Это не «запихнуть побольше в промпт»,…
-
Инженерия промптов
Системный промпт — «должностная инструкция» агента. Принципы: тон и стиль (заглавные буквы беречь для критичных ограничений); структура (XML-теги для семантики, Markdown для организации); ориентация н…
-
Инъекция промпта
Инъекция промпта — злоумышленник через внешний контент (веб-страницы, письма, документы) подмешивает в контекст инструкции, замаскированные под системные, захватывая поведение агента. В агентных систе…
-
Пять компонентов контекста
При каждом вызове LLM контекст состоит из пяти частей: системный промпт, определения инструментов, сообщения пользователя, ответы модели (reasoning + content + tool_calls), результаты выполнения инстр…
-
Сжатие контекста
Сжатие нужно не только из-за длины, но и для качества мышления: обобщённое знание использовать удобнее сырого. Причины две — ограничение окна/стоимости и деградация контекста (помещается, но не находи…
-
Строка состояния агента
Строка состояния агента — сводка динамической метаинформации, вставляемая в конец контекста: счётчики вызовов инструментов, прогресс TODO, текущее время, состояние среды. Аналогия — статусбар телефона…
-
Три правила дружественности к KV Cache
Три практических вывода из механизма KV Cache: (1) системный промпт и определения инструментов, однажды зафиксированные, менять нельзя — даже пробел инвалидирует весь кэш; (2) динамическую информацию …
-
Четыре роли сообщений API
Список сообщений API содержит четыре роли: system (инструкция разработчика, высший приоритет), user (ввод пользователя), assistant (предыдущие ответы модели, включая вызовы инструментов), tool (резуль…
-
GraphRAG
GraphRAG моделирует знания как граф сущностей и отношений (триплеты субъект-отношение-объект). Два ключевых преимущества: многошаговый вывод по отношениям (пользователь → врач → больница → адрес) и ра…
-
RAG
RAG (генерация с дополнением поиском) соединяет рассуждение LLM с широтой внешней базы знаний: ретривер находит релевантные фрагменты, генератор получает их как контекст и отвечает. Позволяет использо…
-
RAPTOR
RAPTOR — рекурсивная абстракция снизу вверх: документ разбивается на листовые блоки, семантически близкие блоки кластеризуются, LLM генерирует резюме каждой группы как родительский узел, процесс повто…
-
User as Code
User as Code — память пользователя как исполняемый Python-код вместо текста. Два этапа: журнал фактов (append-only, ничего не теряется) и периодическое структурирование в типизированные объекты. Три з…
-
Агентный RAG
Агентный RAG превращает поиск из автоматического подготовительного шага в инструмент, которым агент управляет по циклу ReAct: подумать → поискать → оценить достаточность → уточнить запрос и искать сно…
-
Гибридный поиск
Гибридный поиск запускает плотный и разреженный движки параллельно и объединяет результаты: плотный понимает семантику, но упускает ключевые слова; разреженный точно совпадает, но не понимает синонимы…
-
Иерархия памяти
Память делится по месту хранения: траектория — полная сырая запись текущей сессии (append-only, «подённая запись»); долгосрочная память пользователя — персистентная информация между сессиями («архив»,…
-
Когнитивные типы памяти
Когнитивная наука делит память на рабочую (контекстное окно) и долговременную трёх типов: эпизодическая — конкретные события («в среду ужинал с коллегой»); семантическая — абстрагированные знания («по…
-
Контекстно-зависимый поиск
Контекстно-зависимый поиск (Anthropic) решает потерю контекста при разбиении: перед индексацией LLM генерирует для каждого чанка префикс-сводку («фрагмент из отчёта ACME за Q2 2025, раздел ключевых по…
-
Плотный эмбеддинг
Плотный эмбеддинг отображает текст в векторное пространство, где семантически близкое оказывается близко. Сходство измеряется косинусом угла (направление важно, длина — нет). Эволюция: Word2Vec — стат…
-
Разбиение документов
Разбиение (chunking) режет длинные документы на фрагменты, пригодные для поиска: у эмбеддинг-моделей ограничен вход, а цель поиска — вставить в контекст только релевантное. Три стратегии: фиксированны…
-
Разреженный поиск BM25
Разреженный поиск основан на точном совпадении ключевых слов (мешок слов). BM25 улучшает TF-IDF двумя дополнениями: насыщение частоты термина (каждое следующее вхождение даёт всё меньший прирост, пара…
-
Структурированная индексация
Плоские чанки игнорируют структуру знания. Два кейса, показывающие проблему: подсчёт «100 котов» невозможен через top-k поиск (агрегация противоречит природе поиска «найти несколько релевантных»); пра…
-
Трёхуровневая оценка памяти
Способность памяти агента оценивается по трём уровням: (1) базовое воспроизведение — точный возврат явно данной информации («мой номер участника 12345»); (2) поиск по нескольким сессиям — связать инфо…
-
Форматы памяти пользователя
Четыре прогрессивных формата: Simple Notes — атомарные факты, O(1), но связи теряются; Enhanced Notes — абзацы с полным контекстом, семантическая целостность, но избыточность; JSON Cards — иерархия ка…
-
Баланс гранулярности инструментов
Слишком мелкая гранулярность — взрыв числа инструментов и нагрузка выбора для LLM; слишком крупная — чрезмерная сложность одного инструмента. Критерий объединения — схожесть функций и перекрытие сцена…
-
Динамическая загрузка инструментов
Динамическая загрузка не должна ломать KV Cache: полная схема нового инструмента добавляется в конец контекста (в траекторию), статический префикс остаётся стабильным. Добавление в конец не инвалидиру…
-
Достоверность передачи параметров
Между тем, как модель воспринимает мир, и тем, как инструмент действует, не должно быть систематического расхождения. Антипаттерны: тихое преобразование входа (инструмент незаметно заменяет фигурные к…
-
Искусство описания инструментов
Описание инструмента должно отвечать «когда использовать», а не только «что умеет». Обязательны границы (чего инструмент не умеет) — большинство ошибок вызова в том, что модель не знает ограничений. П…
-
Классификация инструментов
Пять категорий инструментов по направлению вызова и объекту воздействия: восприятия (активно получает информацию), выполнения (изменяет внешний мир), сотрудничества (управляет другими агентами и людьм…
-
Механизм Sidecar
Sidecar — лёгкий вызов LLM, параллельный основному размышлению, играющий роль шлюза для каждого вызова инструмента: опасная операция не выполнится, пока Sidecar её не пропустит. Ключевое решение — Sid…
-
Предложитель-рецензент
Парадигма предложитель-рецензент: одна модель предлагает действие, другая независимо проверяет. Два механизма: предварительное согласование (как двойная подпись в банке — для необратимых операций: пла…
-
Прерывание и заполнители
Как втиснуть асинхронное прерывание в синхронный формат: в обычном режиме LLM видит идеальную синхронную траекторию; только при прерывании вставляется заполнитель. Правила: сообщение assistant записыв…
-
Проактивное обнаружение инструментов
Когда инструментов сотни и тысячи, плоское перечисление схем в промпте не работает. Подходы: предварительный отбор через поиск; проактивная декларация (агент сам описывает потребность на естественном …
-
Протокол MCP
MCP (Model Context Protocol) — открытый стандарт Anthropic (конец 2024), унифицирующий взаимодействие моделей с инструментами и данными: «единая розетка» экосистемы. Архитектура клиент-сервер; три при…
-
Риски безопасности MCP
Каждый подключённый MCP-сервер — фрагмент неконтролируемого текста в контексте. Четыре типа рисков: отравление описания инструмента (вредоносные инструкции в description — инъекция, срабатывающая кажд…
-
Событийно-управляемый асинхронный агент
Асинхронность нужна для длительных задач, динамических приоритетов событий и плавного прерывания/восстановления. Фундаментальное противоречие: парадигма обучения LLM синхронна (после вызова инструмент…
-
Специализированный инструмент против Skill
Две базовые формы выражения возможностей: специализированный инструмент-код (структурированный вызов, детерминированность, тестируемость, но сотни токенов и разрастание) и Skill + универсальный исполн…
-
Человек в контуре
Вмешательство человека (human in the loop) — ключевая защита в критических точках: некоторые суждения требуют человеческих ценностей и экспертизы. Две ситуации запуска: превышение порога сбоев (эскала…
-
Sessionless
Sessionless — агент постоянно онлайн, без сессий и входа: пользователь пишет в любой момент через свой мессенджер. Инженерная сложность: состояние среды исполнения должно переживать разрывы от минут д…
-
Генеративный UI
Агент может динамически генерировать интерфейсы вместо текстового диалога: формы для уточнения намерения (вся информация собирается за одну отправку вместо десяти раундов), артефакты данных. Паттерн а…
-
Код как инструмент мышления
LLM вероятностна и приближённа, а математика и логика требуют детерминированной точности. Разделение труда: LLM отвечает за понимание задачи и написание кода, интерпретатор — за точные вычисления. При…
-
Код как метаспособность
Генерация кода — метаспособность: способность создавать другие способности во время выполнения. Код точен, исполняем, комбинируем, поэтому порождает новые инструменты, новые ограничения и новые формы …
-
Код как ограничение бизнес-правил
Принцип «ограничение важнее указания»: правило, закреплённое в коде, означает «нельзя сделать», а в промпте — лишь «рекомендуется не делать». Паттерн тройной гарантии (τ-bench): правила на естественно…
-
Лояльность агента
На чьей стороне агент при поручениях от нескольких сторон? По умолчанию модель помогает «тому, кто говорит», но в переговорах напротив сидит оппонент, чьи интересы противоположны. Спектр провалов: чре…
-
Парадигма файловой системы для знаний
OpenViking отображает весь контекст (память, ресурсы, навыки) в директории и файлы виртуальной файловой системы с URI вида viking://. Три уровня загрузки: L0 резюме (~100 токенов), L1 обзор (~2000 ток…
-
Самозагрузка агента
Агент способен создавать агентов: самовосстановление (OpenClaw Doctor — детерминированные проверки частых проблем + LLM для длинного хвоста сложных случаев), копирование и модификация себя. Ключевой п…
-
Сбои и восстановление
Надёжность агента определяется не тем, ошибается ли он, а тем, есть ли для каждого класса ошибок путь обнаружения, восстановления и прекращения. Таксономия: уровень API (рейт-лимиты, тайм-ауты), инстр…
-
Семантический разбор команд
Чёрный список ключевых слов не справляется с комбинаторным взрывом Shell-команд: запрет обходится через конвейеры, вложенные оболочки, раскрытие переменных ($(echo rm) -rf /). Нужен семантический разб…
-
Семь базовых инструментов
Минимальный набор кодинг-агента: Code Interpreter (песочница Python), Bash Shell, чтение файлов, запись файлов, редактирование файлов (локальные изменения), glob (поиск по именам), grep (поиск по соде…
-
Смертельная триада
Формула Саймона Уиллисона: доступ к приватным данным + воздействие недоверенного контента + способность к внешней коммуникации = полная замкнутая цепочка атаки. Вредоносная инструкция в ненадёжном кон…
-
Файловая система как центр агента
В архитектуре OpenClaw файловая система — не просто хранилище, а центр памяти, знаний и возможностей: MEMORY.md (факты и предпочтения), датированные журналы, SOUL.md (идентичность), файлы базы знаний,…
-
LLM-as-a-Judge
LLM-as-a-Judge — модель судит по экспертной рубрике: баланс масштаба автоматизации и качества человеческого суждения для открытых задач. Ограничения: смещение к длине, нестабильность повторных оценок.…
-
Анализ стоимости агента
Стоимость агента нелинейна из-за накопления контекста: на шаге 1 отправляется 1000 токенов, на шаге 2 — 2000, на шаге 3 — 3000, суммарно 6000 вместо 3000. Усиливающие факторы: токены размышления (опла…
-
Метрики оценки агентов
Метрики процесса: доля допустимых действий, точность вызова инструментов, эффективность пути (шаги, избыточность, откаты), стоимость и задержка. Метрики результата: доля успеха, Pass@k (хотя бы одна и…
-
Наблюдаемость агента
Наблюдаемость — способность судить о внутреннем состоянии системы по внешним сигналам (журналы, метрики, трассировки). Трассировка (trace) — одному запуску задачи; каждый вызов LLM, инструмента, поиск…
-
От бенчмарка к улучшениям
Методология: наблюдение → гипотеза → эксперимент → решение → итерация. Чтение отчёта: таблица по задачам + матрица меток способностей раскрывают структурные слабости (сбои в transcription, math_counti…
-
Симуляционная среда
Когда цель расширяется от оценки до воспитания способностей, среда оценки эволюционирует в симуляционную: миллионы взаимодействий вместо тысяч, рандомизация против зубрёжки, мгновенная обратная связь.…
-
Среды оценки
Две основные парадигмы сред: инструментальная (Verifiers) — агент вызывает инструменты, проверка исполняемыми критериями (тесты, совпадение ответа), без человека и LLM-судьи; человеко-машинная (τ-benc…
-
Статистическая значимость оценки
Наблюдаемая разница может быть шумом выборки. Стандартная ошибка биномиального распределения √(p(1-p)/n): при 100 примерах и успехе 70% полоса шума ±9 пунктов — разница 3% несущественна. Правильный по…
-
Три уровня системы оценки
Система оценки строится на трёх уровнях: (1) среда оценки — где тестировать (инструментальная, человеко-машинная, симуляционная); (2) методы — как судить (дизайн датасета, метрики, LLM-as-a-Judge, пар…
-
Четыре принципа рубрики
Принципы Scale AI: (1) опора на экспертное знание — фиксировать ключевые факты и шаги, типичные ловушки; (2) полнота охвата — точность, связность, полнота, безопасность плюс явные pitfall; (3) взвешив…
-
GRPO
GRPO (Group Relative Policy Optimization) отказывается от сети ценности: для одного вопроса сэмплируется группа траекторий, преимущество каждой — её относительная позиция внутри группы ((ri − mean)/st…
-
KL - mode-seeking против mass-covering
KL-дивергенция несимметрична, и направление важно. Обратная KL KL(πθ‖πref) штрафует уход политики туда, где референсная модель даёт почти ноль, — она mode-seeking: концентрирует вероятность на несколь…
-
On-Policy Distillation
On-Policy Distillation сочетает достоинства SFT и RL: ученик сам генерирует траектории (on-policy — решает проблему несоответствия распределений), а более сильный учитель даёт пословное распределение …
-
RLHF
RLHF — обучение с подкреплением от обратной связи человека. Трёхэтапный пайплайн InstructGPT: SFT на демонстрациях → модель вознаграждения на парных сравнениях людей (по Брэдли-Терри: сравнивать «что …
-
RLVR и проверяемые награды
RLVR — обучение с подкреплением с проверяемыми наградами: сигнал выдаёт правило-верификатор (прошёл ли тест, верен ли ответ), а не обученная модель. Задачи агентов в большинстве проверяемы — поэтому R…
-
SFT запоминает - RL обобщает
SFT оптимизирует «похоже ли на эталон» (максимальное правдоподобие) — выучивает жёсткое отображение вход→выход и запоминает: при изменении правил среды применяет старый ответ. RL оптимизирует «насколь…
-
Данные и среда важнее алгоритма
Самый контринтуитивный опыт индустрии: готовые алгоритмы RL достаточно уметь применять; успех определяют достоверность симуляционной среды, качество данных и возможности базовой модели. Если среда иск…
-
Награда за процесс и награда за результат
Ключевой выбор для многошаговых задач: награда за результат (только в конце, максимум свободы исследования, но разреженный сигнал) или процессная награда (каждый шаг, проще обучение, но риск ограничит…
-
Самодистилляция OPSD
Что делать без более сильного учителя: одна модель играет и учителя, и ученика — разница только в контексте. Учитель видит привилегированную информацию (эталонный ответ, документацию) и «объясняет по …
-
Сначала SFT потом RL
RL требует парсируемого вывода: если модель выдаёт хаотичный текст вместо JSON, функция вознаграждения не может ничего посчитать — учиться не на чем. SFT играет роль «сначала научить говорить внятно»:…
-
Три этапа постобучения
Возможности модели формируются в три этапа-конвейера: предобучение — «прочитать десять тысяч книг» (предсказание следующего токена на интернет-текстах, знания и язык); SFT — «учитель показывает эталон…
-
Границы безопасности самомодификации
Самоэволюция превращает единичную ошибку в долгосрочный риск. Три границы: (1) разделение свидетельств и инструкций — необработанный внешний контент не записывается в Skill напрямую, только через обоб…
-
Два контура эволюции
Онлайн-контур только выполняет задачи и фиксирует свидетельства — не изменяет официального агента. Офлайн-контур агрегирует траектории, диагностирует первопричины, создаёт кандидатные изменения и публ…
-
Непрерывная эволюция агента
Парадокс: агент решает новые задачи без примеров, но после десяти тысяч похожих может повторить ошибку первого дня. Сохранение опыта ≠ обучение на опыте: записать траектории в базу — не значит извлечь…
-
Обновление Prompt и Skill
Когда много траекторий выявляет одну стратегическую ошибку, выразимую словами, — повысить её статус с «рекомендуемого опыта» до «обязательного правила». Обучение системного промпта (термин Карпаты): м…
-
Обновление параметров модели
Параметризация нужна для способностей, которые нельзя выразить внешними символами: распознавание медицинских изображений, естественная просодия, устранение «привкуса AI». Решение определяется не стаби…
-
Обучающие сигналы из траекторий
Отправная точка эволюции — не обобщение, а оценка. Трёхуровневая проверка: проверяющий результат (тесты, состояние БД — «задача действительно выполнена?»), проверяющий процесс (правила, полномочия — «…
-
Обучение во сне
«Обучение во сне» — офлайн-интеграция опыта: онлайн-агент выполняет задачи и добавляет неизменяемые свидетельства; фоновый процесс в простое читает пакет опыта, сопоставляет новое со старым, объединяе…
-
От опыта к знаниям
Двухэтапный принцип (как User as Code): сначала фиксация неизменяемых свидетельств, потом офлайн-систематизация. Три уровня данных: неизменяемые исходные траектории (аудит); анализ отдельного выполнен…
-
От опыта к программам
Стабильные повторяющиеся проверяемые операции компилируются в код: рабочие процессы, инструменты, проверки Harness. Жизненный цикл браузерного рабочего процесса: запись траектории с локаторами → парам…
-
Проверка - выпуск - откат
Любое изменение сначала создаёт кандидатную версию, а не заменяет производственную. Проверки по носителю: знания — улучшают ли новые задачи после извлечения; промпты и Skill — пограничные случаи + рег…
-
Четыре носителя обновления
Куда записать опыт — определяет природа способности: база знаний — факты и закономерности (быстрое обновление, прослеживаемость); Prompt и Skill — выражаемые естественным языком стратегии (объяснимост…
-
Computer Use
Computer Use — агент управляет графическим интерфейсом как человек. Цикл восприятие-мышление-действие: скриншот → мультимодальная модель выводит рассуждение и действие → слой исполнения выполняет (мыш…
-
Sim2Real
Разрыв между симуляцией и реальностью: симуляция не воспроизводит точно физику, визуальные и аппаратные характеристики. Рандомизация домена: широко и случайно варьировать параметры (трение, массы, осв…
-
VLA-модели
VLA (зрение-язык-действие) — «VLM + вывод действий»: увидеть и продумать плюс действовать руками. Двухуровневая архитектура: медленное долгосрочное планирование (что делать — разбиение инструкции на п…
-
Архитектура мышления быстрое и медленное
Противоречие: миллисекундный отклик против секунд глубокого размышления. Три варианта: (1) быстрое мышление отвечает отговоркой за 500 мс, медленное думает 5-10 секунд и даёт полный ответ — риски избы…
-
Визуальная локализация GUI
Как найти элемент на скриншоте. Подход с вариантами ответа: Set-of-Mark — сегментация по пикселям и номерные метки; структурированная индексация — DOM/дерево доступности (browser-use: интерактивные эл…
-
Голосовые парадигмы
Три парадигмы голосовой архитектуры: (1) каскад — конвейер VAD→ASR→LLM→TTS, модульность, но накопление задержки и потеря информации на стыках; (2) сквозная всемодальная модель (Omni) — единая модель с…
-
Двухуровневая архитектура планирование-управление
Роботу нужны решения на двух временных масштабах: долгосрочное планирование (0,1-1 Гц: «убери кухню» → последовательность подцелей — семантика, зависимости, многошаговый план) и VLA-управление (1-10 Г…
-
Каскадный голосовой конвейер
VAD определяет конец речи (порог тишины 500-800 мс — компромисс: короче — обрезает паузы думающего, длиннее — лишняя секунда ожидания) → ASR транскрибирует → LLM генерирует → TTS озвучивает. Каждый эт…
-
Полный дуплекс
Полнодуплексная модель слушает и говорит одновременно, полностью снимая предположение об очереди: перекрывающаяся речь и произвольное прерывание — естественное поведение, не требующее детекции. Пионер…
-
Потоковое речевое восприятие
Замена связки VAD+ASR потоковой моделью восприятия: непрерывный аудиопоток вместо нарезанных фрагментов, полный контекст для обучения в контексте, выше точность имён и терминов. Модель выдаёт не тольк…
-
Синтез речи подобный человеку
«Совершенство» традиционного TTS — и есть проблема: слишком гладкая речь выдаёт машину. Человеческие «несовершенства» (паузы, «м-м», повторы) — внешнее проявление мышления. Решение: LLM выводит управл…
-
Децентрализованная модель и handoff
Нет центрального управляющего: равноправные агенты сами решают, когда передать управление (handoff), запросить обратную связь или сообщить о проблеме. Примеры по степени настоящести: MetaGPT — конвейе…
-
Запрос состояния и персистентность траектории
Два способа узнать прогресс дочернего агента. Через сообщения: спросить «как продвигается?» асинхронно или получать инициативные status_update в шину; состояние выражать единым словарём (выполняется/т…
-
Межагентная коммуникация
Механизмы коммуникации укладываются в две парадигмы межпроцессного взаимодействия: разделяемая память и передача сообщений. Три способа: параметры вызова инструмента (синхронная передача со структурой…
-
Модель оркестрации
Централизованный менеджер: понять задачу → разбить на подзадачи → выбрать агентов → отследить прогресс → объединить результаты. Каждый специализированный агент моделируется как инструмент: вызов, пере…
-
Мультиагентная смена ролей
Многоэтапная смена ролей (общий контекст): на каждом этапе системный промпт и набор инструментов переключаются — фактически новый агент, но с полной историей. Аналитик требований задаёт вопросы и не п…
-
Мультиагентное взаимодействие без общего контекста
Каждый агент — независимая сущность со своим контекстом и состоянием; взаимодействие только через явные структурированные механизмы. Преимущества процессной изоляции: независимая разработка и тестиров…
-
Мультиагентность против одного агента
Критерий ценности: вносит ли процесс взаимодействия новую информацию, которую единичный агент не получил бы при генерации? Несколько агентов обсуждают один текст (дебаты) — при равном бюджете не лучше…
-
Общество агентов
Stanford AI Town: генеративные агенты с тремя компонентами — поток памяти (записи с важностью, недавностью, релевантностью), рефлексия (периодическое самоопрашивание, возгонка событий в обобщённое пон…
-
Общий и раздельный контекст
Первое измерение проектирования: разделяется ли контекст. Общий контекст — последующий агент наследует полную траекторию предшественника (новая роль, но вся память): нулевая потеря информации, но конт…
-
Протокол A2A
Когда взаимодействие выходит за границы организации, нужен стандартизированный протокол: A2A (Agent2Agent, Google 2025, под эгидой Linux Foundation). Три элемента: карточка агента (метаданные возможно…
-
Режимы отказа мультиагентных систем
MAST-классификация: 14 режимов отказа в трёх категориях (дефекты системного дизайна, сбой согласованности между агентами, отсутствие проверки выполнения). Простые исправления дают лишь ~15% улучшения …
-
Топологии взаимодействия
Второе измерение — по какой структуре перемещаются управление и информация. Три формы при раздельном контексте по возрастанию сложности: равноправное сотрудничество (2-3 агента, цикл итеративного улуч…
-
Файловая система в мультиагентных системах
Агент обращается к виртуальной файловой системе: четыре типа областей смонтированы в одно дерево. Собственная рабочая область (scratchpad) — приватная, уничтожается с экземпляром, процесс проб и ошибо…
-
Эмерджентное поведение агентов
Когда агентов много и взаимодействие свободно, возникает коллективное поведение, которое нельзя предсказать из правил отдельной особи — как муравьиная колония находит кратчайший путь без единого «прое…
-
Harness постепенно поглощается моделью
«Горький урок» применительно к эпохе агентов: универсальный метод в конце концов победит, но каждый отрезок пути к этому «в конце концов» проложен Harness. Пример: прерывание и вставка реплик — поведе…
-
Два облака агентного неба
Два нерешённых вызова: (1) потоковое взаимодействие со средой в реальном времени — мир не ждёт, пока агент додумает: речь прерывается, картинка меняется, письма приходят непрерывно. Пути: архитектурно…
-
Маховик модель-агент
Быстрее всего маховик крутится там, где оба конца держит один игрок (Anthropic + Claude Code): модель знает, как её вызовет Harness, Harness знает границы модели. Эксперимент: без смены модели, только…
-
Совместная эволюция модели и агента
Каждый слой подстраховки в Harness (сжатие контекста, повторные попытки, пессимистичные права) фиксирует место, где модель пока нестабильна. Когда следующее поколение модели интернализирует ограничени…