Один агент упирается в своё окно контекста, несколько — делят работу и приносят наверх только выводы. Плата за это — примерно пятнадцатикратный расход токенов. Разбираем паттерны, цифры и границу, за которой схема не окупается.
Мультиагентная система — это несколько ИИ-агентов, работающих над одной задачей вместе: ведущий агент разбирает запрос, ставит подзадачи исполнителям, а те работают параллельно, каждый в своём окне контекста, и возвращают наверх выжимку вместо сырых логов. Anthropic в инженерном разборе своей поисковой системы приводит цифры обеих сторон сделки: связка ведущего агента и исполнителей обошла одиночную модель на 90,2% на внутреннем тесте и потратила примерно в 15 раз больше токенов, чем обычный чат. Поэтому решение всегда экономическое, а не техническое.
Что узнаешь из разбора
Часть 1 · Определение
Главное
Определение из инженерного разбора Anthropic звучит буднично: мультиагентная система — это несколько агентов, работающих вместе, где агент — модель, которая в цикле сама пользуется инструментами. Вся сложность не в определении, а в координации.
Ключевое отличие от «одного умного чата» — не количество моделей, а разделение контекстов. У каждого исполнителя своё окно, свой набор инструментов и своя постановка задачи. Он копается в деталях у себя и отдаёт наверх результат в сжатом виде. Ведущий агент видит выводы, а не гигабайты промежуточного вывода — и потому дольше остаётся вменяемым.
В документации OpenAI это сформулировано через две болезни длинной сессии: загрязнение контекста, когда полезное тонет в логах и стек-трейсах, и гниение контекста, когда качество падает по мере того, как чат заполняется малозначимыми деталями. Субагент — способ вынести шум из главной ветки.
Часть 2 · Смысл
Практических причин три, и все они про ограничения одиночной сессии.
Цифра, по которой можно сверяться
В своём внутреннем тесте Anthropic сравнила две конфигурации: одиночный Claude Opus 4 против связки, где Opus 4 ведущий, а исполнители на Sonnet 4. Связка выиграла на 90,2%. Пост опубликован 13 июня 2025 года и оперирует моделями того времени, поэтому число стоит читать как порядок эффекта, а не как обещание на нынешней линейке.
Часть 3 · Экономика
Мультиагентность работает во многом потому, что позволяет потратить на задачу больше вычислений. Это и её главный минус.
| Режим работы | Расход токенов относительно чата |
|---|---|
| Обычный чат | 1x, точка отсчёта |
| Один агент с инструментами | около 4x |
| Мультиагентная система | около 15x |
Почему это вообще работает
В анализе Anthropic три фактора объясняют 95% разброса результатов на их оценочном тесте, и расход токенов сам по себе — 80%. То есть мультиагентная архитектура выигрывает прежде всего тем, что даёт задаче больше вычислений через параллельные окна контекста. Отсюда и правило: схема оправдана там, где ценность результата покрывает пятнадцатикратный счёт.
На практике это упирается в лимиты подписки, а не в абстрактные токены. Как считаются лимиты у OpenAI, разобрано в гайде лимиты Codex, приёмы экономии контекста — в гайде как экономить токены.
Часть 4 · Схемы
Классификация ниже — из документации LangChain, она удобна тем, что описывает не фреймворк, а способ мышления.
| Паттерн | Как устроен | Когда брать |
|---|---|---|
| Субагенты как инструменты | главный агент вызывает остальных, вся маршрутизация через него | базовый случай, самый предсказуемый |
| Передача состояния | вызов инструмента меняет состояние, оно переключает агента или его инструменты | когда этапы включают и выключают возможности |
| Скилы | один агент подгружает знания и инструкции по требованию | когда нужна экспертиза, а не второй исполнитель |
| Роутер | запрос классифицируется и уходит профильному агенту | поддержка, разбор входящих, разные типы запросов |
| Воркфлоу | жёсткая схема, агентные шаги — узлы в ней | когда порядок шагов известен заранее |
Паттерн «скилы» стоит в этом списке не случайно: часто «нам нужен ещё один агент» на деле означает «нам нужна ещё одна инструкция под конкретную задачу». Скил подгружается по требованию и не платит за себя постоянным местом в контексте — разбор механики в гайде скилы Claude Code.
Главный вопрос — не схема, а контекст
В документации LangChain это названо прямо: качество системы зависит от того, что именно видит каждый агент. Сначала решается, какие данные нужны исполнителю для его куска работы, и только потом — каким паттерном их доставить.
Часть 5 · Инструменты
Писать оркестратор с нуля в большинстве случаев не нужно: он уже есть в агентах, которыми вы и так пользуетесь.
/agent. Модель исполнителя наследуется от родителя, если не задать её явно в config.toml или в файле агента.Часть 6 · Сборка
Что писать в задании исполнителю
Anthropic перечисляет минимум: цель, формат вывода, подсказка по инструментам и источникам, явные границы задачи. Хороший запрос к субагентам ещё и говорит, как делить работу и ждать ли всех перед продолжением. Пример из документации OpenAI: «проверь ветку параллельными субагентами — один на риски безопасности, один на дыры в тестах, один на поддерживаемость; дождись всех троих и собери выводы по категориям со ссылками на файлы».
Часть 7 · Грабли
Часть 8 · Граница
Честный ответ есть у обоих источников. LangChain пишет, что не всякая сложная задача требует такой схемы: один агент с правильными инструментами и промптом часто даёт тот же результат. Anthropic добавляет конкретики: домены, где всем агентам нужен общий контекст или где между шагами много зависимостей, для мультиагента сегодня не подходят, и большинство задач по коду распараллеливается хуже, чем исследование.
Практический критерий: если вы не можете за минуту описать, какие куски работы идут одновременно и что каждый вернёт, — мультиагентная схема пока не нужна. Начните с одного агента и хороших инструментов, а как собрать такого, разобрано в гайде как создать ИИ-агента. Как эта схема выглядит на дистанции в реальной работе — в разборе офиса ИИ-агентов.
Коротко
FAQ
Мультиагентная система — это несколько ИИ-агентов, которые работают над одной задачей вместе. Агент здесь означает модель, которая в цикле сама вызывает инструменты, а не просто отвечает текстом. Обычно один агент ведущий: он разбирает запрос, ставит подзадачи остальным и собирает из их ответов результат. Каждый исполнитель работает в своём окне контекста и возвращает выжимку.
Двумя вещами: сжатием контекста и параллельностью. Каждый исполнитель разбирает свой кусок в отдельном окне и отдаёт наверх только выводы, поэтому главное окно не забивается логами и промежуточным мусором. По внутренней оценке Anthropic связка из ведущего агента на Opus 4 и исполнителей на Sonnet 4 обошла одиночного Opus 4 на 90,2% на их исследовательском тесте.
По данным Anthropic агенты в среднем тратят примерно в 4 раза больше токенов, чем обычная переписка в чате, а мультиагентные системы — примерно в 15 раз больше. Там же указано, что расход токенов сам по себе объясняет около 80% разброса результатов на их оценочном тесте. Поэтому мультиагент оправдан там, где ценность задачи покрывает счёт.
Когда шаги зависят друг от друга и агентам нужен общий контекст. Anthropic прямо пишет, что большинство задач по коду распараллеливаются хуже, чем исследование, и что модели пока плохо координируются между собой на лету. Документация LangChain добавляет: часто хватает одного агента с правильными инструментами и промптом. Отдельный риск — параллельная запись: несколько агентов, одновременно правящих код, создают конфликты.
В документации LangChain перечислены пять основных. Субагенты как инструменты: главный агент вызывает остальных и всё маршрутизирует через себя. Передача состояния: вызов инструмента меняет состояние, а оно переключает агента или его набор инструментов. Скилы: один агент подгружает нужные знания по требованию. Роутер: запрос сначала классифицируется и уходит нужному специалисту. Воркфлоу: жёсткая схема, где агентные шаги встроены как узлы.
В Claude Code есть субагенты: каждый работает в своём окне контекста, со своим системным промптом и правами на инструменты, и возвращает в основную сессию только итог. В Codex субагентные сценарии включены по умолчанию: агент запускает параллельных исполнителей и собирает их результаты в один ответ, а следить за ветками можно командой /agent. Для сборки своей системы на Python есть LangGraph.
Координация. В разборе Anthropic перечислены реальные сбои ранних версий: система порождала по 50 исполнителей на простой запрос, бесконечно искала несуществующие источники и мешала сама себе лишними обновлениями. Второй типовой сбой — размытая постановка: на инструкции вроде «изучи тему» два исполнителя делают одну и ту же работу, а третий уходит не в тот год.
Anthropic описывает свою рабочую схему так: ведущий агент поднимает 3-5 исполнителей параллельно, а каждый исполнитель вызывает 3 и более инструментов параллельно. По их данным это сократило время сложных исследований почти на 90%. Масштаб задаётся правилами: простой факт — один агент, сравнение — 2-4 исполнителя, сложное исследование — больше десяти.
Почти. Оркестрация — это часть мультиагентной системы, отвечающая за координацию: кто какую подзадачу получает, в каком порядке запускается, чего ждут остальные и как результаты собираются в один ответ. В готовых инструментах оркестрацию берёт на себя сам агент: в Codex, например, платформа сама поднимает исполнителей, маршрутизирует уточнения, дожидается результатов и закрывает ветки.
Платформа и сообщество, где я по шагам показываю, как поставить ИИ на рутину: контент, код, продажи, аналитика. Заходи и забирай рабочие связки, которыми пользуюсь сам.
Посмотреть, что внутриtelegram
Канал с полезными материалами про нейросети
Разборы, новые инструменты и приёмы по ИИ — то, чем пользуюсь сам, без воды. Подпишись, чтобы не потерять.