Агенты · архитектура

Мультиагентная система: как собрать команду ИИ-агентов

Один агент упирается в своё окно контекста, несколько — делят работу и приносят наверх только выводы. Плата за это — примерно пятнадцатикратный расход токенов. Разбираем паттерны, цифры и границу, за которой схема не окупается.

Кирилл СандаковКирилл СандаковВайбкодер, предприниматель, продюсерОпубликовано 06.09.202611 мин чтения

Мультиагентная система — это несколько ИИ-агентов, работающих над одной задачей вместе: ведущий агент разбирает запрос, ставит подзадачи исполнителям, а те работают параллельно, каждый в своём окне контекста, и возвращают наверх выжимку вместо сырых логов. Anthropic в инженерном разборе своей поисковой системы приводит цифры обеих сторон сделки: связка ведущего агента и исполнителей обошла одиночную модель на 90,2% на внутреннем тесте и потратила примерно в 15 раз больше токенов, чем обычный чат. Поэтому решение всегда экономическое, а не техническое.

Что узнаешь из разбора

  • Как устроена связка ведущего агента и исполнителей
  • Пять рабочих паттернов и чем они отличаются
  • Реальную цену в токенах и когда она окупается
  • Где мультиагентность уже встроена и её не надо писать
  • Типовые поломки: дубли работы, 50 агентов на пустяк

Часть 1 · Определение

Что такое мультиагентная система

Главное

Определение из инженерного разбора Anthropic звучит буднично: мультиагентная система — это несколько агентов, работающих вместе, где агент — модель, которая в цикле сама пользуется инструментами. Вся сложность не в определении, а в координации.

Ключевое отличие от «одного умного чата» — не количество моделей, а разделение контекстов. У каждого исполнителя своё окно, свой набор инструментов и своя постановка задачи. Он копается в деталях у себя и отдаёт наверх результат в сжатом виде. Ведущий агент видит выводы, а не гигабайты промежуточного вывода — и потому дольше остаётся вменяемым.

В документации OpenAI это сформулировано через две болезни длинной сессии: загрязнение контекста, когда полезное тонет в логах и стек-трейсах, и гниение контекста, когда качество падает по мере того, как чат заполняется малозначимыми деталями. Субагент — способ вынести шум из главной ветки.


Часть 2 · Смысл

Зачем несколько агентов вместо одного

Практических причин три, и все они про ограничения одиночной сессии.

  • Сжатие. Поиск по сути и есть сжатие: из большого корпуса надо вытащить немногое. Исполнители перебирают источники параллельно и приносят выжимку.
  • Параллельность. Независимые куски работы идут одновременно, а не по очереди. У Anthropic переход на 3-5 параллельных исполнителей и 3+ параллельных вызова инструментов сократил время сложных исследований почти на 90%.
  • Специализация. Разные промпты, разные инструменты, разные права. Агент-ревьюер и агент-исследователь не мешают друг другу.

Цифра, по которой можно сверяться

В своём внутреннем тесте Anthropic сравнила две конфигурации: одиночный Claude Opus 4 против связки, где Opus 4 ведущий, а исполнители на Sonnet 4. Связка выиграла на 90,2%. Пост опубликован 13 июня 2025 года и оперирует моделями того времени, поэтому число стоит читать как порядок эффекта, а не как обещание на нынешней линейке.


Часть 3 · Экономика

Сколько это стоит в токенах

Мультиагентность работает во многом потому, что позволяет потратить на задачу больше вычислений. Это и её главный минус.

Режим работыРасход токенов относительно чата
Обычный чат1x, точка отсчёта
Один агент с инструментамиоколо 4x
Мультиагентная системаоколо 15x

Почему это вообще работает

В анализе Anthropic три фактора объясняют 95% разброса результатов на их оценочном тесте, и расход токенов сам по себе — 80%. То есть мультиагентная архитектура выигрывает прежде всего тем, что даёт задаче больше вычислений через параллельные окна контекста. Отсюда и правило: схема оправдана там, где ценность результата покрывает пятнадцатикратный счёт.

На практике это упирается в лимиты подписки, а не в абстрактные токены. Как считаются лимиты у OpenAI, разобрано в гайде лимиты Codex, приёмы экономии контекста — в гайде как экономить токены.


Часть 4 · Схемы

Пять паттернов, из которых всё собирается

Классификация ниже — из документации LangChain, она удобна тем, что описывает не фреймворк, а способ мышления.

ПаттернКак устроенКогда брать
Субагенты как инструментыглавный агент вызывает остальных, вся маршрутизация через негобазовый случай, самый предсказуемый
Передача состояниявызов инструмента меняет состояние, оно переключает агента или его инструментыкогда этапы включают и выключают возможности
Скилыодин агент подгружает знания и инструкции по требованиюкогда нужна экспертиза, а не второй исполнитель
Роутерзапрос классифицируется и уходит профильному агентуподдержка, разбор входящих, разные типы запросов
Воркфлоужёсткая схема, агентные шаги — узлы в нейкогда порядок шагов известен заранее

Паттерн «скилы» стоит в этом списке не случайно: часто «нам нужен ещё один агент» на деле означает «нам нужна ещё одна инструкция под конкретную задачу». Скил подгружается по требованию и не платит за себя постоянным местом в контексте — разбор механики в гайде скилы Claude Code.

Главный вопрос — не схема, а контекст

В документации LangChain это названо прямо: качество системы зависит от того, что именно видит каждый агент. Сначала решается, какие данные нужны исполнителю для его куска работы, и только потом — каким паттерном их доставить.


Часть 5 · Инструменты

Где мультиагентность уже встроена

Писать оркестратор с нуля в большинстве случаев не нужно: он уже есть в агентах, которыми вы и так пользуетесь.

  • Claude Code. Субагенты работают каждый в своём окне контекста, со своим системным промптом, набором инструментов и правами; делегирование идёт по описанию агента. Полезная деталь из документации: если суммарные описания ваших субагентов превысят 15 000 токенов, Claude Code предупредит об этом при запуске — то есть за сам факт наличия команды агентов вы платите контекстом. Как заводить своих — в гайде про субагентов Claude Code.
  • Codex. Субагентные сценарии включены по умолчанию: агент поднимает параллельных исполнителей и собирает результат в один ответ, а ветки видны по команде /agent. Модель исполнителя наследуется от родителя, если не задать её явно в config.toml или в файле агента.
  • LangGraph. Когда нужна своя система на Python с графом состояний, чекпойнтами и человеком в цикле — разбор в гайде LangGraph.
  • n8n. Вариант для тех, кому ближе визуальные схемы: узлы вместо кода, разбор n8n.

Часть 6 · Сборка

Как собрать первую систему

  1. Проверить задачу на параллельность. Раскладывается ли работа на независимые куски? Обзор десяти источников — да. Правка, где каждый следующий шаг зависит от предыдущего, — нет.
  2. Назначить ведущего и исполнителей. Ведущий держит цель, требования и финальный ответ. Исполнители — разведку, тесты, разбор логов.
  3. Каждому — цель, формат, инструменты, границы. Anthropic называет это главной причиной сбоев: без явных границ исполнители дублируют работу и оставляют дыры.
  4. Задать масштаб. Простой факт — один агент и 3-10 вызовов инструментов. Сравнение — 2-4 исполнителя по 10-15 вызовов. Сложное исследование — больше десяти исполнителей с разделёнными участками.
  5. Замерить и сравнить. Прогнать ту же задачу одним агентом. Если разница в качестве не видна на глаз, а счёт вырос в разы — схему надо упрощать.

Что писать в задании исполнителю

Anthropic перечисляет минимум: цель, формат вывода, подсказка по инструментам и источникам, явные границы задачи. Хороший запрос к субагентам ещё и говорит, как делить работу и ждать ли всех перед продолжением. Пример из документации OpenAI: «проверь ветку параллельными субагентами — один на риски безопасности, один на дыры в тестах, один на поддерживаемость; дождись всех троих и собери выводы по категориям со ссылками на файлы».


Часть 7 · Грабли

Что ломается чаще всего

  • Перебор с числом агентов. Ранние версии системы Anthropic порождали по 50 исполнителей на простой запрос. Лечится правилами масштаба прямо в промпте ведущего.
  • Дубли работы. На задании «изучи тему» два исполнителя делают одно и то же, а третий уходит не в тот год. У Anthropic это реальный пример: один разбирал кризис чипов 2021 года, двое дублировали друг друга по текущему.
  • Шум вместо результата. Агенты отвлекают друг друга избыточными обновлениями. Исполнитель должен возвращать выжимку, а не поток сознания.
  • Параллельная запись. OpenAI советует смело распараллеливать чтение — разведку, тесты, разбор, сортировку — и осторожнее относиться к параллельной правке кода: агенты, редактирующие файлы одновременно, создают конфликты и лишнюю координацию.
  • Плохие описания инструментов. Агент, ищущий в вебе то, что лежит в рабочем чате, обречён с самого начала. У Anthropic переписывание описания инструмента дало 40% сокращения времени выполнения задачи.

Часть 8 · Граница

Когда мультиагент не нужен

Честный ответ есть у обоих источников. LangChain пишет, что не всякая сложная задача требует такой схемы: один агент с правильными инструментами и промптом часто даёт тот же результат. Anthropic добавляет конкретики: домены, где всем агентам нужен общий контекст или где между шагами много зависимостей, для мультиагента сегодня не подходят, и большинство задач по коду распараллеливается хуже, чем исследование.

Практический критерий: если вы не можете за минуту описать, какие куски работы идут одновременно и что каждый вернёт, — мультиагентная схема пока не нужна. Начните с одного агента и хороших инструментов, а как собрать такого, разобрано в гайде как создать ИИ-агента. Как эта схема выглядит на дистанции в реальной работе — в разборе офиса ИИ-агентов.

Коротко

  • Мультиагентная система — ведущий агент плюс исполнители в своих окнах контекста.
  • Выигрыш даёт сжатие контекста и параллельность, а не «много моделей».
  • Anthropic: плюс 90,2% к качеству на своём тесте и около 15x токенов.
  • Рабочий масштаб: 3-5 исполнителей параллельно, 3+ параллельных вызова инструментов.
  • Пять паттернов: субагенты-инструменты, состояние, скилы, роутер, воркфлоу.
  • Читать параллельно — можно смело, писать параллельно — осторожно.
  • Если куски работы не независимы, один агент дешевле и лучше.

FAQ

Частые вопросы

Что такое мультиагентная система простыми словами

Мультиагентная система — это несколько ИИ-агентов, которые работают над одной задачей вместе. Агент здесь означает модель, которая в цикле сама вызывает инструменты, а не просто отвечает текстом. Обычно один агент ведущий: он разбирает запрос, ставит подзадачи остальным и собирает из их ответов результат. Каждый исполнитель работает в своём окне контекста и возвращает выжимку.

Чем мультиагентная система лучше одного агента

Двумя вещами: сжатием контекста и параллельностью. Каждый исполнитель разбирает свой кусок в отдельном окне и отдаёт наверх только выводы, поэтому главное окно не забивается логами и промежуточным мусором. По внутренней оценке Anthropic связка из ведущего агента на Opus 4 и исполнителей на Sonnet 4 обошла одиночного Opus 4 на 90,2% на их исследовательском тесте.

Сколько токенов тратит мультиагентная система

По данным Anthropic агенты в среднем тратят примерно в 4 раза больше токенов, чем обычная переписка в чате, а мультиагентные системы — примерно в 15 раз больше. Там же указано, что расход токенов сам по себе объясняет около 80% разброса результатов на их оценочном тесте. Поэтому мультиагент оправдан там, где ценность задачи покрывает счёт.

Когда мультиагентная система не нужна

Когда шаги зависят друг от друга и агентам нужен общий контекст. Anthropic прямо пишет, что большинство задач по коду распараллеливаются хуже, чем исследование, и что модели пока плохо координируются между собой на лету. Документация LangChain добавляет: часто хватает одного агента с правильными инструментами и промптом. Отдельный риск — параллельная запись: несколько агентов, одновременно правящих код, создают конфликты.

Какие есть паттерны мультиагентных систем

В документации LangChain перечислены пять основных. Субагенты как инструменты: главный агент вызывает остальных и всё маршрутизирует через себя. Передача состояния: вызов инструмента меняет состояние, а оно переключает агента или его набор инструментов. Скилы: один агент подгружает нужные знания по требованию. Роутер: запрос сначала классифицируется и уходит нужному специалисту. Воркфлоу: жёсткая схема, где агентные шаги встроены как узлы.

Где мультиагентность уже встроена

В Claude Code есть субагенты: каждый работает в своём окне контекста, со своим системным промптом и правами на инструменты, и возвращает в основную сессию только итог. В Codex субагентные сценарии включены по умолчанию: агент запускает параллельных исполнителей и собирает их результаты в один ответ, а следить за ветками можно командой /agent. Для сборки своей системы на Python есть LangGraph.

Что чаще всего ломается в мультиагентной системе

Координация. В разборе Anthropic перечислены реальные сбои ранних версий: система порождала по 50 исполнителей на простой запрос, бесконечно искала несуществующие источники и мешала сама себе лишними обновлениями. Второй типовой сбой — размытая постановка: на инструкции вроде «изучи тему» два исполнителя делают одну и ту же работу, а третий уходит не в тот год.

Сколько агентов запускать параллельно

Anthropic описывает свою рабочую схему так: ведущий агент поднимает 3-5 исполнителей параллельно, а каждый исполнитель вызывает 3 и более инструментов параллельно. По их данным это сократило время сложных исследований почти на 90%. Масштаб задаётся правилами: простой факт — один агент, сравнение — 2-4 исполнителя, сложное исследование — больше десяти.

Мультиагентная система и оркестрация агентов — это одно и то же

Почти. Оркестрация — это часть мультиагентной системы, отвечающая за координацию: кто какую подзадачу получает, в каком порядке запускается, чего ждут остальные и как результаты собираются в один ответ. В готовых инструментах оркестрацию берёт на себя сам агент: в Codex, например, платформа сама поднимает исполнителей, маршрутизирует уточнения, дожидается результатов и закрывает ветки.


Читать дальше

ИИ-офис
Собери свой ИИ-офис и перестань делать руками то, что делает нейросеть

Платформа и сообщество, где я по шагам показываю, как поставить ИИ на рутину: контент, код, продажи, аналитика. Заходи и забирай рабочие связки, которыми пользуюсь сам.

Посмотреть, что внутри

telegram

Канал с полезными материалами про нейросети

Разборы, новые инструменты и приёмы по ИИ — то, чем пользуюсь сам, без воды. Подпишись, чтобы не потерять.

Перейти в канал
Кирилл Сандаков

Об авторе

Кирилл Сандаков

Вайбкодер, предприниматель, продюсер

Завайбкодил контент-ферму на США в Instagram (более 300 тыс. подписчиков, среди читателей Дональд Трамп Младший), создатель платформы и сообщества ИИ-офис, автор блога о нейросетях «Выжимаем из ИИ Максимум».

Все статьи автора