Исследование

Плейбук агентных роёв 2026

Как строят, ломают и окупают рои ИИ-агентов. Исследование, которое написал сам рой: 55+ агентов, 537 источников, одна ночь.

Создано роем агентов за одну ночь
537
источников
147
верифицированных утверждений
55+
агентов
12
глав

Коротко — для тех, кто решает

Вопрос давно не в том, внедрять ли агентный ИИ, а в том, где он окупается — и где тихо жжёт бюджет. Это исследование отвечает на второй вопрос цифрами, а не обещаниями.

К 2027 году свернут больше 40% агентных проектов — почти всегда потому, что рой поставили не на ту задачу. Мы собрали карту этого решения: 12 глав, 537 источников, 147 ключевых утверждений, и каждое перепроверил второй агент с заданием опровергнуть, а не поддакнуть. Спорные цифры помечены прямо в тексте.

Как это было

Исследование о мультиагентных системах выполнено мультиагентной системой: 55+ агентов под оркестрацией одного человека, 51 записанный запуск, четыре фазы — исследование, верификация, написание, отбор.

Первый запуск упёрся в лимит конкурентности: монолит из 43 агентов пришлось на ходу перешардировать в параллельные воркфлоу. Эпизод не вырезан из отчёта — он стал иллюстрацией главы об отказах.

Телеметрия открыта: судовой журнал фиксирует каждый запуск и каждое обращение к инструментам. Контрольный эксперимент прилагается — тот же обзор, написанный одним агентом без источников.

Три приёма из издания

Каждый приём ведёт в открытую главу, где он разобран целиком.

Дополнительно к тексту

Почему это уникально

55+ агентов

Рой исследует рои

Это не обзор «из памяти модели» и не эссе о будущем. Исследование о мультиагентных системах выполнено мультиагентной системой: 15 исследователей, адверсариальные фактчекеры, 12 параллельных авторов, панель отбора идей, финальный критик. Метод описан в самой книге — и доказан её существованием.

23% исправлено

Каждая цифра проверена вторым агентом

147 ключевых утверждений прошли независимую верификацию, причём проверяющий получал задачу опровергнуть, а не подтвердить. 34 утверждения (23%) верификаторы исправили у собственных исследователей — и этот счётчик опубликован. Датасет проверок машиночитаем.

Реестр хрупкости

Честность как архитектурный принцип

Самые слабые места собраны в отдельный «реестр хрупкости»: single-sourced кейсы и спорные цифры помечены прямо в тексте. Признанная ошибка антихрупка; скрытая — ждёт скриншота.

12 глав — карта

Три главы открыты полностью — без регистрации. Остальные девять открывает бесплатная регистрация.

  1. 019 минЧитать

    Ландшафт 2026

    Рынок фреймворков пережил жёсткую консолидацию: одна лаборатория — один фреймворк.

    2 из 3 самых скачиваемых агентных SDK до сих пор не имеют версии 1.0

  2. 0212 минЧитать

    Паттерны оркестрации

    Единственная архитектура с сильными production-доказательствами — orchestrator-worker; остальное — с оговорками.

    +90,2% против одиночной модели (Anthropic)

  3. 039 минПо регистрации

    Экономика роя

    Рой — способ потратить больше компьюта параллельно; окупается не везде.

    рой из 16 агентов написал 100 000-строчный C-компилятор за <$20 000

  4. 048 минЧитать

    Почему рои падают

    Отказы — это баги дизайна системы, а не «глупость модели».

    41–86,7% прогонов заканчиваются провалом (MAST, 1 642 трейса)

  5. 0513 минПо регистрации

    Протоколы

    Война стандартов закончилась расслоением: MCP — для инструментов, A2A — для агентов.

    ~97 млн загрузок MCP SDK в месяц

  6. 069 минПо регистрации

    Безопасность флота

    Prompt injection не решён — проектируйте радиус поражения, а не фильтры.

    microVM-изоляция стоит ~125 мс и <5 MiB на агента (Firecracker)

  7. 079 минПо регистрации

    Память и контекст

    Долгоживущий рой выживает за счёт дисциплины контекста, а не большого окна.

    кэшированный вход в ~10 раз дешевле — KV-cache hit rate это метрика №1

  8. 088 минПо регистрации

    Наблюдаемость и оценка

    Судить агента по финальному ответу — систематически льстить ему.

    outcome-only оценка завышает качество на 20–40%

  9. 097 минПо регистрации

    Кейсы продакшна

    Что реально развернули в 2025–2026 — и что откатили.

    Devin поднял merge-rate с 34% до 67% за год

  10. 108 минПо регистрации

    Человек и рой

    Индустрия сошлась на модели «много агентов, один экран» — и упёрлась в человеческое ревью.

    6 крупных вендоров пришли к fleet-интерфейсу за 10 месяцев

  11. 1110 минПо регистрации

    Академический фронтир

    Большинство «преимуществ мультиагентности» — это компьют, разнообразие и агрегация, а не коллаборация.

    панель из 9 ИИ-судей даёт ~2 реальных голоса

  12. 129 минПо регистрации

    Рекомендации для self-hosted флота

    Типовые решения self-hosted флота агентов, сверенные с рыночными данными 2025–2026.

    аргумент против microVM завышен в ~100 раз (реальный overhead <5 MiB)

Как это сделано

Телеметрия открыта — судовой журнал timeline.json фиксирует каждый запуск.

51 записанный запуск агентов

В четырёх фазах: 17 исследовательских (включая два рестарта после аварийной остановки монолита из 43 агентов), 14 верификационных, 12 авторских, 8 панельных. Плюс оркестратор, финальный критик и инженер демо — всего 55+.

~40 мин основных фаз

Первый исследователь стартовал в 00:46 UTC, панель закончила в 01:27. Пик — 10 исследователей одновременно; 12 глав написаны параллельно, большинство за ~3 минуты.

~4 млн токенов, 1 060+ обращений к инструментам

В основном веб-поиск и чтение источников.

Драма включена в отчёт

Первый запуск упёрся в лимит конкурентности; оркестратор на ходу перешардировал рой с монолита на 5 параллельных воркфлоу — этот эпизод сам стал иллюстрацией главы об отказах. Контрольный эксперимент прилагается: тот же обзор, написанный одним агентом без источников.

10 выводов об агентных роях — за 5 минут

Каждая цифра ниже прошла независимую проверку вторым агентом; спорные помечены. Полные обоснования — в 12 главах исследования.

  1. 01

    Рой — это способ потратить больше компьюта параллельно, а не «коллективный разум».

    По данным Anthropic, объём потраченных токенов сам по себе объясняет 80% разброса качества мультиагентной системы на бенчмарке BrowseComp. Топология и «умное сотрудничество» вторичны: вы покупаете параллельные вычисления, а не магию.

    Источник: Anthropic, How we built our multi-agent research system, 2025

  2. 02

    Orchestrator-worker — единственный паттерн с сильными production-доказательствами.

    Мультиагентная research-система Anthropic обошла одиночную модель на 90,2% — но потратила примерно в 15 раз больше токенов, чем чат. Паттерн годится для широкого параллельного чтения, но не для связного кодинга.

    Источник: Anthropic, 2025-06-13

  3. 03

    Правило read/write решает всё.

    Чтение — исследование, ревью, поиск — параллельте. Запись — код, синтез, связный текст — держите однопоточной. В этой точке сошлись даже публичные оппоненты: Cognition («Don't Build Multi-Agents») и Anthropic после спора в июне 2025.

    Источник: Cognition; Anthropic, 2025

  4. 04

    Рои падают в 41–86,7% прогонов — и причины организационные.

    Таксономия MAST (1 642 размеченных трейса, 7 фреймворков) относит ~44% отказов к дефектам спецификации, ~32% — к рассинхрону агентов, ~24% — к слабой верификации. Это баги дизайна системы, а не «глупость модели» — значит, они чинятся инженерно.

    Источник: UC Berkeley, MAST, NeurIPS 2025

  5. 05

    Дебаты и «панели из 9 судей» в основном не пережили репликацию.

    Коррелированные ошибки судей съедают ~75% номинальной «независимости» панели: 9 судей дают примерно 2 реальных голоса. Оптимизация промптов приносит вдвое больше, чем оптимизация топологии. Лучшее место для дополнительных агентов — верификация, а не генерация.

    Источник: Nine Judges (Apple, 2026); MASS (ICLR 2026); Weaver (NeurIPS 2025)

  6. 06

    Экономика роя — это ярусы моделей и KV-cache.

    Разброс цен внутри модельных линеек — примерно 10×, что делает схему «дешёвые скауты + дорогие судьи» рабочим паттерном. Кэшированный вход стоит примерно в 10 раз дешевле обычного — поэтому KV-cache hit rate становится метрикой №1 в продакшне.

    Источник: Прайс-листы вендоров, 2026; Manus, Context Engineering, 2025

  7. 07

    Бюджет должен блокировать вызов, а не слать алерт.

    Задокументированная петля из двух агентов сожгла ~$47 000 за 11 дней — при работающих дашбордах. Лимит расходов обязан останавливать вызов до отправки, на уровне инфраструктуры. Кейс single-sourced и честно помечен в реестре хрупкости исследования.

    Источник: Fragility-registry плейбука (single-sourced кейс)

  8. 08

    Протокольная война закончилась расслоением: MCP — для инструментов, A2A — для агентов.

    MCP стал де-факто стандартом слоя «агент–инструмент»: ~97 млн загрузок SDK в месяц, 10 000+ активных серверов. Оба протокола ушли под нейтральное управление Linux Foundation — риск вендорского захвата снят. Открытая проблема — безопасность: supply chain MCP-серверов уже атакуют.

    Источник: Anthropic / Linux Foundation, декабрь 2025

  9. 09

    Prompt injection не решён — стройте радиус поражения, а не фильтры.

    «Летальная трифекта» — приватные данные, недоверенный ввод и внешний канал — не должна собираться у одного агента. Изоляция почти бесплатна: microVM грузится за ~125 мс при overhead менее 5 MiB. Инъекции уже самореплицируются от агента к агенту.

    Источник: Willison, 2025; Firecracker; Prompt Infection (UCL/Stanford, 2024)

  10. 10

    Провал — базовый сценарий; планируйте откат до запуска.

    74% энтерпрайзов уже откатили живого клиентского ИИ-агента (n=2 527), Gartner ждёт отмены более 40% agentic-проектов к концу 2027. При этом Devin поднял merge-rate с 34% до 67% за год: там, где рой применён по назначению, он окупается. Разница — в триггерах отката, определённых заранее.

    Источник: Sinch, 2026; Gartner, 2025; Cognition, 2025

Реестр верифицированных утверждений

147 ключевых утверждений исследования с вердиктами адверсариальной проверки и ссылками на источники. Каждое утверждение — атомарно цитируемый блок с постоянным якорем.

Показано 12 из 147

  1. 01ПодтвержденоR01-frameworks

    LangGraph 1.0 GA 2025-10-22, no-breaking-changes-until-2.0 pledge; 64.7M PyPI downloads/mo (langgraph alone); users Uber, LinkedIn, Klarna, JPMorgan, BlackRock, Cisco (+Rippling)

    Источник: changelog.langchain.com
  2. 02ПодтвержденоR01-frameworks

    Microsoft Agent Framework: preview 2025-10-01, RC 2026-02-19, 1.0 GA 2026-04-03; SK+AutoGen in maintenance mode; AG2 ~555K/mo vs CrewAI 11.4M/mo

    Источник: devblogs.microsoft.com
  3. 03ИсправленоR01-frameworks

    OpenAI Agent Builder + Evals deprecation notices 2026-06-03/04, sunset 2026-11-30, migration to code-first Agents SDK; SDK #2 at 30.8M/mo, still 0.18.x

    Источник: therouter.ai
  4. 04ИсправленоR01-frameworks

    Claude Agent SDK 22.0M/mo (third overall) at v0.2.x; H1-2026 subagent fan-out + Outcomes grading (+8.4%/+10.1% Word/PowerPoint)

    Источник: claude.com
  5. 05ПодтвержденоR01-frameworks

    A2A to Linux Foundation (June 2025), v0.3 with gRPC + signed security cards (2025-07-31), 150+ orgs; ADK GA in Python/Go/Java/TS at 15.5M/mo

    Источник: linuxfoundation.org
  6. 06ПодтвержденоR01-frameworks

    n8n valuation doubled to $5.2B via SAP strategic investment 2026-05-12, embedded in Joule Studio; 1,400+ enterprise customers, 1.7M monthly active builders; 196K GitHub stars

    Источник: bloomberg.com
  7. 07ПодтвержденоR01-frameworks

    Mastra: 1.0 Jan 2026 at 300K weekly npm downloads; $22M Series A led by Spark Capital 2026-04-09 ($35M total); @mastra/core 1.11M/week by Jul 2026 (3.7x); users Brex, Sanity, Factorial

    Источник: mastra.ai
  8. 08ПодтвержденоR01-frameworks

    CrewAI: 55.4K stars (most-starred pure agent framework), 11.4M/mo downloads, 60-63% F500 + ~2B executions/yr (vendor-reported, unaudited), $18M total funding, ~$3M est. revenue

    Источник: siliconangle.com
  9. 09ПодтвержденоR02-anthropic-practices

    Orchestrator-worker Research architecture (Opus 4 lead + Sonnet 4 subagents, own context windows) beat single-agent Opus 4 by 90.2% on internal eval; post dated 2025-06-13

    Источник: anthropic.com
  10. 10ПодтвержденоR02-anthropic-practices

    Agents ~4× / multi-agent ~15× chat tokens; token usage alone explains 80% of variance (95% with tool calls + model choice, BrowseComp); parallelism cut research time up to 90%

    Источник: anthropic.com
  11. 11ПодтвержденоR02-anthropic-practices

    Effort-scaling rules (1 agent/3–10 calls; 2–4 subagents ×10–15 calls; >10 subagents) as one of exactly eight named prompt-engineering principles

    Источник: anthropic.com
  12. 12ПодтвержденоR02-anthropic-practices

    "Building Effective Agents" 2024-12-19, Schluntz & Zhang, workflows-vs-agents taxonomy, five workflow patterns, "simplest solution possible"

    Источник: anthropic.com

Что дальше

Инструмент-спутник

F/ONE Verdict

Движок вердикта считает по цифрам этого плейбука: та же экономика, те же режимы отказов, те же пороги. Опишите свою задачу в девяти шагах — получите оценку и ссылку на главу, из которой она выведена.

Как читать дальше

  1. 1

    Читать бесплатные главы

    Executive summary, реестр утверждений и три полные главы — бесплатно, без регистрации.

  2. 2

    Получить полную версию

    12 глав, сохранение прогресса, обновления живого документа, PDF — скоро. По бесплатной регистрации.

  3. 3

    Аудиоверсия — скоро

    Пер-главная начитка и подкаст-обзор. Оставьте почту — пришлём первым.

    Скоро

Автор

Вячеслав Федосеев

Вячеслав Федосеев

AI-эксперт для управленцев уровня C-Suite. Проектирует и внедряет агентные системы, консультирует руководителей по стратегии применения ИИ. Основатель F/ONE — портала «ИИ для тех, кто решает»: без хайпа, с цифрами и проверяемыми источниками.

Кто оркестрирует рой

Разборы для тех, кто решает

Раз в месяц — что изменилось в мире агентных роёв и что это значит для ваших решений. Коротко, с цифрами и источниками.