К исследованиюГлава 6 из 129 мин чтенияПо регистрации

Глава 6. Безопасность агентного флота

в 2026 году по-прежнему не решён, поэтому центральная идея этой главы — перестать надеяться на фильтры и проектировать флот в парадигме assume breach: считать, что модель будет скомпрометирована, и ограничивать радиус поражения средствами, работающими вне модели. Multi-agent-система не безопаснее одиночного — это большая поверхность атаки: инъекции самореплицируются от агента к агенту, а десятки тысяч открытых в интернет инсталляций OpenClaw показали, чем заканчивается централизованный доступ без аутентификации.

У угроз появился каталог: OWASP Top 10 для агентных приложений

9 декабря 2025 года OWASP выпустил Top 10 for Agentic Applications — редакцию 2026 года, собранную с участием более 100 экспертов и review board из NIST, Microsoft, AWS, Cisco, Oracle Cloud и Alan Turing Institute. Важно не переоценивать новизну: это первый именно _Top 10_, но не первая таксономия — сама OWASP называла «первой в своём роде» свою же Agentic AI – Threats and Mitigations v1.0 от февраля 2025 года с 15 категориями угроз.

Для флота ключевой сдвиг — риски multi-agent подняты до первого класса: ASI07 Insecure Inter-Agent Communication и ASI08 Cascading Failures теперь именованные пункты списка, наряду с ASI01 Agent Goal Hijack, ASI02 Tool Misuse, ASI04 Agentic Supply Chain Vulnerabilities и ASI10 Rogue Agents. Межагентное доверие — это поверхность атаки, а не деталь реализации.

Летальная трифекта и как она ломается в бою

Рабочая ментальная модель — «lethal trifecta» Саймона Уиллисона (пост от 16 июня 2025): опасен любой , который одновременно имеет (1) доступ к приватным данным, (2) контакт с недоверенным контентом и (3) канал внешней коммуникации. «Если ваш агент сочетает эти три свойства, атакующий легко заставит его прочитать ваши приватные данные и отправить их атакующему».

Диаграмма (mermaid)
flowchart LR
    A[Доступ к приватным данным] --> T[Летальная трифекта]
    B[Недоверенный контент на входе] --> T
    C[Канал внешней коммуникации] --> T
    T --> X[Эксфильтрация данных атакующему]

Трифекта — не теория, все три инцидента 2025 года укладываются в неё:

  • GitHub exploit (Invariant Labs, 26 мая 2025): вредоносный issue в _публичном_ репозитории заставил агента на Claude 4 Opus прочитать _приватный_ репозиторий через тот же PAT и слить содержимое (включая данные о зарплате) через pull request. Никаких скомпрометированных инструментов — только официальные; уязвима сама кросс-репозиторная граница доверия, которую Invariant назвал «toxic agent flow». Их фикс — runtime-блокировка «один репозиторий на сессию».
  • postmark-mcp (Snyk, 25 сентября 2025): первый подтверждённый _живой_ вредоносный MCP-сервер. Версии 1.0.0–1.0.15 были чистыми; v1.0.16 от 17 сентября 2025 добавила одну строку, скрыто ставящую BCC всех исходящих писем на адрес атакующего. Классический rug pull: пакет становится вредоносным _после_ того, как заработал доверие. PoC-демонстрации tool poisoning (Invariant, апрель 2025) опередили его на ~5 месяцев — не путайте PoC и in-the-wild.
  • Prompt Infection (Lee & Tiwari, arXiv 2410.07283 — работа 2024 года): одна инъекция в PDF или письме самореплицируется agent-to-agent и в обществах из 10–50 агентов достигает полного насыщения по логистической, эпидемической кривой. Саморепликация подняла успех атаки на +13,92% для GPT-4o и +209% для GPT-3.5. Отрезвляющая деталь: GPT-4o игнорировал 66% заражений, но, будучи скомпрометированным, исполнял payload _эффективнее_ — более сильная модель означает более сильного противника внутри вашего периметра.

Здесь заканчивается открытая часть главы. Продолжение — по бесплатной регистрации: без оплаты, нужен только адрес почты.

Дальше — по бесплатной регистрации

Мы гейтим удобство, а не знание: executive summary и 3 главы открыты полностью. Регистрация открывает остальные 9.

Что открывает регистрация

  • Полный текст всех 12 глав
  • Сохранение прогресса чтения
  • PDF-версия — скоро
  • Обновления живого документа

Регистрируясь, вы соглашаетесь с политикой обработки данных.