К исследованиюГлава 3 из 129 мин чтенияПо регистрации

Глава 3. Экономика роя: когда 15× токенов окупаются

система тратит примерно в 15 раз больше , чем обычный чат, — и это не побочный эффект, а сам механизм её превосходства: по данным Anthropic, объём потраченных токенов в одиночку объясняет 80% разницы в качестве. Поэтому экономика роя сводится к двум вопросам: достаточно ли высока ценность задачи, чтобы оплатить множитель, и умеете ли вы инженерными средствами — тирингом моделей, , батчами и бюджетами — сбить его реальную цену в разы.

Откуда взялись 4×, 15× и 90,2%

Канонический источник цифр — инженерный пост Anthropic «How we built our multi-agent research system» (июнь 2025). Дословно: «agents typically use about 4× more tokens than chat interactions», а «multi-agent systems use about 15× more tokens than chats». Плата за это: система с Claude Opus 4 в роли ведущего и на Claude Sonnet 4 обошла одиночный Opus 4 на 90,2% на внутреннем research-эвале Anthropic. На BrowseComp три фактора объяснили 95% дисперсии качества, причём сами по себе — 80%, остальное — число tool-вызовов и выбор модели. Вывод авторов честен: «multi-agent systems require tasks where the value of the task is high enough to pay for the increased performance».

Три оговорки, без которых цитировать эти цифры нельзя:

  1. 15× — это замер одной внутренней системы середины 2025 года, а не закон природы. Он сделан до моделей с контекстом 1M токенов, дешёвых cache-reads и server-side compaction; обновлённый множитель ни один вендор к середине 2026 не опубликовал.
  2. Сравнение 90,2% не было выровнено по бюджету. Работа Tran & Kiela (arXiv 2604.02460, апрель 2026) показывает: при равных бюджетах «thinking»-токенов одиночный на multi-hop-рассуждениях стабильно догоняет или обгоняет системы. Значительная часть выигрыша роя — просто покупка дополнительных токенов, недоступных одному .
  3. Параллелизм покупает , а не деньги. Anthropic сообщает о сокращении времени исследования «до 90%» — при росте токенов в ~15×. Практический пример: параллельные субагенты Claude Code исчерпали окно Pro-плана за ~15 минут против ~30 минут последовательно — та же работа, вдвое быстрее сожжённая квота (dev.to).

Прайс-лист 2026: сырьё для тиринга

Экономику определяет не средняя цена , а разброс цен внутри линейки — именно он позволяет платить за интеллект только там, где он нужен. Цены на июль 2026, $ за 1M токенов input/output (Anthropic, OpenAI, Google):

МодельInputOutputРоль в рое
Claude Fable 5$10$50топ-orchestrator, судья
Claude Opus 4.8$5$25lead-агент
Claude Sonnet 5$3 / интро $2 до 31.08.2026$15 / $10worker
Claude Haiku 4.5$1$5scout, классификатор
GPT-5.6 sol / terra / luna$5 / $2.50 / $1$30 / $15 / $6аналогичная лестница
gpt-5.5-pro, gpt-5.4-pro$30$180самые дорогие API-модели рынка
Gemini 3.5 Flash$1.50$9дешёвый worker
Gemini 3.1 Pro (≤200K / >200K ctx)$2 / $4$12 / $18у Google сохранилась long-context-наценка

Здесь заканчивается открытая часть главы. Продолжение — по бесплатной регистрации: без оплаты, нужен только адрес почты.

Дальше — по бесплатной регистрации

Мы гейтим удобство, а не знание: executive summary и 3 главы открыты полностью. Регистрация открывает остальные 9.

Что открывает регистрация

  • Полный текст всех 12 глав
  • Сохранение прогресса чтения
  • PDF-версия — скоро
  • Обновления живого документа

Регистрируясь, вы соглашаетесь с политикой обработки данных.