К исследованиюГлава 11 из 1210 мин чтенияПо регистрации

Глава 11. Академический фронтир: что наука говорит о роях

Главный итог академической проверки 2023–2026 годов неприятен для энтузиастов: большинство измеренных «преимуществ » сводится к трём вещам — дополнительному inference-компьюту, разнообразию ответов и агрегации, а вовсе не к «коллаборации». Честно cost-matched baseline в виде chain-of-thought + оказался почти непобедим, и рои выигрывают лишь в узких, но реальных нишах: breadth-first-поиск за пределами одного , ансамбли гетерогенных моделей и верификация. При этом главная причина провалов роёв — не слабость моделей, а ошибки и отсутствие проверки результата.

Точка отсчёта: голосование как самый жёсткий baseline

Опорный результат, относительно которого измеряется всё остальное, — работа «More Agents Is All You Need» (Li et al., TMLR, февраль 2024): точность растёт с числом независимо сэмплированных , объединённых простым majority vote, — без , ролей и переписки. из ~15 экземпляров Llama2-13B догоняет одиночную Llama2-70B на GSM8K, а прирост для 13B-модели составляет +24 п.п. (0,35→0,59). Прирост коррелирует со сложностью задачи; эксперименты доведены до ~40 агентов.

Пиком заявлений «коллаборация бьёт фронтир-модель» стал Mixture-of-Agents (Wang et al., ICLR 2025): слоёная композиция open-source-моделей набрала 65,1% на AlpacaEval 2.0 против 57,5% у GPT-4o (блог Together). Важная оговорка из досье: результат не был compute-matched, лидерборд с тех пор деприкейчен, а поздние аудиты относят большую часть MoA-эффекта к дополнительному компьюту и агрегации.

Практический вывод: любой роевой дизайн обязан сначала победить sampling-and-voting при равном бюджете . Как показано ниже, это удаётся редко.

Взлёт и падение multi-agent debate

История — образцовый пример того, как наука проверяет красивую идею.

  • 2023: Du et al. (ICML 2024) сообщают, что многораундовые дебаты LLM-инстансов улучшают математику, рассуждения и фактологию.
  • 2024: «Should we be going MAD?» (Smit et al., ICML 2024) — дебаты «не превосходят надёжно» и хрупки к гиперпараметрам.
  • 2025: «Stop Overvaluing Multi-Agent Debate» (Zhang et al.) прогоняют 5 MAD-методов на 9 и 4 моделях: MAD «часто не превосходит простые одноагентные baselines вроде CoT и Self-Consistency», потребляя заметно больше компьюта. Единственный устойчивый рычаг — гетерогенность моделей (Heter-MAD).
  • 2025: «Debate or Vote» (NeurIPS 2025 Spotlight) доказывает, что траектория убеждений в дебатах — мартингал: дебаты сами по себе не меняют ожидаемую корректность, а большую часть приписанных MAD выигрышей даёт обычное голосование.
  • 2025: «Can LLM Agents Really Debate?» (Wu et al.) — решают сила рассуждений моделей и разнообразие группы; структурные ручки (порядок реплик, видимость уверенности) почти не влияют, а давление большинства подавляет независимую коррекцию.

Нюанс, который не даёт похоронить дебаты окончательно: ablations Google MASS (ICLR 2026) показали, что debate-блоки критичны именно для factual QA (HotpotQA +3%), но бесполезны или вредны в остальном. Дебаты — task-conditional инструмент, а действующее вещество в них — разнообразие моделей, а не разговор.

Здесь заканчивается открытая часть главы. Продолжение — по бесплатной регистрации: без оплаты, нужен только адрес почты.

Дальше — по бесплатной регистрации

Мы гейтим удобство, а не знание: executive summary и 3 главы открыты полностью. Регистрация открывает остальные 9.

Что открывает регистрация

  • Полный текст всех 12 глав
  • Сохранение прогресса чтения
  • PDF-версия — скоро
  • Обновления живого документа

Регистрируясь, вы соглашаетесь с политикой обработки данных.