Глава 11. Академический фронтир: что наука говорит о роях
Главный итог академической проверки 2023–2026 годов неприятен для энтузиастов: большинство измеренных «преимуществ » сводится к трём вещам — дополнительному inference-компьюту, разнообразию ответов и агрегации, а вовсе не к «коллаборации». Честно cost-matched baseline в виде chain-of-thought + оказался почти непобедим, и рои выигрывают лишь в узких, но реальных нишах: breadth-first-поиск за пределами одного , ансамбли гетерогенных моделей и верификация. При этом главная причина провалов роёв — не слабость моделей, а ошибки и отсутствие проверки результата.
Точка отсчёта: голосование как самый жёсткий baseline
Опорный результат, относительно которого измеряется всё остальное, — работа «More Agents Is All You Need» (Li et al., TMLR, февраль 2024): точность растёт с числом независимо сэмплированных , объединённых простым majority vote, — без , ролей и переписки. из ~15 экземпляров Llama2-13B догоняет одиночную Llama2-70B на GSM8K, а прирост для 13B-модели составляет +24 п.п. (0,35→0,59). Прирост коррелирует со сложностью задачи; эксперименты доведены до ~40 агентов.
Пиком заявлений «коллаборация бьёт фронтир-модель» стал Mixture-of-Agents (Wang et al., ICLR 2025): слоёная композиция open-source-моделей набрала 65,1% на AlpacaEval 2.0 против 57,5% у GPT-4o (блог Together). Важная оговорка из досье: результат не был compute-matched, лидерборд с тех пор деприкейчен, а поздние аудиты относят большую часть MoA-эффекта к дополнительному компьюту и агрегации.
Практический вывод: любой роевой дизайн обязан сначала победить sampling-and-voting при равном бюджете . Как показано ниже, это удаётся редко.
Взлёт и падение multi-agent debate
История — образцовый пример того, как наука проверяет красивую идею.
- 2023: Du et al. (ICML 2024) сообщают, что многораундовые дебаты LLM-инстансов улучшают математику, рассуждения и фактологию.
- 2024: «Should we be going MAD?» (Smit et al., ICML 2024) — дебаты «не превосходят надёжно» и хрупки к гиперпараметрам.
- 2025: «Stop Overvaluing Multi-Agent Debate» (Zhang et al.) прогоняют 5 MAD-методов на 9 и 4 моделях: MAD «часто не превосходит простые одноагентные baselines вроде CoT и Self-Consistency», потребляя заметно больше компьюта. Единственный устойчивый рычаг — гетерогенность моделей (Heter-MAD).
- 2025: «Debate or Vote» (NeurIPS 2025 Spotlight) доказывает, что траектория убеждений в дебатах — мартингал: дебаты сами по себе не меняют ожидаемую корректность, а большую часть приписанных MAD выигрышей даёт обычное голосование.
- 2025: «Can LLM Agents Really Debate?» (Wu et al.) — решают сила рассуждений моделей и разнообразие группы; структурные ручки (порядок реплик, видимость уверенности) почти не влияют, а давление большинства подавляет независимую коррекцию.
Нюанс, который не даёт похоронить дебаты окончательно: ablations Google MASS (ICLR 2026) показали, что debate-блоки критичны именно для factual QA (HotpotQA +3%), но бесполезны или вредны в остальном. Дебаты — task-conditional инструмент, а действующее вещество в них — разнообразие моделей, а не разговор.
Здесь заканчивается открытая часть главы. Продолжение — по бесплатной регистрации: без оплаты, нужен только адрес почты.