Глава 8. Наблюдаемость и оценка качества роя
, который нельзя протрейсить, нельзя и улучшать: по данным таксономии , 41–86,7% запусков открытых мультиагентных систем заканчиваются провалом, а оценка только по финальному результату завышает качество на 20–40%. и — не операционная гигиена, а главный контур обратной связи роя. Как формулирует Braintrust: «выигрывают команды, которые быстрее всех замыкают цикл между сбоем в продакшене и фиксом».
Трасса важнее результата
Консенсус 2026 года — оценивать траекторию, а не только outcome. , которых судят по финальному ответу, «проходят на 20–40% больше тестов, чем показывает полная оценка траектории» (Confident AI, 2026). Причина в природе сбоев: (arXiv:2503.13657, 1 642 аннотированных по 7 фреймворкам, NeurIPS 2025) показывает, что крупнейшие моды отказов — повторение шагов (15,7%), расхождение и действий (13,2%), незнание условий терминации (12,4%) — живут внутри трассы и маскируются правдоподобным финальным выводом. Отдельное предупреждение: некорректная и неполная верификация вместе дают 17,3% отказов — слабый агент-верификатор сам является источником сбоев, а не защитой.
Мета-исследование HAL (Princeton, arXiv:2510.11977: 21 730 прогонов, 9 моделей × 9 , ~$40k вычислений) добавляет два отрезвляющих факта: повышение reasoning effort _снижало_ точность в большинстве прогонов, а LLM-инспекция логов ловила агентов, которые «ищут бенчмарк на HuggingFace вместо решения задачи». Вывод HAL: ни один скор не интерпретируем без полного и логов.
Практический контур trajectory-евалов: проверки выбора инструментов и их аргументов (не LLM-judge), плюс цикл «каждый провал — новый регрессионный тест». Типовая форма в CI — около 30 golden-replay кейсов на PR, прогон меньше 5 минут, блокировка merge при регрессии метрик (Confident AI CI/CD guide).
flowchart LR
A[Сбой в продакшене] --> B[Разбор трассы человеком]
B --> C[Новый eval-кейс]
C --> D[CI регрессионный набор]
D --> E[Merge блокируется при регрессии]
E --> AБенчмарки 2026: чему верить
SWE-bench Verified как сигнал фронтира мёртв: в феврале 2026 команда OpenAI Frontier перестала его репортить после аудита, нашедшего дефекты примерно в 60% из 138 сложных задач, а главное — модели воспроизводили gold-патчи дословно по одному только ID задачи, чистый отпечаток контаминации (Digital Applied). Замена — SWE-bench Pro (Scale AI, ICLR 2026): те же модели с 81% на Verified падают до 46–58% (CodeSOTA). Второй конфаундер — scaffolding: одна и та же модель ходит на ±12 пунктов в зависимости от . Урок для : скор — это скор связки «модель + harness», и цитировать число без спецификации обвязки бессмысленно.
Третий конфаундер — инфраструктура. Anthropic измерила шум кодинг-эвалов напрямую («Quantifying infrastructure noise in agentic coding evals», Segato, 2026-02-05): одна лишь конфигурация ресурсов контейнера даёт разброс 6 п.п. на Terminal-Bench 2.0 (p<0,01) — часто больше межмодельной разницы; доля infra-ошибок падает с 5,8% при лимите 1× до 2,1% при 3× (p<0,001) и 0,5% без лимита, при этом прирост скора от 1× к 3× статистически неотличим от шума (p=0,40). Рекомендация — потолок ресурсов 3× от спецификации задачи: щедрее — платите за простой без значимого прироста, жаднее — меряете не модель, а лимиты контейнера. Формула из предыдущего абзаца удлиняется: скор — это «модель + harness + инфраструктура».
Здесь заканчивается открытая часть главы. Продолжение — по бесплатной регистрации: без оплаты, нужен только адрес почты.