01
Отчёт ≠ внедрение
Как отличить внедрение от отчёта о внедрении.
Исследование
Как мультиагентный конвейер провёл реальный аудит завода и собрал из него книгу, которая поймала ошибки в самой себе — с открытым реестром верифицированных утверждений.
7 глав, 3 открыто без регистрации.
Наверх ушло слово «внедрили». Вниз — датчики за 500 тысяч, лежащие в карманах рабочих. Модель, обученная на таком отчёте, ускоряет не производство, а ошибку.
Один полевой пилот на промышленном предприятии и один производственный день сборки — N=1, границы обобщения расписаны в самом издании. Смотреть здесь стоит не на вывод, а на цех: как из 19:57:11 записанных интервью получается пакет документов, почему шапка реестра обещала 156 болей, а пересчёт тела дал 88, и как готовая книга нашла арифметически невозможную таблицу в собственной главе про ловлю невязок.
Я приехал на предприятие с готовым набором гипотез. Первое, что выяснилось: датчики стоимостью полмиллиона за штуку лежат в карманах рабочих, а наверх ушло «внедрили». Второе: ~21–22% штата живёт вне официального учёта — значит любая производительность «на официальную численность» смещена системно, до всякого ИИ.
Дальше начинается собственно фабрика. 19:57:11 — это не оценка длительности интервью, а сумма таймкодов: пересчёт первички вместо доверия к отчёту. Реестр обещал 156 болей, пересчёт тела дал 88 — клиенту ушла вторая цифра. Это же правило легло в конвейер издания: не верь шапке, верь пересчёту тела.
В производственный день книга собрала сама себя: 5 инструментов, 182 субагента, 21 609 960 измеренных токенов — и один вендор, вычеркнутый из итога за отсутствие телеметрии. Затем 22 агента проверили результат и нашли арифметически невозможную таблицу — в главе о ловле арифметических невязок. Опубликованы оба факта: и таблица, и протокол её поимки.
Каждый приём ведёт в открытую главу, где он разобран целиком.
Шапка реестра обещала 156 болей. Пересчёт тела дал 88 — и только эта цифра пошла клиенту.
19:57:11~21–22% штата вне официальных книг: метрика «на численность» смещена системно, и это видно до внедрения любой модели.
Датчики в кармане21 609 960 measured-токенов, 182 субагента, 5 инструментов — и вендор, вычеркнутый из итога за отсутствие телеметрии.
Фабрика, собравшая эту книгуПо одному пункту на главу — без обещаний на будущее.
01
Как отличить внедрение от отчёта о внедрении.
02
Как считать первичку так, чтобы цифра выдержала пересчёт на стороне клиента.
03
Почему автор не может быть своим проверяющим и что делает антагонист в чистой сессии.
04
Из чего физически состоит день, в который исследование собирается.
05
Как встроить самопроверку, которая ловит вас, а не хвалит.
06
Почему дешевеющие модели почти не меняют себестоимость исследования.
07
Где окно возможности и по какой дате оно пересматривается.
Это не учебник и не кейс-стади. Это фабрика исследований, показанная в работе: цех, телеметрия, смета — и обязательно брак с протоколом того, как его поймали и что он стоил. N=1: в основе один полевой пилот и один производственный день, генерализация ограничена — её границы честно расписаны в главе 7.
Каждое несущее и продающее число этого издания — клейм в открытом реестре с вердиктом верификации:
49 клеймов: 39 confirmed · 8 corrected · 0 refuted · 2 unverifiable
В главе 5 встретится другой счётчик — 44 клейма: это улов самопроверки первой сборки в производственный день; 49 — текущий реестр издания после финализации. Исправленные не спрятаны: у каждого corrected опубликованы обе версии — «было» и «стало» — с причиной замены. Фильтр реестра по corrected открыт; мы советуем начинать проверку доверия именно с него.
Правило, из которого вырос этот реестр, — «не верь шапке, верь пересчёту тела» — можно исполнить самостоятельно: его публичная версия живёт на /gate. Вставьте свой отчёт — гейт пересчитает заявленное в шапке против тела документа прямо в браузере.
Легенда объявляется один раз — здесь; дальше в тексте только маркировка.
Карта глав — ниже: у каждой главы есть крючок и одна выделенная цифра; выделенные цифры не повторяются между главами — у каждой выделенной цифры один дом.
Три главы открыты и образуют завершённую мини-историю: глава 1 — почему нельзя верить доложенным данным, глава 2 — как из 20 часов интервью делается пакет документов, глава 4 — судовой журнал дня, в который эта книга собрала сама себя. Остальные четыре — контур доверия, самопроверка издания, экономика и прогноз — открываются после регистрации.
Каждое несущее число издания — утверждение в открытом реестре с вердиктом независимой проверки. Исправленные не спрятаны: у каждого опубликованы обе версии.
Датчики за 500 тысяч лежали в карманах рабочих — наверх ушло «внедрили». ИИ на таких данных не бесполезен, он вреден.
Реестр обещал 156 болей. Пересчёт тела дал 88 — и только эта цифра пошла клиенту.
Источник «Gemini Research» выглядел как консалтинговая фирма. Фирмы не существует — существует генеративный ИИ. Поймал не автор — поймал антагонист в чистой сессии.
Эта книга собрала сама себя за один день: 5 инструментов, 182 субагента, 21,6 млн токенов — и один вендор, вычеркнутый из итога за отсутствие телеметрии.
22 агента проверили готовую книгу и нашли арифметически невозможную таблицу — в главе про ловлю арифметических невязок. Оба факта опубликованы.
Счёт за токены — арифметическая пыль: 99,4% себестоимости исследования — это человек. Дешевеющие модели не изменят почти ничего.
0 из 9 вендоров публикуют исполняемый контур честности. Это не приговор рынку — это окно, и у него есть дата истечения.
Читать открытую главу
Открытые главы читаются целиком и без регистрации — начните с первой.
Инструмент-спутник
Правило, из которого вырос реестр этого издания, — «не верь шапке, верь пересчёту тела». Вставьте свой отчёт: гейт пересчитает заявленные числа против тела документа прямо в браузере, без сети и без LLM.
Каждое утверждение — атомарно цитируемый блок с постоянным якорем и вердиктом независимой проверки. Фильтр «исправлено» открыт: с него мы советуем начинать проверку доверия.
Показано 12 из 49
Теневой контингент — ~21–22% штата пилотного завода вне официального учёта (аутсорс-контингент + внеучётные работники); реальная численность выше официальной на ~15–20%, поэтому производительность и себестоимость «на официальную численность» систематически искажены
Первичка исследования (внутренний артефакт)
Датчики мониторинга (~500 тыс. ₽/шт) лежали в карманах рабочих «чтобы не получить штраф»; по вертикали доложено «внедрили» — вскрыто просьбой «покажите на экране» (потёмкинская цифровизация, флаг [POTEMKIN?] + Gemba-тесты)
Первичка исследования (внутренний артефакт)
Официальная рентабельность около 1% названа инсайдером «фикцией» (реальная — в несколько раз выше, «два контура учёта») — намеренная фальсификация учёта под налоговую оптимизацию
Первичка исследования (внутренний артефакт)
У коммерческих LLM с поиском и deep-research агентов 3–13% URL-цитат сфабрикованы (нет ни живой страницы, ни архивного снапшота), 5–18% не резолвятся всего (10 моделей; DRBench 53 090 URL + ExpertQA 168 021 URL)
Источник: arxiv.orgDeep-research агенты галлюцинируют URL статистически значимо чаще search-augmented моделей: pooled 10,7% [10,2–11,2] против 4,8% [4,3–5,2], z=15,15, p<10⁻⁵¹
Источник: arxiv.org0 упоминаний руководителя ИТ-направления за 27 интервью — «молчание = данные»: формальная улика оргизоляции ИТ, а не пробел корпуса
Первичка исследования (внутренний артефакт)
19:57:11 — сумма таймкодов 34 файлов интервью (24 роли-респондента, ~4 месяца поля); кросс-проверка вторым способом: 218 822 слова расшифровок по wc -w
Первичка исследования (внутренний артефакт)
Реестр болей: 88 дедуплицированных записей (PP-FINAL-001…088 без пропусков) — единственная защищаемая цифра тела реестра
Первичка исследования (внутренний артефакт)
Из 17 гипотез 15 строго подтверждены (1 частично — H7, 1 расширена — H15, 0 опровергнуто)
Первичка исследования (внутренний артефакт)
Флагманский клиентский отчёт — 2 279 строк / ~18 200 слов (≈90 страниц — claimed, согласуется с объёмом слов); клиентский пакет — 8 документов
Первичка исследования (внутренний артефакт)
Аналитический конвейер пилота: 16 сессий за 2 календарных дня против плановых 14 дней; 5 стадий, 6 ролей агентов, 21 промпт-файл
Первичка исследования (внутренний артефакт)
Срыв интервью с ИТ-руководителем: интервьюер совместил роли «диагност» и «продавец» и перешёл на личность; дословный финал респондента: «Всё. У меня нет времени. До свидания» → правило говорения ≤30/70 и красные линии интервьюера
Первичка исследования (внутренний артефакт)
Стадия верификации из 10 категорий отловила 34 дефекта (7 критических / 12 высоких / 9 средних / 6 рекомендаций) и закрыла 14 приоритетных фиксов до передачи клиенту; дисклеймер обязателен: измеряем пойманные дефекты, не полное число дефектов
Первичка исследования (внутренний артефакт)
Деградация качества внутри одной сессии: 1-й блок — 18 страниц, 3-й — 9; отсюда правило «2 блока за сессию» (measured в скоупе одной сессии пилота, не универсальная константа)
Первичка исследования (внутренний артефакт)
Помесячные потери клиента ~5–7,5 млн ₽/мес (60÷12=5; 90÷12=7,5) — арифметику поймала стадия верификации
Первичка исследования (внутренний артефакт)
Ложный источник «Gemini Research» (несуществующая консалтинговая фирма — на деле генеративный ИИ) пойман персоной-аудитором в чистой сессии; в том же улове — non-compete, неисполнимый по ТК РФ
Первичка исследования (внутренний артефакт)
Confirmation bias был вшит в сами промпты пилота (гипотеза «саботаж» заложена до сбора доказательств); правило: >20% находок из одного источника = красный флаг; ИТ-источник давал 23% данных ИТ-блока при конфликте интересов
Первичка исследования (внутренний артефакт)
21 609 960 measured-токенов за производственный день 2026-07-25 (только инструменты с телеметрией run_id; self-reported в итог не включены)
Первичка исследования (внутренний артефакт)
182 субагента Claude: 115 (производственный день, включая ночной рой консолидации корпуса) + 67 (отдельная сессия консолидации издания; совпадение с 67 агентами ночного роя — случайное, разные run_id); 1 845 + 1 094 tool-вызова; ≈187,6 + ≈109,5 мин чистого времени роёв
Первичка исследования (внутренний артефакт)
Ночной рой консолидации корпуса пилота (этап 1 производственного дня, run wf_af5f9b65-f77, входит в 115): 67 агентов прочитали 191 файл хаотичной папки пилота за 86,6 минуты — 8 624 353 токена, 727 tool-вызовов, 0 ошибок
Первичка исследования (внутренний артефакт)
Discovery-рой досье: 12 агентов тремя волнами (корпус → веб → дайджест с gap-аудитом) — 1 370 473 токена, 321 tool-вызов, ≈36,8 мин, 0 ошибок и 0 повторных запусков; суммы таблицы сходятся самопроверкой HL-25
Первичка исследования (внутренний артефакт)
Холодный ревьюер-одиночка: 99 665 токенов, 6 минут — самый дешёвый агент дня; его находка сбила множитель ускорения
Первичка исследования (внутренний артефакт)
Множитель ускорения конвейера — «20–30×»
Первичка исследования (внутренний артефакт)
Codex-контур: 24/24 теста PASS, но release-гейт честно НЕ открылся — FAIL, 808 ошибок / 12 категорий на немигрированном корпусе; токены Codex — not_instrumented и не подменены оценкой
Первичка исследования (внутренний артефакт)
Grok — 1 агент, 0 субагентов (осознанный trade-off «единый голос»), токены только order-of-magnitude; Antigravity — 13 субагентов self-reported без run_id → в measured-итог не включён
Первичка исследования (внутренний артефакт)
Микс моделей производственного дня: 74% Sonnet / 26% Opus («ни один Opus не читал механически»); ~10% агентов — чистые верификаторы
Первичка исследования (внутренний артефакт)
Итог дня: 5 инструментов, 11 роевых прогонов, 0 потерянных результатов (1 структурный сбой формата закрыт перезапуском с ревалидацией — 87/87 клеймов, вердикт REPAIRED); санитизация «чистой лаборатории»: git-история пересоздана, 5 рисков утечки закрыто
Первичка исследования (внутренний артефакт)
Data-слой первой сборки издания: 44 клейма — 22 confirmed / 7 corrected / 0 refuted / 15 unverifiable; счётчики сходятся скриптовой проверкой и ручным пересчётом
Первичка исследования (внутренний артефакт)
Рой ревью №3 (22 агента) на готовом издании: 4 critical + 8 high, включая арифметически невозможную таблицу диспозиции (19 закрытых внутри 14 фиксов) в главе про ловлю невязок; контролёр чистого контекста подтвердил ALL_CLOSED
Первичка исследования (внутренний артефакт)
«11–57% галлюцинаций» — округление «between 11.4% and 56.8%» из аудита фабрикации библиографических ссылок в академическом письме (69 557 цитат, 10 LLM, без поиска); перенос на deep research — категориальная ошибка; убита тремя независимыми линиями (досье первички, kill-хант второго вендора, gap-аудит), все 2026-07-25
Источник: arxiv.orgЛожная тревога ревью «класс E_SELF_REVIEW сфабрикован» опровергнута проверкой первички: идентификатор существует (honesty_lib.py:1184); ревьюер сверялся с дайджестом, не с кодом; тревога опубликована
Первичка исследования (внутренний артефакт)
Инверсия смысла Deloitte-числа (стоимость отчёта подана как «частичный возврат») пропущена оркестратором при личном чтении и поймана только независимым ревью — аргумент против «просто вычитай сам»
Первичка исследования (внутренний артефакт)
Финальный grep-свип молча не матчил многобайтный тире в «11–57%» (класс «омоглифы/кодировки» сработал на самих себе); перескан фиксированной строкой: все 4 вхождения — санкционированные контексты
Первичка исследования (внутренний артефакт)
Труд = 99,4% полной себестоимости аудит-пакета при рыночной ставке 5 000 ₽/ч (380 000 ₽ труда против 2 313 ₽ компьюта); компьют <1% во всех сценариях ставок (98,1–99,6%); модельная оценка с объявленными допущениями, центр 382 тыс. ₽ — оптимистичная нижняя оценка
Первичка исследования (внутренний артефакт)
Стоимость LLM-вызовов полного пакета: $14,7 (эконом) / $25,7 (сбалансированный) / $45,9 (премиум) — по официальным API-ценам июля 2026
Первичка исследования (внутренний артефакт)
«Стоимость честности»: стадия верификации ≈17% токенов конвейера, ~26% денег на токены в сбалансированном стеке, 12 человеко-часов; ≈60 603 ₽ на пакет при рыночной ставке
Первичка исследования (внутренний артефакт)
Полная себестоимость (центр 0,38 млн ₽) ниже цены РФ-интегратора (1,2–2,5 млн ₽) в 3,2–6,6 раза — зазор «наша себестоимость ↔ их цена», с явной базой деления
Первичка исследования (внутренний артефакт)
Sensitivity: цена токенов ±50% двигает полную себестоимость на ±0,3% (×10 → ~+5%: компьют 2 313 ₽ → 23 130 ₽ на базе 382 313 ₽); человеко-часы ×2 → +99%
Первичка исследования (внутренний артефакт)
Собственный deep-research-движок: ~103 сек / 25 источников / $0,398 на прогон, со встроенным cost-accounting по ключу агента
Первичка исследования (внутренний артефакт)
Внешние якоря риска строки человеко-часов: BIT/DSIT — доработка AI-черновика +48% против человеческого (27 ч vs 18,25 ч); Faros AI — время ревью PR +91% при высоком внедрении ИИ
Первичка исследования (внутренний артефакт)
76 человеко-часов на полный пакет (30 поле + 46 производство)
Первичка исследования (внутренний артефакт)
0 из 9: ни один коммерческий deep-research-продукт (OpenAI, Google, Anthropic, Perplexity, xAI) и ни один массовый мультиагентный фреймворк (LangGraph, CrewAI, AG2, MetaGPT) не отдаёт пользователю персистентный реестр верифицированных клеймов как продуктовую фичу (negative result, срез 2026-07)
Первичка исследования (внутренний артефакт)
Адверсариальная верификация как концепция НЕ уникальна (Claude /deep-research skill, Claude Code Agent Teams, BMAD Adversarial Review); пусто только пересечение: опубликованная количественная метрика пойманных до клиента дефектов + фикс-таксономия — тезис «у них нет верификации» снят тремя верификаторами как самообман
Первичка исследования (внутренний артефакт)
Deloitte Australia (октябрь 2025): AI-галлюцинации (несуществующие ссылки, выдуманная цитата из судебного решения) в клиентском отчёте для DEWR стоимостью AU$290–440 тыс.; найдены академиком ПОСЛЕ сдачи; частичный возврат по контракту
Источник: fortune.comTow Center/CJR (март 2025): 8 AI-поисковиков × 1 600 запросов — >60% ответов с неверной атрибуцией источника; разброс 37% (Perplexity) — 94% (Grok-3)
Источник: cjr.orgEBU/BBC «News Integrity in AI Assistants» (октябрь 2025): 22 вещателя, 18 стран, >3 000 ответов — 45% ответов с ≥1 значимой проблемой, 31% с проблемами сорсинга
Источник: ebu.chMETR (2025): опытные разработчики с AI-инструментами работали на 19% медленнее при субъективной оценке «+20% быстрее» — разрыв ощущаемой и фактической пользы
Источник: arxiv.orgГосударственный слой зрелостных самоотчётов глобален: CMMM (GB/T 39116-2020) применён на >100 тыс. предприятий КНР с региональными субсидиями; DX推進指標 (METI/IPA, с 2019): лидеры 3,6 из 5 против ~1,5 у типичной компании; РФ — цифровой паспорт ГИСП (бесплатная самодиагностика). Все три — анкеты, не исполняемые контуры
Первичка исследования (внутренний артефакт)
Окно незанятого пересечения (полевые интервью × verified-deliverable × публичная defect-метрика) — 12–18 месяцев; прогнозы главы имеют дату пересмотра 2027-07
Первичка исследования (внутренний артефакт)
Автор

AI-эксперт для управленцев уровня C-Suite. Проектирует и внедряет агентные системы, консультирует руководителей по стратегии применения ИИ. Основатель F/ONE — портала «ИИ для тех, кто решает»: без хайпа, с цифрами и проверяемыми источниками.
Кто оркестрирует рой