01
A report is not a deployment
How to tell a deployment from a report about a deployment.
Research
How a multi-agent pipeline ran a real factory audit and turned it into a book that caught its own errors — with an open registry of verified claims.
7 chapters, 3 open without registration.
Management heard “deployed.” On the floor, sensors worth 500K each sat in workers' pockets. A model trained on that report does not accelerate production — it accelerates the error.
One field pilot at an industrial enterprise and one production day of assembly — N=1, and the limits of generalisation are spelled out inside. What matters here is not the conclusion but the shop floor: how 19:57:11 of recorded interviews becomes a document package, why the registry header promised 156 pain points while recounting the body gave 88, and how the finished book found an arithmetically impossible table in its own chapter about catching arithmetic discrepancies.
I arrived at the enterprise with a ready set of hypotheses. The first thing I found: sensors costing half a million each were sitting in workers' pockets, while management had reported “deployed.” The second: ~21–22% of the headcount lives outside the official books — so any productivity figure “per official headcount” is systematically skewed, long before any AI.
Then the factory proper begins. 19:57:11 is not an estimate of interview length but a sum of timecodes: recounting the primary material instead of trusting the report. The registry promised 156 pain points; recounting the body gave 88 — and the second number is what went to the client. That same rule went into the edition's pipeline: don't trust the header, trust the recount of the body.
On the production day the book assembled itself: 5 tools, 182 subagents, 21,609,960 measured tokens — and one vendor struck from the total for missing telemetry. Then 22 agents checked the result and found an arithmetically impossible table — in the chapter about catching arithmetic discrepancies. Both facts are published: the table and the protocol that caught it.
Each technique links to an open chapter where it is worked through in full.
The registry header promised 156 pain points. Recounting the body gave 88 — and only that number went to the client.
19:57:11~21–22% of headcount outside the official books: any “per headcount” metric is systematically skewed, visible before any model is deployed.
Sensors in a Pocket21,609,960 measured tokens, 182 subagents, 5 tools — and a vendor struck from the total for missing telemetry.
The Factory That Assembled This BookOne item per chapter — no promises about the future.
01
How to tell a deployment from a report about a deployment.
02
How to count primary material so the number survives a recount on the client's side.
03
Why an author cannot review their own work, and what an antagonist in a clean session does.
04
What a day in which research assembles itself physically consists of.
05
How to build a self-check that catches you rather than flatters you.
06
Why cheaper models barely move the cost of research.
07
Where the window of opportunity is, and the date on which it gets reviewed.
Every load-bearing number in this edition is a claim in an open registry with an independent verification verdict. Corrections are not hidden: both versions are published for each.
Sensors worth 500K each sat in workers' pockets while management reported “deployed.” AI on such data isn't useless — it's harmful.
The registry header promised 156 pain points. Recounting the body gave 88 — and only that number went to the client.
A source called “Gemini Research” looked like a consulting firm. The firm doesn't exist — generative AI does. The author didn't catch it; an antagonist in a clean session did.
This book assembled itself in a single day: 5 tools, 182 subagents, 21.6M tokens — and one vendor struck from the total for missing telemetry.
22 agents checked the finished book and found an arithmetically impossible table — in the chapter about catching arithmetic discrepancies. Both facts are published.
The token bill is arithmetic dust: 99.4% of the research cost is human labor. Cheaper models will change almost nothing.
0 of 9 vendors publish an executable honesty loop. That's not a verdict on the market — it's a window, and it has an expiry date.
Read an open chapter
Open chapters are readable in full with no sign-up — start with the first one.
Companion tool
The rule this edition's registry grew from — “don't trust the header, trust the recount of the body.” Paste your own report: the gate recounts the declared numbers against the body right in your browser, with no network and no LLM.
Every claim is an atomically quotable block with a permanent anchor and an independent verification verdict. The “corrected” filter is open — that is where we suggest starting your trust check.
Showing 12 of 49
Теневой контингент — ~21–22% штата пилотного завода вне официального учёта (аутсорс-контингент + внеучётные работники); реальная численность выше официальной на ~15–20%, поэтому производительность и себестоимость «на официальную численность» систематически искажены
Research primary material (internal artifact)
Датчики мониторинга (~500 тыс. ₽/шт) лежали в карманах рабочих «чтобы не получить штраф»; по вертикали доложено «внедрили» — вскрыто просьбой «покажите на экране» (потёмкинская цифровизация, флаг [POTEMKIN?] + Gemba-тесты)
Research primary material (internal artifact)
Официальная рентабельность около 1% названа инсайдером «фикцией» (реальная — в несколько раз выше, «два контура учёта») — намеренная фальсификация учёта под налоговую оптимизацию
Research primary material (internal artifact)
У коммерческих LLM с поиском и deep-research агентов 3–13% URL-цитат сфабрикованы (нет ни живой страницы, ни архивного снапшота), 5–18% не резолвятся всего (10 моделей; DRBench 53 090 URL + ExpertQA 168 021 URL)
Source: arxiv.orgDeep-research агенты галлюцинируют URL статистически значимо чаще search-augmented моделей: pooled 10,7% [10,2–11,2] против 4,8% [4,3–5,2], z=15,15, p<10⁻⁵¹
Source: arxiv.org0 упоминаний руководителя ИТ-направления за 27 интервью — «молчание = данные»: формальная улика оргизоляции ИТ, а не пробел корпуса
Research primary material (internal artifact)
19:57:11 — сумма таймкодов 34 файлов интервью (24 роли-респондента, ~4 месяца поля); кросс-проверка вторым способом: 218 822 слова расшифровок по wc -w
Research primary material (internal artifact)
Реестр болей: 88 дедуплицированных записей (PP-FINAL-001…088 без пропусков) — единственная защищаемая цифра тела реестра
Research primary material (internal artifact)
Из 17 гипотез 15 строго подтверждены (1 частично — H7, 1 расширена — H15, 0 опровергнуто)
Research primary material (internal artifact)
Флагманский клиентский отчёт — 2 279 строк / ~18 200 слов (≈90 страниц — claimed, согласуется с объёмом слов); клиентский пакет — 8 документов
Research primary material (internal artifact)
Аналитический конвейер пилота: 16 сессий за 2 календарных дня против плановых 14 дней; 5 стадий, 6 ролей агентов, 21 промпт-файл
Research primary material (internal artifact)
Срыв интервью с ИТ-руководителем: интервьюер совместил роли «диагност» и «продавец» и перешёл на личность; дословный финал респондента: «Всё. У меня нет времени. До свидания» → правило говорения ≤30/70 и красные линии интервьюера
Research primary material (internal artifact)
Стадия верификации из 10 категорий отловила 34 дефекта (7 критических / 12 высоких / 9 средних / 6 рекомендаций) и закрыла 14 приоритетных фиксов до передачи клиенту; дисклеймер обязателен: измеряем пойманные дефекты, не полное число дефектов
Research primary material (internal artifact)
Деградация качества внутри одной сессии: 1-й блок — 18 страниц, 3-й — 9; отсюда правило «2 блока за сессию» (measured в скоупе одной сессии пилота, не универсальная константа)
Research primary material (internal artifact)
Помесячные потери клиента ~5–7,5 млн ₽/мес (60÷12=5; 90÷12=7,5) — арифметику поймала стадия верификации
Research primary material (internal artifact)
Ложный источник «Gemini Research» (несуществующая консалтинговая фирма — на деле генеративный ИИ) пойман персоной-аудитором в чистой сессии; в том же улове — non-compete, неисполнимый по ТК РФ
Research primary material (internal artifact)
Confirmation bias был вшит в сами промпты пилота (гипотеза «саботаж» заложена до сбора доказательств); правило: >20% находок из одного источника = красный флаг; ИТ-источник давал 23% данных ИТ-блока при конфликте интересов
Research primary material (internal artifact)
21 609 960 measured-токенов за производственный день 2026-07-25 (только инструменты с телеметрией run_id; self-reported в итог не включены)
Research primary material (internal artifact)
182 субагента Claude: 115 (производственный день, включая ночной рой консолидации корпуса) + 67 (отдельная сессия консолидации издания; совпадение с 67 агентами ночного роя — случайное, разные run_id); 1 845 + 1 094 tool-вызова; ≈187,6 + ≈109,5 мин чистого времени роёв
Research primary material (internal artifact)
Ночной рой консолидации корпуса пилота (этап 1 производственного дня, run wf_af5f9b65-f77, входит в 115): 67 агентов прочитали 191 файл хаотичной папки пилота за 86,6 минуты — 8 624 353 токена, 727 tool-вызовов, 0 ошибок
Research primary material (internal artifact)
Discovery-рой досье: 12 агентов тремя волнами (корпус → веб → дайджест с gap-аудитом) — 1 370 473 токена, 321 tool-вызов, ≈36,8 мин, 0 ошибок и 0 повторных запусков; суммы таблицы сходятся самопроверкой HL-25
Research primary material (internal artifact)
Холодный ревьюер-одиночка: 99 665 токенов, 6 минут — самый дешёвый агент дня; его находка сбила множитель ускорения
Research primary material (internal artifact)
Множитель ускорения конвейера — «20–30×»
Research primary material (internal artifact)
Codex-контур: 24/24 теста PASS, но release-гейт честно НЕ открылся — FAIL, 808 ошибок / 12 категорий на немигрированном корпусе; токены Codex — not_instrumented и не подменены оценкой
Research primary material (internal artifact)
Grok — 1 агент, 0 субагентов (осознанный trade-off «единый голос»), токены только order-of-magnitude; Antigravity — 13 субагентов self-reported без run_id → в measured-итог не включён
Research primary material (internal artifact)
Микс моделей производственного дня: 74% Sonnet / 26% Opus («ни один Opus не читал механически»); ~10% агентов — чистые верификаторы
Research primary material (internal artifact)
Итог дня: 5 инструментов, 11 роевых прогонов, 0 потерянных результатов (1 структурный сбой формата закрыт перезапуском с ревалидацией — 87/87 клеймов, вердикт REPAIRED); санитизация «чистой лаборатории»: git-история пересоздана, 5 рисков утечки закрыто
Research primary material (internal artifact)
Data-слой первой сборки издания: 44 клейма — 22 confirmed / 7 corrected / 0 refuted / 15 unverifiable; счётчики сходятся скриптовой проверкой и ручным пересчётом
Research primary material (internal artifact)
Рой ревью №3 (22 агента) на готовом издании: 4 critical + 8 high, включая арифметически невозможную таблицу диспозиции (19 закрытых внутри 14 фиксов) в главе про ловлю невязок; контролёр чистого контекста подтвердил ALL_CLOSED
Research primary material (internal artifact)
«11–57% галлюцинаций» — округление «between 11.4% and 56.8%» из аудита фабрикации библиографических ссылок в академическом письме (69 557 цитат, 10 LLM, без поиска); перенос на deep research — категориальная ошибка; убита тремя независимыми линиями (досье первички, kill-хант второго вендора, gap-аудит), все 2026-07-25
Source: arxiv.orgЛожная тревога ревью «класс E_SELF_REVIEW сфабрикован» опровергнута проверкой первички: идентификатор существует (honesty_lib.py:1184); ревьюер сверялся с дайджестом, не с кодом; тревога опубликована
Research primary material (internal artifact)
Инверсия смысла Deloitte-числа (стоимость отчёта подана как «частичный возврат») пропущена оркестратором при личном чтении и поймана только независимым ревью — аргумент против «просто вычитай сам»
Research primary material (internal artifact)
Финальный grep-свип молча не матчил многобайтный тире в «11–57%» (класс «омоглифы/кодировки» сработал на самих себе); перескан фиксированной строкой: все 4 вхождения — санкционированные контексты
Research primary material (internal artifact)
Труд = 99,4% полной себестоимости аудит-пакета при рыночной ставке 5 000 ₽/ч (380 000 ₽ труда против 2 313 ₽ компьюта); компьют <1% во всех сценариях ставок (98,1–99,6%); модельная оценка с объявленными допущениями, центр 382 тыс. ₽ — оптимистичная нижняя оценка
Research primary material (internal artifact)
Стоимость LLM-вызовов полного пакета: $14,7 (эконом) / $25,7 (сбалансированный) / $45,9 (премиум) — по официальным API-ценам июля 2026
Research primary material (internal artifact)
«Стоимость честности»: стадия верификации ≈17% токенов конвейера, ~26% денег на токены в сбалансированном стеке, 12 человеко-часов; ≈60 603 ₽ на пакет при рыночной ставке
Research primary material (internal artifact)
Полная себестоимость (центр 0,38 млн ₽) ниже цены РФ-интегратора (1,2–2,5 млн ₽) в 3,2–6,6 раза — зазор «наша себестоимость ↔ их цена», с явной базой деления
Research primary material (internal artifact)
Sensitivity: цена токенов ±50% двигает полную себестоимость на ±0,3% (×10 → ~+5%: компьют 2 313 ₽ → 23 130 ₽ на базе 382 313 ₽); человеко-часы ×2 → +99%
Research primary material (internal artifact)
Собственный deep-research-движок: ~103 сек / 25 источников / $0,398 на прогон, со встроенным cost-accounting по ключу агента
Research primary material (internal artifact)
Внешние якоря риска строки человеко-часов: BIT/DSIT — доработка AI-черновика +48% против человеческого (27 ч vs 18,25 ч); Faros AI — время ревью PR +91% при высоком внедрении ИИ
Research primary material (internal artifact)
76 человеко-часов на полный пакет (30 поле + 46 производство)
Research primary material (internal artifact)
0 из 9: ни один коммерческий deep-research-продукт (OpenAI, Google, Anthropic, Perplexity, xAI) и ни один массовый мультиагентный фреймворк (LangGraph, CrewAI, AG2, MetaGPT) не отдаёт пользователю персистентный реестр верифицированных клеймов как продуктовую фичу (negative result, срез 2026-07)
Research primary material (internal artifact)
Адверсариальная верификация как концепция НЕ уникальна (Claude /deep-research skill, Claude Code Agent Teams, BMAD Adversarial Review); пусто только пересечение: опубликованная количественная метрика пойманных до клиента дефектов + фикс-таксономия — тезис «у них нет верификации» снят тремя верификаторами как самообман
Research primary material (internal artifact)
Deloitte Australia (октябрь 2025): AI-галлюцинации (несуществующие ссылки, выдуманная цитата из судебного решения) в клиентском отчёте для DEWR стоимостью AU$290–440 тыс.; найдены академиком ПОСЛЕ сдачи; частичный возврат по контракту
Source: fortune.comTow Center/CJR (март 2025): 8 AI-поисковиков × 1 600 запросов — >60% ответов с неверной атрибуцией источника; разброс 37% (Perplexity) — 94% (Grok-3)
Source: cjr.orgEBU/BBC «News Integrity in AI Assistants» (октябрь 2025): 22 вещателя, 18 стран, >3 000 ответов — 45% ответов с ≥1 значимой проблемой, 31% с проблемами сорсинга
Source: ebu.chMETR (2025): опытные разработчики с AI-инструментами работали на 19% медленнее при субъективной оценке «+20% быстрее» — разрыв ощущаемой и фактической пользы
Source: arxiv.orgГосударственный слой зрелостных самоотчётов глобален: CMMM (GB/T 39116-2020) применён на >100 тыс. предприятий КНР с региональными субсидиями; DX推進指標 (METI/IPA, с 2019): лидеры 3,6 из 5 против ~1,5 у типичной компании; РФ — цифровой паспорт ГИСП (бесплатная самодиагностика). Все три — анкеты, не исполняемые контуры
Research primary material (internal artifact)
Окно незанятого пересечения (полевые интервью × verified-deliverable × публичная defect-метрика) — 12–18 месяцев; прогнозы главы имеют дату пересмотра 2027-07
Research primary material (internal artifact)
Author

AI advisor to C-suite executives. Designs and deploys agent systems; consults leadership teams on AI strategy. Founder of F/ONE — “AI for those who decide”: no hype, numbers and checkable sources.
Who orchestrates the swarm