К исследованиюГлава 2 из 711 мин чтенияОткрыто

Глава 2. 19:57:11

Девятнадцать часов пятьдесят семь минут одиннадцать секунд. Это не «около двадцати часов интервью» из презентации — это сумма таймкодов тридцати четырёх аудиофайлов, посчитанная по мастер-реестру записей. Мы могли бы округлить, и никто бы не заметил. Но округлённое число нельзя проверить, а 19:57:11 — можно: возьмите реестр, сложите длительности, получите ровно эту сумму.

Больше того, у этой цифры есть двойник, посчитанный независимым способом. Прогоните все тридцать четыре расшифровки через утилиту подсчёта слов — получится 218 822 слова. Порядка двухсот двадцати тысяч слов устной речи на без малого двадцать часов записи — темп сходится. Два разных измерения одного объёма, снятые разными инструментами, подтверждают друг друга. Вот это — а не круглое число на слайде — мы называем эффектным результатом. Весь стиль издания устроен так же: удивлять должна сходимость, а не величина.

Теперь — откуда эти двадцать часов взялись и во что они превратились.

Полевой цех

Крупное производство строительных конструкций, четыре месяца полевой работы. Команда из трёх человек, 24 респондента — от первых лиц до операторов и технолога бетоносмесительного узла. Интервью группируются не хронологически, а пятью пакетами от стратегии к операциям: руководство, инженеры, производство, снабжение с логистикой, сервисы с ИТ. Порядок не косметический: каждый следующий пакет читается с накопленным контекстом предыдущих, и более поздний респондент, сам того не зная, верифицирует более раннего.

Полевой этап начинается раньше первого вопроса — с установочной встречи, задача которой снять страх. Сценарий отработан: слово руководства с явной гарантией «всё, что вы скажете, пойдёт на улучшение, а не на наказание»; объяснение на языке цеха, что команда пришла убирать рутину, а не людей; логистика самозаписи. Это не церемония вежливости, а инженерия качества данных: по всей нашей практике семьдесят процентов успеха трансформации — люди, и напуганный респондент даёт не данные, а показания. Кстати, о цифре «24 респондента» при 23 профилях: бухгалтерию мы интервьюировали группой, и это отдельный протокол — групповой профиль плюс наблюдение, кто кого перебивает: динамика прерываний оказалась честным прокси реальной иерархии.

Два эпизода из этого цеха объясняют про полевую работу больше, чем любая методичка.

Эпизод первый. Респондент рассказывает, как в её узле всё оцифровано: программа стоит, данные вводятся, вручную ничего не делается. Слова записаны, таймкод стоит. Интервьюер просит: покажите на экране. И на пути к экрану обнаруживаются бумажные талоны на прищепке — живой рабочий процесс, который в словах только что не существовал. Никакого злого умысла: человек искренне описывал, как «положено», а не как есть. Просьба «покажите на экране» — правило, чьё рождение описано в главе 1, — здесь отработала как штатный элемент протокола: вербальный ответ и наблюдаемый процесс — это два разных источника данных, и совпадают они далеко не всегда.

Эпизод второй — о цене ошибки интервьюера, и здесь мне придётся говорить о себе. Одно из ключевых интервью — с руководителем ИТ-направления — я сорвал. Я пытался продавать и диагностировать одновременно: вместо вопросов пошёл саморекламный монолог, потом — обвинение собеседника в причастности к «цифровой отсталости», потом я транслировал ему в лоб непроверенный негатив третьих лиц и не представился, когда он прямо попросил. Респондент закончил разговор за меня: «Всё. У меня нет времени. До свидания». Дословно. Эта минута куплена дорого, и из неё выведено жёсткое правило : роли диагноста и продавца не совмещаются в одном разговоре никогда, а интервьюер говорит не больше трети времени. Тренажёр интервью на портале — прямой потомок этой минуты: дешевле отрабатывать срыв на симуляции, чем на живом ключевом респонденте.

Между этими двумя полюсами — рутинный репертуар полевых приёмов, каждый из которых куплен практикой. Завершение по насыщению: одно из интервью длилось двенадцать минут, потому что паттерн повторился трижды, и дальше время дороже вежливости. Количественная калибровка перед любым предложением: сначала «сколько времени у вас уходит на проверку договора?» — полтора-два часа, — и только потом разговор о сокращении; цифра, названная самим респондентом, не оспаривается на защите. Встречные гипотезы-«пробные шары» для операционного звена: открытый вопрос «что бы вы автоматизировали?» приносит от линейного персонала только то, что он и так знает; продуктивнее предъявить конкретную гипотезу и дать её разбить. И просто наблюдение: сосульки на теплотрассе — вопрос о теплопотерях, которого не было в гайде.

К полевым данным относится и то, чего в них нет. За 27 интервью — сессий меньше, чем 34 аудиофайлов, потому что часть респондентов интервьюировалась дважды, а длинные записи разрезаны на части, — ни один респондент ни разу не упомянул руководителя ИТ-направления — ноль упоминаний человека, формально отвечающего за все системы предприятия. Молчание такого масштаба — не пробел данных, а само по себе данные: ИТ для цехов физически не существует. В конвейере под это есть отдельный шаг — аудит умолчаний: для каждого респондента ведётся список тем, которые он должен был затронуть и не затронул.

Конвейер сжатия

Дальше двадцать часов речи входят в . Расшифровки — грязные: реплики одного респондента машинная диаризация приписывает другому — ловится только вручную, по содержанию; интервью разрезаны на файлы, обрывающиеся на полуслове ровно на главной претензии; один служебный реестр вовсе не читался парсером из-за неэкранированной кавычки; таймкоды скачут. Поэтому у корпуса есть входной контроль — валидация спикеров, линт форматов, склейка частей — и правило заморозки: корпус фиксируется до старта синтеза, чтобы каждый вывод можно было привязать к версии данных, на которых он сделан.

Сам конвейер — пять стадий. Первая — нормализация: каждый фрагмент превращается в структурированную запись с дословной цитатой, таймкодом, тяжестью, привязкой к гипотезам. Вторая — синтез с дедупликацией и перекрёстной верификацией. Третья — написание глав. Четвёртая — верификация чужим взглядом (её анатомия — в главе 3). Пятая — финализация и сборка. Канонический разбор шести ролей этого конвейера живёт в агентных — здесь мы показываем не орг-чарт, а цех.

Конвейером управляет корпус из двадцати одного промпт-файла, и у него есть неочевидное свойство: эволюционируют от пакета к пакету. У модели нет памяти между сессиями, поэтому каждый следующий промпт открывается сводкой результатов предыдущего — ручной перенос контекста, — и туда же дописываются свежие уроки: после того как агенты начали пересказывать цитаты, появилось требование дословности; после коллизии нумерации — заранее выданные диапазоны идентификаторов. Конвейер учится письменно, и след этого обучения читается в промптах, как годовые кольца.

На выходе — пакет из восьми клиентских документов: диагностика, дорожная карта, стратегия, финмодель, первоочередные меры. Флагманский отчёт — 2 279 строк, порядка девяноста страниц. Всё это заняло шестнадцать рабочих сессий за два дня — против четырнадцати дней, заложенных в план. План строился по человеческим нормам трудозатрат; параллельная работа агентов сломала норму в семь раз, и это единственная строка этой главы, где расхождение плана с фактом нас радует.

Как выглядит атом этого конвейера? Вот реальная запись из реестра болей — та самая структурированная единица, в которую превращается фрагмент интервью. Запись санитизирована по правилам чистой лаборатории: роль вместо имени, детали предприятия сняты; структура полей и цитата — настоящие:

- id: PP-003-041
  severity: high
  block: operations
  quote: "Раньше отчёт сдавали третьего-пятого числа. Сейчас —
    пятнадцатого-восемнадцатого. Людей меньше, а бумаг больше."
  timestamp: "00:41:37"
  respondent: "начальник заготовительного цеха"
  department: production
  theme: "деградация цикла отчётности"
  codes: [reporting-lag, workload, degradation-trend]
  related_hypotheses: [H12]
  business_impact: "закрытие периода смещается к 20-му числу следующего
    месяца; управление по факту становится посмертным"
  quick_win_potential: medium
  cross_reference: [PP-001-017, PP-004-052]
  confidence: corroborated # 2 независимых источника
  verified_by: synthesis-moderator

Пятнадцать полей на одну жалобу — это кажется бюрократией ровно до момента, когда таких записей становятся сотни. Тогда поля превращаются в единственный способ фильтровать, дедуплицировать и трассировать: от цитаты с таймкодом — к боли, от боли — к инициативе, от инициативы — к странице отчёта. Заметьте поле confidence: сила утверждения зависит не от яркости цитаты, а от числа независимых подтверждений из разных отделов.

А вот чем это извлечение управляется — фрагмент реального промпта стадии нормализации, из корпуса в двадцать один промпт-файл, которым шёл пилот:

ВАЖНО: ДОСЛОВНЫЕ цитаты, ТОЧНЫЕ таймкоды в формате ЧЧ:ММ:СС — урок предыдущего пакета: агенты дают приблизительный пересказ, пересказ = дефект. Каждый код подкреплён прямой цитатой; не интерпретируй за респондента; различай факты, мнения и эмоции. Неразборчивое помечай тегом [неразб.], при доле выше 30% — эскалация. Диапазоны ID выданы заранее: агент A — PP-003-001…030, агент B — …031…060, агент C — …061…090; самовольная нумерация запрещена.

Каждая строчка этой инструкции — шрам. «Дословные цитаты» появились после того, как агенты начали пересказывать; выданные заранее диапазоны ID — после того, как один агент занумеровал записи самовольно и слияние пришлось переделывать руками. Промпт — это не заклинание, а журнал ошибок, переписанный в повелительное наклонение.

88 вместо 156

Теперь главная история этой главы — про число, которое мы не понесли клиенту.

В служебной шапке итогового реестра болей значилось: после дедупликации — 156 записей. Красивое число, оно уже разошлось по черновикам и просилось в отчёт. Но при подготовке витрины кейса мы сделали то, что делаем с любой цифрой: пересчитали её по телу файла, а не по заголовку. И шапка рассыпалась. Три её внутренние суммы противоречили друг другу: разбивка по тяжести давала 156, по блокам — 172, по категориям — 176. Соседний документ цитировал четвёртую версию — 239. А в самом теле реестра оказалось ровно 88 записей, идущих подряд, без пропусков.

Разгадка прозаична: шапку написали на этапе планирования и никогда не пересчитывали, а тело жило своей жизнью. Расхождение оказалось сквозным: даже «сырое» число до дедупликации не сошлось — документация обещала 264 исходные записи, пересчёт по пяти пакетным файлам дал 268, а восемь записей были отброшены при слиянии молча, без пометки. Никто не врал — просто заголовок и данные разошлись, как доклад и датчик из главы 1. Но для читателя отчёта разницы нет: непроверяемая цифра — это мина, и взрывается она в худший момент, на защите перед скептиком. Единственная защищаемая цифра — 88, и именно она пошла в работу. Отсюда правило, которое теперь зашито в отдельным скриптом: не верь шапке реестра — верь пересчёту тела. Любой YAML со счётчиком в заголовке проходит автоматическую сверку «заявлено ↔ фактически» до того, как попадёт в документ.

Та же дисциплина съела ещё одну красивую формулу. В сводке пилота значилось «17 из 17 гипотез подтверждены» — идеальный результат, который так хочется напечатать крупно. Пересчёт по сводной таблице дал: строго подтверждены 15, одна гипотеза — частично, одна — переформулирована. «15 из 17» продаёт хуже, чем «17 из 17». Зато первую цифру можно защищать под перекрёстным допросом, а вторая ломается от одного взгляда в таблицу. Мы оставили первую — потому что исследование, пойманное на одной завышенной цифре, теряет право на доверие ко всем остальным.

Признаюсь: убирать 156 из черновиков было неприятно. Число уже жило в текстах, на него опирались формулировки, и «88» на его фоне выглядело скромнее. Но это ровно та развилка, где решается, чем фабрика отличается от генератора отчётов: генератор оптимизирует впечатление, фабрика — проверяемость.

У правила «не верь шапке — верь пересчёту тела» есть и публичная версия, которую можно исполнить прямо сейчас: инструмент /gate на портале пересчитывает заявленное в шапке против тела документа у вас в браузере — вставьте свой отчёт и посмотрите, разойдётся ли его шапка так же, как разошлась наша.

Что обещала шапка и что выдержало пересчёт

ОбещаноВыдержало пересчётКомментарий
156 болей в реестре88три несовместимые суммы в шапке; тело файла — единственный источник правды
17/17 гипотез подтверждены15/17ещё две — «частично» и «переформулирована»; честная дробь вместо круглого счёта
14 дней на проект2 дняединственное расхождение в пользу факта: параллельные сломали норму планирования

Эта таблица — портрет метода в трёх строках. Две первые — про то, что заявленное систематически больше измеренного, и фабрика существует, чтобы этот зазор вскрывать до клиента, а не после. Третья — про то, почему фабрика вообще возможна: там, где нормой были недели, укладывается в дни, и высвобожденное время тратится не на «ещё больше текста», а на пересчёт каждой шапки.

Кто именно внутри конвейера не даёт автору поверить собственной шапке — про это следующая глава: у каждой роли там своё имя, и ни одна не проверяет саму себя.

Что дальше