Расшифруйте совещание без разделения по говорящим — и получите странный документ: все слова на месте, а встречи нет. «Надо перенести срок. Нет, не можем. Ладно, тогда четверг» — три человека, одно решение, и по расшифровке не понять, кто уступил. Технология, которая возвращает это измерение, называется диаризацией — дословно, ответом на вопрос «кто когда говорил». Это самый незаметный и самый важный шаг в разборе встречи, и стоит понимать, что он умеет, а что нет.
Коротко
- Диаризация отвечает «кто когда говорил»: режет запись по голосам, не зная ничьих имён. Именно привязка к голосу делает обязательства в расшифровке проверяемыми.
- Работает она так: превращает отрезки речи в голосовые отпечатки и группирует похожие. Предварительно «знакомить» систему с голосами команды не нужно.
- Честные слабые места: наложение голосов, совсем короткие реплики, похожие голоса на плохом микрофоне. Их не избегает никто; обещание идеальной точности — повод насторожиться.
- На плечах диаризации стоят все следующие этажи: задачи с именами, баланс «кто сколько говорил», переименование «Участника 2» в живого человека (факты продукта ниже).
Что диаризация делает на самом деле
Диаризация делит аудиопоток на отрезки и приписывает каждый анонимному голосу: Участник 1, Участник 2, Участник 3. Имён она не знает — это отдельный шаг (в Летучке участника переименовываешь один раз, и подпись применяется по всей встрече (факт продукта)). Что она знает — это одинаковость: вот этот отрезок и вон тот произнесены одним и тем же голосом.
Звучит скромно. Но это разница между поиском по тексту и восстановленной картиной разговора: «клиент согласовал бюджет» ценно, только если по расшифровке видно, что слова прозвучали в отрезках клиента, а не менеджера, который с надеждой пересказывает то, что хотел услышать.
Как машина различает голоса
Конвейер устроен концептуально просто. Сначала запись режется там, где голос, похоже, меняется. Потом каждый кусок сворачивается в компактную числовую подпись — отпечаток, в котором высота, тембр и манера речи, а не слова. Наконец, подписи группируются: близкие склеиваются в «одного человека», далёкие остаются разными. Расшифровка совмещается с группами — и каждая фраза наследует говорящего.
Заметьте, чего в рецепте нет: знакомства. Никто заранее не записывает образцы голосов — система открывает участников из самой встречи. Поэтому диаризация работает на записи людей, которых никогда не слышала. И поэтому же она может споткнуться: она решает задачу, к которой не приложен ответ.
Где она ломается — и почему здесь важна честность
Три слабых места — структурные, это не «баги»:
- Наложение голосов. Когда двое говорят одновременно, в записи действительно смесь. Отрезки становятся короткими, подписи — мутными.
- Микрореплики. В «да» длиной полсекунды голоса почти нет — коротким вставкам чаще всего и достаётся чужое имя.
- Похожие голоса на плохом микрофоне. Два коллеги с близким тембром через один ноутбук в гулкой переговорке могут слипнуться в одного «участника».
Практические меры скучны: нормальный микрофон, говорить по одному (полезная норма встреч и без всякой диаризации) и десять секунд взгляда на подписи участников перед отправкой протокола. В Летучке разделение по голосам работает на премиум-движке, и результат редактируется — неверно приписанный отрезок не обязан таким оставаться (факт продукта).
Что открывает привязка к голосу
Когда у каждой фразы есть владелец, «магические» функции превращаются в бухгалтерию:
- Задачи с именами. «Аня отправит смету» может стать задачей на Аню — извлечение задач знает, кто говорил в момент обещания (факт продукта; весь путь — в статье как превратить запись планёрки в задачи).
- Баланс речи. Сложите длительности отрезков по каждому участнику — и видно, кто доминировал на встрече; для руководителя это тренд, за которым стоит следить (факт продукта: Летучка показывает время речи участников и ведёт тренд баланса по встречам в разделе аналитики).
- Протокол, которому верят. Шаблон из статьи протокол планёрки предполагает, что каждое решение прослеживается до голоса. Диаризация — фундамент этого предположения.
Источники и метод
Объяснение диаризации (сегментация, голосовые отпечатки, группировка, работа без предварительного знакомства) описывает стандартную архитектуру современных систем этого класса в общих чертах; слабые места — широко задокументированные ограничения технологии, а не измерения конкретной системы: цифры точности не приводятся и не выдумываются. Факты продукта (разделение по голосам на премиум-движке, редактируемые подписи и переименование участников, время речи и тренд баланса в аналитике, извлечение задач с учётом говорящего) описаны по продуктовому каталогу Летучки на момент написания.
Похожие материалы: Как расшифровать запись Zoom или Телемоста · Как превратить запись планёрки в задачи · Протокол планёрки: рабочий шаблон и автоматизация · Руководитель, который помнит (юзкейс)
Посмотрите, как выглядит ваша последняя встреча, когда у каждой реплики есть голос: киньте запись в @letuchka_robot. Новым пользователям — приветственные турбо-минуты: разделение по голосам работает на премиум-движке.