Диаризация: как ИИ различает голоса на записи

Диаризация превращает стену расшифрованного текста в «кто что сказал» — это разница между архивом и документом. Как она работает и где ошибается.

Разборы

Расшифруйте совещание без разделения по говорящим — и получите странный документ: все слова на месте, а встречи нет. «Надо перенести срок. Нет, не можем. Ладно, тогда четверг» — три человека, одно решение, и по расшифровке не понять, кто уступил. Технология, которая возвращает это измерение, называется диаризацией — дословно, ответом на вопрос «кто когда говорил». Это самый незаметный и самый важный шаг в разборе встречи, и стоит понимать, что он умеет, а что нет.

Коротко

Что диаризация делает на самом деле

Диаризация делит аудиопоток на отрезки и приписывает каждый анонимному голосу: Участник 1, Участник 2, Участник 3. Имён она не знает — это отдельный шаг (в Летучке участника переименовываешь один раз, и подпись применяется по всей встрече (факт продукта)). Что она знает — это одинаковость: вот этот отрезок и вон тот произнесены одним и тем же голосом.

Звучит скромно. Но это разница между поиском по тексту и восстановленной картиной разговора: «клиент согласовал бюджет» ценно, только если по расшифровке видно, что слова прозвучали в отрезках клиента, а не менеджера, который с надеждой пересказывает то, что хотел услышать.

Как машина различает голоса

Конвейер устроен концептуально просто. Сначала запись режется там, где голос, похоже, меняется. Потом каждый кусок сворачивается в компактную числовую подпись — отпечаток, в котором высота, тембр и манера речи, а не слова. Наконец, подписи группируются: близкие склеиваются в «одного человека», далёкие остаются разными. Расшифровка совмещается с группами — и каждая фраза наследует говорящего.

Заметьте, чего в рецепте нет: знакомства. Никто заранее не записывает образцы голосов — система открывает участников из самой встречи. Поэтому диаризация работает на записи людей, которых никогда не слышала. И поэтому же она может споткнуться: она решает задачу, к которой не приложен ответ.

Где она ломается — и почему здесь важна честность

Три слабых места — структурные, это не «баги»:

Практические меры скучны: нормальный микрофон, говорить по одному (полезная норма встреч и без всякой диаризации) и десять секунд взгляда на подписи участников перед отправкой протокола. В Летучке разделение по голосам работает на премиум-движке, и результат редактируется — неверно приписанный отрезок не обязан таким оставаться (факт продукта).

Что открывает привязка к голосу

Когда у каждой фразы есть владелец, «магические» функции превращаются в бухгалтерию:

Источники и метод

Объяснение диаризации (сегментация, голосовые отпечатки, группировка, работа без предварительного знакомства) описывает стандартную архитектуру современных систем этого класса в общих чертах; слабые места — широко задокументированные ограничения технологии, а не измерения конкретной системы: цифры точности не приводятся и не выдумываются. Факты продукта (разделение по голосам на премиум-движке, редактируемые подписи и переименование участников, время речи и тренд баланса в аналитике, извлечение задач с учётом говорящего) описаны по продуктовому каталогу Летучки на момент написания.

Похожие материалы: Как расшифровать запись Zoom или Телемоста · Как превратить запись планёрки в задачи · Протокол планёрки: рабочий шаблон и автоматизация · Руководитель, который помнит (юзкейс)


Посмотрите, как выглядит ваша последняя встреча, когда у каждой реплики есть голос: киньте запись в @letuchka_robot. Новым пользователям — приветственные турбо-минуты: разделение по голосам работает на премиум-движке.

Попробуйте бесплатно

Загрузите запись встречи — получите саммари и задачи. 100 бесплатных минут каждый месяц, без карты.