Диаризация: кто из говорящих что сказал
Диаризация - это разбор записи на реплики разных людей. На этой странице галочка под кнопкой уже стоит, время расчета при этом примерно удваивается.
Файл до 2 ГБ, до 3 часов звучания. Час записи обрабатывается примерно за две минуты. Результат отдается файлами: текст, текст с таймкодами, субтитры SRT и документ Word. Исходная запись удаляется сразу после расшифровки, готовые файлы - через 24 часа или раньше, по вашей кнопке.
Бесплатно и без регистрации. Расшифровку ведет программа «Сибирь.ИИ» на карте в Новосибирске. Записи не покидают Россию и не передаются третьим лицам. Оператор - ООО «ФИИ», ИНН 5402076457. Порядок обработки описан в политике обработки персональных данных. Обновлено .
Что означает слово
Диаризация отвечает на вопрос «кто говорил и когда», отдельно от вопроса «что было сказано». Программа сравнивает голоса по звучанию, собирает похожие куски в группы и помечает их как разных говорящих. Имен она при этом не знает и не может знать: подписи выглядят как «Говорящий 1» и «Говорящий 2».
Дальше разметка по голосам склеивается с расшифровкой, и получается текст, где видно очередность реплик.
Как это работает у нас
Модель распознавания склеивает речь в длинные куски, иногда по полминуты. Если внутри такого куска голос сменился, разметка «по большинству» размажет всю реплику на одного человека. Поэтому мы режем по словам и ставим границу там, где меняется говорящий: на проверочном диалоге это подняло число отдельных реплик с трех до двенадцати.
Разделение считается отдельным проходом, поэтому время примерно удваивается. Час записи вместо двух минут займет около четырех.
Где оно ошибается, и это важно знать заранее
- Короткие реплики вроде «да», «угу», «согласен» часто приписываются соседу.
- Когда двое говорят одновременно, граница размывается.
- Похожие голоса одного пола и возраста путаются чаще.
- Запись с одного микрофона посреди стола хуже, чем запись с гарнитур.
На синтезированном диалоге трех голосов разметка совпала с эталоном полностью, но это проверочный случай, а не живое совещание. На настоящей встрече с перебиваниями ошибки будут, и их придется править руками.
Как проставить настоящие имена
Проще всего поиском с заменой: обычно по первым же репликам понятно, кто есть кто. Мы намеренно не пытаемся угадать имена по содержанию разговора: догадка, вписанная в текст без пометки, потом неотличима от факта.
Сколько это занимает и где считается
Час записи обрабатывается примерно за две минуты. Это замер на нашей карте.
Запись обрабатывается на видеокарте в Новосибирске и не уходит в зарубежные облака.
Когда разделение работает, а когда разваливается
Разделение говорящих опирается на тембр. Пока голоса различимы по тембру, все хорошо. Как только различие пропадает, результат рассыпается, и понять это лучше заранее, чем по итогу.
- Хорошо. Два-три человека, разные по высоте голоса, один микрофон на столе, говорят по очереди.
- Терпимо. Пять-шесть человек на совещании, если перебивают редко.
- Плохо. Несколько похожих голосов, например трое мужчин близкого возраста в одинаковых условиях записи.
- Не работает. Двое говорят одновременно. Разделить наложившуюся речь нельзя в принципе, там просто нет двух отдельных сигналов.
Почему меток больше, чем людей
Частая жалоба: в комнате было трое, а в расшифровке пять говорящих. Причина обычно не в ошибке, а в том, что один и тот же человек звучал по-разному: сначала говорил сидя рядом с микрофоном, потом отошел к доске. Для алгоритма это два разных тембра.
Обратная ситуация тоже бывает: двое похожих слились в одного. Оба случая лечатся одинаково - правкой руками. Автоматика здесь помощник, а не судья.
Как записать, чтобы разделение получилось
- Один микрофон в центре, а не у одного из участников.
- Попросить участников представляться в начале: тогда метки легко превратить в имена.
- Не класть телефон на стол, по которому стучат: удары маскируют тембр.
- Если есть возможность, писать каждого на свою дорожку. Тогда разделение вообще не понадобится.
| Формат | Что внутри | Зачем нужен |
|---|---|---|
| TXT | текст с отметками времени по репликам | читать и править |
| MD | тот же текст в разметке Markdown со сводкой записи | заметки и базы знаний |
| DOCX | текст с абзацами | сдать документом |
| SRT | текст с таймкодами | субтитры к видео |
| JSON | фразы и слова со временем начала и конца, говорящие | дальнейшая обработка |
Чего эта страница не делает
- Не называет людей по именам. Метки обезличенные: говорящий один, два, три.
- Не узнает конкретного человека между разными записями.
- Не разделяет одновременную речь.
Частые вопросы
Что такое диаризация простыми словами
Разделение записи по говорящим: кто из участников когда говорил. Отдельно от того, что именно было сказано.
Программа подпишет имена участников
Нет, она их не знает. Реплики помечаются как «Говорящий 1» и «Говорящий 2», имена проставляются поиском с заменой.
Насколько это точно
На проверочном диалоге трех голосов совпало полностью. На живой встрече с перебиваниями ошибки будут, особенно на коротких репликах.
Насколько дольше считается
Примерно вдвое. Час записи вместо двух минут займет около четырех.
Другие способы расшифровки
- MP4 в текст - видеофайл в текст
- Speech to text: речь в текст - распознавание речи без ключей и квот
- Аудиоформаты в текст: WAV, M4A, OGG и остальные - все прочие форматы записи
- Транскрибация: что это такое - значение слова и как это делается
- Голосовой ввод: надиктовать текст - запись с микрофона прямо на странице
- Точность расшифровки: от чего она зависит - что означает доля ошибок и где она хуже
- Расшифровка видео с YouTube в текст - текст и субтитры из ролика
- Голосовое сообщение и запись с диктофона в текст - голосовые и диктофонные записи