Сибирь AI

Точность расшифровки: от чего она зависит

На чистой начитанной русской речи ошибок единицы процентов. Точную цифру мы не называем, и ниже объяснено почему, а заодно разобрано, что эта величина считает и в каких случаях она заметно хуже.

Файл до 2 ГБ, до 3 часов звучания. Час записи обрабатывается примерно за две минуты. Результат отдается файлами: текст, текст с таймкодами, субтитры SRT и документ Word. Исходная запись удаляется сразу после расшифровки, готовые файлы - через 24 часа или раньше, по вашей кнопке.

Бесплатно и без регистрации. Расшифровку ведет программа «Сибирь.ИИ» на карте в Новосибирске. Записи не покидают Россию и не передаются третьим лицам. Оператор - ООО «ФИИ», ИНН 5402076457. Порядок обработки описан в политике обработки персональных данных. Обновлено .

Что за величина

Доля ошибок в словах, по-английски word error rate. Считается так: текст расшифровки сравнивается с эталонной записью того, что было сказано, и подсчитывается, сколько правок нужно, чтобы превратить одно в другое. Правка это замена слова, пропуск слова или лишнее слово. Сумма правок делится на число слов эталона.

Пример на трех словах. Сказано «привет как дела», распознано «привет как тела» - одна замена на три слова, доля ошибок 33 процента. Распознано «привет как там дела» - лишнее слово, и это тоже ошибка, а не улучшение: снова 33 процента.

Рядом обычно называют долю ошибок в символах. Она меньше, потому что слово с одной перепутанной буквой целиком считается ошибочным словом, но почти целиком правильным набором символов. Если сервис называет только вторую величину, он называет меньшее из двух чисел.

Почему мы не называем точную цифру

Потому что любая такая цифра верна ровно для того набора записей, на котором получена, и не переносится на ваш. Формулировка «точность 99 процентов» без указания, на чем она получена, не значит ничего: на студийной начитке столько дает почти любая современная модель, а на записи совещания с четырьмя перебивающими людьми не дает ни одна.

И потому что цифру полагается уметь показать. Число, рядом с которым нельзя выложить набор записей, знаменатель и правило счета, проверить невозможно, а непроверяемое число ничем не лучше чужого «99 процентов». Мы предпочитаем сказать «единицы процентов на чистой речи» и объяснить, от чего это зависит, чем поставить красивую десятую долю и промолчать про остальное.

Модель мы при этом называем прямо: Whisper large-v3, одна из самых крупных открытых моделей распознавания речи, на нашей видеокарте в Новосибирске. Она открыта, и проверить ее может кто угодно, не спрашивая нас.

От чего точность зависит сильнее всего

Чистая читаная речь, один человек, микрофон рядом, нет фона - это лучший случай. Он бывает, но это не то, с чем чаще приходят. Дальше по убыванию:

Как проверить на своей записи

Это единственный способ узнать, что будет именно у вас, и он занимает пару минут. Возьмите кусок настоящей записи, а не специально записанную для пробы фразу: проба, сделанная по тому же признаку, что и ожидание, проверяет только саму себя.

Что считать

Сравните расшифровку с тем, что слышно, и посчитайте правки: замены, пропуски, лишние слова. Поделите на число слов. Регистр и знаки препинания перед сравнением стоит снять, а два написания буквы е, с точками и без, считать одним и тем же: иначе замер меряет оформление, а не речь.

Доля по нескольким записям считается суммарно: все ошибки делятся на все слова. Это не то же самое, что среднее от построчных долей, потому что среднее дает двухсекундной реплике тот же вес, что часовой записи.

На что смотреть кроме доли

Если модель вернула пустой текст, это сто процентов ошибок, а не ноль. Молчание успехом не является, и на этом ломаются и самодельные счетчики, и впечатление от сервиса.

И отдельно стоит посмотреть не на число, а на характер ошибок. Одна перепутанная частица «не» дает ничтожную долю ошибок и выворачивает фразу наизнанку. Доля ошибок это не доля правильно понятого смысла.

Чем эта величина не является

Поэтому расшифровка отдается вместе с разбивкой по фразам и метками времени: спорное место находится в записи за секунды и переслушивается. Инструмент, который не дает этого сделать, просит верить ему на слово.

Частые вопросы

Почему не написано «точность 99 процентов», как у других?

Потому что это было бы верно только для студийной начитки и бесполезно для всего остального. Цифра без указания, на чем она получена, не проверяема, а непроверяемую цифру мы не ставим и свою тоже.

Какая точность будет у меня?

Зависит от записи, и узнать это можно только на своей записи. На чистой начитанной речи ошибок единицы процентов, на шумной записи с перебивками заметно больше.

Насколько хуже на шумной записи?

Точной цифры мы не называем, потому что не мерили ее на своем наборе шумных записей. Называть придуманное число было бы враньем того же сорта, что «точность 99 процентов».

Можно ли улучшить результат со своей стороны?

Да, и сильнее всего помогает микрофон ближе к говорящему. Запись с телефона на столе в переговорной и запись с петлички дают разный результат на одной и той же модели.

Считается ли ошибкой неверная пунктуация?

При таком счете обычно нет: знаки препинания снимают перед сравнением. Модель расставляет их сама, а эталонные записи почти не содержат, и без этого шага замер мерил бы пунктуацию, а не распознавание речи.

Какая модель считает?

Whisper large-v3 на нашей видеокарте в Новосибирске. Подробнее на странице про нейросеть.

Другие способы расшифровки

Все инструменты на одной странице