Speech to text: речь в текст
Загрузите запись и получите текст. Ключи, квоты и счет за минуты не нужны: считает наша видеокарта, а не облачный тариф.
Файл до 2 ГБ, до 3 часов звучания. Час записи обрабатывается примерно за две минуты. Результат отдается файлами: текст, текст с таймкодами, субтитры SRT и документ Word. Исходная запись удаляется сразу после расшифровки, готовые файлы - через 24 часа или раньше, по вашей кнопке.
Бесплатно и без регистрации. Расшифровку ведет программа «Сибирь.ИИ» на карте в Новосибирске. Записи не покидают Россию и не передаются третьим лицам. Оператор - ООО «ФИИ», ИНН 5402076457. Порядок обработки описан в политике обработки персональных данных. Обновлено .
Что означает speech to text
Speech to text, или распознавание речи, - превращение звучащей речи в текст. По-русски ту же задачу называют транскрибацией или расшифровкой аудио. Обратная задача, озвучивание написанного текста голосом, называется text to speech, и ее мы не делаем: об этом лучше сказать сразу, чем заставлять искать.
Чем это отличается от облачных сервисов распознавания
Крупные облака продают распознавание как услугу с оплатой за минуты: заводится проект, выпускается ключ, считается квота. Это удобно, когда речь идет о встраивании в свое приложение и о больших объемах.
Здесь другое. Нужен один текст из одной записи, без регистрации, ключей и счета. Загрузили файл - получили текст, субтитры и документ. Ограничение техническое: час записи в сутки с одного человека.
Если нужно именно встраивание в свою систему и поток записей, это решается установкой «Сибирь.ИИ» на ваше оборудование. Тогда распознавание работает внутри вашего контура и наружу не обращается вовсе.
Какая модель распознает
Whisper large-v3 на нашей видеокарте в Новосибирске. Подробнее о том, что она умеет и где ошибается, на странице про нейросеть.
Про точность: на чистой русской речи доля ошибок в словах единицы процентов, на шумной записи заметно больше. Почему мы не называем точную цифру.
Час записи обрабатывается примерно за две минуты. Это замер на нашей карте.
Что приходит на выходе
- Текст расшифровки.
- Текст с метками времени по фразам.
- Субтитры SRT для видеоредактора или площадки.
- Документ Word.
Для монтажа субтитры обычно и нужны: файл SRT понимают и профессиональные видеоредакторы, и видеоплощадки. Вшивать субтитры в картинку мы не станем, потому что вшитые нельзя ни выключить, ни исправить.
Языки
Язык определяется автоматически, русский стоит по умолчанию. Перевода нет: текст получается на том языке, на котором говорят в записи.
Где считается запись
Запись обрабатывается на видеокарте в Новосибирске и не уходит в зарубежные облака.
Исходная запись удаляется сразу после расшифровки, готовые файлы живут сутки или меньше, по вашей кнопке.
Что стоит за словами speech to text
За английским термином скрываются две разные задачи, и от того, какая из них ваша, зависит выбор инструмента.
- Распознавание готовой записи. Есть файл, нужен текст. Точность важнее скорости, можно позволить модели подумать и учесть контекст всей фразы. Это то, что делаем мы.
- Распознавание на лету. Человек говорит, текст появляется сразу. Здесь все наоборот: важна задержка, и качество приносится в жертву. Так работают голосовой ввод в телефоне и субтитры в видеозвонках.
Путать их не стоит: инструмент для первой задачи будет казаться медленным во второй, а инструмент для второй - неточным в первой.
Почему доля ошибок измеряется в словах
Общепринятая мера качества распознавания - доля ошибок в словах: сколько слов заменено, пропущено или добавлено лишних на сотню. У нее есть особенность, о которой редко говорят: пропущенный предлог и перевранная фамилия весят одинаково, хотя для читателя это совершенно разные ошибки.
Поэтому на любую такую цифру стоит смотреть как на порядок величины, а не как на приговор. На чистой начитанной речи ошибок единицы процентов, на шумной записи с перебивками заметно больше, и мы этого не скрываем.
| Формат | Что внутри | Зачем нужен |
|---|---|---|
| TXT | текст с отметками времени по репликам | читать и править |
| MD | тот же текст в разметке Markdown со сводкой записи | заметки и базы знаний |
| DOCX | текст с абзацами | сдать документом |
| SRT | текст с таймкодами | субтитры к видео |
| JSON | фразы и слова со временем начала и конца, говорящие | дальнейшая обработка |
Чего эта страница не делает
- Не распознает речь в реальном времени. Нужен готовый файл.
- Не переводит с языка на язык. Текст получается на том языке, на котором говорили.
- Не синтезирует речь. Обратная задача, озвучивание текста, на сайте пока не работает.
Частые вопросы
Нужен ли ключ или регистрация
Нет. Ни ключа, ни проекта, ни привязки карты. Ограничение техническое: час записи в сутки с одного человека.
Есть ли у вас API для встраивания
Публичного нет. Для встраивания в свою систему ставится «Сибирь.ИИ» на ваше оборудование, тогда распознавание идет внутри вашего контура.
Делаете ли вы text to speech, озвучивание текста
Нет. Здесь только обратное направление: речь в текст.
Какая модель используется
Whisper large-v3 на нашей видеокарте. На чистой начитанной речи доля ошибок в словах единицы процентов, подробнее на странице про точность.
Другие способы расшифровки
- Аудиоформаты в текст: WAV, M4A, OGG и остальные - все прочие форматы записи
- Транскрибация: что это такое - значение слова и как это делается
- Голосовой ввод: надиктовать текст - запись с микрофона прямо на странице
- Точность расшифровки: от чего она зависит - что означает доля ошибок и где она хуже
- Расшифровка видео с YouTube в текст - текст и субтитры из ролика
- Голосовое сообщение и запись с диктофона в текст - голосовые и диктофонные записи
- Сделать субтитры к видео онлайн - готовый файл SRT из видео
- Расшифровка совещаний и встреч - запись встречи с разделением по говорящим