Сибирь AI

Speech to text: речь в текст

Загрузите запись и получите текст. Ключи, квоты и счет за минуты не нужны: считает наша видеокарта, а не облачный тариф.

Файл до 2 ГБ, до 3 часов звучания. Час записи обрабатывается примерно за две минуты. Результат отдается файлами: текст, текст с таймкодами, субтитры SRT и документ Word. Исходная запись удаляется сразу после расшифровки, готовые файлы - через 24 часа или раньше, по вашей кнопке.

Бесплатно и без регистрации. Расшифровку ведет программа «Сибирь.ИИ» на карте в Новосибирске. Записи не покидают Россию и не передаются третьим лицам. Оператор - ООО «ФИИ», ИНН 5402076457. Порядок обработки описан в политике обработки персональных данных. Обновлено .

Что означает speech to text

Speech to text, или распознавание речи, - превращение звучащей речи в текст. По-русски ту же задачу называют транскрибацией или расшифровкой аудио. Обратная задача, озвучивание написанного текста голосом, называется text to speech, и ее мы не делаем: об этом лучше сказать сразу, чем заставлять искать.

Путь записи до текстаЗаписьРаспознаваниевидеокарта в НовосибирскеТекстСубтитры SRTДокумент
Запись уходит на нашу видеокарту в Новосибирске, а обратно приходит текст с таймкодами, субтитры и документ.

Чем это отличается от облачных сервисов распознавания

Крупные облака продают распознавание как услугу с оплатой за минуты: заводится проект, выпускается ключ, считается квота. Это удобно, когда речь идет о встраивании в свое приложение и о больших объемах.

Здесь другое. Нужен один текст из одной записи, без регистрации, ключей и счета. Загрузили файл - получили текст, субтитры и документ. Ограничение техническое: час записи в сутки с одного человека.

Если нужно именно встраивание в свою систему и поток записей, это решается установкой «Сибирь.ИИ» на ваше оборудование. Тогда распознавание работает внутри вашего контура и наружу не обращается вовсе.

Какая модель распознает

Whisper large-v3 на нашей видеокарте в Новосибирске. Подробнее о том, что она умеет и где ошибается, на странице про нейросеть.

Про точность: на чистой русской речи доля ошибок в словах единицы процентов, на шумной записи заметно больше. Почему мы не называем точную цифру.

Час записи обрабатывается примерно за две минуты. Это замер на нашей карте.

Что приходит на выходе

Для монтажа субтитры обычно и нужны: файл SRT понимают и профессиональные видеоредакторы, и видеоплощадки. Вшивать субтитры в картинку мы не станем, потому что вшитые нельзя ни выключить, ни исправить.

Языки

Язык определяется автоматически, русский стоит по умолчанию. Перевода нет: текст получается на том языке, на котором говорят в записи.

Где считается запись

Запись обрабатывается на видеокарте в Новосибирске и не уходит в зарубежные облака.

Исходная запись удаляется сразу после расшифровки, готовые файлы живут сутки или меньше, по вашей кнопке.

Что стоит за словами speech to text

За английским термином скрываются две разные задачи, и от того, какая из них ваша, зависит выбор инструмента.

Путать их не стоит: инструмент для первой задачи будет казаться медленным во второй, а инструмент для второй - неточным в первой.

Почему доля ошибок измеряется в словах

Общепринятая мера качества распознавания - доля ошибок в словах: сколько слов заменено, пропущено или добавлено лишних на сотню. У нее есть особенность, о которой редко говорят: пропущенный предлог и перевранная фамилия весят одинаково, хотя для читателя это совершенно разные ошибки.

Поэтому на любую такую цифру стоит смотреть как на порядок величины, а не как на приговор. На чистой начитанной речи ошибок единицы процентов, на шумной записи с перебивками заметно больше, и мы этого не скрываем.

Что получится на выходе
ФорматЧто внутриЗачем нужен
TXTтекст с отметками времени по репликамчитать и править
MDтот же текст в разметке Markdown со сводкой записизаметки и базы знаний
DOCXтекст с абзацамисдать документом
SRTтекст с таймкодамисубтитры к видео
JSONфразы и слова со временем начала и конца, говорящиедальнейшая обработка

Чего эта страница не делает

Частые вопросы

Нужен ли ключ или регистрация

Нет. Ни ключа, ни проекта, ни привязки карты. Ограничение техническое: час записи в сутки с одного человека.

Есть ли у вас API для встраивания

Публичного нет. Для встраивания в свою систему ставится «Сибирь.ИИ» на ваше оборудование, тогда распознавание идет внутри вашего контура.

Делаете ли вы text to speech, озвучивание текста

Нет. Здесь только обратное направление: речь в текст.

Какая модель используется

Whisper large-v3 на нашей видеокарте. На чистой начитанной речи доля ошибок в словах единицы процентов, подробнее на странице про точность.

Другие способы расшифровки

Все инструменты на одной странице