Сибирь AI

Транскрибатор: аудио и видео в текст

Загрузите запись и получите текст. Бесплатно, без регистрации, без водяных знаков и без урезанной пробной версии. Работает с аудио, видео и голосовыми сообщениями.

Файл до 2 ГБ, до 3 часов звучания. Час записи обрабатывается примерно за две минуты. Результат отдается файлами: текст, текст с таймкодами, субтитры SRT и документ Word. Исходная запись удаляется сразу после расшифровки, готовые файлы - через 24 часа или раньше, по вашей кнопке.

Откуда запись 7

Какой формат 3

Что нужно на выходе 5

Как это устроено 6

Бесплатно и без регистрации. Расшифровку ведет программа «Сибирь.ИИ» на карте в Новосибирске. Записи не покидают Россию и не передаются третьим лицам. Оператор - ООО «ФИИ», ИНН 5402076457. Порядок обработки описан в политике обработки персональных данных. Обновлено .

Что это

Это бесплатный перевод аудио и видео в текст. Вы загружаете файл, программа распознает речь и отдает расшифровку пятью файлами сразу: текст с таймкодами, тот же текст в разметке Markdown со сводкой записи, субтитры SRT, документ Word и JSON со временем каждого слова. Ничего настраивать не нужно, русский язык определяется по умолчанию.

Сервис сделан не как отдельный продукт, а как открытая часть программы «Сибирь.ИИ». Мы держим свою видеокарту под обучение моделей, и свободное время этой карты отдаем на расшифровку. Поэтому у сервиса нет платной версии: платить не за что, оборудование все равно наше и все равно работает.

Путь записи до текстаЗаписьРаспознаваниевидеокарта в НовосибирскеТекстСубтитры SRTДокумент
Запись уходит на нашу видеокарту в Новосибирске, а обратно приходит текст с таймкодами, субтитры и документ.

Как это еще называют

Одну и ту же задачу ищут разными словами: транскрибатор, расшифровка аудио, перевод звука в текст, транскрибация, speech to text. Это все про одно: взять запись и получить из нее текст. Отдельно стоит только синтез речи, то есть обратная задача - озвучить написанный текст голосом. Этого мы не делаем.

Как это работает

Час записи обрабатывается примерно за две минуты. Это замер на нашей карте, снятый в тот момент, когда она параллельно была занята обучением модели.

Кому это чаще всего нужно

Отдельная и большая часть - люди, которым просто удобнее читать. Час записи просматривается глазами за несколько минут, а слушается час.

Сколько это стоит

Нисколько. Нет подписки, нет пробного периода, нет платы за минуты. Ограничение одно и оно техническое: один файл до 2 ГБ и до трех часов звучания, а суммарно с одного человека принимается час записи в сутки. Это не маркетинговая уловка, а честная граница: карта одна, и если ее занять целиком, очередь встанет для всех.

Для сравнения, чтобы было понятно, много это или мало. У одного из соседних сервисов бесплатно тридцать минут на файл и три файла в сутки, а дальше платная подписка. Здесь регистрации нет вовсе, а файл принимается до трех часов.

Если этого не хватает, ту же программу можно поставить себе: она входит в состав «Сибирь.ИИ» и работает на вашем оборудовании без обращений наружу.

Точность

На чистой начитанной речи доля ошибок в словах единицы процентов. Точную цифру мы не называем: подтвердить ее прямо сейчас мы не можем, а неподтвержденное число ничем не лучше чужих «99 процентов». На шумной записи, при перебивках и сильном акценте ошибок будет больше, и мы этого не скрываем.

Формулировка «точность 99 процентов» без указания, на чем она получена, не значит ничего: на студийной начитке столько дает почти любая современная модель, а на записи совещания с четырьмя перебивающими людьми не дает ни одна. Поэтому своей точной цифры мы тоже не ставим: пока мы не можем показать замер, наше число было бы таким же ничего не значащим.

Что эта величина считает, от чего зависит и как проверить ее на своей записи - на отдельной странице про точность расшифровки.

Где записи хранятся

Запись обрабатывается на видеокарте в Новосибирске и не уходит в зарубежные облака. Ни один шаг обработки не обращается наружу: модель распознавания работает на нашем оборудовании, а не через чужой интерфейс.

Исходная запись удаляется сразу после расшифровки, готовые файлы живут сутки. Удалить их раньше можно кнопкой на странице результата. Расшифровки не читаются людьми, не используются для обучения моделей и не передаются третьим лицам. Оператор обработки - ООО «Финансовый искусственный интеллект», ИНН 5402076457, Новосибирск.

Что умеет сверх простого текста

Таймкоды

Каждая фраза получает метку времени. По ней легко найти нужное место в записи, не переслушивая целиком.

Субтитры

Файл SRT подходит для YouTube, VK Видео, Rutube и любого видеоредактора. Подробнее на странице создания субтитров.

Разделение по говорящим

Для интервью и совещаний программа помечает реплики разных людей. Имен она не знает и подписывает их как «Говорящий 1» и «Говорящий 2». Разделение примерно удваивает время расчета, поэтому включается отдельной галочкой.

Тишина и музыка

На участках без речи модели любят придумывать фразы вроде «Продолжение следует» или названия несуществующих субтитровщиков. Мы такие куски вычищаем, и это отдельная проверка, а не побочный эффект.

Что получится на выходе
ФорматЧто внутриЗачем нужен
TXTтекст с отметками времени по репликамчитать и править
MDтот же текст в разметке Markdown со сводкой записизаметки и базы знаний
DOCXтекст с абзацамисдать документом
SRTтекст с таймкодамисубтитры к видео
JSONфразы и слова со временем начала и конца, говорящиедальнейшая обработка

Чего сервис не делает

Частые вопросы

Правда бесплатно и без регистрации

Да. Почту оставлять не нужно, карту привязывать не нужно, платной версии этой же расшифровки нет. Ограничение техническое: час записи в сутки с одного человека.

Какие форматы принимаются

Аудио MP3, WAV, M4A, OGG, OPUS, FLAC, AAC, AMR, WMA и видео MP4, MOV, MKV, AVI, WEBM. Голосовые сообщения из мессенджеров это обычно OGG или M4A, они принимаются как есть.

Сколько ждать

Час записи обрабатывается примерно за две минуты, плюс время на загрузку файла. При разделении по говорящим время примерно удваивается. Если в очереди есть чужие работы, страница покажет ожидание честно, а не крутит бесконечный индикатор.

Что с моей записью после расшифровки

Исходная запись удаляется сразу после расшифровки, готовые файлы через сутки или раньше, по вашей кнопке. Записи не используются для обучения моделей и не передаются третьим лицам. Обработка идет на нашем оборудовании в России.

Насколько точно распознается русская речь

На чистой начитанной речи доля ошибок в словах единицы процентов. Точную цифру мы не называем, пока не можем ее показать. На шумной записи с перебивками ошибок будет заметно больше.

Можно ли расшифровать запись на английском или казахском

Да, язык определяется автоматически. Русский стоит по умолчанию, потому что чаще всего приносят именно его.