Сибирь AI

Голосовое сообщение и запись с диктофона в текст

Загрузите голосовое из мессенджера или запись с диктофона и получите текст. Форматы OGG, OPUS, M4A, WAV, AMR принимаются как есть, конвертировать не нужно.

Файл до 2 ГБ, до 3 часов звучания. Час записи обрабатывается примерно за две минуты. Результат отдается файлами: текст, текст с таймкодами, субтитры SRT и документ Word. Исходная запись удаляется сразу после расшифровки, готовые файлы - через 24 часа или раньше, по вашей кнопке.

Бесплатно и без регистрации. Расшифровку ведет программа «Сибирь.ИИ» на карте в Новосибирске. Записи не покидают Россию и не передаются третьим лицам. Оператор - ООО «ФИИ», ИНН 5402076457. Порядок обработки описан в политике обработки персональных данных. Обновлено .

Голосовые сообщения

Голосовое из мессенджера это обычно файл OGG или M4A. Сохраните его и загрузите сюда: переименовывать и конвертировать не нужно. Короткое сообщение расшифровывается за несколько секунд.

Расшифровка удобна там, где слушать неуместно: на совещании, в транспорте без наушников, при разборе десятка сообщений подряд. Текст можно искать глазами, а голосовое нельзя.

Путь записи до текстаЗаписьРаспознаваниевидеокарта в НовосибирскеТекстСубтитры SRTДокумент
Запись уходит на нашу видеокарту в Новосибирске, а обратно приходит текст с таймкодами, субтитры и документ.

Записи с диктофона

Диктофонные файлы приносят отдельную беду, о которой стоит знать. У части записей в заголовке WAV занижен размер блока данных: это случается, когда запись оборвалась или была дописана позже. Обычный проигрыватель честно останавливается там, где велел заголовок, и 46 минут превращаются в 5.

Мы такие файлы читаем принудительно целиком и сверяем длительность с расчетом по размеру файла. Если заголовок врет, расшифровка все равно будет полной. Это отдельная проверка, которую мы завели после того, как сами на этом обожглись.

Качество записи

Про точность: на чистой русской речи доля ошибок в словах единицы процентов, на шумной записи заметно больше. Почему мы не называем точную цифру.

Диктофон в кармане, запись через стол, шум улицы - все это сказывается. Программа не выдумывает то, чего не слышно: неразборчивый кусок будет виден в тексте, а не заглажен правдоподобной фразой.

На участках тишины модели склонны сочинять. Мы вычищаем такие вставки отдельной проверкой, поэтому в расшифровке не появится «Продолжение следует» там, где просто молчали.

Несколько голосов

Если на записи говорят несколько человек, включите разделение по говорящим. Реплики будут помечены, имен программа не знает и подписывает их номерами. Для встреч и интервью это обычно и нужно: смотрите страницу расшифровки совещаний.

Запись обрабатывается на видеокарте в Новосибирске и не уходит в зарубежные облака.

Что получится на выходе
ФорматЧто внутриЗачем нужен
TXTтекст с отметками времени по репликамчитать и править
MDтот же текст в разметке Markdown со сводкой записизаметки и базы знаний
DOCXтекст с абзацамисдать документом
SRTтекст с таймкодамисубтитры к видео
JSONфразы и слова со временем начала и конца, говорящиедальнейшая обработка

Чего эта страница не делает

Частые вопросы

Какой формат у голосового сообщения

Чаще всего OGG или OPUS, иногда M4A. Все три принимаются как есть, конвертировать не нужно.

Почему моя запись с диктофона оказалась короче, чем на самом деле

Так бывает, когда в заголовке файла занижен размер блока данных. Мы читаем такие файлы принудительно целиком и сверяем длительность с расчетом по размеру, поэтому расшифровка получается полной.

Можно ли расшифровать шепот или тихую запись

Можно, но точность падает. Тихие места модель слышит хуже, и чем тише запись, тем больше пропусков. Неразборчивое останется неразборчивым, а не будет придумано.

Сколько хранится файл

Исходная запись удаляется сразу после расшифровки, готовые файлы через сутки или раньше, по вашей кнопке.

Другие способы расшифровки

Все инструменты на одной странице