Транскрибатор: аудио и видео в текст
Загрузите запись и получите текст. Бесплатно, без регистрации, без водяных знаков и без урезанной пробной версии. Работает с аудио, видео и голосовыми сообщениями.
Файл до 2 ГБ, до 3 часов звучания. Час записи обрабатывается примерно за две минуты. Результат отдается файлами: текст, текст с таймкодами, субтитры SRT и документ Word. Исходная запись удаляется сразу после расшифровки, готовые файлы - через 24 часа или раньше, по вашей кнопке.
Откуда запись 7
- Голосовое сообщение из Телеграма в текст голосовые из мессенджера
- Голосовое сообщение из WhatsApp в текст голосовые из мессенджера
- Видео и голосовые ВКонтакте в текст видео и голосовые из ВКонтакте
- Расшифровка видео с YouTube в текст текст и субтитры из ролика
- Транскрибация звонков записи телефонных разговоров
- Голосовое сообщение и запись с диктофона в текст голосовые и диктофонные записи
- Расшифровка совещаний и встреч запись встречи с разделением по говорящим
Какой формат 3
- MP3 в текст самый частый формат записи
- MP4 в текст видеофайл в текст
- Аудиоформаты в текст: WAV, M4A, OGG и остальные все прочие форматы записи
Что нужно на выходе 5
- Сделать субтитры к видео онлайн готовый файл SRT из видео
- Конспект по видео: сначала текст расшифровка как основа конспекта
- Стенограмма: что это такое что такое стенограмма и как ее получить
- Диаризация: кто из говорящих что сказал разделение реплик по голосам
- Извлечь текст из песни слова песни из аудиофайла
Как это устроено 6
- Транскрибация: что это такое значение слова и как это делается
- Speech to text: речь в текст распознавание речи без ключей и квот
- Нейросеть, которая переводит речь в текст какая модель считает и с какой точностью
- Программа для перевода аудио в текст онлайн без установки и установка в свой контур
- Голосовой ввод: надиктовать текст запись с микрофона прямо на странице
- Точность расшифровки: от чего она зависит что означает доля ошибок и где она хуже
Бесплатно и без регистрации. Расшифровку ведет программа «Сибирь.ИИ» на карте в Новосибирске. Записи не покидают Россию и не передаются третьим лицам. Оператор - ООО «ФИИ», ИНН 5402076457. Порядок обработки описан в политике обработки персональных данных. Обновлено .
Что это
Это бесплатный перевод аудио и видео в текст. Вы загружаете файл, программа распознает речь и отдает расшифровку пятью файлами сразу: текст с таймкодами, тот же текст в разметке Markdown со сводкой записи, субтитры SRT, документ Word и JSON со временем каждого слова. Ничего настраивать не нужно, русский язык определяется по умолчанию.
Сервис сделан не как отдельный продукт, а как открытая часть программы «Сибирь.ИИ». Мы держим свою видеокарту под обучение моделей, и свободное время этой карты отдаем на расшифровку. Поэтому у сервиса нет платной версии: платить не за что, оборудование все равно наше и все равно работает.
Как это еще называют
Одну и ту же задачу ищут разными словами: транскрибатор, расшифровка аудио, перевод звука в текст, транскрибация, speech to text. Это все про одно: взять запись и получить из нее текст. Отдельно стоит только синтез речи, то есть обратная задача - озвучить написанный текст голосом. Этого мы не делаем.
Как это работает
- Загрузите файл. Поддерживаются MP3, WAV, M4A, OGG, OPUS, FLAC, AAC, AMR, WMA и видео MP4, MOV, MKV, AVI, WEBM.
- Дорожка отделяется от видео и сжимается, поэтому гигабайтный ролик не отнимает у вас полчаса на загрузку.
- Речь распознает модель Whisper large-v3 на нашей видеокарте.
- Готовые файлы можно скачать сразу или забрать по ссылке в течение суток.
Час записи обрабатывается примерно за две минуты. Это замер на нашей карте, снятый в тот момент, когда она параллельно была занята обучением модели.
Кому это чаще всего нужно
- Студентам и научным сотрудникам. Лекция в текст, интервью респондента дословно, запись семинара, по которой потом ищешь нужное место.
- Журналистам. Расшифровка интервью, чтобы цитировать точно, а не по памяти.
- Юристам. Записи переговоров и заседаний, где важно именно дословно.
- Кадровикам. Собеседования: сравнить ответы кандидатов проще по тексту.
- Руководителям. Совещание, с которого нужен не пересказ, а что было сказано.
- Поддержке и продажам. Разбор звонков: что обещали и о чем договорились.
Отдельная и большая часть - люди, которым просто удобнее читать. Час записи просматривается глазами за несколько минут, а слушается час.
Сколько это стоит
Нисколько. Нет подписки, нет пробного периода, нет платы за минуты. Ограничение одно и оно техническое: один файл до 2 ГБ и до трех часов звучания, а суммарно с одного человека принимается час записи в сутки. Это не маркетинговая уловка, а честная граница: карта одна, и если ее занять целиком, очередь встанет для всех.
Для сравнения, чтобы было понятно, много это или мало. У одного из соседних сервисов бесплатно тридцать минут на файл и три файла в сутки, а дальше платная подписка. Здесь регистрации нет вовсе, а файл принимается до трех часов.
Если этого не хватает, ту же программу можно поставить себе: она входит в состав «Сибирь.ИИ» и работает на вашем оборудовании без обращений наружу.
Точность
На чистой начитанной речи доля ошибок в словах единицы процентов. Точную цифру мы не называем: подтвердить ее прямо сейчас мы не можем, а неподтвержденное число ничем не лучше чужих «99 процентов». На шумной записи, при перебивках и сильном акценте ошибок будет больше, и мы этого не скрываем.
Формулировка «точность 99 процентов» без указания, на чем она получена, не значит ничего: на студийной начитке столько дает почти любая современная модель, а на записи совещания с четырьмя перебивающими людьми не дает ни одна. Поэтому своей точной цифры мы тоже не ставим: пока мы не можем показать замер, наше число было бы таким же ничего не значащим.
Что эта величина считает, от чего зависит и как проверить ее на своей записи - на отдельной странице про точность расшифровки.
Где записи хранятся
Запись обрабатывается на видеокарте в Новосибирске и не уходит в зарубежные облака. Ни один шаг обработки не обращается наружу: модель распознавания работает на нашем оборудовании, а не через чужой интерфейс.
Исходная запись удаляется сразу после расшифровки, готовые файлы живут сутки. Удалить их раньше можно кнопкой на странице результата. Расшифровки не читаются людьми, не используются для обучения моделей и не передаются третьим лицам. Оператор обработки - ООО «Финансовый искусственный интеллект», ИНН 5402076457, Новосибирск.
Что умеет сверх простого текста
Таймкоды
Каждая фраза получает метку времени. По ней легко найти нужное место в записи, не переслушивая целиком.
Субтитры
Файл SRT подходит для YouTube, VK Видео, Rutube и любого видеоредактора. Подробнее на странице создания субтитров.
Разделение по говорящим
Для интервью и совещаний программа помечает реплики разных людей. Имен она не знает и подписывает их как «Говорящий 1» и «Говорящий 2». Разделение примерно удваивает время расчета, поэтому включается отдельной галочкой.
Тишина и музыка
На участках без речи модели любят придумывать фразы вроде «Продолжение следует» или названия несуществующих субтитровщиков. Мы такие куски вычищаем, и это отдельная проверка, а не побочный эффект.
| Формат | Что внутри | Зачем нужен |
|---|---|---|
| TXT | текст с отметками времени по репликам | читать и править |
| MD | тот же текст в разметке Markdown со сводкой записи | заметки и базы знаний |
| DOCX | текст с абзацами | сдать документом |
| SRT | текст с таймкодами | субтитры к видео |
| JSON | фразы и слова со временем начала и конца, говорящие | дальнейшая обработка |
Чего сервис не делает
- Не переводит на другой язык. Расшифровка идет на том языке, на котором говорят.
- Не редактирует текст по смыслу и не пишет за вас пересказ на основе домыслов.
- Не распознает текст на картинке и надписи в кадре: работа идет со звуковой дорожкой.
- Не восстанавливает то, чего не слышно. Если запись неразборчива, это будет видно по расшифровке, а не спрятано за гладкими фразами.
Частые вопросы
Правда бесплатно и без регистрации
Да. Почту оставлять не нужно, карту привязывать не нужно, платной версии этой же расшифровки нет. Ограничение техническое: час записи в сутки с одного человека.
Какие форматы принимаются
Аудио MP3, WAV, M4A, OGG, OPUS, FLAC, AAC, AMR, WMA и видео MP4, MOV, MKV, AVI, WEBM. Голосовые сообщения из мессенджеров это обычно OGG или M4A, они принимаются как есть.
Сколько ждать
Час записи обрабатывается примерно за две минуты, плюс время на загрузку файла. При разделении по говорящим время примерно удваивается. Если в очереди есть чужие работы, страница покажет ожидание честно, а не крутит бесконечный индикатор.
Что с моей записью после расшифровки
Исходная запись удаляется сразу после расшифровки, готовые файлы через сутки или раньше, по вашей кнопке. Записи не используются для обучения моделей и не передаются третьим лицам. Обработка идет на нашем оборудовании в России.
Насколько точно распознается русская речь
На чистой начитанной речи доля ошибок в словах единицы процентов. Точную цифру мы не называем, пока не можем ее показать. На шумной записи с перебивками ошибок будет заметно больше.
Можно ли расшифровать запись на английском или казахском
Да, язык определяется автоматически. Русский стоит по умолчанию, потому что чаще всего приносят именно его.