Голосовой ввод: надиктовать текст
Нажмите «Записать с микрофона», наговорите текст, остановите запись и нажмите расшифровку. Бесплатно, без регистрации и без установки программ.
Файл до 2 ГБ, до 3 часов звучания. Час записи обрабатывается примерно за две минуты. Результат отдается файлами: текст, текст с таймкодами, субтитры SRT и документ Word. Исходная запись удаляется сразу после расшифровки, готовые файлы - через 24 часа или раньше, по вашей кнопке.
Бесплатно и без регистрации. Расшифровку ведет программа «Сибирь.ИИ» на карте в Новосибирске. Записи не покидают Россию и не передаются третьим лицам. Оператор - ООО «ФИИ», ИНН 5402076457. Порядок обработки описан в политике обработки персональных данных. Обновлено .
Сразу о главном: это не ввод в реальном времени
В телефоне и в текстовых редакторах голосовой ввод работает иначе: вы говорите, и слова появляются на экране сразу. Здесь по-другому. Вы записываете речь целиком, потом запись уходит на расчет и через время возвращается текстом.
Зачем тогда так. Потому что расчет идет на большой модели, а не на телефоне, и результат заметно точнее: она слышит слово в контексте всей фразы, а не по мере произнесения. Для длинной надиктовки это важнее мгновенности.
Час записи обрабатывается примерно за две минуты. Это замер на нашей карте.
Когда это удобнее набора руками
- Надиктовать письмо или заметку, когда руки заняты.
- Наговорить черновик статьи: говорить быстрее, чем печатать, примерно втрое.
- Записать мысль, пока она не ушла, и разобрать текстом позже.
- Продиктовать список дел или состав задачи.
Отдельно это выручает тех, кому набор руками дается тяжело. Ограничений по времени внутри одной записи нет, кроме общего суточного: час записи с одного человека.
Как записать, чтобы получилось хорошо
- Говорите обычным темпом, не диктуйте по слогам: модель обучена на живой речи.
- Знаки препинания она расставляет сама, называть их вслух не нужно.
- Микрофон ближе ко рту, окно закрыто: шум улицы съедает окончания слов.
- Если сбились, не начинайте заново: скажите фразу еще раз, лишнее уберете в тексте.
Про точность: на чистой русской речи доля ошибок в словах единицы процентов, на шумной записи заметно больше. Почему мы не называем точную цифру.
Надиктовка обычно распознается лучше среднего: один голос, спокойный темп, нет перебиваний. Хуже будет с редкими фамилиями, названиями компаний и терминами.
Что нужно от браузера
Разрешение на микрофон, о нем браузер спросит сам при первом нажатии. Запись работает по защищенному соединению, то есть на этом сайте. Если разрешение не дали или браузер старый, кнопка скажет об этом прямо, а не промолчит.
Пока вы не нажали расшифровку, запись остается у вас в браузере и никуда не отправляется.
Что происходит с записью потом
Запись обрабатывается на видеокарте в Новосибирске и не уходит в зарубежные облака.
Исходная запись удаляется сразу после расшифровки, готовые файлы живут сутки или меньше, если нажать кнопку. Расшифровки не читаются людьми и не используются для обучения моделей.
Чего здесь нет
- Нет ввода в чужое окно: текст появляется на этой странице, а не в вашем редакторе.
- Нет команд вроде «новая строка» и «точка»: пунктуация ставится сама.
- Нет синтеза речи, то есть обратной задачи.
- Нет перевода на другой язык.
Почему надиктовать быстрее, чем набрать
Обычная скорость речи - сто двадцать слов в минуту. Обычная скорость набора вслепую - от сорока до шестидесяти, а на телефоне вдвое меньше. Разница в три-пять раз, и на длинных текстах она решает.
Расплата за скорость известна: устная речь получается рыхлой. Наговоренный текст почти всегда надо сокращать, и это нормальная часть работы, а не признак неудачи. Посчитать, сколько вышло, поможет счетчик, а убрать лишнее - чистка.
| Формат | Что внутри | Зачем нужен |
|---|---|---|
| TXT | текст с отметками времени по репликам | читать и править |
| MD | тот же текст в разметке Markdown со сводкой записи | заметки и базы знаний |
| DOCX | текст с абзацами | сдать документом |
| SRT | текст с таймкодами | субтитры к видео |
| JSON | фразы и слова со временем начала и конца, говорящие | дальнейшая обработка |
Как наговаривать, чтобы потом меньше править
- Скажите вслух план из трех пунктов, прежде чем начать. Он задаст структуру, и текст не расползется.
- Проговаривайте знаки препинания там, где они важны: «точка», «новый абзац». В расшифровке это останется словами, но найти и заменить их проще, чем восстанавливать структуру по памяти.
- Не переделывайте фразу на ходу. Если сбились, скажите «еще раз» и повторите целиком: при правке такие места видны сразу.
- Держите микрофон на одном расстоянии. Перепады громкости мешают больше, чем ровный фоновый шум.
Частые вопросы
Текст появляется сразу, пока я говорю
Нет. Вы записываете речь, потом она уходит на расчет и возвращается текстом. Час записи обрабатывается около двух минут, короткая заметка - секунды.
Нужно ли называть знаки препинания
Нет, они расставляются сами. Говорите обычным темпом.
Сколько можно наговорить за раз
Внутри одной записи ограничения нет, но общий суточный лимит это час записи с одного человека.
Куда уходит запись с микрофона
Пока вы не нажали расшифровку, никуда: она лежит у вас в браузере. После - на нашу видеокарту в Новосибирске, и удаляется сразу после расчета.
Работает ли это на телефоне
Да, в современных браузерах. Разрешение на микрофон спрашивается так же.
Другие способы расшифровки
- Точность расшифровки: от чего она зависит - что означает доля ошибок и где она хуже
- Расшифровка видео с YouTube в текст - текст и субтитры из ролика
- Голосовое сообщение и запись с диктофона в текст - голосовые и диктофонные записи
- Сделать субтитры к видео онлайн - готовый файл SRT из видео
- Расшифровка совещаний и встреч - запись встречи с разделением по говорящим
- Нейросеть, которая переводит речь в текст - какая модель считает и с какой точностью
- Программа для перевода аудио в текст - онлайн без установки и установка в свой контур
- Извлечь текст из песни - слова песни из аудиофайла