Бесплатно 90 минут

Нейросеть для расшифровки аудио в текст

Bloknot распознаёт речь на 100+ языках и расставляет таймкоды по фразам. Насколько точным будет текст, решает запись: чистый звук расшифровывается заметно лучше, чем разговор с эхом и шумом. Ниже — что именно на это влияет.

Блокнот в наушниках показывает карточку с расшифровкой: звуковая волна и строки текста
перетащи файл
или вставь ссылку

Перетащите файл сюда

MP3 · WAV · M4A · MP4 · MOV · OGG · FLAC · WEBM

Вставьте ссылку

YouTube · TikTok · Instagram

Записать прямо в браузере

Нажмите, чтобы начать запись с микрофона

Бесплатно 90 мин/месбез карты100+ языков
100+
языков распознавания
~90сек
на час записи
среднее время обработки
7
форматов выгрузки
Word, PDF, текст, Markdown, SRT, VTT, JSON
90
минут бесплатно
чтобы проверить на своей записи
Как это работает

Как нейросеть превращает запись в текст

Распознавание не «слушает смысл» — оно разбирает звук. Поэтому всё, что мешает расслышать речь человеку, мешает и нейросети.

Загрузите записьАудио MP3, WAV, M4A, OGG, OPUS, FLAC, WEBM и видео MP4, MOV, MKV — конвертировать заранее не нужно; по ссылке работают YouTube, TikTok и Instagram
Нейросеть разбирает звук и восстанавливает слова100+ языков с автоопределением. Пунктуация расставляется по смыслу, а не сплошным потоком слов; голоса разделяются на реплики
Сверьте спорные места и поправьтеКлик по строке переносит к этому моменту записи. Фамилию или термин можно исправить прямо в кабинете, не выгружая файл
Чистота звукаФоновый шумЭхоДикцияТерминыНаложение голосов
Что вы получите

Текст, который легко сверить с записью

Расшифровка разбита на фразы, у каждой — таймкод и метка говорящего. Спорное слово не нужно искать на слух: клик по строке возвращает ровно в то место записи, где оно прозвучало.

  • Таймкоды по каждой фразе — сверка занимает секунды
  • Метки говорящих с переименованием под реальные имена
  • Поиск по тексту вместо повторного прослушивания
  • Правка прямо в кабинете: фамилии, термины, аббревиатуры
Расшифровка с таймкодами для сверки с записью в интерфейсе Bloknot
Мифы про ИИ-транскрибацию

Что на самом деле влияет на точность

Сервисы распознавания речи любят круглые проценты в рекламе. Вот честная версия — без цифр там, где их нет.

МифНейросеть распознаёт речь одинаково точно на любой записи
На делеВсё решает звук. Разговор в петличку с полуметра расшифровывается заметно лучше, чем та же беседа на громкой связи в переговорной с эхом. Человек-расшифровщик на этой записи спотыкается ровно там же.
МифТочность можно выразить одним процентом
На делеОдна цифра описывала бы одну конкретную запись, а не ваши. Мы не печатаем процент, который нечем подтвердить на русской речи. Честная формулировка: на чистой записи точность выше, на шумной — ниже, и проверяется это за пару минут на своём файле.
МифТермины, фамилии и аббревиатуры распознаются как обычные слова
На делеРедкая фамилия, название препарата или отраслевое сокращение — самое частое место ошибки: нейросеть подставляет похожее по звучанию слово. Там, где цена ошибки высока, такие места стоит пробежать глазами и поправить.
МифКогда говорят одновременно, разницы нет
На делеПеребивания и перекрёстная речь бьют и по тексту, и по разметке говорящих: два голоса в одной секунде звучат как один смазанный. На групповой дискуссии таких мест больше, чем на разговоре вдвоём.
МифАкцент и дикция для нейросети не имеют значения
На делеСильный акцент, торопливая или невнятная речь снижают точность — так же, как это происходит у человека на слух. Это не отдельная слабость машины, а свойство самой записи.
МифИИ понимает смысл разговора и догадается сам
На делеРаспознавание восстанавливает произнесённые слова, а не додумывает содержание. Если фразу заглушил кашель или проехавшая машина, нейросеть не «допишет» её по контексту — на этом месте будет пропуск или неточное слово.
Одна нейросеть, разные записи

ИИ-транскрибация: четыре записи и четыре результата

Обработка одна и та же, а текст получается разного качества. Разница — в том, что попало в микрофон.

Блокнот говорит в петличный микрофон, из него выходит ровная звуковая волна

Чистая запись — лучший результат

Микрофон близко, говорит один человек, вокруг тихо. Так пишутся подкасты, диктофонные заметки и интервью один на один. Текст выходит почти готовым: править остаётся термины и имена.

Блокнот в пустой комнате: звук от громкой связи отражается от стен и возвращается смазанным

Эхо и громкая связь — заметно хуже

Телефон на середине стола, голый кабинет, кондиционер. Голос доходит до микрофона дважды — прямо и отражением, — и слова сливаются. Ошибок будет больше, особенно у дальних участников.

Блокнот распутывает два наложившихся друг на друга облачка речи

Спор и перебивания — самое трудное место

На планёрке или фокус-группе люди договаривают друг за друга. Там, где два голоса накладываются, страдает и текст, и метки говорящих: реплика может уйти не тому участнику.

Блокнот с карандашом и лупой исправляет одно слово в готовой расшифровке

Спорное слово правится за секунды

Фамилию, препарат или аббревиатуру нейросеть могла услышать по-своему. Найдите слово поиском, послушайте это место по таймкоду и исправьте прямо в кабинете — выгружать и открывать файл в редакторе не нужно.

Не верьте цифрам в рекламе

Проверьте на своей записи бесплатно

Загрузите типичный для вас файл — через пару минут увидите, какой текст нейросеть делает именно из вашего звука.

Блокнот в наушниках показывает карточку с расшифровкой: звуковая волна и строки текста
Тарифы
Free
0 ₽ навсегда
Без карты · без истечения пробного периода
Для знакомства, разовых задач и коротких клипов.
  • 90 минут расшифровки в месяц
  • ИИ-ассистент на встречу — минуты из месячного лимита
  • Файлы до 1 ГБ, длительность не ограничена
  • Распознавание речи на 100+ языках
  • Разбивка по говорящим
  • ИИ-чат по записи — 10 вопросов в месяц
  • 1 ИИ-отчёт на запись
  • API доступен
  • Экспорт в любом формате: DOCX, PDF, TXT, MD, SRT, VTT, JSON
  • Аудио удаляется после расшифровки, текст остаётся навсегда
Начать бесплатно
Нужно подтвердить email
Максимум
Team
2 390 ₽ / месяц
Оплата 28 690 ₽/год · экономия 20%
Для отделов и компаний: минуты общие на всю команду.
  • 2 500 минут — общий пул команды
  • Файлы до 5 ГБ
  • Всё из Pro
  • ИИ-чат без ограничений
  • До 3 ИИ-отчётов на каждую запись
  • Рабочие пространства и отделы
  • Докупка минут пакетами
  • Дополнительные места — 990 ₽ за участника
  • Приоритетная поддержка
Выбрать Team
Большая команда? Напишите нам

Оплата картой РФ · Ежегодно — выгоднее на 20% · Для Free карта не нужна

Частые вопросы
Какая точность распознавания на русском языке?+
Мы не публикуем процент: одна цифра описывала бы одну конкретную запись, а не вашу. На чистом звуке — микрофон близко, говорит один человек — текст выходит почти готовым. На записи с эхом, шумом улицы или наложением голосов ошибок заметно больше. Проверить это на своём файле можно бесплатно, 90 минут в месяц.
Почему у других сервисов проценты есть, а у вас нет?+
Опубликованные проценты обычно измерены на подготовленных тестовых наборах и чаще всего на английской речи. Переносить чужую цифру на русский язык и на вашу конкретную запись — значит обещать то, что нечем подтвердить. Мы вместо этого показываем, от чего результат зависит.
Это Whisper?+
Нет. Bloknot работает не на Whisper, а на коммерческой нейросети распознавания речи. Сравнений и замеров с открытыми моделями мы не публикуем — вместо чужих бенчмарков честнее прогнать свою типичную запись и посмотреть результат.
Чем ИИ-транскрибация отличается от расшифровки вручную?+
Результатом занимается нейросеть, а не человек: час записи обрабатывается примерно за полторы минуты, текст сразу разбит на фразы с таймкодами и метками говорящих. Спорные места — фамилии, термины — остаются на вас, но правится это в готовом тексте, а не набирается с нуля.
«Нейросеть, переводящая аудио в текст» — это перевод на другой язык?+
Нет. Bloknot записывает речь словами на том же языке, на котором говорят в записи: получается текст, а не перевод. Если нужен именно перевод на другой язык, готовую расшифровку можно перевести отдельно — на тарифе Pro.
Что сильнее всего портит точность?+
Четыре вещи: расстояние до микрофона и фоновый шум, эхо в помещении и громкая связь, наложение голосов при перебиваниях, а также редкие фамилии, термины и аббревиатуры. Акцент и невнятная дикция добавляются к этому списку.
Как записать так, чтобы текст вышел точнее?+
Держите микрофон ближе к говорящему, выключите музыку и кондиционер, по возможности откажитесь от громкой связи в пользу гарнитуры. На созвоне лучше подключить ассистента Bloknot: он берёт звук с площадки, а не из комнаты.
Можно исправить ошибку в готовом тексте?+
Да. Найдите слово поиском, послушайте это место по таймкоду и отредактируйте строку прямо в кабинете. Метки говорящих переименовываются в настоящие имена. Расшифровка не заморожена в том виде, в каком её отдала нейросеть.
Можно заранее подсказать нейросети список терминов?+
Пока нет: словаря своих терминов и имён в сервисе нет, и обещать его мы не будем. Специфичную лексику проще поправить в готовом тексте — обычно это несколько слов, повторяющихся по всей расшифровке.
Точность одинаковая для файла и для записи с созвона?+
Распознавание одно и то же — разница только в звуке. У записи с созвона он обычно чище: ассистент пишет звук с площадки, тогда как диктофон в переговорной собирает ещё и эхо, стук чашек и шум из коридора.
Какие форматы принимает сервис?+
Аудио — MP3, WAV, M4A, OGG, OPUS, FLAC, WEBM. Видео — MP4, MOV, MKV, WEBM, звук извлекается автоматически. По прямой ссылке работают YouTube, TikTok и Instagram; записи с других площадок сначала скачайте и загрузите файлом.
Что происходит с записью после расшифровки?+
Исходный файл удаляется автоматически в течение суток, а расшифровка остаётся в кабинете — её можно открыть, поправить и скачать в любой момент. На пользовательских данных сервис не обучается.
Откуда берётся чистый звук

На созвон Bloknot приходит сам

Ассистент подключается к созвону по ссылке — в Телемосте, СберДжазе, Контур.Толке, МТС Линк, Zoom, Google Meet и Teams — и пишет звук прямо с площадки, а не микрофоном из комнаты. Такая запись обычно чище диктофона на столе, и расшифровка получается точнее.

Страница про созвоны
Блокнот у ноутбука с видеозвонком: от каждого участника идёт своя чистая звуковая дорожка