Bloknot распознаёт речь на 100+ языках и расставляет таймкоды по фразам. Насколько точным будет текст, решает запись: чистый звук расшифровывается заметно лучше, чем разговор с эхом и шумом. Ниже — что именно на это влияет.
Распознавание не «слушает смысл» — оно разбирает звук. Поэтому всё, что мешает расслышать речь человеку, мешает и нейросети.
Расшифровка разбита на фразы, у каждой — таймкод и метка говорящего. Спорное слово не нужно искать на слух: клик по строке возвращает ровно в то место записи, где оно прозвучало.

Сервисы распознавания речи любят круглые проценты в рекламе. Вот честная версия — без цифр там, где их нет.
Обработка одна и та же, а текст получается разного качества. Разница — в том, что попало в микрофон.

Микрофон близко, говорит один человек, вокруг тихо. Так пишутся подкасты, диктофонные заметки и интервью один на один. Текст выходит почти готовым: править остаётся термины и имена.

Телефон на середине стола, голый кабинет, кондиционер. Голос доходит до микрофона дважды — прямо и отражением, — и слова сливаются. Ошибок будет больше, особенно у дальних участников.

На планёрке или фокус-группе люди договаривают друг за друга. Там, где два голоса накладываются, страдает и текст, и метки говорящих: реплика может уйти не тому участнику.

Фамилию, препарат или аббревиатуру нейросеть могла услышать по-своему. Найдите слово поиском, послушайте это место по таймкоду и исправьте прямо в кабинете — выгружать и открывать файл в редакторе не нужно.
Загрузите типичный для вас файл — через пару минут увидите, какой текст нейросеть делает именно из вашего звука.

Оплата картой РФ · Ежегодно — выгоднее на 20% · Для Free карта не нужна
Ассистент подключается к созвону по ссылке — в Телемосте, СберДжазе, Контур.Толке, МТС Линк, Zoom, Google Meet и Teams — и пишет звук прямо с площадки, а не микрофоном из комнаты. Такая запись обычно чище диктофона на столе, и расшифровка получается точнее.
Страница про созвоны →