Руководства · 2026-03-23 · 8 мин
Русская речь в расшифровке: где ошибается модель и что с этим делать
Имена и отчества, падежи, аббревиатуры, английские термины вперемешку с русскими — что распознаётся хуже всего в русскоязычных записях и как это чинить при вычитке.
Точность на русском — 94–96% при нормальной записи. Цифра выглядит хорошо, но она средняя: ошибки распределены неравномерно и концентрируются в предсказуемых местах.
Знать эти места полезно: вычитывать текст целиком незачем, достаточно проверять то, что ломается чаще всего.

Имена, фамилии, отчества
Самая частая категория ошибок, и объяснение простое: имён собственных бесконечно много, а контекст, по которому обычно восстанавливается слово, тут не помогает.
Русские отчества страдают отдельно — они длинные, произносятся бегло и часто сливаются: «Пал Палыч» вместо «Павел Павлович», «Сан Саныч» вместо «Александр Александрович». Модель распознаёт то, что услышала, и формально она права.
Что помогает: если участники называют друг друга по имени в начале записи, эти имена подставляются в расшифровку автоматически. Если нет — говорящие останутся «Спикер 1», «Спикер 2», и их можно переименовать в один клик, после чего имена подтянутся во весь текст и во все отчёты.
При вычитке имена стоит проверять всегда — это то место, где ошибка заметнее всего для читателя документа.
Падежи и согласование
Русский язык флективный: слово меняет форму в зависимости от роли в предложении. Модель обычно справляется, но на границах реплик и после пауз согласование иногда сбивается.
Выглядит это как «отправить документы клиенту Иванов» или «согласовали с отделом продаж бюджету». Смысл понятен, но в документе такое режет глаз.
Это правится при вычитке за секунды и почти никогда не искажает содержание — в отличие от ошибок в именах и цифрах.
Английские термины в русской речи
Профессиональный разговор на русском обычно наполовину состоит из заимствований: дедлайн, бэклог, оффер, кейс, апрув. Часть из них модель пишет кириллицей, часть латиницей, и единообразия ждать не стоит.
Отдельная сложность — термины, которые произносятся по-английски, но склоняются по-русски: «задеплоить», «отревьюить», «зашерить». Они распознаются по-разному от записи к записи.
Практический подход: если текст пойдёт в документ, приведите терминологию к одному виду при вычитке. Если текст нужен для поиска и понимания — оставьте как есть, смысл не страдает.
Аббревиатуры и цифры
Аббревиатуры распознаются то как слово, то по буквам: «ЖКХ» может стать «же ка ха», «НДС» — «эн дэ эс». Особенно если произносятся быстро.
Цифры и суммы — самое опасное место, потому что ошибка здесь меняет смысл, а не форму. «Двести пятьдесят» и «двести пятнадцать» на быстрой речи звучат похоже.
Даты и сроки — та же история: «до пятого» и «до пятнадцатого» различаются одним слогом.
Вывод простой: при вычитке цифры, даты и суммы проверяются в первую очередь. Их в тексте немного, а цена ошибки высокая — особенно в протоколе с поручениями.
Разговорная речь и слова-паразиты
Живая речь состоит не только из предложений. В ней есть «ну», «типа», «как бы», «вот», незаконченные фразы, самоперебивы.
Расшифровка передаёт это довольно точно, и первое впечатление от собственного текста обычно неприятное: кажется, что говорил бессвязно. На самом деле так говорят все — просто в устной форме это не заметно.
Для дословной стенограммы такое сохранение правильно: убирать сказанное нельзя. Для отчётов это неважно — они собирают суть, а не форму.
Диалекты, акценты, темп
Региональные особенности произношения распознаются хорошо: аканье, оканье, южное «г» проблемой не являются.
Заметнее влияет акцент неносителя, особенно в сочетании с быстрым темпом. Но и здесь связная речь на разборчивой записи даёт приемлемый результат.
Хуже всего распознаётся не акцент, а невнятность: бормотание, речь в сторону от микрофона, разговор вполголоса. Это не свойство языка, а свойство записи — про условия подробнее в статье про качество записи.
Мат и грубая лексика
Распознаётся, передаётся как есть, не цензурируется. В рабочих записях это иногда становится сюрпризом при чтении расшифровки совещания.
Если документ пойдёт дальше вас, такие места стоит просмотреть перед отправкой — не ради приличий, а потому что письменная форма усиливает сказанное. Фраза, брошенная в сердцах и забытая через минуту, в тексте выглядит намеренной.
Что проверять при вычитке: короткий список
Порядок по важности:
1. Цифры, суммы, даты, сроки — ошибка меняет смысл.
2. Имена и должности — заметнее всего для читателя.
3. Термины и названия продуктов — контекст здесь не помогает модели.
4. Места с рваными репликами — там звук не разобрался.
5. Всё остальное можно читать по диагонали.
На часовой записи это занимает десять-пятнадцать минут против четырёх часов ручного набора.
Почему «точность 95%» — цифра лукавая
Любой сервис называет похожие цифры, и все они верны при одном условии: хорошая запись, один говорящий, обычная лексика.
На практике точность — это не одно число, а диапазон. На чистой надиктовке она выше заявленной. На совещании впятером с эхом — заметно ниже. И падение обеспечивает не язык, а условия записи.
Отсюда единственный надёжный способ оценить: прогнать свой типичный материал. Не образцовый, а именно типичный — тот, с которым вы будете работать постоянно.
Что делает язык сложным для распознавания
У русского есть особенности, которых нет, например, у английского.
Свободный порядок слов. Модель хуже опирается на позицию слова в предложении, потому что она может быть любой.
Богатая морфология. Одно слово существует в десятке форм, и каждую нужно распознать.
Длинные слова. Средняя русская словоформа длиннее английской, и ошибка в середине слова заметнее.
Редукция гласных. В беглой речи безударные гласные проглатываются, и «сейчас» звучит как «щас», «вообще» как «ваще». Модель обычно восстанавливает нормативную форму, но не всегда.
Всё это не мешает работать — просто объясняет, почему разбирать русскую речь технически сложнее, чем кажется.
Когда стоит вычитывать, а когда нет
Ошибки в связном тексте почти не мешают пониманию: смысл восстанавливается контекстом, как при чтении текста с опечатками.
Не вычитывать — если текст нужен вам самим, чтобы вспомнить содержание или найти фрагмент.
Вычитать выборочно — если документ пойдёт коллегам: цифры, даты, имена, поручения.
Вычитать сплошь — если текст станет документом, публикацией или основанием в споре.
Большинство расшифровок относится к первой категории, а вычитывают их часто как третью. Это и есть главная потеря времени.
Пунктуация и абзацы
Знаки препинания расставляются автоматически, по интонации и паузам. Получается неплохо, но не идеально: там, где человек говорит длинными периодами без пауз, предложения выходят громоздкими.
Для чтения это не мешает. Для документа, который пойдёт дальше, стоит пройтись и разбить самые длинные конструкции — это пять минут работы на часовую запись.
Абзацы в расшифровке привязаны к смене говорящего, а не к смыслу. В монологе одного человека текст идёт сплошным блоком, и его разумно поделить самому.
Числительные
Отдельная категория, где ошибки заметны.
Модель обычно пишет числа цифрами, но не всегда единообразно: «двадцать пять» может стать «25», а может остаться словами. В документе это выглядит неаккуратно, зато правится поиском по тексту за минуту.
Сложнее с составными: «двести пятьдесят тысяч» на быстрой речи иногда распадается. Суммы в протоколах и договорённостях стоит проверять всегда — это первое, что нужно сверять при вычитке.
Проверить на своей записи
Первые 20 минут после регистрации бесплатны, карта не нужна. Возьмите фрагмент с терминологией и несколькими говорящими — по нему сразу видно, где придётся вычитывать, а где нет.## Что чаще всего приходится править
| Что | Почему ошибается | Как чинить |
|---|---|---|
| Фамилии и имена | система слышит их впервые | заменой по всему тексту |
| Названия компаний | звучат как обычные слова | заменой |
| Аббревиатуры | «эн-де-эс» вместо НДС | заменой |
| Числа и суммы | «двести пятьдесят» словами или цифрами | проверять глазами |
| Английские термины | пишутся то латиницей, то кириллицей | привести к одному виду |
| Падежные окончания | проглатываются в быстрой речи | по смыслу |
Хорошая новость: однотипные ошибки повторяются одинаково. Фамилия, которую
система услышала неверно, будет неверной по всему тексту — значит, правится
одной заменой, а не двадцатью правками.
Почему русский сложнее английского для распознавания
Дело не в качестве моделей, а в устройстве языка.
Свободный порядок слов. В английском позиция слова подсказывает его роль,
в русском — окончание. Проглоченное окончание в быстрой речи убирает эту подсказку.
Богатая морфология. У одного существительного дюжина форм, у глагола больше.
Система должна выбрать правильную по контексту, а не просто узнать слово.
Ударение меняет смысл. «Замок» и «замок», «мука» и «мука» — в тексте
различаются только по смыслу фразы.
Приставки съедаются. «Подписал» и «переписал» в беглой речи различаются
одним слогом, который часто проглатывают.
Практический вывод: на русском выигрыш от чистой записи больше, чем на английском.
Гарнитура даёт здесь больше, чем любые настройки.
Слова-паразиты и разговорная речь
Живая речь на бумаге выглядит непривычно у всех без исключения: «вот», «как бы»,
«э-э», начатые заново фразы, повторы. Это не ошибка распознавания — так говорят все,
просто обычно этого не видно.
Что с этим делать, зависит от задачи:
- Рабочий документ — не трогать. Смысл понятен, время дороже.
- Публикация — чистить обязательно, это половина работы редактора.
- Стенограмма для спора — не трогать ни в коем случае: там дословность
и есть ценность.
Почему «точность 95 процентов» — цифра лукавая
Любая заявленная точность верна только для условий, в которых её измеряли.
Обычно это дикторская речь в студии — а у вас переговорная и четверо участников.
Что действительно определяет результат, по убыванию:
1. Расстояние до микрофона. Главный фактор, важнее всех остальных вместе.
2. Наложение голосов. Одновременная речь — прямая потеря реплик.
3. Фоновый шум. Особенно ровный: кондиционер, вентилятор, улица.
4. Темп и артикуляция. Быстрая невнятная речь теряет окончания.
5. Незнакомая лексика. Термины и фамилии.
Ни один из пунктов не про сервис. Все пять — про запись.
Частые вопросы
Сколько времени занимает расшифровка? Около трёх минут на час записи.
Считается фактическая длина файла, округления в большую сторону нет.
Какие форматы принимаются? Практически любые: MP3, WAV, M4A, OGG, OPUS, AMR,
FLAC, а из видео — MP4, MOV, MKV, AVI, WEBM. Звук из видео отдельно вынимать
не нужно. Ограничение одно: файл до 2 ГБ, это примерно 25 часов.
Нужно ли что-то устанавливать? Нет, всё работает в браузере, в том числе
с телефона.
Что с разделением по говорящим? Работает по умолчанию, включать ничего
не нужно. Имена подставляются, если участники обращались друг к другу вслух;
иначе останутся «Спикер 1» и «Спикер 2», их можно переименовать вручную.
Есть ли таймкоды? Да, у каждой реплики. Спорное место в записи находится
за секунды, без перемотки наугад.
Сколько это стоит? Пакеты минут: 300 — 390 ₽, 1000 — 990 ₽, 3000 — 2690 ₽,
6000 — 4990 ₽. Минуты не сгорают год. Первые 20 минут бесплатны и не требуют карты.
На каких языках работает? На 73 языках, язык определяется автоматически.
Читайте также
Смежное: