Технологии · 2026-05-29 · 9 мин
Как записать так, чтобы распозналось: что влияет на точность на самом деле
Расстояние до говорящего решает больше, чем цена микрофона. Что поправить до записи, что после и почему агрессивное шумоподавление делает хуже.
Точность расшифровки почти целиком определяется тем, что вы загрузили. Никакая обработка не восстановит слова, которых нет в записи, — поэтому всё важное происходит до нажатия кнопки, а не после.
Ниже — что реально влияет, в порядке убывания значимости.

Расстояние решает больше, чем цена микрофона
Это главный вывод, к которому сводится половина остальных советов.
Громкость звука падает пропорционально квадрату расстояния: отодвинули источник вдвое — получили вчетверо тише. При этом фоновый шум в комнате остаётся прежним, то есть соотношение речи и шума ухудшается стремительно.
Практически это значит, что телефон в центре стола даст лучший результат, чем дорогой микрофон, стоящий рядом с одним участником. И что запись с последней парты в аудитории проиграет записи с первой при любом оборудовании.
Ориентир: 20–40 сантиметров до говорящего — хорошо, метр — приемлемо, три метра — уже проблема.
Эхо хуже шума
Ровный фоновый шум — кондиционер, гул улицы, вентилятор — распознаванию мешает умеренно: он предсказуем.
Эхо мешает гораздо сильнее, потому что накладывает на речь её же копию со сдвигом. Звуки размазываются, границы слов теряются.
Что даёт эхо: пустая комната с голыми стенами, большой зал, громкая связь вместо гарнитуры, стеклянные перегородки. Что помогает: мягкая мебель, шторы, люди в помещении, гарнитура у всех участников звонка.
Если выбирать между тихой пустой переговорной и шумноватой комнатой с мягкой мебелью, вторая обычно даёт лучшую запись.
Как говорят участники
Одновременная речь — единственное место, где автоматическая расшифровка стабильно уступает человеку. Когда двое перебивают друг друга, часть слов теряется или уходит не тому говорящему.
Скорость влияет слабее, чем принято думать. Быстрая, но внятная речь распознаётся хорошо. Плохо распознаётся невнятная — независимо от темпа.
Имена вслух. Если участники обращаются друг к другу по имени, имена подставятся в расшифровку автоматически. Если нет — останутся «Спикер 1» и «Спикер 2», и переименовать их придётся вручную. Это одна фраза в начале встречи против ручной работы потом.
Что поправить до записи
- Положите источник ближе к говорящим, экраном вверх, на твёрдую поверхность.
- Не накрывайте телефон бумагами и не держите в руке — трение о корпус идёт прямо в микрофон.
- Закройте окно, если за ним улица или ветер.
- В звонках попросите всех надеть гарнитуру.
- Договоритесь говорить по очереди — это единственный способ решить проблему наложения голосов.
Что поправить после — и чего делать не стоит
Здесь чаще вредят, чем помогают.
Агрессивное шумоподавление — главная ошибка. Алгоритмы вырезают шум вместе с согласными, потому что шипящие и взрывные звуки спектрально похожи на шум. На слух запись становится «чище», а распознавание падает: слова превращаются в гласные без опознавательных признаков.
Если шум ровный и мешает, применяйте самую слабую настройку. Если запись и так разборчива — не трогайте вовсе.
Нормализация громкости безопасна и иногда помогает, особенно когда один участник говорит заметно тише остальных.
Пережатие файла не нужно. Лимит 2 ГБ рассчитан на исходники, а повторное сжатие только теряет детали.
Обрезка тишины экономит минуты, если в записи полчаса ожидания перед началом. Но резать паузы внутри разговора не стоит — они помогают разделять реплики.
Что происходит при загрузке
Язык определяется автоматически, отдельно указывать его не нужно — формы выбора языка в сервисе нет. Автоопределение работает на 73 языках и надёжно справляется, пока запись ведётся на одном языке.
Сложности начинаются при переключении между языками в середине фразы: на стыках возможны ошибки. Если запись двуязычная, спорные места стоит проверить по таймкодам.
Разделение по голосам работает для двух-десяти участников.
Чего ждать по точности
На разборчивой русской речи — 94–96%. Это означает примерно одну ошибку на двадцать слов, и в связном тексте они почти не мешают: смысл восстанавливается контекстом.
Падение начинается там, где сходятся несколько факторов сразу: дальний микрофон плюс эхо, шум плюс наложение голосов. По отдельности каждый переносится сносно.
Отдельная категория ошибок — имена собственные, редкие термины и аббревиатуры. Их стоит проверять при вычитке всегда: контекст здесь не спасает, потому что правильного варианта модель может просто не знать.
Как понять, что запись не годится
Признаки видно сразу по тексту:
- рваные реплики и обрывы фраз — звук не разобрался;
- много коротких реплик подряд у разных говорящих — наложение голосов;
- бессмысленные слова вместо терминов — либо шум, либо незнакомая лексика.
Если такого мало — вычитайте эти места по таймкодам. Если текст состоит из обрывков целиком, дальнейшая вычитка бессмысленна: проще перезаписать или отдать запись человеку.
Онлайн-встречи: отдельные правила
В Zoom, Teams и Google Meet звук проходит через связь, и это добавляет свои сложности.
Гарнитура обязательна всем. Один участник на громкой связи портит запись для всей встречи: его микрофон ловит динамик и добавляет эхо в общий поток.
Запись встречи, а не своего окна. В некоторых сервисах локальная запись пишет только вашу дорожку — проверьте настройку заранее, а не после важных переговоров.
Каждому сервису посвящена своя страница: Zoom, Google Meet, Teams.
Слабый интернет слышно. Дрожание связи даёт пропуски и артефакты, которые распознавание принимает за речь. Здесь ничего не поделать, кроме как переспрашивать в моменте.
Запись в машине и на улице
Две ситуации, где качество проседает предсказуемо.
В машине мешает не двигатель, а вибрация корпуса и обдув. Телефон на держателе даёт лучший результат, чем лежащий на панели, а обдув на время разговора стоит уменьшить.
На улице главный враг — ветер. Он даёт не шум, а перегрузку микрофона: речь в такие моменты пропадает полностью. Помогает прикрыть телефон корпусом или отойти за препятствие.
Проверка перед важной записью
Если предстоит встреча, которую нельзя переснять, стоит потратить минуту.
Запишите двадцать секунд в том же помещении, с того же места, где будет лежать телефон. Прослушайте: если ваш голос с дальнего конца стола разборчив, всё в порядке. Если приходится вслушиваться — переставьте источник ближе.
Эта минута экономит час разбирательств с текстом, в котором половина реплик оборвана.
Микрофон: что реально стоит покупать
Если записи регулярные, вопрос техники встаёт всерьёз. Ориентиры простые.
Петличный микрофон — лучшее вложение для интервью и лекций. Он всегда близко к говорящему, а это главное. Стоит недорого и решает больше, чем студийный конденсатор на столе.
Конференц-микрофон для переговорной — если встречи регулярные и участников много. Круговая направленность и расположение в центре стола дают ровный звук от всех.
USB-микрофон на столе — для подкастов и надиктовок в одиночку.
Чего покупать не нужно: дорогой микрофон, который будет стоять там же, где сейчас лежит телефон. Прирост качества не окупит расходы — расстояние решает больше.
Проверка записи до того, как она понадобилась
Самая обидная ситуация — обнаружить проблему после важной встречи.
Минутный тест решает: запишите двадцать секунд в том же помещении, с того же места, при том же обдуве и шуме. Прогоните через бесплатные минуты. Если текст читается — всё в порядке, если нет — переставьте источник и повторите.
Такой тест имеет смысл делать один раз для каждой типовой ситуации: своя переговорная, своя аудитория, свой формат звонков. Дальше вы просто знаете, как класть телефон.
Проверьте на своём материале
Обещаниям точности верить не стоит — у всех сервисов они примерно одинаковые, а результат зависит от вашей записи.
Первые 20 минут после регистрации бесплатны, карта не нужна. Возьмите самый сложный фрагмент — там, где шумно и говорят несколько человек, — и посмотрите, что получится. Это надёжнее любого сравнения на бумаге.
Про форматы файлов и битрейт — в отдельной статье, про особенности русской речи — в статье про распознавание на русском.## Что даёт наибольший прирост: по убыванию
| Что сделать | Насколько улучшит | Сколько стоит |
|---|---|---|
| Надеть гарнитуры участникам | очень сильно | цена наушников |
| Придвинуть микрофон ближе | очень сильно | ноль |
| Говорить по очереди | сильно | ноль |
| Убрать источник ровного шума | заметно | ноль |
| Закрыть окно на улицу | заметно | ноль |
| Назвать участников по именам | удобство разбора | ноль |
| Купить дорогой микрофон | слабо, если он далеко | дорого |
Верхние строки — бесплатные или почти. Нижняя — самая дорогая и самая
бесполезная, если микрофон стоит в двух метрах.
Эхо: почему оно хуже шума
Шум добавляет к речи посторонний звук, а эхо добавляет **саму речь со сдвигом
по времени**. Для распознавания это хуже: система слышит слово дважды и пытается
разобрать оба.
Признак комнаты с эхом: хлопните в ладоши — если звук «звенит» дольше секунды,
эхо есть.
Что помогает без ремонта:
- Мягкие предметы. Шторы, ковёр, диван, даже куртки на спинках стульев.
- Не садиться в центр пустой комнаты. Ближе к мебели и стенам с текстилем.
- Микрофон ближе ко рту. Прямой звук становится громче отражённого.
- Не включать колонки громко. Звук из колонок возвращается в микрофон.
Что можно и чего нельзя поправить после записи
| Проблема | Чинится после? |
|---|---|
| Тихая запись | да, поднять громкость |
| Ровный фоновый гул | частично, аккуратным фильтром |
| Эхо | почти нет |
| Наложение голосов | нет |
| Далёкий говорящий | нет |
| Обрыв записи | нет |
| Неверные имена спикеров | да, за минуту |
| Ошибки в терминах | да, заменой |
⚠️ Отдельно про шумоподавление: агрессивный фильтр съедает согласные вместе
с шумом. Текст после такой «очистки» часто хуже, чем до неё. Если пробуете —
сравните результат до и после на одном и том же куске.
Частые вопросы
Сколько времени занимает расшифровка? Около трёх минут на час записи.
Считается фактическая длина файла, округления в большую сторону нет.
Какие форматы принимаются? Практически любые: MP3, WAV, M4A, OGG, OPUS, AMR,
FLAC, а из видео — MP4, MOV, MKV, AVI, WEBM. Звук из видео отдельно вынимать
не нужно. Ограничение одно: файл до 2 ГБ, это примерно 25 часов.
Нужно ли что-то устанавливать? Нет, всё работает в браузере, в том числе
с телефона.
Что с разделением по говорящим? Работает по умолчанию, включать ничего
не нужно. Имена подставляются, если участники обращались друг к другу вслух;
иначе останутся «Спикер 1» и «Спикер 2», их можно переименовать вручную.
Есть ли таймкоды? Да, у каждой реплики. Спорное место в записи находится
за секунды, без перемотки наугад.
Сколько это стоит? Пакеты минут: 300 — 390 ₽, 1000 — 990 ₽, 3000 — 2690 ₽,
6000 — 4990 ₽. Минуты не сгорают год. Первые 20 минут бесплатны и не требуют карты.
На каких языках работает? На 73 языках, язык определяется автоматически.
Читайте также
По теме: