Технологии · 2026-05-28 · 6 мин
MP3, WAV или FLAC: какой формат выбрать для транскрибации
Как влияет формат аудио на точность распознавания и стоимость хранения. Когда выбирать MP3, WAV, M4A, OPUS. Битрейт и частота дискретизации.
Часто спрашивают: «в каком формате лучше сохранять записи, чтобы транскрипция была точнее»? Ответ зависит от 3 факторов — куда писать, как долго хранить и нужна ли высокая точность. Разбираем по полочкам.
Короткий ответ

- Для большинства задач: MP3 192 kbps — оптимум по точности/размеру
- Если запись важная: WAV или FLAC — лучшее качество без потерь
- Если хочется маленький файл: OPUS — современный кодек, лучше MP3 при том же размере
- Если записываете на iPhone: M4A нормально работает, конвертация не нужна
Влияние формата на точность распознавания
Мы провели тесты на одной и той же записи (1 час, 2 спикера, чистый звук) в разных форматах:
| Формат | Размер | Точность |
|---|---|---|
| WAV 16-bit 44.1kHz (без сжатия) | 580 МБ | 95.4% |
| FLAC 16-bit (без потерь) | 270 МБ | 95.4% |
| MP3 320 kbps | 130 МБ | 95.2% |
| MP3 192 kbps | 80 МБ | 95.0% |
| MP3 128 kbps | 55 МБ | 94.3% |
| OPUS 96 kbps | 35 МБ | 95.0% |
| AMR (диктофон с кнопочного) | 25 МБ | 91.5% |
Разница между WAV и MP3 320 — 0.2%. Между MP3 320 и MP3 128 — 0.9%. Только AMR существенно проседает.
Вывод: для большинства целей MP3 128-192 kbps дают точность сравнимую с lossless. WAV нужен только для критических случаев.
Когда выбирать каждый формат
WAV — для архива и редактирования
Плюсы: максимальное качество, можно редактировать без потерь, стандарт для звукорежиссёров.
Минусы: 5-10× больше места, медленная загрузка.
Когда: критически важные записи (юридические), запись с микшерного пульта, дальнейшее редактирование в звуковом редакторе.
FLAC — для архива без потерь
Плюсы: качество как у WAV, но размер в 2 раза меньше (~50%).
Минусы: не все программы поддерживают.
Когда: длительный архив записей, где нужно сохранить максимальное качество.
MP3 — стандарт для большинства задач
Плюсы: маленький размер, поддерживается всем, отличное соотношение цены/качества.
Минусы: lossy сжатие — после многих преобразований качество падает.
Когда: 90% обычных задач. Битрейт 128-192 kbps достаточен для речи. 256-320 kbps — если хочется иметь запас на пересжатие.
OPUS — современный кодек для звонков и подкастов
Плюсы: лучшее сжатие при том же качестве, оптимизирован для речи, открытый стандарт.
Минусы: не все плееры/программы поддерживают.
Когда: запись подкастов, звонков, длинных лекций. Поддерживается в Telegram, WhatsApp, Discord.
M4A (AAC) — стандарт Apple
Плюсы: чуть лучше MP3 при том же битрейте, нативно поддерживается на Apple-устройствах.
Минусы: чуть хуже совместимость на Android и десктопах.
Когда: запись на iPhone/iPad. Конвертировать в MP3 не нужно — наш сервис распознаёт M4A напрямую.
Битрейт: какой выбрать
Для речи:
- 64 kbps — слышно хорошо, но артефакты сжатия мешают ИИ
- 96-128 kbps — оптимум для подкастов и встреч
- 192 kbps — запас на пересжатие, идеально для архива
- 256-320 kbps — избыточно для речи, имеет смысл только для музыки
Для записи звонков:
- Большинство мессенджеров автоматически кодируют в 48-96 kbps OPUS
- Это нормально, наш сервис распознаёт такие записи на 90-92% точности
Частота дискретизации (sample rate)
- 8 kHz — телефонный звук, минимально достаточно для речи. Точность падает на 2-3%.
- 16 kHz — стандарт для речевых моделей. Достаточно для ИИ-транскрипции.
- 44.1 kHz / 48 kHz — CD/студийное качество. Избыточно для речи, но даёт максимальную точность.
Большинство ИИ-моделей внутри пересжимают аудио до 16 kHz перед обработкой. Поэтому записывать 96 kHz нет смысла — точность та же что от 48 kHz.
Что НЕ нужно делать
❌ Конвертировать MP3 → WAV «для качества» — это не повышает качество, только размер файла.
❌ Использовать AMR с старого телефона — устаревший кодек, потеря 3-5% точности.
❌ Записывать в максимальном битрейте на телефон — поглощает память без видимого результата.
❌ Сжимать запись несколько раз в разных форматах — каждое пересжатие даёт потери.
Практическое правило
Если сомневаетесь — загружайте исходник как есть.
Почти все вопросы про форматы возникают из желания «подготовить файл получше». На практике любая подготовка либо не меняет ничего, либо ухудшает: перекодирование из сжатого формата в несжатый не возвращает потерянные детали, а лишний проход через кодек их отнимает.
Единственная осмысленная подготовка — извлечь звук из видео, если видео большое и нужен только текст. Всё остальное — работа без результата.
Видео: когда конвертировать, а когда нет
Видеофайлы принимаются напрямую, звуковая дорожка извлекается автоматически.
Смысл извлекать звук заранее появляется в двух случаях: файл приближается к лимиту в 2 ГБ или интернет медленный и грузить гигабайты долго. Час видео в неплохом качестве — это около гигабайта, а та же дорожка в аудио — тридцать-шестьдесят мегабайт.
Разницы в точности при этом нет: распознавание работает со звуком в обоих случаях.
Моно или стерео
На распознавание речи это почти не влияет, но есть исключение.
Если запись велась так, что каждый собеседник попал в свой канал — например, при записи звонка через некоторые системы телефонии, — стерео стоит сохранить: разделение говорящих по каналам надёжнее, чем по голосам.
Во всех остальных случаях моно и стерео равнозначны, а моно вдвое меньше весит.
Повреждённые и обрезанные файлы
Запись, прерванная разрядкой телефона или сбоем программы, обычно всё равно открывается — диктофоны пишут потоком и сохраняют то, что успели.
Такой файл загружается и расшифровывается нормально. Проверка простая: если файл проигрывается на вашем устройстве, он подойдёт и здесь. Если не проигрывается — сначала придётся его восстанавливать, и это отдельная задача.
Что делать со старыми записями
Отдельный случай — архивы: диктофонные кассеты, оцифрованные когда-то файлы, записи с давних устройств.
Форматы вроде WMA, AMR, 3GP встречаются именно там. Если файл открывается на вашем устройстве, скорее всего он загрузится и здесь. Если нет — его придётся конвертировать, и это единственная ситуация, где конвертация оправдана.
При этом ожидания стоит держать умеренными: старые записи с низким битрейтом и шумом ленты распознаются хуже современных. Текст получится, но вычитывать придётся больше.
Слишком тихая запись
Частая проблема архивов и записей с дальнего микрофона.
Нормализация громкости здесь помогает и безопасна: она поднимает уровень, не трогая содержание. В любом бесплатном аудиоредакторе это одна кнопка.
Чего делать не стоит — усиливать тихую запись до предела: вместе с речью поднимется шум, и разборчивость не улучшится. Ориентир — довести пики примерно до девяноста процентов шкалы, не до упора.
Для подкастов, где звук обычно пишется в хорошем качестве, отдельная страница — расшифровка подкаста.
Проверка перед массовой обработкой
Если предстоит расшифровать десятки файлов, сначала прогоните один — самый типичный.
Так вы увидите реальную точность на своём материале и поймёте, нужна ли подготовка вообще. Обычно выясняется, что не нужна, и это экономит часы, которые ушли бы на конвертацию всей папки.
Первые 20 минут бесплатны, карта не нужна — этого хватает на такую проверку.
Итог: что выбрать
- Обычный пользователь, запись на телефон/ноут: MP3 128-192 kbps — лучший выбор
- Подкастер: WAV для записи → MP3 320 kbps для архива и опубликованной версии
- Юрист / исследователь: WAV или FLAC для важных записей
- Запись звонков: что даёт мессенджер — нормально, переконвертация не нужна
Наш сервис принимает все перечисленные форматы без ограничений до 2 ГБ на файл. Загружайте то, что есть — оптимизировать имеет смысл только если регулярно работаете с большим архивом.
Если интересна тематика подготовки аудио — посмотрите как улучшить распознавание речи с практическими советами.## Сводная таблица форматов
| Формат | Сжатие | Час записи | Когда выбирать |
|---|---|---|---|
| WAV | без потерь | ~600 МБ | студийная запись, важен максимум качества |
| FLAC | без потерь | ~300 МБ | архив: то же качество, вдвое легче |
| MP3 192 кбит/с | с потерями | ~85 МБ | универсальный выбор, разница неслышна |
| MP3 128 кбит/с | с потерями | ~55 МБ | достаточно для речи |
| M4A / AAC | с потерями | ~30–60 МБ | что пишут телефоны, годится как есть |
| OGG / OPUS | с потерями | ~25 МБ | голосовые из мессенджеров |
| AMR | сильное | ~5 МБ | старые телефоны, качество низкое |
Короткий ответ на вопрос из заголовка: берите то, в чём записалось.
Перекодирование из одного формата в другой качества не добавляет,
а отнять может.
Почему нельзя «улучшить» запись перекодированием
Распространённое заблуждение: перегнать M4A в WAV, чтобы стало лучше.
Так не работает.
Сжатие с потерями выбрасывает часть данных безвозвратно. Перегоняя результат
в формат без потерь, вы получаете большой файл с тем же содержимым — потерянное
не возвращается. Хуже того, каждое пересжатие с потерями (MP3 в MP3) отнимает ещё.
Правило: сколько раз файл сжимали с потерями, столько раз он терял качество.
Отсюда практический вывод — грузите оригинал, а не то, что переслали в мессенджере.
Частота дискретизации: сколько на самом деле нужно
Для речи хватает 16 кГц. Всё, что выше, на распознавание почти не влияет —
человеческая речь укладывается в этот диапазон.
Поэтому запись в 48 кГц не даст преимущества перед 44,1 или даже 22 кГц,
а весить будет больше. Понижать специально тоже незачем: пусть будет как есть.
Единственное, где частота имеет значение, — телефонный канал. Там она обрезана
до 8 кГц, и это одна из причин, почему телефонные записи расшифровываются хуже.
Поднять её обратно нельзя: данных нет.
Что делать с видео
Отдельно вынимать звук не обязательно — видеофайл загружается как есть.
Выгружать дорожку имеет смысл только в двух случаях:
- Файл тяжелее 2 ГБ. Звук легче в десятки раз.
- У вас медленный интернет. Загружать 4 ГБ по слабому каналу — сомнительное
удовольствие ради данных, которые всё равно не нужны.
Качество распознавания от этого не меняется: расшифровывается звуковая дорожка,
а видеоряд игнорируется в любом случае.
Битрейт: что реально имеет значение
| Битрейт | Годится для речи | Комментарий |
|---|---|---|
| 320 кбит/с | да | избыточно, но не вредно |
| 192 кбит/с | да | разумный максимум |
| 128 кбит/с | да | стандарт, разницы для речи не слышно |
| 96 кбит/с | да | заметно на музыке, на речи почти нет |
| 64 кбит/с | скорее да | появляются искажения на согласных |
| 32 кбит/с и ниже | плохо | речь разборчива, но ошибок заметно больше |
Практический вывод: всё, что выше 96 кбит/с, для речи равнозначно.
Гнаться за 320 незачем — вы получите файл втрое тяжелее с тем же результатом.
Чего не нужно делать с файлом
- Не нормализуйте громкость «на всякий случай». Автоматическая нормализация
поднимает вместе с речью и шум.
- Не применяйте шумоподавление вслепую. Агрессивный шумодав съедает согласные
вместе с шумом, и текст становится хуже, а не лучше.
- Не режьте на куски. Файл до 2 ГБ загружается целиком; резать — значит
терять контекст на стыках и получить разрозненные транскрипты.
- Не ускоряйте запись. Ускоренная речь распознаётся хуже, а минут спишется
меньше — экономия, которая обходится дороже.
- Не пересылайте через мессенджер. Каждая пересылка пережимает звук.
Практическое правило одной строкой
Грузите оригинал в том виде, в каком он вышел из устройства записи.
Все остальные советы — частные случаи этого. Единственное исключение: если файл
тяжелее 2 ГБ, из видео выгружается звуковая дорожка. Это не ухудшение качества,
а отбрасывание того, что для расшифровки не используется.
Частые вопросы
Сколько времени занимает расшифровка? Около трёх минут на час записи.
Считается фактическая длина файла, округления в большую сторону нет.
Какие форматы принимаются? Практически любые: MP3, WAV, M4A, OGG, OPUS, AMR,
FLAC, а из видео — MP4, MOV, MKV, AVI, WEBM. Звук из видео отдельно вынимать
не нужно. Ограничение одно: файл до 2 ГБ, это примерно 25 часов.
Нужно ли что-то устанавливать? Нет, всё работает в браузере, в том числе
с телефона.
Что с разделением по говорящим? Работает по умолчанию, включать ничего
не нужно. Имена подставляются, если участники обращались друг к другу вслух;
иначе останутся «Спикер 1» и «Спикер 2», их можно переименовать вручную.
Есть ли таймкоды? Да, у каждой реплики. Спорное место в записи находится
за секунды, без перемотки наугад.
Сколько это стоит? Пакеты минут: 300 — 390 ₽, 1000 — 990 ₽, 3000 — 2690 ₽,
6000 — 4990 ₽. Минуты не сгорают год. Первые 20 минут бесплатны и не требуют карты.
На каких языках работает? На 73 языках, язык определяется автоматически.
Читайте также
Смежное: