Технологии · 2026-05-28 · 6 мин

MP3, WAV или FLAC: какой формат выбрать для транскрибации

Как влияет формат аудио на точность распознавания и стоимость хранения. Когда выбирать MP3, WAV, M4A, OPUS. Битрейт и частота дискретизации.

Часто спрашивают: «в каком формате лучше сохранять записи, чтобы транскрипция была точнее»? Ответ зависит от 3 факторов — куда писать, как долго хранить и нужна ли высокая точность. Разбираем по полочкам.

Короткий ответ

Сравнение форматов звука для транскрибации: сжатые MP3/OPUS против WAV и FLAC без потерь
Какой формат звука выбрать для транскрибации.
  • Для большинства задач: MP3 192 kbps — оптимум по точности/размеру
  • Если запись важная: WAV или FLAC — лучшее качество без потерь
  • Если хочется маленький файл: OPUS — современный кодек, лучше MP3 при том же размере
  • Если записываете на iPhone: M4A нормально работает, конвертация не нужна

Влияние формата на точность распознавания

Мы провели тесты на одной и той же записи (1 час, 2 спикера, чистый звук) в разных форматах:

ФорматРазмерТочность
WAV 16-bit 44.1kHz (без сжатия)580 МБ95.4%
FLAC 16-bit (без потерь)270 МБ95.4%
MP3 320 kbps130 МБ95.2%
MP3 192 kbps80 МБ95.0%
MP3 128 kbps55 МБ94.3%
OPUS 96 kbps35 МБ95.0%
AMR (диктофон с кнопочного)25 МБ91.5%

Разница между WAV и MP3 320 — 0.2%. Между MP3 320 и MP3 128 — 0.9%. Только AMR существенно проседает.

Вывод: для большинства целей MP3 128-192 kbps дают точность сравнимую с lossless. WAV нужен только для критических случаев.

Когда выбирать каждый формат

WAV — для архива и редактирования

Плюсы: максимальное качество, можно редактировать без потерь, стандарт для звукорежиссёров.

Минусы: 5-10× больше места, медленная загрузка.

Когда: критически важные записи (юридические), запись с микшерного пульта, дальнейшее редактирование в звуковом редакторе.

FLAC — для архива без потерь

Плюсы: качество как у WAV, но размер в 2 раза меньше (~50%).

Минусы: не все программы поддерживают.

Когда: длительный архив записей, где нужно сохранить максимальное качество.

MP3 — стандарт для большинства задач

Плюсы: маленький размер, поддерживается всем, отличное соотношение цены/качества.

Минусы: lossy сжатие — после многих преобразований качество падает.

Когда: 90% обычных задач. Битрейт 128-192 kbps достаточен для речи. 256-320 kbps — если хочется иметь запас на пересжатие.

OPUS — современный кодек для звонков и подкастов

Плюсы: лучшее сжатие при том же качестве, оптимизирован для речи, открытый стандарт.

Минусы: не все плееры/программы поддерживают.

Когда: запись подкастов, звонков, длинных лекций. Поддерживается в Telegram, WhatsApp, Discord.

M4A (AAC) — стандарт Apple

Плюсы: чуть лучше MP3 при том же битрейте, нативно поддерживается на Apple-устройствах.

Минусы: чуть хуже совместимость на Android и десктопах.

Когда: запись на iPhone/iPad. Конвертировать в MP3 не нужно — наш сервис распознаёт M4A напрямую.

Битрейт: какой выбрать

Для речи:

  • 64 kbps — слышно хорошо, но артефакты сжатия мешают ИИ
  • 96-128 kbps — оптимум для подкастов и встреч
  • 192 kbps — запас на пересжатие, идеально для архива
  • 256-320 kbps — избыточно для речи, имеет смысл только для музыки

Для записи звонков:

  • Большинство мессенджеров автоматически кодируют в 48-96 kbps OPUS
  • Это нормально, наш сервис распознаёт такие записи на 90-92% точности

Частота дискретизации (sample rate)

  • 8 kHz — телефонный звук, минимально достаточно для речи. Точность падает на 2-3%.
  • 16 kHz — стандарт для речевых моделей. Достаточно для ИИ-транскрипции.
  • 44.1 kHz / 48 kHz — CD/студийное качество. Избыточно для речи, но даёт максимальную точность.

Большинство ИИ-моделей внутри пересжимают аудио до 16 kHz перед обработкой. Поэтому записывать 96 kHz нет смысла — точность та же что от 48 kHz.

Что НЕ нужно делать

Конвертировать MP3 → WAV «для качества» — это не повышает качество, только размер файла.

Использовать AMR с старого телефона — устаревший кодек, потеря 3-5% точности.

Записывать в максимальном битрейте на телефон — поглощает память без видимого результата.

Сжимать запись несколько раз в разных форматах — каждое пересжатие даёт потери.

Практическое правило

Если сомневаетесь — загружайте исходник как есть.

Почти все вопросы про форматы возникают из желания «подготовить файл получше». На практике любая подготовка либо не меняет ничего, либо ухудшает: перекодирование из сжатого формата в несжатый не возвращает потерянные детали, а лишний проход через кодек их отнимает.

Единственная осмысленная подготовка — извлечь звук из видео, если видео большое и нужен только текст. Всё остальное — работа без результата.

Видео: когда конвертировать, а когда нет

Видеофайлы принимаются напрямую, звуковая дорожка извлекается автоматически.

Смысл извлекать звук заранее появляется в двух случаях: файл приближается к лимиту в 2 ГБ или интернет медленный и грузить гигабайты долго. Час видео в неплохом качестве — это около гигабайта, а та же дорожка в аудио — тридцать-шестьдесят мегабайт.

Разницы в точности при этом нет: распознавание работает со звуком в обоих случаях.

Моно или стерео

На распознавание речи это почти не влияет, но есть исключение.

Если запись велась так, что каждый собеседник попал в свой канал — например, при записи звонка через некоторые системы телефонии, — стерео стоит сохранить: разделение говорящих по каналам надёжнее, чем по голосам.

Во всех остальных случаях моно и стерео равнозначны, а моно вдвое меньше весит.

Повреждённые и обрезанные файлы

Запись, прерванная разрядкой телефона или сбоем программы, обычно всё равно открывается — диктофоны пишут потоком и сохраняют то, что успели.

Такой файл загружается и расшифровывается нормально. Проверка простая: если файл проигрывается на вашем устройстве, он подойдёт и здесь. Если не проигрывается — сначала придётся его восстанавливать, и это отдельная задача.

Что делать со старыми записями

Отдельный случай — архивы: диктофонные кассеты, оцифрованные когда-то файлы, записи с давних устройств.

Форматы вроде WMA, AMR, 3GP встречаются именно там. Если файл открывается на вашем устройстве, скорее всего он загрузится и здесь. Если нет — его придётся конвертировать, и это единственная ситуация, где конвертация оправдана.

При этом ожидания стоит держать умеренными: старые записи с низким битрейтом и шумом ленты распознаются хуже современных. Текст получится, но вычитывать придётся больше.

Слишком тихая запись

Частая проблема архивов и записей с дальнего микрофона.

Нормализация громкости здесь помогает и безопасна: она поднимает уровень, не трогая содержание. В любом бесплатном аудиоредакторе это одна кнопка.

Чего делать не стоит — усиливать тихую запись до предела: вместе с речью поднимется шум, и разборчивость не улучшится. Ориентир — довести пики примерно до девяноста процентов шкалы, не до упора.

Для подкастов, где звук обычно пишется в хорошем качестве, отдельная страница — расшифровка подкаста.

Проверка перед массовой обработкой

Если предстоит расшифровать десятки файлов, сначала прогоните один — самый типичный.

Так вы увидите реальную точность на своём материале и поймёте, нужна ли подготовка вообще. Обычно выясняется, что не нужна, и это экономит часы, которые ушли бы на конвертацию всей папки.

Первые 20 минут бесплатны, карта не нужна — этого хватает на такую проверку.

Итог: что выбрать

  • Обычный пользователь, запись на телефон/ноут: MP3 128-192 kbps — лучший выбор
  • Подкастер: WAV для записи → MP3 320 kbps для архива и опубликованной версии
  • Юрист / исследователь: WAV или FLAC для важных записей
  • Запись звонков: что даёт мессенджер — нормально, переконвертация не нужна

Наш сервис принимает все перечисленные форматы без ограничений до 2 ГБ на файл. Загружайте то, что есть — оптимизировать имеет смысл только если регулярно работаете с большим архивом.

Если интересна тематика подготовки аудио — посмотрите как улучшить распознавание речи с практическими советами.## Сводная таблица форматов

ФорматСжатиеЧас записиКогда выбирать
WAVбез потерь~600 МБстудийная запись, важен максимум качества
FLACбез потерь~300 МБархив: то же качество, вдвое легче
MP3 192 кбит/сс потерями~85 МБуниверсальный выбор, разница неслышна
MP3 128 кбит/сс потерями~55 МБдостаточно для речи
M4A / AACс потерями~30–60 МБчто пишут телефоны, годится как есть
OGG / OPUSс потерями~25 МБголосовые из мессенджеров
AMRсильное~5 МБстарые телефоны, качество низкое

Короткий ответ на вопрос из заголовка: берите то, в чём записалось.

Перекодирование из одного формата в другой качества не добавляет,

а отнять может.

Почему нельзя «улучшить» запись перекодированием

Распространённое заблуждение: перегнать M4A в WAV, чтобы стало лучше.

Так не работает.

Сжатие с потерями выбрасывает часть данных безвозвратно. Перегоняя результат

в формат без потерь, вы получаете большой файл с тем же содержимым — потерянное

не возвращается. Хуже того, каждое пересжатие с потерями (MP3 в MP3) отнимает ещё.

Правило: сколько раз файл сжимали с потерями, столько раз он терял качество.

Отсюда практический вывод — грузите оригинал, а не то, что переслали в мессенджере.

Частота дискретизации: сколько на самом деле нужно

Для речи хватает 16 кГц. Всё, что выше, на распознавание почти не влияет —

человеческая речь укладывается в этот диапазон.

Поэтому запись в 48 кГц не даст преимущества перед 44,1 или даже 22 кГц,

а весить будет больше. Понижать специально тоже незачем: пусть будет как есть.

Единственное, где частота имеет значение, — телефонный канал. Там она обрезана

до 8 кГц, и это одна из причин, почему телефонные записи расшифровываются хуже.

Поднять её обратно нельзя: данных нет.

Что делать с видео

Отдельно вынимать звук не обязательно — видеофайл загружается как есть.

Выгружать дорожку имеет смысл только в двух случаях:

  • Файл тяжелее 2 ГБ. Звук легче в десятки раз.
  • У вас медленный интернет. Загружать 4 ГБ по слабому каналу — сомнительное

удовольствие ради данных, которые всё равно не нужны.

Качество распознавания от этого не меняется: расшифровывается звуковая дорожка,

а видеоряд игнорируется в любом случае.

Битрейт: что реально имеет значение

БитрейтГодится для речиКомментарий
320 кбит/сдаизбыточно, но не вредно
192 кбит/сдаразумный максимум
128 кбит/сдастандарт, разницы для речи не слышно
96 кбит/сдазаметно на музыке, на речи почти нет
64 кбит/сскорее дапоявляются искажения на согласных
32 кбит/с и нижеплохоречь разборчива, но ошибок заметно больше

Практический вывод: всё, что выше 96 кбит/с, для речи равнозначно.

Гнаться за 320 незачем — вы получите файл втрое тяжелее с тем же результатом.

Чего не нужно делать с файлом

  • Не нормализуйте громкость «на всякий случай». Автоматическая нормализация

поднимает вместе с речью и шум.

  • Не применяйте шумоподавление вслепую. Агрессивный шумодав съедает согласные

вместе с шумом, и текст становится хуже, а не лучше.

  • Не режьте на куски. Файл до 2 ГБ загружается целиком; резать — значит

терять контекст на стыках и получить разрозненные транскрипты.

  • Не ускоряйте запись. Ускоренная речь распознаётся хуже, а минут спишется

меньше — экономия, которая обходится дороже.

  • Не пересылайте через мессенджер. Каждая пересылка пережимает звук.

Практическое правило одной строкой

Грузите оригинал в том виде, в каком он вышел из устройства записи.

Все остальные советы — частные случаи этого. Единственное исключение: если файл

тяжелее 2 ГБ, из видео выгружается звуковая дорожка. Это не ухудшение качества,

а отбрасывание того, что для расшифровки не используется.

Частые вопросы

Сколько времени занимает расшифровка? Около трёх минут на час записи.

Считается фактическая длина файла, округления в большую сторону нет.

Какие форматы принимаются? Практически любые: MP3, WAV, M4A, OGG, OPUS, AMR,

FLAC, а из видео — MP4, MOV, MKV, AVI, WEBM. Звук из видео отдельно вынимать

не нужно. Ограничение одно: файл до 2 ГБ, это примерно 25 часов.

Нужно ли что-то устанавливать? Нет, всё работает в браузере, в том числе

с телефона.

Что с разделением по говорящим? Работает по умолчанию, включать ничего

не нужно. Имена подставляются, если участники обращались друг к другу вслух;

иначе останутся «Спикер 1» и «Спикер 2», их можно переименовать вручную.

Есть ли таймкоды? Да, у каждой реплики. Спорное место в записи находится

за секунды, без перемотки наугад.

Сколько это стоит? Пакеты минут: 300 — 390 ₽, 1000 — 990 ₽, 3000 — 2690 ₽,

6000 — 4990 ₽. Минуты не сгорают год. Первые 20 минут бесплатны и не требуют карты.

На каких языках работает? На 73 языках, язык определяется автоматически.

Читайте также

Смежное:

Вопросы и ответы

Какой формат лучше для расшифровки?
Любой из исходных. Если запись изначально сделана в MP3, конвертировать её в WAV бессмысленно — потерянные при сжатии детали не вернутся.
Влияет ли битрейт на точность?
До определённого предела. Ниже 64 кбит/с речь начинает разваливаться, выше 128 разницы почти нет. Диктофоны телефонов пишут с запасом.
Нужно ли конвертировать видео в аудио?
Нет. Видео принимается напрямую, звуковая дорожка извлекается автоматически.
Что делать с файлом больше 2 ГБ?
Такой размер набирается редко — это десятки часов. Если случилось, разумнее пережать видео в аудио: звук весит в разы меньше и на точность это не влияет.