Перевести аудио в текст онлайн
Загрузите запись — получите готовый текст с таймкодами и разделением по спикерам. MP3, WAV, M4A, OGG. До 2 ГБ на файл. 20 минут бесплатно после регистрации.
95%+ точность на русском
Модель обучена на современной разговорной речи. Понимает имена, термины, аббревиатуры.
Разделение по спикерам
ИИ определяет голоса и проставляет имена. Любую реплику можно переименовать в один клик.
1 час аудио — за 3 минуты
Быстрее, чем кофе попьёте. Транскрипт открывается в браузере, скачивается в DOCX/PDF/JSON.
Как это работает
1. Загрузите аудио
Перетащите MP3, WAV, M4A или OGG в окно браузера. Файл шифруется при передаче.
2. ИИ расшифровывает
60 секунд аудио = 3-5 секунд работы. На фоне определяются спикеры и таймкоды.
3. Получите текст
Откройте в редакторе, скачайте DOCX/PDF, запросите краткое содержание или задачи.
Какие форматы аудио поддерживаются
Сервис принимает: MP3, WAV, M4A, OGG, AAC, FLAC, OPUS. Максимум 2 ГБ на файл (≈ 25 часов записи). Если у вас MP3 без метаданных — мы автоматически определим длительность и битрейт.
Аудио в текст — за три шага
От загрузки файла до готового текста с разделением по спикерам
Загрузите запись
Перетащите файл или вставьте ссылку. До 2 ГБ, без установки программ.
ИИ распознаёт речь
Модель расшифровывает аудио, различает голоса и проставляет таймкоды.
Готовый текст и отчёт
Скачайте расшифровку или соберите ИИ-отчёт: протокол, конспект, саммари.
Как это работает технически
Транскрипция работает на современной нейросетевой модели распознавания речи + дополнительной обработке через ИИ-модели для определения имён собственных и форматирования. Сервис уверенно работает с:
- Громкими и тихими записями
- Несколькими спикерами в одной записи
- Иностранными словами и терминами
- Профессиональной лексикой (медицина, IT, юриспруденция)
Что получите на выходе
- Полный транскрипт с таймкодами на уровне каждой реплики
- Имена спикеров (можно отредактировать)
- Краткое содержание — ИИ-резюме одной кнопкой
- Задачи и решения — извлекаются из текста автоматически
- Чат по транскрипту — задавайте вопросы прямо к записи
Примеры использования
Журналист записал интервью — получает чистый текст с цитатами, готов к публикации.
Студент записал лекцию — получает конспект с тезисами и определениями.
Менеджер записал переговоры — получает протокол с договорённостями и следующими шагами.
Продюсер записал подкаст — получает таймкоды для шоу-нотов и описание выпуска.## Какие форматы аудио подойдут
Практически любые. Конвертировать перед загрузкой ничего не нужно — и не стоит: лишнее пережатие только ухудшит распознавание.
| Формат | Откуда обычно берётся | Годится |
|---|---|---|
| MP3 | диктофоны, подкасты, телефония | да |
| WAV | студийная запись, профессиональные рекордеры | да, лучший вариант |
| M4A, AAC | диктофон айфона, запись экрана | да |
| OGG, OPUS | голосовые в мессенджерах | да |
| AMR, 3GP | старые телефоны, автоответчики | да, но качество исходно низкое |
| FLAC | архивные записи без потерь | да |
| WMA | старые записи с Windows | да |
Ограничение одно: файл до 2 ГБ, это примерно 25 часов записи. Длина отдельной записи не ограничена — трёхчасовое заседание грузится целиком, разбивать не нужно.
Если запись лежит внутри видео, отдельно вынимать звук тоже не требуется: видеофайл загружается как есть.
Что влияет на точность распознавания
На русской речи при нормальной записи точность держится выше 95 %. Слово «нормальной» здесь ключевое — вот что стоит за ним.
| Условие | Что происходит с текстом |
|---|---|
| Гарнитура или петличка | почти без ошибок, правки единичные |
| Микрофон ноутбука в тихой комнате | хорошо, редкие ошибки в окончаниях |
| Телефон на столе в переговорной | заметно хуже у тех, кто дальше |
| Двое говорят одновременно | часть реплик теряется, берётся тот, кто громче |
| Фоновая музыка поверх речи | ошибки резко растут |
| Телефонный канал | глуше, больше ошибок: канал режет частоты |
| Сильный шум, улица, транспорт | распознаётся плохо, иногда никак |
Отдельно про термины и фамилии: названия компаний, препаратов, внутренние сокращения пишутся на слух и часто неверно. Зато ошибаются они одинаково по всему тексту, поэтому правятся поиском и заменой за минуту.

Где обычно лежит нужная запись
| Источник | Где искать файл |
|---|---|
| Диктофон айфона | приложение «Диктофон», кнопка «Поделиться» |
| Диктофон Android | приложение «Запись», папка Recordings |
| Запись звонка | приложение телефона или карточка звонка в облачной телефонии |
| Голосовое в Телеграме | долгое нажатие на сообщение, «Сохранить в загрузки» |
| Яндекс Телемост | Яндекс Диск организатора |
| Zoom | папка Zoom в «Документах», файл M4A рядом с видео |
| Google Meet, Teams | Google Диск или OneDrive организатора |
Что получается кроме текста
Расшифровка делается один раз, а отчёты поверх неё строятся сколько угодно раз и в любой момент — заново платить за распознавание не нужно.
- Расшифровка по говорящим с таймкодами — основной результат.
- Краткое содержание — суть в несколько абзацев, для тех, кто не слушал.
- Протокол — повестка, решения, поручения со сроками.
- Стенограмма — дословный текст по правилам делопроизводства.
- Список задач — что кому делать, вынуто из разговора.
- Разбор для продаж — возражения и как их закрывали.
- Конспект — структурированный текст по темам, для лекций.
Всего 21 тип отчёта. Экспорт в DOCX, PDF, TXT и SRT.
Языки и смешанная речь
Распознаётся речь на 73 языках. Язык определяется автоматически, указывать его не нужно.
Смешанная речь — отдельный случай. Если внутри русской фразы звучат английские термины, они обычно распознаются правильно. А вот когда говорящий переходит на другой язык целыми предложениями и обратно, на переключении бывают ошибки. Если запись двуязычная по-настоящему, лучше расшифровать её дважды, указав разные основные языки, и собрать нужное из двух текстов.
Чего распознавание не сделает
- Не восстановит неразборчивое. Если человек говорил в стороне от микрофона,
реплика будет неполной. Сервис не переспрашивает.
- Не разберёт музыку и пение. Расшифровывается речь; песни, джинглы и рингтоны
не распознаются.
- Не сработает на записи короче трёх секунд. Слишком мало данных.
- Не расставит смысловые акценты. Ирония, сарказм и отсылки останутся дословно.
- Не гарантирует имён. Спикеры получают имена, только если участники обращаются
друг к другу по имени вслух. Иначе останутся «Спикер 1» и «Спикер 2», переименовать их можно вручную.
Сколько это занимает и сколько стоит
Час записи расшифровывается около трёх минут. Считается фактическая длина файла, округления в большую сторону нет.
| Запись | Спишется минут | На стартовом пакете | На пакете 1000 минут |
|---|---|---|---|
| Голосовое сообщение, 5 минут | 5 | 6,5 ₽ | 5 ₽ |
| Интервью, 40 минут | 40 | 52 ₽ | 40 ₽ |
| Встреча, 1 час | 60 | 78 ₽ | 59 ₽ |
| Заседание, 3 часа | 180 | 234 ₽ | 178 ₽ |
Пакеты: 300 минут — 390 ₽, 1000 — 990 ₽, 3000 — 2690 ₽, 6000 — 4990 ₽. Минуты не сгорают год. Первые 20 минут бесплатны и не требуют карты.
Из аудиозаписи сразу в протокол
Судя по тому, что люди спрашивают, задача чаще формулируется не как «расшифровать аудио», а как «сделать протокол совещания из аудиозаписи». Это один и тот же путь, просто с двумя остановками, и вторая важнее первой.
1. Загружаете аудиофайл — диктофонная запись, дорожка из Телемоста, файл из облачной телефонии. 2. Получаете транскрипт с разбивкой по спикерам и таймкодами. 3. Выбираете отчёт «Протокол» — и из транскрипта собирается документ: повестка, решения, поручения с ответственными и сроками. 4. Выгружаете в DOCX или PDF и правите под свой шаблон.
Промежуточный текст никуда не девается: если в протоколе спорная формулировка, вы находите её в транскрипте по времени и слушаете исходную запись.
Транскрибировать аудиозапись в текст с разбивкой по спикерам — это поведение по умолчанию, включать ничего не нужно. Реплики раскладываются по говорящим сразу, имена подставляются, если участники обращались друг к другу вслух.
Транскрипция из аудио с таймкодами — тоже по умолчанию: время стоит у каждой реплики. Именно это отличает рабочий транскрипт от простыни текста: спорное место находится за секунды, а не перемоткой наугад.
Стенограмма по звукозаписи: когда нужна именно она
«Сделать стенограмму с диктофона» и «сделать протокол» — разные задачи, и путать их дорого.
| Протокол | Стенограмма | |
|---|---|---|
| Что внутри | решения и поручения | всё сказанное дословно |
| Объём с часа записи | страница-полторы | 15–25 страниц |
| Правки допускаются | да, это выжимка | нет, в этом смысл |
| Когда нужна | планёрки, совещания | спорные ситуации, комиссии, суд |
Если нужен документ, на который потом можно сослаться в споре, берите стенограмму: там сохраняются оговорки, паузы и точные формулировки. Подробный разбор — на странице про стенограмму, а для юридических задач есть расшифровка для юриста.
Конспект лекций, записанных на диктофон
Отдельная частая задача — не встреча, а учебная запись. Порядок тот же, отчёт другой: вместо «Протокола» выбирается «Конспект», и из расшифровки собирается структурированный текст по темам, а не список решений.
Что стоит учесть именно для диктофонных записей: кладите диктофон ближе к преподавателю, а не к себе, и не включайте режим экономии места — он режет как раз те частоты, по которым различаются согласные. Подробнее — расшифровка лекции и разбор как собрать конспект из аудиозаписи.
Кто этим пользуется и что берёт на выходе
Задача звучит одинаково — «получить текст записи», — а нужен всем разный документ. Отсюда простое правило: сначала решите, что будете делать с результатом, и уже под это выбирайте отчёт.
| Кто | Что записывает | Какой отчёт берёт |
|---|---|---|
| Руководитель, проектный менеджер | совещания, планёрки | протокол с решениями и поручениями |
| Отдел продаж | переговоры и звонки | разбор возражений и следующий шаг |
| HR и рекрутёр | собеседования | оценка кандидата, красные флаги |
| Юрист | заседания, консультации, переговоры | дословная стенограмма |
| Исследователь, продакт | интервью и фокус-группы | инсайты и цитаты |
| Журналист, редактор | интервью | текст статьи с цитатами |
| Маркетолог | эфиры, интервью с клиентами | материал для контента |
| Копирайтер | разговоры с экспертом | заготовка текста |
| Коуч, психолог | сессии с клиентом | динамика и договорённости |
| Преподаватель, студент | лекции и семинары | конспект и карточки |
| Подкастер | выпуски | таймкоды, статья, нарезки |
Механика у всех одна: загружается запись, дальше выбирается нужный отчёт. Всего их 21 — полный каталог с разбором, какой когда брать.
Часто задаваемые вопросы
Сколько стоит расшифровать аудио в текст?▾
20 минут бесплатно сразу после регистрации. Дальше пакеты от 390₽ (300 минут). Минуты не сгорают.
Можно ли перевести аудио в текст без регистрации?▾
Регистрация нужна только чтобы сохранить результат и активировать 20 бесплатных минут. Регистрация занимает 30 секунд.
Какая максимальная длина аудио?▾
До 2 ГБ на файл, это ≈ 24-25 часов в формате MP3 128 kbps. Если запись больше — разбейте на части.
Точно ли распознаётся русская речь?▾
Точность 95%+ на чистой записи. На шумной или с акцентом — 85-90%. Сравнимо с лучшими решениями на рынке.
Сохраняются ли мои аудиозаписи?▾
Записи хранятся в вашем личном кабинете до тех пор, пока вы их не удалите. Никто кроме вас не имеет доступа.
Попробуйте сейчас
20 минут бесплатно после регистрации. Без карты, без скрытых платежей. Минуты не сгорают.
Перевести аудио в текст