Расшифровка аудио в текст: 8 сервисов и как сделать из эфира посты

Где бесплатно перевести аудио и видео в текст, сколько стоит час записи, как расшифровать ролик по ссылке и превратить эфир или созвон в MAX в серию постов.

25 сентября 2026 16 мин чтения
Сервисы расшифровки аудио в текст и цены
Сервисы расшифровки аудио в текст и цены

Коротко. Расшифровать аудио в текст бесплатно можно в GigaChat (файл до 60 минут и 30 МБ) и Speech2Text (180 минут при регистрации), а час записи в Yandex SpeechKit стоит около 36 ₽. Условия сверены Tapbox 19.09.2026.

Часовой эфир, созвон с экспертом или голосовое на десять минут — это сырьё для десятка постов, если превратить речь в текст. Ниже — восемь сервисов, условия которых мы сверили по их официальным страницам 19 сентября 2026 года: что умеют, где лимиты, сколько стоит час записи. И отдельно — путь от эфира или звонка в MAX до серии постов, на котором не теряются цифры и имена.

Что такое транскрибация и чем она отличается от саммари

Транскрибация — это перевод речи из аудио- или видеозаписи в текст слово за словом, часто с тайм-кодами и пометками, кто говорит. «Расшифровка» — то же самое, только русским словом. Саммари — это краткое содержание: не всё сказанное, а главные мысли в нескольких абзацах. Субтитры — та же расшифровка, нарезанная на короткие строки и привязанная ко времени в ролике.

Технология за всем этим одна — распознавание речи. Так и отвечают на вопрос «перевод голоса в текст как называется»: распознавание речи, а когда вы говорите сами и текст сразу появляется в поле ввода — голосовой ввод, или диктовка.

Что этоЧто получаетеКогда нужно
Транскрибация (расшифровка)Полный текст, иногда с тайм-кодами и спикерамиЦитаты, статья по эфиру, протокол, поиск по записи
Саммари5–10 тезисов или пара абзацевПонять, о чём запись, и написать анонс
СубтитрыТекст по строкам с временем, файл SRTВидео в канал, которое смотрят без звука
Голосовой вводТекст из вашей речи прямо в поле сообщенияНабросать пост или ответ, не печатая

Внутри MAX речь в текст переводится без сторонних сервисов, но только для переписки: голосовые и кружки расшифровываются кнопкой рядом с сообщением. Где эта кнопка, какие у неё ограничения и как надиктовать сообщение вместо голосового, разобрано в статье как перевести голосовое в текст в MAX. Дальше — о том, чего встроенная кнопка не делает: о файлах, эфирах, созвонах и роликах по ссылке.

Где расшифровать аудио в текст онлайн: 8 сервисов

Условия каждого сервиса сверены по официальной странице 19 сентября 2026 года. Цены меняются, поэтому перед оплатой откройте тарифы ещё раз.

СервисЧто умеетЛимиты и цена
Кнопка расшифровки в MAXГолосовые и видеосообщения прямо в чатеБесплатно; справка описывает только сообщения, не файлы
GigaChat (giga.chat)Аудиофайлы, различает нескольких спикеров, тайм-кодов нетБесплатно, запись до 60 минут и до 30 МБ
Speech2TextФайлы и ссылки на YouTube, VK, Дзен; спикеры, тайм-коды, DOCX и субтитры SRT180 минут при регистрации и 15 минут в день, дальше 2–4 ₽ за минуту
Яндекс Браузер с Алисой AIПересказ видео с YouTube, VK Видео, Rutube и Дзена: «Кратко» и «Подробно» с тайм-кодамиРолики от 40 секунд до 4 часов; полного текста не даёт
Yandex SpeechKitРаспознавание через API — для разработчиков и сервисов0,1515 ₽ за 15 секунд, в отложенном режиме 0,0381 ₽
WhisperОткрытая модель OpenAI, работает на вашем компьютере без интернетаБесплатно, лицензия MIT; нужна установка
Телемост с Алисой ПроКонспект и полная расшифровка встречи с тайм-кодами на почту организаторуТарифы Яндекс 360 для компаний
Контур.ТолкРасшифровка и пересказ встреч, ИИ-протокол с решениями и задачамиРасшифровка — с тарифа «Профи», протокол — с «Бизнес Плюс»

GigaChat — самый простой бесплатный вариант для файла до часа. Лимиты взяты из справки на сайте GigaChat: «запись длительностью до 60 минут и размером до 30 МБ», спикеры различаются, тайм-кодов нет. В API у Сбера потолок 35 МБ на аудиофайл (документация от 17.07.2026). В самом MAX есть официальный бот GigaChat — он разобран в статье GigaChat в MAX, но лимитов на аудиофайлы для бота справка не называет.

Speech2Text нужен, когда требуется рабочий файл: субтитры SRT, документ Word, разметка по спикерам. Ролик можно не скачивать — сервис принимает ссылки на YouTube, VK и Дзен. Бесплатно — 180 минут при регистрации и 15 минут в день, сверх лимита 4 ₽ за минуту; на тарифе «Старт» без абонентской платы — 2 ₽.

Whisper — модель распознавания речи, которую OpenAI открыла в сентябре 2022 года под лицензией MIT. Её ставят на свой компьютер, и запись никуда не уходит — главный довод для разговоров с клиентами. Для ноутбука без мощной видеокарты есть порт whisper.cpp. Цена — время на установку: без навыков работы с командной строкой придётся искать готовую оболочку.

SaluteSpeech Сбера до сих пор советуют в подборках, но частному пользователю этот путь закрыт: с 15 июля 2026 года Сбер прекратил продажу новых пакетов и продление бесплатного тарифа Freemium для физлиц. Раньше Freemium давал 100 минут распознавания в месяц.

Запрос «без регистрации» понятен, но бесплатные минуты Speech2Text начисляются именно при регистрации, а совсем без аккаунта и облака работает Whisper на своём компьютере. Сайт, который обещает часовую расшифровку без входа и оплаты, проверьте до того, как загружать в него разговор с клиентом.

Какой сервис выбрать под вашу запись

Выбор зависит не от того, какая нейросеть «умнее», а от того, что у вас на руках: сообщение в чате, ролик по ссылке, файл или созвон, который ещё только будет. Идите по шагам сверху вниз.

Шаг 1. Что у вас за запись?

  • Голосовое или кружок в чате MAX — нажмите кнопку текста справа от сообщения, сторонний сервис не нужен
  • Видео по ссылке на YouTube, VK Видео, Rutube или Дзен — шаг 2
  • Аудио- или видеофайл на телефоне или компьютере — шаг 3
  • Созвон или эфир, который ещё предстоит, — шаг 4

Шаг 2. Видео по ссылке

  • Нужно понять, о чём ролик, — пересказ в Яндекс Браузере, вкладки «Кратко» и «Подробно» с тайм-кодами
  • Нужен полный текст или субтитры — вставьте ссылку в Speech2Text
  • Ролик нужен файлом, чтобы расшифровать в другом сервисе, — скачайте его — шаг 3

Шаг 3. Файл

  • Запись до часа, её можно отдать в облако — GigaChat, бесплатно; видео сначала превратите в звук
  • Больше часа или нужны спикеры, тайм-коды и SRT — Speech2Text
  • Записей десятки в месяц и есть разработчик — Yandex SpeechKit по API
  • Разговор конфиденциальный — Whisper на своём компьютере

Шаг 4. Созвон или эфир

  • Звонок в MAX — включите запись, файл придёт в «Избранное» — шаг 3
  • Эфир в канале MAX идёт через VK Видео, запись остаётся там — скачайте её — шаг 3
  • Рабочие встречи компании каждый день — Телемост или Контур.Толк на тарифах с расшифровкой

Сколько стоит расшифровка часа записи

Чтобы сравнить сервисы с разной единицей оплаты, мы пересчитали всё в один час записи по тарифам на 19 сентября 2026 года. У SpeechKit единица тарификации — 15 секунд одноканального звука, в часе их 240.

СпособЧас записи, ₽Оговорка
Кнопка в MAX0Только голосовые и кружки в чате
GigaChat0Файл до 60 минут и 30 МБ
Whisper на своём компьютере0Время на установку и обработку
Yandex SpeechKit, отложенный режим90,0381 ₽ × 240, результат не сразу
Yandex SpeechKit, асинхронно360,1515 ₽ × 240 = 36,36 ₽
Speech2Text, тариф «Старт»1202 ₽ за минуту
Speech2Text сверх бесплатного лимита2404 ₽ за минуту

Пример. Канал онлайн-школы проводит четыре часовых эфира в месяц. В SpeechKit асинхронно это 4 × 36,36 = 145 ₽, в Speech2Text на «Старте» — 240 минут × 2 ₽ = 480 ₽, в GigaChat — ноль, если каждый эфир уложен в файл до 60 минут и 30 МБ. Разница невелика, поэтому решает другое: нужны ли SRT и спикеры и можно ли отдавать запись в облако.

Как расшифровать видео по ссылке с YouTube и VK Видео

«Расшифровка видео по ссылке» — это два разных желания: понять, о чём ролик, или получить весь текст.

Пересказ. В Яндекс Браузере Алиса AI пересказывает ролики с dzen.ru, vkvideo.ru, vk.com, youtube.com и rutube.ru. По справке Браузера, длительность видео — от 40 секунд до 4 часов, основные языки — русский и английский, а у пересказа две вкладки: «Кратко» с главными тезисами и «Подробно». Полного текста функция не выдаёт — это саммари, а не расшифровка.

Полный текст. Speech2Text принимает ссылки на YouTube, VK и Дзен и возвращает расшифровку с тайм-кодами, её можно скачать документом или субтитрами. Если ссылки сервис не берёт, скачайте ролик и загрузите файлом: способы для VK собраны в статье как скачать видео из ВК и VK Видео, а ролик с YouTube можно получить прямо в MAX через бота-скачивателя — это разобрано в инструкции как скачать видео с YouTube и TikTok в MAX.

Субтитры для зрителей. VK Видео делает автоматические «умные субтитры» с пунктуацией — о запуске VK сообщила в пресс-релизе от 24.02.2025. Зрителям записи эфира это помогает смотреть без звука, но выгрузку текста субтитров автору релиз не описывает — для поста текст придётся расшифровать отдельно.

Как записать эфир или созвон в MAX и подготовить файл

Расшифровать можно только то, что записано. В MAX у звонков и эфиров разные пути к файлу.

Звонок. Запись — штатная функция: по справке MAX включить её может любой участник, вести одновременно — только один, и в момент старта всем собеседникам приходит уведомление. Файлу можно задать название, после остановки запись уходит в «Избранное» тому, кто её вёл, а обработка «может занимать несколько минут». Где кнопка на разных устройствах и кто может остановить чужую запись, разобрано в статье как позвонить в MAX. Интервью с экспертом по звонку — самый короткий путь к расшифровке: запись уже у вас.

Эфир в канале. Трансляция в канале MAX технически идёт через VK Видео, поэтому запись эфира остаётся там, а не в мессенджере. Как устроены эфиры и что делать, если бота трансляций в канале пока нет, — в статье прямой эфир в MAX. Запасной вариант, который там же описан: провести эфир звонком по ссылке с записью — тогда файл окажется в «Избранном».

Длинное голосовое. Встроенная кнопка переводит его в текст, но если нужен файл для внешнего сервиса, кнопки «Скачать» у голосового нет — как быть, разобрано в статье как сохранить голосовое из MAX.

Видео в звук. Запись звонка — это видеофайл, а часовое видео весит сотни мегабайт и в лимит GigaChat не пролезет. Для распознавания картинка не нужна: достаточно звука в моно. При битрейте 48 кбит/с час речи весит 48 000 × 3 600 ÷ 8 = 21,6 МБ — с запасом до лимита в 30 МБ. На компьютере это делает бесплатная программа ffmpeg одной командой:

ffmpeg -i zapis.mp4 -vn -ac 1 -b:a 48k zvuk.mp3

Здесь -vn отбрасывает видео, -ac 1 сводит звук в один канал, -b:a 48k задаёт битрейт. Моно полезно и для SpeechKit: он считает секунды одноканального звука. Если командная строка пугает, тот же результат даёт плеер VLC через «Медиа» → «Конвертировать/сохранить» с профилем MP3.

Нейросеть для саммари: как получить краткое содержание записи

Саммари надёжнее делать в два шага: сначала полный текст, потом выжимка из него. Так каждую мысль выжимки можно найти в расшифровке и проверить. Пересказ без расшифровки, как в Браузере, хорош для чужих роликов, а для своего эфира нужен текст-источник.

Второй шаг делает любая текстовая нейросеть — GigaChat, Алиса AI или другая. Качество выжимки решает запрос: модели надо запретить додумывать и попросить отметить, где мысль прозвучала. Как устроен хороший запрос, разобрано в статье что такое промпт. Рабочий вариант для эфира:

Ниже расшифровка часового эфира канала о [тема]. Выпиши: 1) пять главных мыслей, по одной фразе на каждую; 2) все цифры и факты, которые прозвучали, с тайм-кодом; 3) вопросы зрителей и ответы на них. Ничего не добавляй от себя. Если чего-то нет в тексте, пиши «в эфире не прозвучало».

Если расшифровка длиннее, чем модель принимает за раз, режьте её на куски по 15–20 минут и просите саммари каждого куска, а потом — общее из готовых выжимок.

Как из эфира сделать посты

Эфир живёт один вечер, а текст из него можно раскладывать по каналу неделями. Порядок работы:

  1. Запишите эфир или звонок и сохраните файл: запись звонка приходит в «Избранное», запись трансляции остаётся в VK Видео.
  2. Превратите видео в звук в моно и проверьте, что файл укладывается в лимит выбранного сервиса.
  3. Расшифруйте запись с тайм-кодами и разметкой спикеров, если сервис это умеет.
  4. Вычитайте по записи имена, цифры, названия и термины.
  5. Попросите нейросеть сделать саммари с тайм-кодами и выберите 5–7 мыслей, которые тянут на отдельный пост.
  6. Сделайте из каждой мысли пост вашим голосом: формулировки берите из расшифровки, цифры переносите без изменений.
  7. Опубликуйте запись с оглавлением по тайм-кодам, а посты-тезисы разнесите по дням со ссылкой на нужную минуту эфира.

Запрос для шестого шага, который сохраняет вашу речь, а не превращает её в пресс-релиз:

Сделай из расшифровки пять постов для канала по 600–900 знаков. Каждый пост — одна мысль из эфира: первая строка-заголовок, два-три коротких абзаца, в конце вопрос к читателям. Бери мои формулировки из текста, цифры переноси без изменений, имена и названия не исправляй. Под каждым постом укажи тайм-код, где прозвучала мысль.

Какие публикации получаются из одной записи:

Формат постаЧто взять из расшифровкиПример
Запись с оглавлениемТайм-коды тем из саммари«12:40 — как считать цену подписчика»
Пост-тезисОдна мысль и пример к нейРазбор одного вопроса из эфира
ЦитатаТочная фраза спикераКарточка с цитатой гостя
Вопросы и ответыВопросы зрителей«Пять вопросов, которые не успели разобрать»
ОпросСпорный момент эфира«А вы как считаете?» по теме выпуска
Чек-листШаги, которые проговорил спикерМатериал за подписку или в закреп

Пример на числах. При темпе речи 120 слов в минуту часовой эфир — это около 7 200 слов, десятки страниц текста. Из такого объёма спокойно выходят запись с оглавлением, пять постов-тезисов, две цитаты, пост с вопросами, опрос и чек-лист — одиннадцать публикаций на две недели из одного вечера. Чек-лист по эфиру — готовый лид-магнит, а как из одного материала собрать набор под разные площадки без копипасты, разобрано в статье о переупаковке контента.

Что проверять в расшифровке руками

Единых цифр точности, посчитанных для всех сервисов одинаково, нет: каждый меряет на своих записях. Правило простое — смысл нейросеть передаёт хорошо, а ошибается чаще всего в том, что в посте перепутать нельзя.

  • Имена и фамилии. Редкую фамилию модель заменит похожим словом. Сверяйте со списком участников.
  • Цифры. «Пятнадцать» и «пятьдесят», «семнадцать» и «семьдесят» на слух различаются плохо. Каждую цифру в посте проверяйте по записи по тайм-коду.
  • Названия и термины. Бренды, английские слова, профессиональный жаргон. Спикеру стоит один раз произнести название чётко и по буквам, если оно редкое.
  • Кто что сказал. Разметка спикеров путается, когда люди говорят одновременно. Чужие слова, приписанные гостю, — худшая ошибка в посте-цитате.
  • Фразы из ниоткуда. На шуме, музыке или в долгой тишине модель иногда выдаёт текст, которого не было. Фраза, которая выбивается из разговора, — повод переслушать этот кусок.

Лучшая страховка — чистый исходник: гарнитура вместо встроенного микрофона ноутбука, без музыки фоном, по одному говорящему.

Можно ли расшифровывать и публиковать чужие записи

Расшифровать ролик для себя, чтобы быстро понять содержание, — обычная работа с информацией. Вопросы начинаются, когда текст уходит в канал.

Чужой эфир или лекция. Авторское право распространяется на произведения и в устной форме — в виде публичного произнесения или исполнения (п. 3 ст. 1259 ГК РФ). Выложить полную расшифровку чужого выступления — то же самое, что выложить чужую статью. Короткая цитата со ссылкой на автора и свой разбор — другое дело; где граница, собрано в статье можно ли брать чужие посты в канал.

Разговор с клиентом или гостем. В записи звонка — имена, телефоны, иногда адреса. Загружая её в облачный сервис, вы передаёте эти данные третьей стороне, а публикуя цитату, — всем подписчикам. Спросите разрешения у собеседника до записи, а при сомнениях расшифровывайте локально в Whisper. Что требует закон, когда в переписке и звонках есть персональные данные, разобрано в статье закон о персональных данных в мессенджере. Уведомление о начале записи MAX присылает всем участникам звонка сам, но согласием на публикацию оно не является.

Частые ошибки

  • Публиковать расшифровку без вычитки. Одна перепутанная цифра в посте стоит дороже, чем пять минут проверки по тайм-кодам.
  • Выкладывать сплошной текст эфира. Расшифровка — сырьё, а не пост: читать полотно без абзацев никто не станет. Режьте на мысли.
  • Просить саммари прямо у звука и сразу постить. Без текста-источника нечем проверить, что нейросеть не додумала.
  • Рассчитывать на SaluteSpeech для физлиц. С 15 июля 2026 года новые пакеты и продление бесплатного тарифа частным пользователям не продаются.
  • Отдавать в облако конфиденциальный созвон. Для разговоров с клиентами и внутренних встреч безопаснее локальная расшифровка.

Чек-лист

  • Запись включена с первой минуты, участники знают, что их записывают.
  • Файл найден: звонок — в «Избранном», трансляция — в VK Видео.
  • Видео превращено в звук в моно, файл укладывается в лимит сервиса.
  • Сервис выбран по задаче: GigaChat до часа, Speech2Text для SRT и спикеров, Whisper для конфиденциального.
  • Имена, цифры и названия сверены с записью по тайм-кодам.
  • Саммари сделано из текста, у каждой мысли есть тайм-код.
  • Из эфира собраны запись с оглавлением, посты-тезисы, цитаты, вопросы и чек-лист.
  • Чужие выступления — только цитатами со ссылкой, разговоры с гостями — с их согласия.

Остался вопрос по теме статьи? Напишите его в предложку блога — отвечаю лично: задать вопрос в MAX. Частые вопросы разбираю отдельными статьями и присылаю ссылку тому, кто спросил.

Частые вопросы

Расшифровка аудио в текст — где сделать бесплатно?

Расшифровать аудио в текст бесплатно можно в GigaChat (файл до 60 минут и 30 МБ) и Speech2Text (180 минут при регистрации), а час записи в Yandex SpeechKit стоит около 36 ₽. Условия сверены Tapbox 19.09.2026.

Что такое транскрибация простыми словами?

Это перевод речи из аудио- или видеозаписи в текст слово за словом, часто с тайм-кодами и пометками, кто говорит. Саммари — другое: краткое содержание в нескольких абзацах. Субтитры — та же расшифровка, нарезанная на строки и привязанная ко времени в ролике.

Как расшифровать видео с YouTube в текст по ссылке?

Полный текст по ссылке делает Speech2Text: он принимает ссылки на YouTube, VK и Дзен и отдаёт расшифровку с тайм-кодами, документом или субтитрами SRT. Если нужно только понять, о чём ролик, хватит пересказа в Яндекс Браузере: он работает для видео от 40 секунд до 4 часов.

Какая нейросеть делает саммари видео и аудио?

Пересказ роликов с YouTube, VK Видео, Rutube и Дзена делает Алиса AI в Яндекс Браузере — вкладки «Кратко» и «Подробно» с тайм-кодами. Для своей записи надёжнее два шага: сначала расшифровка, потом саммари из текста в GigaChat или другой текстовой нейросети, чтобы каждую мысль можно было проверить.

Можно ли расшифровать запись звонка в MAX?

Да, через файл. Звонок в MAX записывается штатно: после остановки запись приходит в «Избранное» тому, кто её вёл, и её можно скачать. Расшифровки звонков в справке MAX нет, поэтому файл отдают стороннему сервису — например, GigaChat или Speech2Text, предварительно превратив видео в звук.

Как перевести голосовое в текст в MAX?

Встроенной кнопкой: откройте чат и нажмите кнопку текста справа от голосового или видеосообщения — так это описано в справке MAX. Сторонний сервис нужен только для файлов, записей звонков и эфиров.

Работает ли SaluteSpeech бесплатно для физлиц?

Нет. С 15 июля 2026 года Сбер прекратил продажу новых пакетов и продление бесплатного тарифа Freemium для физических лиц. Ранее купленные пакеты действуют до конца срока или до исчерпания лимита.

Можно ли расшифровать аудио без интернета?

Да: открытая модель Whisper от OpenAI работает на вашем компьютере, и запись никуда не отправляется. Она бесплатна и распространяется по лицензии MIT, для обычного ноутбука есть порт whisper.cpp. Цена — время на установку и обработку.

Статья помогла?
Николай Шаповалов Николай Шаповалов Основатель Tapbox, делает сервисы для MAX Канал автора в MAX

Читайте дальше