Расшифровка аудио в текст: 8 сервисов и как сделать из эфира посты
Где бесплатно перевести аудио и видео в текст, сколько стоит час записи, как расшифровать ролик по ссылке и превратить эфир или созвон в MAX в серию постов.
В этой статье
Коротко. Расшифровать аудио в текст бесплатно можно в GigaChat (файл до 60 минут и 30 МБ) и Speech2Text (180 минут при регистрации), а час записи в Yandex SpeechKit стоит около 36 ₽. Условия сверены Tapbox 19.09.2026.
Часовой эфир, созвон с экспертом или голосовое на десять минут — это сырьё для десятка постов, если превратить речь в текст. Ниже — восемь сервисов, условия которых мы сверили по их официальным страницам 19 сентября 2026 года: что умеют, где лимиты, сколько стоит час записи. И отдельно — путь от эфира или звонка в MAX до серии постов, на котором не теряются цифры и имена.
Что такое транскрибация и чем она отличается от саммари
Транскрибация — это перевод речи из аудио- или видеозаписи в текст слово за словом, часто с тайм-кодами и пометками, кто говорит. «Расшифровка» — то же самое, только русским словом. Саммари — это краткое содержание: не всё сказанное, а главные мысли в нескольких абзацах. Субтитры — та же расшифровка, нарезанная на короткие строки и привязанная ко времени в ролике.
Технология за всем этим одна — распознавание речи. Так и отвечают на вопрос «перевод голоса в текст как называется»: распознавание речи, а когда вы говорите сами и текст сразу появляется в поле ввода — голосовой ввод, или диктовка.
| Что это | Что получаете | Когда нужно |
|---|---|---|
| Транскрибация (расшифровка) | Полный текст, иногда с тайм-кодами и спикерами | Цитаты, статья по эфиру, протокол, поиск по записи |
| Саммари | 5–10 тезисов или пара абзацев | Понять, о чём запись, и написать анонс |
| Субтитры | Текст по строкам с временем, файл SRT | Видео в канал, которое смотрят без звука |
| Голосовой ввод | Текст из вашей речи прямо в поле сообщения | Набросать пост или ответ, не печатая |
Внутри MAX речь в текст переводится без сторонних сервисов, но только для переписки: голосовые и кружки расшифровываются кнопкой рядом с сообщением. Где эта кнопка, какие у неё ограничения и как надиктовать сообщение вместо голосового, разобрано в статье как перевести голосовое в текст в MAX. Дальше — о том, чего встроенная кнопка не делает: о файлах, эфирах, созвонах и роликах по ссылке.
Где расшифровать аудио в текст онлайн: 8 сервисов
Условия каждого сервиса сверены по официальной странице 19 сентября 2026 года. Цены меняются, поэтому перед оплатой откройте тарифы ещё раз.
| Сервис | Что умеет | Лимиты и цена |
|---|---|---|
| Кнопка расшифровки в MAX | Голосовые и видеосообщения прямо в чате | Бесплатно; справка описывает только сообщения, не файлы |
| GigaChat (giga.chat) | Аудиофайлы, различает нескольких спикеров, тайм-кодов нет | Бесплатно, запись до 60 минут и до 30 МБ |
| Speech2Text | Файлы и ссылки на YouTube, VK, Дзен; спикеры, тайм-коды, DOCX и субтитры SRT | 180 минут при регистрации и 15 минут в день, дальше 2–4 ₽ за минуту |
| Яндекс Браузер с Алисой AI | Пересказ видео с YouTube, VK Видео, Rutube и Дзена: «Кратко» и «Подробно» с тайм-кодами | Ролики от 40 секунд до 4 часов; полного текста не даёт |
| Yandex SpeechKit | Распознавание через API — для разработчиков и сервисов | 0,1515 ₽ за 15 секунд, в отложенном режиме 0,0381 ₽ |
| Whisper | Открытая модель OpenAI, работает на вашем компьютере без интернета | Бесплатно, лицензия MIT; нужна установка |
| Телемост с Алисой Про | Конспект и полная расшифровка встречи с тайм-кодами на почту организатору | Тарифы Яндекс 360 для компаний |
| Контур.Толк | Расшифровка и пересказ встреч, ИИ-протокол с решениями и задачами | Расшифровка — с тарифа «Профи», протокол — с «Бизнес Плюс» |
GigaChat — самый простой бесплатный вариант для файла до часа. Лимиты взяты из справки на сайте GigaChat: «запись длительностью до 60 минут и размером до 30 МБ», спикеры различаются, тайм-кодов нет. В API у Сбера потолок 35 МБ на аудиофайл (документация от 17.07.2026). В самом MAX есть официальный бот GigaChat — он разобран в статье GigaChat в MAX, но лимитов на аудиофайлы для бота справка не называет.
Speech2Text нужен, когда требуется рабочий файл: субтитры SRT, документ Word, разметка по спикерам. Ролик можно не скачивать — сервис принимает ссылки на YouTube, VK и Дзен. Бесплатно — 180 минут при регистрации и 15 минут в день, сверх лимита 4 ₽ за минуту; на тарифе «Старт» без абонентской платы — 2 ₽.
Whisper — модель распознавания речи, которую OpenAI открыла в сентябре 2022 года под лицензией MIT. Её ставят на свой компьютер, и запись никуда не уходит — главный довод для разговоров с клиентами. Для ноутбука без мощной видеокарты есть порт whisper.cpp. Цена — время на установку: без навыков работы с командной строкой придётся искать готовую оболочку.
SaluteSpeech Сбера до сих пор советуют в подборках, но частному пользователю этот путь закрыт: с 15 июля 2026 года Сбер прекратил продажу новых пакетов и продление бесплатного тарифа Freemium для физлиц. Раньше Freemium давал 100 минут распознавания в месяц.
Запрос «без регистрации» понятен, но бесплатные минуты Speech2Text начисляются именно при регистрации, а совсем без аккаунта и облака работает Whisper на своём компьютере. Сайт, который обещает часовую расшифровку без входа и оплаты, проверьте до того, как загружать в него разговор с клиентом.
Какой сервис выбрать под вашу запись
Выбор зависит не от того, какая нейросеть «умнее», а от того, что у вас на руках: сообщение в чате, ролик по ссылке, файл или созвон, который ещё только будет. Идите по шагам сверху вниз.
Шаг 1. Что у вас за запись?
- Голосовое или кружок в чате MAX — нажмите кнопку текста справа от сообщения, сторонний сервис не нужен
- Видео по ссылке на YouTube, VK Видео, Rutube или Дзен — шаг 2
- Аудио- или видеофайл на телефоне или компьютере — шаг 3
- Созвон или эфир, который ещё предстоит, — шаг 4
Шаг 2. Видео по ссылке
- Нужно понять, о чём ролик, — пересказ в Яндекс Браузере, вкладки «Кратко» и «Подробно» с тайм-кодами
- Нужен полный текст или субтитры — вставьте ссылку в Speech2Text
- Ролик нужен файлом, чтобы расшифровать в другом сервисе, — скачайте его — шаг 3
Шаг 3. Файл
- Запись до часа, её можно отдать в облако — GigaChat, бесплатно; видео сначала превратите в звук
- Больше часа или нужны спикеры, тайм-коды и SRT — Speech2Text
- Записей десятки в месяц и есть разработчик — Yandex SpeechKit по API
- Разговор конфиденциальный — Whisper на своём компьютере
Шаг 4. Созвон или эфир
- Звонок в MAX — включите запись, файл придёт в «Избранное» — шаг 3
- Эфир в канале MAX идёт через VK Видео, запись остаётся там — скачайте её — шаг 3
- Рабочие встречи компании каждый день — Телемост или Контур.Толк на тарифах с расшифровкой
Сколько стоит расшифровка часа записи
Чтобы сравнить сервисы с разной единицей оплаты, мы пересчитали всё в один час записи по тарифам на 19 сентября 2026 года. У SpeechKit единица тарификации — 15 секунд одноканального звука, в часе их 240.
| Способ | Час записи, ₽ | Оговорка |
|---|---|---|
| Кнопка в MAX | 0 | Только голосовые и кружки в чате |
| GigaChat | 0 | Файл до 60 минут и 30 МБ |
| Whisper на своём компьютере | 0 | Время на установку и обработку |
| Yandex SpeechKit, отложенный режим | 9 | 0,0381 ₽ × 240, результат не сразу |
| Yandex SpeechKit, асинхронно | 36 | 0,1515 ₽ × 240 = 36,36 ₽ |
| Speech2Text, тариф «Старт» | 120 | 2 ₽ за минуту |
| Speech2Text сверх бесплатного лимита | 240 | 4 ₽ за минуту |
Пример. Канал онлайн-школы проводит четыре часовых эфира в месяц. В SpeechKit асинхронно это 4 × 36,36 = 145 ₽, в Speech2Text на «Старте» — 240 минут × 2 ₽ = 480 ₽, в GigaChat — ноль, если каждый эфир уложен в файл до 60 минут и 30 МБ. Разница невелика, поэтому решает другое: нужны ли SRT и спикеры и можно ли отдавать запись в облако.
Как расшифровать видео по ссылке с YouTube и VK Видео
«Расшифровка видео по ссылке» — это два разных желания: понять, о чём ролик, или получить весь текст.
Пересказ. В Яндекс Браузере Алиса AI пересказывает ролики с dzen.ru, vkvideo.ru, vk.com, youtube.com и rutube.ru. По справке Браузера, длительность видео — от 40 секунд до 4 часов, основные языки — русский и английский, а у пересказа две вкладки: «Кратко» с главными тезисами и «Подробно». Полного текста функция не выдаёт — это саммари, а не расшифровка.
Полный текст. Speech2Text принимает ссылки на YouTube, VK и Дзен и возвращает расшифровку с тайм-кодами, её можно скачать документом или субтитрами. Если ссылки сервис не берёт, скачайте ролик и загрузите файлом: способы для VK собраны в статье как скачать видео из ВК и VK Видео, а ролик с YouTube можно получить прямо в MAX через бота-скачивателя — это разобрано в инструкции как скачать видео с YouTube и TikTok в MAX.
Субтитры для зрителей. VK Видео делает автоматические «умные субтитры» с пунктуацией — о запуске VK сообщила в пресс-релизе от 24.02.2025. Зрителям записи эфира это помогает смотреть без звука, но выгрузку текста субтитров автору релиз не описывает — для поста текст придётся расшифровать отдельно.
Как записать эфир или созвон в MAX и подготовить файл
Расшифровать можно только то, что записано. В MAX у звонков и эфиров разные пути к файлу.
Звонок. Запись — штатная функция: по справке MAX включить её может любой участник, вести одновременно — только один, и в момент старта всем собеседникам приходит уведомление. Файлу можно задать название, после остановки запись уходит в «Избранное» тому, кто её вёл, а обработка «может занимать несколько минут». Где кнопка на разных устройствах и кто может остановить чужую запись, разобрано в статье как позвонить в MAX. Интервью с экспертом по звонку — самый короткий путь к расшифровке: запись уже у вас.
Эфир в канале. Трансляция в канале MAX технически идёт через VK Видео, поэтому запись эфира остаётся там, а не в мессенджере. Как устроены эфиры и что делать, если бота трансляций в канале пока нет, — в статье прямой эфир в MAX. Запасной вариант, который там же описан: провести эфир звонком по ссылке с записью — тогда файл окажется в «Избранном».
Длинное голосовое. Встроенная кнопка переводит его в текст, но если нужен файл для внешнего сервиса, кнопки «Скачать» у голосового нет — как быть, разобрано в статье как сохранить голосовое из MAX.
Видео в звук. Запись звонка — это видеофайл, а часовое видео весит сотни мегабайт и в лимит GigaChat не пролезет. Для распознавания картинка не нужна: достаточно звука в моно. При битрейте 48 кбит/с час речи весит 48 000 × 3 600 ÷ 8 = 21,6 МБ — с запасом до лимита в 30 МБ. На компьютере это делает бесплатная программа ffmpeg одной командой:
ffmpeg -i zapis.mp4 -vn -ac 1 -b:a 48k zvuk.mp3
Здесь -vn отбрасывает видео, -ac 1 сводит звук в один канал, -b:a 48k задаёт битрейт. Моно полезно и для SpeechKit: он считает секунды одноканального звука. Если командная строка пугает, тот же результат даёт плеер VLC через «Медиа» → «Конвертировать/сохранить» с профилем MP3.
Нейросеть для саммари: как получить краткое содержание записи
Саммари надёжнее делать в два шага: сначала полный текст, потом выжимка из него. Так каждую мысль выжимки можно найти в расшифровке и проверить. Пересказ без расшифровки, как в Браузере, хорош для чужих роликов, а для своего эфира нужен текст-источник.
Второй шаг делает любая текстовая нейросеть — GigaChat, Алиса AI или другая. Качество выжимки решает запрос: модели надо запретить додумывать и попросить отметить, где мысль прозвучала. Как устроен хороший запрос, разобрано в статье что такое промпт. Рабочий вариант для эфира:
Ниже расшифровка часового эфира канала о [тема]. Выпиши: 1) пять главных мыслей, по одной фразе на каждую; 2) все цифры и факты, которые прозвучали, с тайм-кодом; 3) вопросы зрителей и ответы на них. Ничего не добавляй от себя. Если чего-то нет в тексте, пиши «в эфире не прозвучало».
Если расшифровка длиннее, чем модель принимает за раз, режьте её на куски по 15–20 минут и просите саммари каждого куска, а потом — общее из готовых выжимок.
Как из эфира сделать посты
Эфир живёт один вечер, а текст из него можно раскладывать по каналу неделями. Порядок работы:
- Запишите эфир или звонок и сохраните файл: запись звонка приходит в «Избранное», запись трансляции остаётся в VK Видео.
- Превратите видео в звук в моно и проверьте, что файл укладывается в лимит выбранного сервиса.
- Расшифруйте запись с тайм-кодами и разметкой спикеров, если сервис это умеет.
- Вычитайте по записи имена, цифры, названия и термины.
- Попросите нейросеть сделать саммари с тайм-кодами и выберите 5–7 мыслей, которые тянут на отдельный пост.
- Сделайте из каждой мысли пост вашим голосом: формулировки берите из расшифровки, цифры переносите без изменений.
- Опубликуйте запись с оглавлением по тайм-кодам, а посты-тезисы разнесите по дням со ссылкой на нужную минуту эфира.
Запрос для шестого шага, который сохраняет вашу речь, а не превращает её в пресс-релиз:
Сделай из расшифровки пять постов для канала по 600–900 знаков. Каждый пост — одна мысль из эфира: первая строка-заголовок, два-три коротких абзаца, в конце вопрос к читателям. Бери мои формулировки из текста, цифры переноси без изменений, имена и названия не исправляй. Под каждым постом укажи тайм-код, где прозвучала мысль.
Какие публикации получаются из одной записи:
| Формат поста | Что взять из расшифровки | Пример |
|---|---|---|
| Запись с оглавлением | Тайм-коды тем из саммари | «12:40 — как считать цену подписчика» |
| Пост-тезис | Одна мысль и пример к ней | Разбор одного вопроса из эфира |
| Цитата | Точная фраза спикера | Карточка с цитатой гостя |
| Вопросы и ответы | Вопросы зрителей | «Пять вопросов, которые не успели разобрать» |
| Опрос | Спорный момент эфира | «А вы как считаете?» по теме выпуска |
| Чек-лист | Шаги, которые проговорил спикер | Материал за подписку или в закреп |
Пример на числах. При темпе речи 120 слов в минуту часовой эфир — это около 7 200 слов, десятки страниц текста. Из такого объёма спокойно выходят запись с оглавлением, пять постов-тезисов, две цитаты, пост с вопросами, опрос и чек-лист — одиннадцать публикаций на две недели из одного вечера. Чек-лист по эфиру — готовый лид-магнит, а как из одного материала собрать набор под разные площадки без копипасты, разобрано в статье о переупаковке контента.
Что проверять в расшифровке руками
Единых цифр точности, посчитанных для всех сервисов одинаково, нет: каждый меряет на своих записях. Правило простое — смысл нейросеть передаёт хорошо, а ошибается чаще всего в том, что в посте перепутать нельзя.
- Имена и фамилии. Редкую фамилию модель заменит похожим словом. Сверяйте со списком участников.
- Цифры. «Пятнадцать» и «пятьдесят», «семнадцать» и «семьдесят» на слух различаются плохо. Каждую цифру в посте проверяйте по записи по тайм-коду.
- Названия и термины. Бренды, английские слова, профессиональный жаргон. Спикеру стоит один раз произнести название чётко и по буквам, если оно редкое.
- Кто что сказал. Разметка спикеров путается, когда люди говорят одновременно. Чужие слова, приписанные гостю, — худшая ошибка в посте-цитате.
- Фразы из ниоткуда. На шуме, музыке или в долгой тишине модель иногда выдаёт текст, которого не было. Фраза, которая выбивается из разговора, — повод переслушать этот кусок.
Лучшая страховка — чистый исходник: гарнитура вместо встроенного микрофона ноутбука, без музыки фоном, по одному говорящему.
Можно ли расшифровывать и публиковать чужие записи
Расшифровать ролик для себя, чтобы быстро понять содержание, — обычная работа с информацией. Вопросы начинаются, когда текст уходит в канал.
Чужой эфир или лекция. Авторское право распространяется на произведения и в устной форме — в виде публичного произнесения или исполнения (п. 3 ст. 1259 ГК РФ). Выложить полную расшифровку чужого выступления — то же самое, что выложить чужую статью. Короткая цитата со ссылкой на автора и свой разбор — другое дело; где граница, собрано в статье можно ли брать чужие посты в канал.
Разговор с клиентом или гостем. В записи звонка — имена, телефоны, иногда адреса. Загружая её в облачный сервис, вы передаёте эти данные третьей стороне, а публикуя цитату, — всем подписчикам. Спросите разрешения у собеседника до записи, а при сомнениях расшифровывайте локально в Whisper. Что требует закон, когда в переписке и звонках есть персональные данные, разобрано в статье закон о персональных данных в мессенджере. Уведомление о начале записи MAX присылает всем участникам звонка сам, но согласием на публикацию оно не является.
Частые ошибки
- Публиковать расшифровку без вычитки. Одна перепутанная цифра в посте стоит дороже, чем пять минут проверки по тайм-кодам.
- Выкладывать сплошной текст эфира. Расшифровка — сырьё, а не пост: читать полотно без абзацев никто не станет. Режьте на мысли.
- Просить саммари прямо у звука и сразу постить. Без текста-источника нечем проверить, что нейросеть не додумала.
- Рассчитывать на SaluteSpeech для физлиц. С 15 июля 2026 года новые пакеты и продление бесплатного тарифа частным пользователям не продаются.
- Отдавать в облако конфиденциальный созвон. Для разговоров с клиентами и внутренних встреч безопаснее локальная расшифровка.
Чек-лист
- Запись включена с первой минуты, участники знают, что их записывают.
- Файл найден: звонок — в «Избранном», трансляция — в VK Видео.
- Видео превращено в звук в моно, файл укладывается в лимит сервиса.
- Сервис выбран по задаче: GigaChat до часа, Speech2Text для SRT и спикеров, Whisper для конфиденциального.
- Имена, цифры и названия сверены с записью по тайм-кодам.
- Саммари сделано из текста, у каждой мысли есть тайм-код.
- Из эфира собраны запись с оглавлением, посты-тезисы, цитаты, вопросы и чек-лист.
- Чужие выступления — только цитатами со ссылкой, разговоры с гостями — с их согласия.
Остался вопрос по теме статьи? Напишите его в предложку блога — отвечаю лично: задать вопрос в MAX. Частые вопросы разбираю отдельными статьями и присылаю ссылку тому, кто спросил.
Частые вопросы
Расшифровка аудио в текст — где сделать бесплатно?
Расшифровать аудио в текст бесплатно можно в GigaChat (файл до 60 минут и 30 МБ) и Speech2Text (180 минут при регистрации), а час записи в Yandex SpeechKit стоит около 36 ₽. Условия сверены Tapbox 19.09.2026.
Что такое транскрибация простыми словами?
Это перевод речи из аудио- или видеозаписи в текст слово за словом, часто с тайм-кодами и пометками, кто говорит. Саммари — другое: краткое содержание в нескольких абзацах. Субтитры — та же расшифровка, нарезанная на строки и привязанная ко времени в ролике.
Как расшифровать видео с YouTube в текст по ссылке?
Полный текст по ссылке делает Speech2Text: он принимает ссылки на YouTube, VK и Дзен и отдаёт расшифровку с тайм-кодами, документом или субтитрами SRT. Если нужно только понять, о чём ролик, хватит пересказа в Яндекс Браузере: он работает для видео от 40 секунд до 4 часов.
Какая нейросеть делает саммари видео и аудио?
Пересказ роликов с YouTube, VK Видео, Rutube и Дзена делает Алиса AI в Яндекс Браузере — вкладки «Кратко» и «Подробно» с тайм-кодами. Для своей записи надёжнее два шага: сначала расшифровка, потом саммари из текста в GigaChat или другой текстовой нейросети, чтобы каждую мысль можно было проверить.
Можно ли расшифровать запись звонка в MAX?
Да, через файл. Звонок в MAX записывается штатно: после остановки запись приходит в «Избранное» тому, кто её вёл, и её можно скачать. Расшифровки звонков в справке MAX нет, поэтому файл отдают стороннему сервису — например, GigaChat или Speech2Text, предварительно превратив видео в звук.
Как перевести голосовое в текст в MAX?
Встроенной кнопкой: откройте чат и нажмите кнопку текста справа от голосового или видеосообщения — так это описано в справке MAX. Сторонний сервис нужен только для файлов, записей звонков и эфиров.
Работает ли SaluteSpeech бесплатно для физлиц?
Нет. С 15 июля 2026 года Сбер прекратил продажу новых пакетов и продление бесплатного тарифа Freemium для физических лиц. Ранее купленные пакеты действуют до конца срока или до исчерпания лимита.
Можно ли расшифровать аудио без интернета?
Да: открытая модель Whisper от OpenAI работает на вашем компьютере, и запись никуда не отправляется. Она бесплатна и распространяется по лицензии MIT, для обычного ноутбука есть порт whisper.cpp. Цена — время на установку и обработку.
Читайте дальше
-
Озвучка текста нейросетью: сервисы, цены и голос для видео в канал
Какие нейросети озвучивают текст в России в 2026 году, сколько стоит 1 000 знаков, какой голос выбрать, как исправить…
-
Нейросети для бизнеса: 12 задач, которые снимают с команды
12 задач для маленькой команды: ответы, КП, встречи, отзывы, описания, скрипты, документы, отчёты, вакансии, перевод…
-
Нейросети для картинок к постам: сервисы и готовые промпты
Обложка поста — не арт и не ролик. Kandinsky и Шедеврум из России, промпты без кривой кириллицы, права на картинку…