Аудио · текст · ИИ-офис

Транскрибация: видео и аудио в текст

Часовая запись превращается в текст за несколько минут — бесплатно и без отправки файла в облако. Whisper распознаёт русскую речь локально, с таймкодами. Разберём весь путь: голосовые, диктофон, созвоны, ролики с YouTube — и что делать с текстом дальше.

Кирилл СандаковКирилл СандаковВайбкодер, предприниматель, продюсерОпубликовано 19.07.20269 мин чтения

Транскрибация нейросетью — это перевод речи из аудио или видео в текст моделью распознавания. Рабочий бесплатный вариант — Whisper, открытая модель OpenAI: она запускается локально, распознаёт русскую речь с таймкодами и не ограничивает длину записи. Видео сначала превращают в аудиодорожку через ffmpeg, голосовые и диктофонные записи распознаются как есть.

Что узнаешь из гайда

  • Чем транскрибировать: быстрые способы и серьёзный
  • Whisper за три шага — локально и бесплатно
  • Скил транскрибации для Claude Code
  • Что делать с текстом: пересказ, субтитры, монтаж

Часть 1 · Выбор

Чем транскрибировать: три уровня

Главное

Для голосового на минуту хватит встроенных функций, для часовых записей и потока задач — Whisper локально или скил в агенте.

  • Встроенные функции. Telegram Premium расшифровывает голосовые кнопкой, Zoom пишет текст созвона сам, у YouTube есть автоматические субтитры. Быстро, но без контроля качества и не для своих файлов.
  • Whisper локально. Открытая модель OpenAI: любая длина, русская речь, таймкоды, запись не покидает компьютер. Единственный способ бесплатно транскрибировать часовое интервью без ограничений — разбор ниже.
  • Скил в агенте. Если записи идут потоком, Whisper подключают к Claude Code скилом: агент сам достаёт дорожку, распознаёт и сразу работает с текстом — пересказывает, чистит, нарезает.

Отдельный случай — рабочие встречи: там после расшифровки нужен протокол с решениями и задачами. Этот сценарий целиком разобран в гайде нейросеть для расшифровки созвонов.


Часть 2 · Практика

Транскрибация через Whisper

Главное

Три шага: поставить whisper-cpp → достать аудиодорожку → запустить распознавание. Дальше всё делает модель.

  • Шаг 1. Поставьте whisper-cpp и скачайте модель. На Mac: brew install whisper-cpp, затем скачайте модель ggml-large-v3-turbo.bin (~1.5 ГБ) из репозитория ggerganov/whisper.cpp на Hugging Face — она лучшая по соотношению скорости и качества для русской речи.
  • Шаг 2. Извлеките аудиодорожку из видео. Whisper принимает аудио: из видеофайла дорожку достаёт ffmpeg одной командой (WAV 16 кГц моно). Для голосовых сообщений и диктофонных записей шаг пропускается.
  • Шаг 3. Запустите распознавание. Команда whisper-cli -m модель -l ru -otxt файл.wav вернёт текст; флаг -osrt даст субтитры с таймкодами. Всё работает локально и бесплатно, запись никуда не отправляется.
видео в текст за три команды
# 1. Ставим whisper-cpp (один раз):
brew install whisper-cpp
# модель ggml-large-v3-turbo.bin — с Hugging Face (ggerganov/whisper.cpp)

# 2. Достаём аудио из видео (WAV 16 кГц моно):
ffmpeg -i lecture.mp4 -ar 16000 -ac 1 lecture.wav

# 3. Распознаём русскую речь:
whisper-cli -m ggml-large-v3-turbo.bin -l ru -otxt lecture.wav
# -osrt вместо -otxt — субтитры с таймкодами

Час записи на современном ноутбуке распознаётся за несколько минут. Качество упирается в звук, а не в модель: близкий микрофон и минимум фоновой музыки дают текст, который почти не нужно править.


Часть 3 · Агент

Скил транскрибации для Claude Code

Главное

Скил избавляет от ручных команд: агент сам достаёт дорожку, распознаёт и продолжает работу с текстом в одной сессии.

Готовый навык — карточка audio-transcriber в каталоге: скил учит агента прогонять аудио и видео через Whisper и возвращать чистый текст. Ставится как любой навык — папка со SKILL.md в ~/.claude/skills/, разбор процесса — в гайде как установить skill. Формат открытый, тот же скил работает в Cursor и Codex.

Главное преимущество перед онлайн-сервисами — конвейер: агент не просто отдаёт транскрипт, а сразу делает следующую операцию — «расшифруй интервью и собери из него статью», «найди в записи все цифры и сведи в таблицу». Как это выглядит в реальной работе — в разборе агентного офиса, где голосовые сообщения расшифровываются этим же пайплайном.


Часть 4 · Продолжение

Что делать с текстом дальше

Главное

Транскрипт — сырьё. Ценность появляется на следующем шаге: пересказ, субтитры, монтаж, статья.

  • Пересказ и протокол. Текст созвона отдают языковой модели за резюме с решениями и задачами — промпты в гайде про расшифровку созвонов.
  • Субтитры на видео. Формат -osrt — готовые субтитры с таймкодами; как их оформить и вшить в ролик — в гайде про нейросеть для субтитров.
  • Монтаж по транскрипту. Из расшифровки длинного ролика агент находит смысловые куски и собирает монтажный лист — разбор в гайде про монтаж видео скилами Claude.

Важно

Не отправляйте чувствительные записи — переговоры, медицинские консультации, персональные данные — в онлайн-транскрибаторы. Локальный Whisper решает и эту проблему: файл не покидает ваш компьютер.

Коротко

  • Whisper (large-v3-turbo) — бесплатная локальная транскрибация русской речи любой длины.
  • Видео → текст: ffmpeg достаёт дорожку, whisper-cli распознаёт, -osrt даёт таймкоды.
  • В потоке — скил audio-transcriber: агент расшифровывает и сразу работает с текстом.

Вопросы

Частые вопросы

Какая нейросеть переводит аудио в текст бесплатно?

Whisper — открытая модель распознавания речи от OpenAI: работает локально на вашем компьютере, бесплатно и без ограничений по длине записи. Для быстрых бытовых задач есть встроенная расшифровка голосовых в Telegram Premium и автоматические субтитры на YouTube.

Как сделать транскрибацию видео в текст?

Достаньте из видео аудиодорожку (ffmpeg делает это одной командой) и прогоните её через Whisper — получите текст или субтитры с таймкодами. Если видео лежит на YouTube, сначала проверьте автоматические субтитры: часто их достаточно, останется только вычитать.

Транскрибация нейросетью работает с русским языком?

Да, Whisper уверенно распознаёт русскую речь — модель large-v3-turbo справляется с терминами, склонениями и быстрым темпом. Качество сильнее всего зависит от звука: близкий микрофон и минимум фоновой музыки дают почти чистый текст без правок.

Чем транскрибация отличается от субтитров?

Транскрибация — это весь текст записи одним документом, с ним дальше работают: пересказывают, ищут цитаты, пишут статьи. Субтитры — тот же текст, но нарезанный по таймкодам под кадры видео; Whisper умеет выдавать оба формата (-otxt и -osrt).

Читать дальше

Соседние гайды

ИИ-офис
Собери свой ИИ-офис и перестань делать руками то, что делает нейросеть

Платформа и сообщество, где я по шагам показываю, как поставить ИИ на рутину: контент, код, продажи, аналитика. Заходи и забирай рабочие связки, которыми пользуюсь сам.

Посмотреть, что внутри

telegram

Канал с полезными материалами про нейросети

Разборы, новые инструменты и приёмы по ИИ — то, чем пользуюсь сам, без воды. Подпишись, чтобы не потерять.

Перейти в канал
Кирилл Сандаков

Об авторе

Кирилл Сандаков

Вайбкодер, предприниматель, продюсер

Завайбкодил контент-ферму на США в Instagram (более 300 тыс. подписчиков, среди читателей Дональд Трамп Младший), создатель платформы и сообщества ИИ-офис, автор блога о нейросетях «Выжимаем из ИИ Максимум».

Все статьи автора