Часовая запись превращается в текст за несколько минут — бесплатно и без отправки файла в облако. Whisper распознаёт русскую речь локально, с таймкодами. Разберём весь путь: голосовые, диктофон, созвоны, ролики с YouTube — и что делать с текстом дальше.
Транскрибация нейросетью — это перевод речи из аудио или видео в текст моделью распознавания. Рабочий бесплатный вариант — Whisper, открытая модель OpenAI: она запускается локально, распознаёт русскую речь с таймкодами и не ограничивает длину записи. Видео сначала превращают в аудиодорожку через ffmpeg, голосовые и диктофонные записи распознаются как есть.
Что узнаешь из гайда
Часть 1 · Выбор
Главное
Для голосового на минуту хватит встроенных функций, для часовых записей и потока задач — Whisper локально или скил в агенте.
Отдельный случай — рабочие встречи: там после расшифровки нужен протокол с решениями и задачами. Этот сценарий целиком разобран в гайде нейросеть для расшифровки созвонов.
Часть 2 · Практика
Главное
Три шага: поставить whisper-cpp → достать аудиодорожку → запустить распознавание. Дальше всё делает модель.
brew install whisper-cpp, затем скачайте модель ggml-large-v3-turbo.bin (~1.5 ГБ) из репозитория ggerganov/whisper.cpp на Hugging Face — она лучшая по соотношению скорости и качества для русской речи.whisper-cli -m модель -l ru -otxt файл.wav вернёт текст; флаг -osrt даст субтитры с таймкодами. Всё работает локально и бесплатно, запись никуда не отправляется.# 1. Ставим whisper-cpp (один раз):
brew install whisper-cpp
# модель ggml-large-v3-turbo.bin — с Hugging Face (ggerganov/whisper.cpp)
# 2. Достаём аудио из видео (WAV 16 кГц моно):
ffmpeg -i lecture.mp4 -ar 16000 -ac 1 lecture.wav
# 3. Распознаём русскую речь:
whisper-cli -m ggml-large-v3-turbo.bin -l ru -otxt lecture.wav
# -osrt вместо -otxt — субтитры с таймкодамиЧас записи на современном ноутбуке распознаётся за несколько минут. Качество упирается в звук, а не в модель: близкий микрофон и минимум фоновой музыки дают текст, который почти не нужно править.
Часть 3 · Агент
Главное
Скил избавляет от ручных команд: агент сам достаёт дорожку, распознаёт и продолжает работу с текстом в одной сессии.
Готовый навык — карточка audio-transcriber в каталоге: скил учит агента прогонять аудио и видео через Whisper и возвращать чистый текст. Ставится как любой навык — папка со SKILL.md в ~/.claude/skills/, разбор процесса — в гайде как установить skill. Формат открытый, тот же скил работает в Cursor и Codex.
Главное преимущество перед онлайн-сервисами — конвейер: агент не просто отдаёт транскрипт, а сразу делает следующую операцию — «расшифруй интервью и собери из него статью», «найди в записи все цифры и сведи в таблицу». Как это выглядит в реальной работе — в разборе агентного офиса, где голосовые сообщения расшифровываются этим же пайплайном.
Часть 4 · Продолжение
Главное
Транскрипт — сырьё. Ценность появляется на следующем шаге: пересказ, субтитры, монтаж, статья.
-osrt — готовые субтитры с таймкодами; как их оформить и вшить в ролик — в гайде про нейросеть для субтитров.Важно
Не отправляйте чувствительные записи — переговоры, медицинские консультации, персональные данные — в онлайн-транскрибаторы. Локальный Whisper решает и эту проблему: файл не покидает ваш компьютер.
Коротко
-osrt даёт таймкоды.Вопросы
Whisper — открытая модель распознавания речи от OpenAI: работает локально на вашем компьютере, бесплатно и без ограничений по длине записи. Для быстрых бытовых задач есть встроенная расшифровка голосовых в Telegram Premium и автоматические субтитры на YouTube.
Достаньте из видео аудиодорожку (ffmpeg делает это одной командой) и прогоните её через Whisper — получите текст или субтитры с таймкодами. Если видео лежит на YouTube, сначала проверьте автоматические субтитры: часто их достаточно, останется только вычитать.
Да, Whisper уверенно распознаёт русскую речь — модель large-v3-turbo справляется с терминами, склонениями и быстрым темпом. Качество сильнее всего зависит от звука: близкий микрофон и минимум фоновой музыки дают почти чистый текст без правок.
Транскрибация — это весь текст записи одним документом, с ним дальше работают: пересказывают, ищут цитаты, пишут статьи. Субтитры — тот же текст, но нарезанный по таймкодам под кадры видео; Whisper умеет выдавать оба формата (-otxt и -osrt).
Читать дальше
Платформа и сообщество, где я по шагам показываю, как поставить ИИ на рутину: контент, код, продажи, аналитика. Заходи и забирай рабочие связки, которыми пользуюсь сам.
Посмотреть, что внутриtelegram
Канал с полезными материалами про нейросети
Разборы, новые инструменты и приёмы по ИИ — то, чем пользуюсь сам, без воды. Подпишись, чтобы не потерять.