Видео · закадровый голос

Озвучить видео нейросетью: 6 шагов и где берут голос

Ролик смонтирован, а голоса нет. Разберём, как написать текст под хронометраж, сгенерировать дорожку, попасть в тайминг и свести так, чтобы это не звучало роботом.

Кирилл СандаковКирилл СандаковВайбкодер, предприниматель, продюсерОпубликовано 13.09.202612 мин чтения

Озвучить своё видео нейросетью это последовательность из шести шагов: написать текст под хронометраж (примерно 130-150 слов на минуту спокойной речи), выбрать голос или клон своего, сгенерировать дорожку не одним файлом, а по сценам, разложить куски по таймкодам, свести с фоновым звуком и проверить финал в наушниках и через динамик телефона. Главная ошибка новичков в другом месте: они пишут текст без учёта длины ролика, а потом ускоряют речь, и синтез становится слышен.

Ниже разбираем все шаги, а заодно три разные задачи, которые люди называют одним словом «озвучить»: закадровый голос, дубляж чужого видео и замена собственного голоса. Тарифы, которые удалось проверить живьём 13 сентября 2026 года, приведены с датой, а там, где сервис не отвечает автоматическому запросу, об этом сказано прямо.

Что узнаешь из гайда

  • Как посчитать текст под длину ролика
  • Когда нужен клон своего голоса, а когда нет
  • Почему дорожку генерируют кусками, а не целиком
  • Как подменить звук в ролике одной командой
  • Пять причин, по которым голос звучит неживым

Часть 1 · Развилка

Три разные задачи под одним словом

Что именно нужно озвучить и каким инструментом это делается
ЗадачаЧто на входеЧем делается
Закадровый голос для своего роликавидео без речи и текстсинтез речи плюс монтаж
Дубляж чужого видеовидео с речью на другом языкесервис перевода и дубляжа
Замена собственного голосазапись со своей речьюклон голоса или чистка звука

Эта статья про первую строку и частично про третью. Перевод и дубляж чужих роликов разобраны отдельно в гайде нейросеть для перевода видео, а выбор голосов и сервисов синтеза текста в гайде нейросеть для озвучки текста.


Шаг 1 · Текст

Текст пишется под секунды, а не под смысл

Главное

Считайте 130-150 слов на минуту спокойной речи. Всё, что сверх, придётся или резать, или проговаривать быстрее, и тогда слышно синтез.

Практический приём: разложите ролик на сцены и напишите под каждую отдельную фразу с указанием длительности. Тогда текст сразу ложится на картинку, а не подгоняется потом. Заодно видно места, где сцена длинная, а сказать нечего: там либо режется видео, либо добавляется деталь.

запрос на дикторский текст
Напиши закадровый текст под ролик.
Хронометраж: <секунд>, значит примерно <секунд/60*140> слов.
Разбей по сценам, у каждой укажи секунды и фразу.
Стиль: разговорный, короткие предложения, без канцелярита.
Никаких вводных вроде «в этом видео мы рассмотрим».
Слова, которые синтез читает неправильно, замени на простые.

Шаг 2 · Голос

Какой голос выбрать

Выбор голоса решает больше, чем выбор сервиса. Три ориентира. Для обучающего ролика берут спокойный средний тембр без актёрской подачи: он не надоедает на десятой минуте. Для рекламы наоборот нужен характер и темп. Для инструкции годится любой голос, но важна чёткая дикция на терминах.

  • Слушайте демо на своём тексте, а не на рекламной фразе сервиса. На чужом примере все голоса звучат хорошо.
  • Проверьте числа и англицизмы. Именно на них ломается большинство русских голосов: «2026» может прочитаться как набор цифр, а название сервиса по буквам.
  • Не меняйте голос между роликами серии. Зритель привыкает к тембру быстрее, чем к лицу.

Часть 3 · Клон

Когда имеет смысл клонировать свой голос

Клон нужен в двух случаях: вы ведёте канал от своего лица и не хотите каждый раз садиться к микрофону, или роликов много и нужен одинаковый тембр во всей серии. Для разовой задачи проще взять готовый голос из библиотеки.

Что входит в тарифы (Runway, 13.09.2026)

В плане Standard за 15 долларов в месяц (12 при годовой оплате) есть генерация музыки, голоса и звуковых эффектов. В Pro за 35 долларов (28 при годовой) добавляется один собственный клон голоса, в Max за 95 долларов (76 при годовой) до трёх клонов.

И отдельно про этику и правила: клонировать чужой голос без разрешения нельзя, это прямо запрещено правилами сервисов. Запись образца всегда делается своим голосом и в тишине, иначе клон унаследует и шум, и эхо комнаты.


Шаг 3 · Генерация

Почему дорожку делают кусками

Соблазн понятный: закинуть весь текст и получить один файл. На практике это дороже по времени. Любая правка означает перегенерацию всей дорожки, а после неё меняются паузы, и весь монтаж едет.

  1. Одна сцена, один файл. Имя файла по номеру сцены, чтобы не искать потом.
  2. Проверять на слух сразу. Плохую фразу дешевле переделать сейчас, чем на сведении.
  3. Хранить исходный текст рядом. Через месяц вы не вспомните, какой вариант фразы озвучен.

Шаг 4 · Синхрон

Как подставить дорожку в ролик

В монтажной программе всё очевидно: старая дорожка убирается, новая кладётся, куски двигаются по сценам. Второй способ пригодится, когда роликов много и они собираются по одному шаблону: звук подменяется командой, картинка при этом не перекодируется, поэтому операция идёт секунды.

подмена звуковой дорожки
# видео берём как есть, звук новый, картинку не пережимаем
ffmpeg -i video.mp4 -i voice.mp3 \
  -map 0:v:0 -map 1:a:0 \
  -c:v copy -shortest out.mp4

Ключевое здесь -c:v copy: видео копируется без пережатия, поэтому качество не теряется и всё работает быстро. Если дорожка короче ролика, флаг обрежет результат по короткому потоку, и это заметно на финальных секундах: проверяйте длину до сведения.

Про конвейер

Когда роликов десятки, такие команды не пишут руками: сборка описывается один раз и повторяется агентом. Как это устроено, разобрано в гайде про скилы Claude для монтажа.


Шаг 5 · Сведение

Сведение: то, что отличает ролик от черновика

  • Музыка тише речи. Заметно тише, а не чуть-чуть. На телефоне разница съедается динамиком.
  • Приглушение под голосом. Фоновая дорожка автоматически становится тише в момент реплики, и речь перестаёт тонуть.
  • Выравнивание громкости. Куски, сгенерированные в разные дни, отличаются по уровню. Общая нормализация убирает скачки.
  • Паузы на склейках. Полсекунды тишины между сценами звучат естественнее, чем встык.
  • Субтитры. Половина зрителей смотрит без звука, поэтому дорожку стоит продублировать текстом: субтитры нейросетью делаются автоматически.

Часть 6 · Отладка

Почему это звучит как робот

  1. Длинные предложения. Синтез не умеет держать интонацию на полутора строках. Режьте на короткие.
  2. Нет пауз. Живая речь дышит: точка, вдох, следующая мысль. Сплошной поток выдаёт машину мгновенно.
  3. Ускорение. Попытка впихнуть текст в короткую сцену растягиванием темпа слышна всегда.
  4. Числа и аббревиатуры. Пишите словами то, что должно читаться словами, иначе получите «две тысячи двадцать шестой» там, где нужно «двадцать шестого года».
  5. Один уровень громкости на весь ролик. Живая подача меняется, ровная дорожка усыпляет.

Чего делать не надо

Не пытайтесь вылечить плохой текст выбором голоса. Перебор десяти тембров на одном и том же полотне без пауз занимает час и не даёт ничего: сначала правится текст, потом выбирается голос.

Коротко

  • Сначала решите, какая из трёх задач ваша.
  • 130-150 слов на минуту спокойной речи.
  • Текст пишется по сценам с указанием секунд.
  • Дорожка генерируется кусками, а не целиком.
  • Клон голоса нужен только для серии роликов.
  • Подмена дорожки делается без пережатия картинки.
  • Музыка заметно тише речи, паузы между сценами обязательны.
  • Ускорение речи слышно всегда, лучше сократить текст.

Источники

Откуда взяты цифры

  • Страница тарифов Runway, открыта 13.09.2026: в Standard за 15 долларов в месяц входит генерация музыки, голоса и звуковых эффектов, в Pro за 35 долларов добавляется один пользовательский клон голоса, в Max за 95 долларов до трёх клонов, при годовой оплате цены 12, 28 и 76 долларов.
  • Страница тарифов Opus Clip, открыта 13.09.2026: дубляж видео входит в план Pro за 29 долларов в месяц или 14,5 при годовой оплате с 3 600 кредитами в год; бесплатный план даёт 60 кредитов в месяц, ставит водяной знак и перестаёт отдавать клипы на экспорт через три дня.
  • Проверка elevenlabs.io и страницы цен Яндекса, 13.09.2026: первый отвечает автоматическому запросу кодом 403, вторая требует пройти проверку, поэтому их тарифы в статье не утверждаются.
  • Wordstat, Россия, 13.09.2026: частотность запросов про озвучку видео нейросетью и про клонирование голоса.

FAQ

Частые вопросы

Что значит озвучить видео нейросетью

Под этим понимают три разные задачи: сделать закадровый голос для своего ролика по написанному тексту, перевести и продублировать чужое видео на другой язык, заменить свой голос в уже записанном видео на более чистый. Инструменты и порядок работы у них разные, и первым делом стоит понять, какая из трёх ваша.

Как посчитать, сколько текста нужно на ролик

По темпу речи. Спокойное дикторское чтение это примерно 130-150 слов в минуту, быстрое до 170. На ролик в полторы минуты нужно около 200-220 слов. Напишете больше, придётся резать текст или ускорять голос, а ускоренная речь сразу выдаёт синтез.

Можно ли озвучить видео бесплатно

Короткий ролик да: у большинства сервисов синтеза речи есть бесплатный лимит символов в месяц, которого хватает на несколько минут. Проблема появляется на регулярной работе: пять роликов в неделю быстро упираются в лимит, и дальше начинается подписка.

Как клонировать собственный голос

Нужен образец записи и сервис с поддержкой клонирования. В тарифах Runway на 13 сентября 2026 года это выглядит так: в плане Pro за 35 долларов в месяц доступен один свой клон голоса, в Max за 95 долларов до трёх. Клон удобен серией роликов: голос звучит одинаково, даже если текст писался в разные дни.

Почему синтезированный голос звучит неестественно

Чаще всего дело не в модели, а в тексте: синтез читает ровно то, что написано, и длинные предложения без знаков превращаются в монотонный поток. Помогают короткие фразы, точки вместо запятых, расставленные паузы и написание сложных слов так, как они произносятся.

Как подставить озвучку в видео

Двумя способами. В монтажной программе: удалили старую дорожку, положили новую, подвинули по таймкодам. Или командой в консоли, если роликов много и нужен конвейер: звук подменяется без перекодирования картинки, поэтому операция занимает секунды.

Что делать, если озвучка не попадает в тайминг

Сокращать текст, а не растягивать видео. Сначала речь подгоняется под картинку, потом картинка под речь и только в крайнем случае меняется скорость. Ещё помогает генерировать дорожку по сценам: тогда не попадает одна фраза, а не весь ролик.

Умеет ли нейросеть дублировать чужое видео на русский

Да, это отдельный сценарий, его поддерживают монтажные сервисы. В тарифах Opus Clip на 13 сентября 2026 года дубляж видео входит в план Pro за 29 долларов в месяц или 14,5 при годовой оплате с 3 600 кредитами в год. Качество зависит от исходного звука: шумная запись даёт плохой перевод.

Какие сервисы озвучки работают из России

Российские сервисы синтеза речи работают без ограничений и принимают рублёвые карты, зарубежные требуют оплаты валютой и не всегда открываются. Конкретные цены зарубежных сервисов мы не приводим: 13 сентября 2026 года их страницы отвечают автоматическим запросам отказом, проверить условия живьём не удалось.

Можно ли использовать такую озвучку в коммерческом ролике

Зависит от сервиса и тарифа. У многих бесплатный план не даёт коммерческих прав, а клонирование чужого голоса без разрешения запрещено правилами почти везде. Перед тем как ставить озвучку в рекламу, проверьте соглашение и убедитесь, что голос ваш или лицензионный.


Читать дальше

ИИ-офис
Собери свой ИИ-офис и перестань делать руками то, что делает нейросеть

Платформа и сообщество, где я по шагам показываю, как поставить ИИ на рутину: контент, код, продажи, аналитика. Заходи и забирай рабочие связки, которыми пользуюсь сам.

Посмотреть, что внутри

telegram

Канал с полезными материалами про нейросети

Разборы, новые инструменты и приёмы по ИИ — то, чем пользуюсь сам, без воды. Подпишись, чтобы не потерять.

Перейти в канал
Кирилл Сандаков

Об авторе

Кирилл Сандаков

Вайбкодер, предприниматель, продюсер

Завайбкодил контент-ферму на США в Instagram (более 300 тыс. подписчиков, среди читателей Дональд Трамп Младший), создатель платформы и сообщества ИИ-офис, автор блога о нейросетях «Выжимаем из ИИ Максимум».

Все статьи автора