Ролик смонтирован, а голоса нет. Разберём, как написать текст под хронометраж, сгенерировать дорожку, попасть в тайминг и свести так, чтобы это не звучало роботом.
Озвучить своё видео нейросетью это последовательность из шести шагов: написать текст под хронометраж (примерно 130-150 слов на минуту спокойной речи), выбрать голос или клон своего, сгенерировать дорожку не одним файлом, а по сценам, разложить куски по таймкодам, свести с фоновым звуком и проверить финал в наушниках и через динамик телефона. Главная ошибка новичков в другом месте: они пишут текст без учёта длины ролика, а потом ускоряют речь, и синтез становится слышен.
Ниже разбираем все шаги, а заодно три разные задачи, которые люди называют одним словом «озвучить»: закадровый голос, дубляж чужого видео и замена собственного голоса. Тарифы, которые удалось проверить живьём 13 сентября 2026 года, приведены с датой, а там, где сервис не отвечает автоматическому запросу, об этом сказано прямо.
Что узнаешь из гайда
Часть 1 · Развилка
| Задача | Что на входе | Чем делается |
|---|---|---|
| Закадровый голос для своего ролика | видео без речи и текст | синтез речи плюс монтаж |
| Дубляж чужого видео | видео с речью на другом языке | сервис перевода и дубляжа |
| Замена собственного голоса | запись со своей речью | клон голоса или чистка звука |
Эта статья про первую строку и частично про третью. Перевод и дубляж чужих роликов разобраны отдельно в гайде нейросеть для перевода видео, а выбор голосов и сервисов синтеза текста в гайде нейросеть для озвучки текста.
Шаг 1 · Текст
Главное
Считайте 130-150 слов на минуту спокойной речи. Всё, что сверх, придётся или резать, или проговаривать быстрее, и тогда слышно синтез.
Практический приём: разложите ролик на сцены и напишите под каждую отдельную фразу с указанием длительности. Тогда текст сразу ложится на картинку, а не подгоняется потом. Заодно видно места, где сцена длинная, а сказать нечего: там либо режется видео, либо добавляется деталь.
Напиши закадровый текст под ролик.
Хронометраж: <секунд>, значит примерно <секунд/60*140> слов.
Разбей по сценам, у каждой укажи секунды и фразу.
Стиль: разговорный, короткие предложения, без канцелярита.
Никаких вводных вроде «в этом видео мы рассмотрим».
Слова, которые синтез читает неправильно, замени на простые.Шаг 2 · Голос
Выбор голоса решает больше, чем выбор сервиса. Три ориентира. Для обучающего ролика берут спокойный средний тембр без актёрской подачи: он не надоедает на десятой минуте. Для рекламы наоборот нужен характер и темп. Для инструкции годится любой голос, но важна чёткая дикция на терминах.
Часть 3 · Клон
Клон нужен в двух случаях: вы ведёте канал от своего лица и не хотите каждый раз садиться к микрофону, или роликов много и нужен одинаковый тембр во всей серии. Для разовой задачи проще взять готовый голос из библиотеки.
Что входит в тарифы (Runway, 13.09.2026)
В плане Standard за 15 долларов в месяц (12 при годовой оплате) есть генерация музыки, голоса и звуковых эффектов. В Pro за 35 долларов (28 при годовой) добавляется один собственный клон голоса, в Max за 95 долларов (76 при годовой) до трёх клонов.
И отдельно про этику и правила: клонировать чужой голос без разрешения нельзя, это прямо запрещено правилами сервисов. Запись образца всегда делается своим голосом и в тишине, иначе клон унаследует и шум, и эхо комнаты.
Шаг 3 · Генерация
Соблазн понятный: закинуть весь текст и получить один файл. На практике это дороже по времени. Любая правка означает перегенерацию всей дорожки, а после неё меняются паузы, и весь монтаж едет.
Шаг 4 · Синхрон
В монтажной программе всё очевидно: старая дорожка убирается, новая кладётся, куски двигаются по сценам. Второй способ пригодится, когда роликов много и они собираются по одному шаблону: звук подменяется командой, картинка при этом не перекодируется, поэтому операция идёт секунды.
# видео берём как есть, звук новый, картинку не пережимаем
ffmpeg -i video.mp4 -i voice.mp3 \
-map 0:v:0 -map 1:a:0 \
-c:v copy -shortest out.mp4Ключевое здесь -c:v copy: видео копируется без пережатия, поэтому качество не теряется и всё работает быстро. Если дорожка короче ролика, флаг обрежет результат по короткому потоку, и это заметно на финальных секундах: проверяйте длину до сведения.
Про конвейер
Когда роликов десятки, такие команды не пишут руками: сборка описывается один раз и повторяется агентом. Как это устроено, разобрано в гайде про скилы Claude для монтажа.
Шаг 5 · Сведение
Часть 6 · Отладка
Чего делать не надо
Не пытайтесь вылечить плохой текст выбором голоса. Перебор десяти тембров на одном и том же полотне без пауз занимает час и не даёт ничего: сначала правится текст, потом выбирается голос.
Коротко
Источники
FAQ
Под этим понимают три разные задачи: сделать закадровый голос для своего ролика по написанному тексту, перевести и продублировать чужое видео на другой язык, заменить свой голос в уже записанном видео на более чистый. Инструменты и порядок работы у них разные, и первым делом стоит понять, какая из трёх ваша.
По темпу речи. Спокойное дикторское чтение это примерно 130-150 слов в минуту, быстрое до 170. На ролик в полторы минуты нужно около 200-220 слов. Напишете больше, придётся резать текст или ускорять голос, а ускоренная речь сразу выдаёт синтез.
Короткий ролик да: у большинства сервисов синтеза речи есть бесплатный лимит символов в месяц, которого хватает на несколько минут. Проблема появляется на регулярной работе: пять роликов в неделю быстро упираются в лимит, и дальше начинается подписка.
Нужен образец записи и сервис с поддержкой клонирования. В тарифах Runway на 13 сентября 2026 года это выглядит так: в плане Pro за 35 долларов в месяц доступен один свой клон голоса, в Max за 95 долларов до трёх. Клон удобен серией роликов: голос звучит одинаково, даже если текст писался в разные дни.
Чаще всего дело не в модели, а в тексте: синтез читает ровно то, что написано, и длинные предложения без знаков превращаются в монотонный поток. Помогают короткие фразы, точки вместо запятых, расставленные паузы и написание сложных слов так, как они произносятся.
Двумя способами. В монтажной программе: удалили старую дорожку, положили новую, подвинули по таймкодам. Или командой в консоли, если роликов много и нужен конвейер: звук подменяется без перекодирования картинки, поэтому операция занимает секунды.
Сокращать текст, а не растягивать видео. Сначала речь подгоняется под картинку, потом картинка под речь и только в крайнем случае меняется скорость. Ещё помогает генерировать дорожку по сценам: тогда не попадает одна фраза, а не весь ролик.
Да, это отдельный сценарий, его поддерживают монтажные сервисы. В тарифах Opus Clip на 13 сентября 2026 года дубляж видео входит в план Pro за 29 долларов в месяц или 14,5 при годовой оплате с 3 600 кредитами в год. Качество зависит от исходного звука: шумная запись даёт плохой перевод.
Российские сервисы синтеза речи работают без ограничений и принимают рублёвые карты, зарубежные требуют оплаты валютой и не всегда открываются. Конкретные цены зарубежных сервисов мы не приводим: 13 сентября 2026 года их страницы отвечают автоматическим запросам отказом, проверить условия живьём не удалось.
Зависит от сервиса и тарифа. У многих бесплатный план не даёт коммерческих прав, а клонирование чужого голоса без разрешения запрещено правилами почти везде. Перед тем как ставить озвучку в рекламу, проверьте соглашение и убедитесь, что голос ваш или лицензионный.
Платформа и сообщество, где я по шагам показываю, как поставить ИИ на рутину: контент, код, продажи, аналитика. Заходи и забирай рабочие связки, которыми пользуюсь сам.
Посмотреть, что внутриtelegram
Канал с полезными материалами про нейросети
Разборы, новые инструменты и приёмы по ИИ — то, чем пользуюсь сам, без воды. Подпишись, чтобы не потерять.