Одна генерация даёт клип на несколько секунд, где герой каждый раз выглядит по-новому. Разбираем сборку целиком: сценарий, лист персонажа, оживление кадров, русская речь и монтаж.
Мультик нейросетью делают конвейером из пяти шагов: текстовая модель пишет сценарий и разбивает его на сцены, картиночная рисует героя и стартовые кадры, видеомодель оживляет каждый кадр в клип на несколько секунд, отдельный сервис озвучивает реплики на русском, монтажка всё склеивает. Главная сложность не в качестве картинки, а в том, чтобы герой остался одним и тем же от кадра к кадру.
Что узнаешь из гайда
Часть 1 · Постановка
Главное
Два ограничения: короткий клип и непостоянный герой. Оба обходятся, но не внутри одной генерации.
Первое ограничение — длительность. Видеомодель отдаёт клип на несколько секунд. Новое поколение подняло планку: в официальном руководстве Kling VIDEO 3.0 от 6 февраля 2026 года заявлен вывод до пятнадцати секунд и гибкая длительность. Но в собственной методичке Hailuo, обновлённой 27 июля 2026 года, сказано прямо: движки оптимизированы под клипы в четыре-шесть секунд, потому что на такой длине картинка остаётся стабильной. Поэтому даже минутный ролик собирается из нескольких склеенных кусков.
Второе ограничение серьёзнее. Каждая генерация независима: модель заново придумывает лицо, причёску, одежду и пропорции. В той же методичке Hailuo для этого есть термин — дрейф личности. Герой во второй сцене оказывается похожим на себя из первой, но другим человеком. На этом и спотыкаются те, кто пробует получить историю серией промптов.
Выбор видеогенератора — отдельный вопрос
Этот гайд отвечает за сборку формата; сравнение моделей между собой — соседняя тема. Если вопрос стоит как «какой сервис вообще взять под видео, сколько он стоит и открывается ли из России», ответ разобран в гайде про нейросети для создания видео. Здесь модели упоминаются как детали конвейера.
Часть 2 · Конвейер
Главное
Порядок важнее инструментов. Сначала герой, потом кадры, и только потом движение.
| Шаг | Что на выходе | Чем делают |
|---|---|---|
| 1. Сценарий | Список сцен: что в кадре, что говорит герой, сколько длится | Любая текстовая модель |
| 2. Лист персонажа | Герой с нескольких ракурсов в одном стиле — набор картинок, а не описание словами | Картиночная модель, например Nano Banana |
| 3. Стартовые кадры | Первый кадр каждой сцены: герой из листа плюс обстановка | Та же картиночная модель |
| 4. Оживление | Клип на несколько секунд из каждого стартового кадра | Видеомодель: Kling, Hailuo и другие |
| 5. Звук и сборка | Готовый ролик с речью, музыкой и подписями | Синтез речи, музыка, субтитры, монтажка |
Ключевой шаг — второй. Пока герой существует только в виде текстового описания, каждая генерация трактует его по-своему. Как только он зафиксирован картинками, дальше работает не фантазия модели, а подстановка. Поэтому лист персонажа рисуют раньше кадров и тем более раньше первого видео.
Четвёртый шаг запускают от картинки. Режим «изображение в видео» берёт готовый кадр первым и достраивает движение — у сцены появляется точка отсчёта. Режим «текст в видео» такой точки не даёт, и герой уезжает уже на второй сцене.
Что писать в сценарии, кроме реплик
Полезно сразу разложить каждую сцену на четыре строки: кто в кадре, что делает, где происходит, какой план — общий, средний или крупный. Эти же четыре строки потом почти дословно превращаются в промпт кадра. Если в четыре строки сцена не укладывается, в ней два события — их лучше развести по разным клипам.
Что именно рассказывать, конвейер не подсказывает. Сюжет и формат выбирают до сценария, и от них зависит, досмотрят ли ролик: понятный конфликт в первые секунды, повторяющийся герой, серия вместо разовых выпусков. Отдельный вопрос — доводит ли ролик до заявок. У Wake Up Marketing это разобрано на примерах вирусных серий: какие сюжетные механики держат зрителя до конца и как анимацию встраивают в воронку — в разборе как из ИИ-мультиков получают заявки.
Часть 3 · Главное место
Главное
Герой держится на референсе, а описание словами только помогает. Референс должен быть скучным: ровный свет, фронтальный ракурс, нейтральное лицо.
Методичка Hailuo про консистентность формулирует главную ошибку так: люди берут в качестве референса эффектный кадр — резкий ракурс, драматичный свет, выразительная эмоция. Модель принимает глубокие тени за постоянные черты лица и при смене ракурса искажает результат. Рабочий мастер-референс выглядит иначе: фронтальный ракурс, ровный мягкий свет, нейтральное выражение, поясной или средний крупный план, высокое разрешение. Лицо должно занимать много пикселей — по ним модель и считывает геометрию.
В кино сцену обычно начинают с общего плана. В генерации порядок обратный, и это осознанный приём из той же методички: первым делают самый крупный план, где лицо занимает максимум кадра. Если герой получился там, дальше его заметно проще удержать на общих планах, где лица почти не видно. Удачный кадр из крупного плана становится референсом для остальных сцен.
Описание героя и описание обстановки живут в промпте раздельно. Первая часть — внешность, одежда, отличительные признаки — копируется из сцены в сцену дословно, без единого изменения. Вторая часть — место, действие, план, свет — меняется свободно. Так модель понимает, что герой постоянен, а мир вокруг переменная. Стоит переписать первую часть «своими словами» хотя бы в одной сцене — связка ломается.
Ручные приёмы дополняются встроенными. В Kling библиотека элементов позволяет собрать героя из нескольких ракурсов и переиспользовать его между работами. По руководству от 5 февраля 2026 года при генерации от стартового кадра можно привязать до трёх элементов, видеогенерация принимает до семи референсных персонажей, а генерация картинок — до десяти. Из одного главного референса сервис сам достраивает дополнительные ракурсы. В версии 3.0 Omni к персонажу привязывается ещё и голос.
Похожий механизм есть и у Hailuo: генерация не по тексту, а по эталонному изображению героя. Названия у сервисов разные, смысл один — модель получает не описание, а образец.
Перегенерация — часть работы, а не сбой
Методичка Hailuo рекомендует закладывать две-три генерации на каждый нужный кадр. Генерация вероятностна: даже идеальный промпт не даёт одинаковый результат дважды. Планировать мультик из расчёта «один кадр — одна генерация» бессмысленно, и по времени, и по деньгам. Ещё один приём оттуда же: чтобы вытянуть сцену длиннее одного клипа, последний кадр берут стартовым для следующего.
Часть 4 · Звук
Главное
Встроенный звук видеомоделей русского не включает. Речь делают отдельно и подкладывают под картинку.
Новое поколение видеомоделей научилось выдавать звук вместе с картинкой — с репликами, попадающими в губы. У Kling это нативный звук с привязкой к конкретному говорящему персонажу. Но в официальном руководстве языки этого звука перечислены поимённо: китайский, английский, японский, корейский, испанский, плюс диалекты и смешение языков внутри сцены. Русского в этом перечне нет — проверено по странице руководства 24 августа 2026 года.
Отсюда практический порядок для русского мультика: сначала озвучка, потом видео под неё. Реплика записывается в сервисе синтеза речи, её длительность становится длительностью сцены, и уже под этот хронометраж генерируется клип. Обратный порядок приводит к тому, что готовое видео приходится резать под текст. Что умеет Алиса, Yandex SpeechKit и другие доступные варианты — в разборе нейросетей для озвучки текста.
Музыка и шумы — третий слой. Фоновый трек генерируется отдельно, и здесь работает то же правило: сначала хронометраж, потом музыка под него. Про генерацию треков с вокалом и без — в гайде про создание песни нейросетью.
Часть 5 · Доступ
Главное
Видеомодели открываются. Упирается в две вещи: часть сервисов вокруг закрыта по стране и оплата подписки.
Проверка сделана 24 августа 2026 года с московского адреса, контроль — тот же запрос с зарубежного. Проверялась отдача сайта, а не возможность зарегистрироваться и оплатить. Открываются без ухищрений: kling.ai, hailuoai.video, wan.video, suno.com, runway.com, higgsfield.ai, gemini.google.com. Закрыты по стране три нужных сервиса — инструмент Google Flow с моделью Veo уводит на страницу «unsupported country», ElevenLabs перекидывает на статью справки о страновых ограничениях, а сайт CapCut отдаёт код 451 «недоступно по юридическим причинам». С зарубежного адреса все три отвечают нормально, так что дело именно в стране.
Не всякий отказ — это блокировка по стране
В той же проверке midjourney.com, pollo.ai и canva.com ответили кодом 403. Но точно так же они ответили и на запрос с зарубежного адреса: это защита от автоматических обращений, а не страновое ограничение. Списки «что не работает в России» часто собирают такие ответы без контрольной проверки и записывают в закрытое то, что на самом деле открыто.
Вторая преграда — деньги. Бесплатных лимитов хватает на пробу и на пару сцен, дальше нужна подписка, а зарубежную подписку картой российского банка не оплатить. Варианты обычные: карта зарубежного банка, карта знакомого или посредник вроде «Оплати по миру». Актуальные цены и размеры бесплатных лимитов держатся на страницах самих сервисов и в наших разборах — по Kling и по Hailuo.
Часть 6 · Применение
Главное
Производство и продвижение — две разные работы. Этот гайд закрывает первую.
Спрос в поиске распадается на два мотива. Одни ищут мультик как развлечение: детские ролики, истории про котов, короткие шутки. Другие делают мультик под задачу — объяснить продукт, собрать короткий ролик для ленты, оживить рубрику в канале. Технически это один и тот же конвейер, но требования к результату разные: во втором случае важен не только красивый кадр, но и формат, ритм и причина, по которой зритель досмотрит.
Здесь заканчивается зона этого текста. Мы разбираем производство: как собрать ролик и как удержать героя. Сторона продвижения — какие форматы коротких видео работают в конкретной нише, как считать результат, какие промпты берут под задачи маркетинга — это отдельная работа, и её мы не ведём. Если нужна она целиком, там же собран каталог разборов про ИИ в маркетинге и продажах — гайды, кейсы и готовые промпты по нишам, включая виральные форматы коротких роликов.
Синтетику приходится помечать
Часть площадок требует раскрывать, что видео сгенерировано. На это указывает и методичка Hailuo, отсылая к правилам TikTok для реалистичного синтетического контента. Перед публикацией стоит свериться с правилами конкретной площадки — и заодно сохранить промпты и референсы, чтобы потом можно было повторить или доказать происхождение ролика.
Если движение вообще не обязательно, задача решается дешевле. Статичная история кадрами с репликами в облачках — это комикс нейросетью: те же герой и сценарий, но без видеогенерации и без расходов на перегенерацию клипов.
Коротко
Вопросы
Мультик собирают из пяти шагов, а не одной генерацией. Сначала текстовая модель пишет сценарий и разбивает его на сцены. Потом рисуется герой — набор его изображений в одном стиле. Дальше из героя собираются стартовые кадры сцен, каждый кадр оживляется в видеомодели, а в конце добавляются озвучка, музыка, субтитры и монтаж.
Короткий ролик — да. У видеосервисов есть бесплатные лимиты, которых хватает на пробу и на пару сцен, а сценарий и картинки делаются в бесплатных моделях. На полноценный мультик бесплатных лимитов не хватает: каждая сцена требует нескольких попыток, а один кадр редко получается с первого раза.
Это называется дрейфом личности: модель при каждой генерации заново придумывает черты лица, причёску и одежду. Лечится референсом — герой описывается не словами, а изображениями с нескольких ракурсов, и они подставляются в каждую сцену. Плюс словесное описание героя держат неизменным, а меняют только описание обстановки.
Одной такой нейросети нет, работают связкой. Кадры рисует картиночная модель, движение делает видеомодель вроде Kling или Hailuo, речь и музыку добавляют отдельные сервисы, а склейка идёт в обычной монтажке. Смысл связки в контроле: свой стартовый кадр и свой набор референсов героя дают повторяемость, которой генерация по одному тексту не даёт.
Отдельным шагом, а не встроенным звуком видеомодели. У Kling нативный звук есть, но в официальном руководстве перечислены китайский, английский, японский, корейский и испанский — русского в списке нет. Поэтому реплики озвучивают в отдельном сервисе синтеза речи и подкладывают под видео либо прогоняют кадр через липсинк.
Читать дальше
Платформа и сообщество, где я по шагам показываю, как поставить ИИ на рутину: контент, код, продажи, аналитика. Заходи и забирай рабочие связки, которыми пользуюсь сам.
Посмотреть, что внутриtelegram
Канал с полезными материалами про нейросети
Разборы, новые инструменты и приёмы по ИИ — то, чем пользуюсь сам, без воды. Подпишись, чтобы не потерять.