Голос · Синтез по образцу

Клонирование голоса: 6 сервисов и 4 причины не делать

Технология из лаборатории превратилась в кнопку: достаточно короткого фрагмента записи, чтобы получить голос, который говорит что угодно. Разобрали, сколько секунд нужно на самом деле, что открывается из России и почему прямой нормы про охрану голоса в кодексе нет.

Кирилл СандаковКирилл СандаковВайбкодер, предприниматель, продюсерОпубликовано 15.09.202612 мин чтения

Клонирование голоса обсуждают в двух крайностях: либо как безобидную озвучку роликов, либо как оружие мошенников. Обе картины неполные, и обе мешают понять, что делать на практике. Клонирование голоса это обучение модели на коротком образце речи, после которого она произносит любой текст этим тембром; минимум по открытым моделям измеряется секундами, из России без обходных путей работают российские и китайские сервисы, а отдельной статьи про охрану голоса в Гражданском кодексе нет.

Коды доступа сняты запросом с московского адреса 15 сентября 2026 года, характеристики открытой модели взяты с её карточки, оглавление кодекса сверено в тот же день. Дальше по порядку: как это работает, сколько записи нужно, чем пользоваться из России, как записать образец, чтобы результат не звучал роботом, где проходят правовые границы и что делать, если клонируют вас.

Главное в одну строку

Технически голос копируется за минуты, а юридически он защищён слабее, чем изображение: прямой статьи про голос в кодексе нет.


Часть 1 · Ответ

Что важно понять до первой попытки

  1. Нужен образец, а не студия. Достаточно чистой записи речи, качество важнее длины.
  2. Результат это модель голоса. Она произносит любой текст, а не только записанные фразы.
  3. Язык может отличаться. Часть моделей переносит голос между языками, вы говорите по-русски, клон по-английски.
  4. Загруженное остаётся у сервиса. Если это неприемлемо, нужен локальный запуск.
  5. Согласие обязательно. Чужой голос без письменного разрешения не берут даже для внутреннего ролика.
  6. Выдавать синтез за живую речь нельзя. Это уже не техника, а обман аудитории.

Часть 2 · Механика

Что именно копируется, когда говорят «клон голоса»

  • Тембр. Окраска звука, по которой человека узнают. Копируется лучше всего.
  • Манера. Темп, длина пауз, характерные растяжки. Копируется хуже и требует более длинного образца.
  • Интонационный рисунок. Как поднимается голос в вопросе, где появляется нажим. Копируется частично.
  • Чего не копируется вовсе. Смысловые акценты: модель не знает, какое слово во фразе главное, и ставит ударение наугад.

Отсюда практическое следствие: чем ближе текст по жанру к образцу, тем лучше результат. Диктор, записанный на спокойном чтении, плохо звучит в эмоциональной рекламе.


Часть 3 · Объём

Сколько секунд нужно на самом деле

Из карточки модели, сверено 15.09.2026

Открытая модель XTTS-v2 в своей карточке на Hugging Face заявляет клонирование голоса по шестисекундному фрагменту, поддержку семнадцати языков и кросс-языковое клонирование, то есть перенос голоса на язык, на котором говорящий не записывался.

  • Шесть секунд. Достаточно, чтобы узнали тембр. Манеру и паузы на таком отрезке не снять.
  • Одна минута. Рабочий минимум для ролика: интонации становятся ровнее, меньше артефактов.
  • Пять и больше минут. Нужны, когда голос будет читать длинные тексты и разные по настроению фрагменты.
  • Что важнее длины. Отсутствие шума, эха, музыки и второго говорящего. Минута из тихой комнаты лучше получаса из кафе.

Часть 4 · Доступ

Что открылось с московского адреса 15 сентября

Коды ответа сняты без VPN. Кодом 200 ответили zvukogram.com и fish.audio. Кодом 403 ответил elevenlabs.io, то есть сервис отказал по региону. Отдельный путь это открытые модели, которые запускаются на своём компьютере и вообще не требуют доступа к внешнему сервису.

  • Российские сервисы. Оплата в рублях, интерфейс на русском, лучше справляются с русской фонетикой.
  • Китайские и открытые. Дают больше контроля и часто бесплатны, но требуют разбираться в настройках.
  • Закрытые по региону. Разбор возможностей ElevenLabs лежит в отдельном гайде, вопрос оплаты зарубежной подписки в гайде про карту для оплаты.
  • Локальный запуск. Когда запись нельзя отдавать наружу, модель ставят на свой компьютер: как это устроено, разобрано в гайде про Ollama.

Часть 5 · Определитель

Задача, путь и цена вопроса

Сценарии клонирования голоса, проверка доступа 15.09.2026
ЗадачаЧем решатьЧто учесть
Озвучить свой ролик своим голосомроссийский сервис синтезаоплата в рублях, запись остаётся у сервиса
Озвучка на другом языкемодель с переносом голоса между языкамиакцент сохраняется, произношение плавает
Чувствительная записьоткрытая модель локальнонужен мощный компьютер и время
Голос диктора для проекталюбой сервис плюс письменное согласиеобычный договор на озвучку это не покрывает
Голос известного человекане делатьпубликация означает выдачу синтеза за его слова
Голос умершего родственникатехнически возможновопрос не технический, а к семье и к публикации
Длинная аудиокнигасервис с разбивкой на главыинтонация уплывает, нужна ручная разметка
ElevenLabsиз России недоступенкод 403 при проверке 15.09.2026

Часть 6 · Образец

Как записать фрагмент, чтобы клон получился

  1. Тихая комната без эха. Мягкая мебель и шторы лучше кафельной кухни. Эхо модель воспроизведёт вместе с голосом.
  2. Один говорящий. Любой второй голос в записи смешивается с целевым.
  3. Ровный темп. Читайте так, как потом должен звучать результат, а не быстрее и не медленнее.
  4. Разные фразы. Утверждение, вопрос, перечисление. Это даёт модели интонационные образцы.
  5. Без музыки и заставок. Фон попадёт в модель и будет всплывать в синтезе.
  6. Формат без сильного сжатия. Голосовое сообщение из мессенджера хуже, чем запись диктофоном.

Часть 7 · Дефекты

Почему длинный текст звучит неживо

  • Фразы синтезируются по отдельности. Общая линия рассказа теряется, каждое предложение звучит как первое.
  • Ударение ставится наугад. Модель не знает, какое слово во фразе главное. Лечится перестановкой слов в тексте.
  • Числа и сокращения читаются странно. Пишите их словами прямо в тексте для озвучки.
  • Нет дыхания. Слишком ровная речь выдаёт синтез. Помогают короткие абзацы и знаки препинания под паузы.
  • Термины и имена. Их проверяют отдельно, часто приходится записывать фонетически.

Если задача не в копировании конкретного человека, а просто в озвучке текста, готовые голоса обычно звучат ровнее: сравнение в гайде про озвучку текста.


Часть 8 · Право

Что в кодексе есть про голос, а чего нет

Оглавление ГК, сверено 15.09.2026

В части первой Гражданского кодекса в главе о нематериальных благах есть статья 152.1 «Охрана изображения гражданина» и статья 152.2 «Охрана частной жизни гражданина». Отдельной статьи, посвящённой охране голоса, в оглавлении нет. Проверка сделана по тексту кодекса на consultant.ru.

Это важное отличие от расхожего утверждения, что «голос защищён так же, как внешность». На практике защита строится обходными путями: через честь и достоинство, если запись порочит человека, через частную жизнь, если раскрыты личные обстоятельства, через законодательство о персональных данных, если голос используется для идентификации, и через смежные права исполнителя, если речь про записанное исполнение.

  • Что это значит для вас. Рассчитывать на быстрый запрет только потому, что «это мой голос», не стоит: потребуется доказывать нарушение конкретной нормы.
  • Что это значит для заказчика. Отсутствие прямой нормы не делает использование чужого голоса безопасным: обманутая аудитория и репутационный ущерб никуда не деваются.
  • Где смотреть про сгенерированный контент. Общая правовая рамка в гайде про авторское право и в разборе закона об ИИ.

Часть 9 · Согласие

Как выглядит нормальное разрешение на голос

  1. Прямо сказано про синтез. Не «запись голоса», а «создание синтетической модели голоса».
  2. Перечислены материалы. Для каких роликов, рассылок, ботов будет использоваться.
  3. Указан срок. И что происходит с моделью после его окончания.
  4. Есть запреты. Например, нельзя использовать в политике, в медицине, в рекламе чужих товаров.
  5. Указано хранение. Где лежит модель и кто имеет к ней доступ.

Частая ошибка заказчика

Договор на озвучку покрывает запись конкретных фраз, а не создание модели, которая произнесёт любые другие. Если диктор записал вам сто фраз, а вы обучили на них клон и озвучили им новый ролик, это выход за рамки того, на что он соглашался.


Часть 10 · Маркировка

Надо ли предупреждать, что голос синтезирован

По закону от 26 июля 2026 года № 243-ФЗ маркировка сгенерированного контента это возможность для автора и обязанность для площадок с суточной аудиторией свыше 500 тысяч пользователей, причём соответствующие статьи вступают в силу 1 марта 2027 года. Обязанности лично у автора ролика пока нет.

Но есть условия сервисов, и они действуют уже сегодня. В условиях использования технологий YandexGPT прямо запрещено вводить третьих лиц в заблуждение и выдавать контент за результат человеческого труда там, где это не подразумевается. Проще говоря, техническая возможность не молчать о синтезе есть всегда, а поводов молчать почти не бывает. Подробнее в разборе про маркировку ИИ-контента.


Часть 11 · Обратная сторона

Почему ту же технологию используют против вас

Шести секунд записи достаточно не только для озвучки ролика. Ровно столько же нужно, чтобы позвонить вашей маме вашим голосом. Банк России на странице про информационную безопасность публикует масштаб борьбы с такими схемами: за 2025 год разделегировано 1002 фишинговых домена, в Генеральную прокуратуру направлены сведения о 32 566 доменах и 4817 страницах, на блокировку передано свыше 69 тысяч номеров телефонов.

  • Откуда берут образец. Из ваших же публичных видео, сторис, голосовых сообщений в открытых чатах.
  • Как звучит атака. Короткий взволнованный звонок, плохая связь как оправдание артефактов, давление на срочность.
  • Признаки разобраны отдельно. Семь маркеров поддельного звонка собраны в гайде про нейросети и мошенников, а механика подделки видео в разборе дипфейков.

Часть 12 · Защита

Что реально снижает риск

  1. Кодовое слово в семье. Простое, не публиковавшееся нигде, известное всем родственникам.
  2. Правило обратного звонка. Любая просьба о деньгах проверяется звонком на известный номер, а не ответом на входящий.
  3. Никаких подтверждений голосом. Фразы вроде «да, подтверждаю» по входящему звонку не произносятся никогда.
  4. Меньше длинных монологов в открытом доступе. Полностью это не решает, но уменьшает объём исходника.
  5. Разговор с родителями заранее. Самая действенная мера: объяснить схему до того, как позвонят.

Памятка

Что запомнить про клонирование голоса

Коротко

  • Открытая модель XTTS-v2 заявляет клонирование по шестисекундному фрагменту.
  • Рабочий минимум для ролика это около минуты чистой записи.
  • Чистота записи важнее её длины: эхо и фон попадут в модель.
  • Из Москвы 15.09.2026 открылись zvukogram.com и fish.audio, ElevenLabs отдал 403.
  • Отдельной статьи про охрану голоса в части первой ГК нет.
  • Защита голоса строится через смежные нормы, а не через прямой запрет.
  • Договор на озвучку не даёт права обучить модель голоса.
  • Согласие должно прямо называть синтез, материалы, срок и запреты.
  • Маркировать сгенерированное по 243-ФЗ будут площадки с 1 марта 2027 года.
  • Против подделки голоса работают кодовое слово и обратный звонок, а не слух.

Источники

Что проверялось живьём и когда

  • Карточка модели XTTS-v2 на Hugging Face, сверена 15.09.2026: клонирование голоса по шестисекундному фрагменту, семнадцать языков, кросс-языковое клонирование.
  • Коды ответа сервисов, curl с московского адреса без VPN, 15.09.2026: 200 у zvukogram.com и fish.audio, 403 у elevenlabs.io.
  • Гражданский кодекс, часть первая, оглавление главы о нематериальных благах на consultant.ru, 15.09.2026: присутствуют статьи 152.1 и 152.2, отдельной статьи про голос нет.
  • Условия использования технологий YandexGPT, yandex.ru/legal, открыты 15.09.2026: пункт 2.2.5 про запрет выдавать сгенерированный контент за результат человеческого труда.
  • Федеральный закон от 26.07.2026 № 243-ФЗ: маркировка как возможность для автора и обязанность для площадок с суточной аудиторией свыше 500 000 пользователей, вступление норм в силу 1 марта 2027 года.
  • Банк России, раздел про информационную безопасность, данные за 2025 год: 1002 разделегированных фишинговых домена, сведения о 32 566 доменах и 4817 страницах в Генпрокуратуру, свыше 69 тысяч номеров на блокировку.
  • Выдача Яндекса по запросу «клонирование голоса», 15.09.2026: первые строки занимают деловые медиа, сервисы идут ниже.

Чего тут нет намеренно: пошаговой инструкции по клонированию конкретного чужого голоса. Технически она никому не нужна, все сервисы устроены одинаково просто, а вот повод её опубликовать сомнительный.


FAQ

Частые вопросы

Сколько записи нужно, чтобы клонировать голос

Минимум измеряется секундами. В карточке открытой модели XTTS-v2 на Hugging Face заявлено клонирование голоса по шестисекундному фрагменту, поддержка семнадцати языков и перенос голоса между языками. Коммерческие сервисы обычно просят от минуты чистой записи, чтобы результат был стабильнее.

Чем клонировать голос из России

Из проверенных 15 сентября 2026 года с московского адреса открылись zvukogram.com и fish.audio, оба ответили кодом 200. ElevenLabs отдал 403, то есть отказал по региону. Ещё один путь это открытые модели, которые запускаются на своём компьютере и никуда не отправляют запись.

Защищает ли закон мой голос

Отдельной статьи про голос в части первой Гражданского кодекса нет: в оглавлении есть статья 152.1 про охрану изображения гражданина и 152.2 про охрану частной жизни, проверено 15 сентября 2026 года. Защита голоса поэтому строится через смежные нормы, а не через прямой запрет.

Можно ли клонировать голос известного человека

Для себя технически можно, публиковать нельзя. Как только запись выдаётся за настоящее высказывание конкретного человека, это уже обман аудитории, а если добавляется его изображение, работает и статья 152.1 ГК про согласие на использование изображения.

Как отличить синтезированный голос от настоящего

По трём признакам: дыхание в неестественных местах или его отсутствие, ровная громкость без естественных перепадов и одинаковая интонация на разных по смыслу фразах. Самая надёжная проверка не техническая: перезвоните человеку на известный вам номер.

Надо ли помечать озвучку, сделанную нейросетью

По закону от 26 июля 2026 года № 243-ФЗ маркировка это возможность для автора и обязанность для площадок с суточной аудиторией свыше 500 тысяч пользователей, нормы вступают в силу 1 марта 2027 года. При этом условия YandexGPT уже сейчас запрещают выдавать сгенерированный контент за результат человеческого труда.

Можно ли клонировать голос диктора для своего проекта

Только с его письменного согласия, где прямо описано, что голос будет синтезирован, для каких материалов и на какой срок. Обычный договор на озвучку такого не покрывает: там оплачена запись конкретных фраз, а не создание модели голоса.

Почему клон звучит роботом на длинных текстах

Потому что модель синтезирует фразы независимо и теряет общую интонационную линию. Помогает разбивка на короткие абзацы, расстановка знаков препинания под дыхание и запись исходника в том же темпе и настроении, в каком нужен результат.

Опасно ли загружать свой голос в сервис

Стоит исходить из того, что загруженное остаётся у сервиса. Перед загрузкой откройте условия и найдите, что сервис вправе делать с вашими данными. Если запись чувствительная, безопаснее локальная модель, которая работает без отправки файла в интернет.

Как защититься от клонирования своего голоса

Полностью никак, если вы публично говорите. Снизить риск помогает бытовая дисциплина: кодовое слово в семье, правило перезванивать на известный номер, отказ подтверждать что-либо голосом по входящему звонку. Банк России в разделе про информационную безопасность публикует статистику по таким схемам.


Читать дальше

ИИ-офис
Собери свой ИИ-офис и перестань делать руками то, что делает нейросеть

Платформа и сообщество, где я по шагам показываю, как поставить ИИ на рутину: контент, код, продажи, аналитика. Заходи и забирай рабочие связки, которыми пользуюсь сам.

Посмотреть, что внутри

telegram

Канал с полезными материалами про нейросети

Разборы, новые инструменты и приёмы по ИИ — то, чем пользуюсь сам, без воды. Подпишись, чтобы не потерять.

Перейти в канал
Кирилл Сандаков

Об авторе

Кирилл Сандаков

Вайбкодер, предприниматель, продюсер

Завайбкодил контент-ферму на США в Instagram (более 300 тыс. подписчиков, среди читателей Дональд Трамп Младший), создатель платформы и сообщества ИИ-офис, автор блога о нейросетях «Выжимаем из ИИ Максимум».

Все статьи автора