Звук · дорожки

Убрать вокал из песни: 4 способа сделать минус

Минус для караоке, для репетиции, для кавера. Разберём, как трек раскладывают на дорожки, почему остаётся эхо и бэк-вокал и что можно делать с результатом по закону.

Кирилл СандаковКирилл СандаковВайбкодер, предприниматель, продюсерОпубликовано 14.09.202612 мин чтения

Вокал из песни убирают разделением записи на дорожки: модель раскладывает сведённый трек обратно на голос, ударные, бас и остальные инструменты, после чего голосовую дорожку просто не берут в сборку. Так работают все онлайн-сервисы и открытые библиотеки, разница только в интерфейсе и лимитах. Идеального результата не даёт ни один инструмент: голос уходит хорошо, а его эхо, бэк-вокал и придыхания часто остаются, потому что в исходной записи они физически перемешаны с музыкой.

Ниже механика на пальцах, таблица по типу записи, четыре способа от браузера до одной команды в терминале, разбор типичных дефектов и короткий блок про права: с минусовкой чужой песни можно не всё. Технические цифры взяты из описаний открытых проектов Demucs и Spleeter, открытых 14 сентября 2026 года.

Что узнаешь из гайда

  • Как трек раскладывают на дорожки и сколько их бывает
  • Почему на старых и монозаписях получается хуже
  • Откуда берётся эхо без певца
  • Как это делается одной командой на своём компьютере
  • Что с минусовкой можно делать, а что нельзя

Часть 1 · Механика

Что значит «разделить трек на дорожки»

Готовая песня это одна звуковая волна, в которой всё уже смешано. Ни голоса, ни баса отдельно в файле нет. Задача модели обратная сведению: по одной смеси восстановить, как звучала каждая составляющая до смешивания.

Опор у неё две. Первая: голос и инструменты по-разному устроены по частотам и по времени, у голоса свои гармоники и своя манера меняться. Вторая: в стереозаписи голос обычно стоит по центру, а инструменты разведены по сторонам. Обе опоры пропадают на плохом исходнике, и отсюда все дальнейшие проблемы.

Сколько дорожек бывает (Demucs и Spleeter, README открыты 14.09.2026)

У Spleeter от Deezer готовые модели на 2, 4 и 5 дорожек: голос и аккомпанемент; голос, ударные, бас и остальное; то же плюс пианино. У Demucs четвёртой версии основной набор из четырёх дорожек, а вариант на шесть источников добавляет гитару и пианино, причём про пианино авторы прямо пишут, что оно пока работает не очень хорошо.

Для минусовки хватает двух дорожек: голос и всё остальное. Четыре и больше нужны, когда вы хотите не просто минус, а переработать аранжировку: убрать только ударные, вытащить бас, заменить партию.


Часть 2 · Определитель

Какой у вас трек и чего от него ждать

Тип записи, ожидаемый результат разделения и что делать
Что за записьЧто получитсяЧто делать
Современное студийное стерео, один солистчистый минус, следов почти нетлюбой инструмент, два стема
Плотная аранжировка с хоромбэк-вокал частично остаётсячетыре стема и ручное сведение остатков
Голос с сильной реверберациейпевца нет, эхо естьподавление хвостов после разделения
Старая монозаписьбульканье, инструменты искаженыискать студийный релиз, а не чинить копию
mp3 низкого битрейта из соцсетиметаллический призвук на высокихвзять исходник лучшего качества
Живой концерт с заломпублика уходит в дорожку инструментовожидания снизить, чистого минуса не будет

Часть 3 · Способы

Четыре способа от браузера до терминала

  1. Онлайн-сервис. Загрузили файл, получили две дорожки. Быстрее всего для одного трека. Ограничения обычно по длине файла и по числу обработок в сутки, а качество то же самое: под капотом часто стоит та же открытая модель.
  2. Приложение на телефоне. Удобно, когда минус нужен прямо сейчас и на месте. Качество ниже, потому что файл сжимается перед отправкой, но для разучивания партии хватает.
  3. Локальная библиотека. Без лимитов, без загрузки музыки на чужие серверы и с возможностью гонять пачками. Один раз настраивается, дальше работает командой.
  4. Программа для сведения. Нужна, когда разделение это только первый шаг: дальше вы чистите остатки, выравниваете громкость и сводите минус заново. Самый долгий и самый качественный путь.

Часть 4 · Локально

Как это выглядит одной командой

Полезно один раз увидеть, насколько простая операция скрыта за кнопкой онлайн-сервиса. В документации Demucs режим для минусовки описан буквально одним ключом, и авторы сами называют его режимом караоке.

разделение на голос и всё остальное
# два стема: vocals.wav и no_vocals.wav
demucs --two-stems=vocals track.mp3

# полный набор: drums, bass, other, vocals
demucs track.mp3

На выходе появляется папка с готовыми стереофайлами с частотой дискретизации 44,1 кГц. По умолчанию используется модель htdemucs. Есть дообученный вариант, который, по словам авторов, работает в четыре раза дольше и может дать чуть лучший результат: это честный размен времени на качество, и он окупается не всегда.

Когда треков много

Разовую задачу проще решить в браузере, а вот пачку из пятидесяти песен имеет смысл прогонять локально: там нет очередей и лимитов, и всю пачку запускает один цикл. Как такие цепочки собираются у нас есть разбор конвейера на нейросетях.


Часть 5 · Дефекты

Эхо, бульканье и оставшийся бэк-вокал

Четыре типичных дефекта, и у каждого своя причина. Лечится каждый по-своему, поэтому сначала определите, что именно у вас звучит не так.

  • Хвост эха там, где был голос. Реверберация с голоса осталась в инструментальной дорожке. Лечится подавлением хвостов уже после разделения, а не повторным прогоном.
  • Металлическое бульканье на тарелках. Модель не смогла развести шумовые составляющие. Чаще всего это следствие плохого исходника, и чинится сменой файла на версию с большим битрейтом.
  • Остатки бэк-вокала. Для модели это голос, просто тише. Иногда помогает вариант с четырьмя стемами: подпевки чаще уходят в дорожку «остальное», и там их можно приглушить точечно.
  • Провал в середине спектра. Вместе с голосом уехала часть гитары или синтезатора в том же диапазоне. Лечится лёгким подъёмом середины на минусовке, но осторожно: перестараетесь, и вернётся призрак голоса.

Чего делать не надо

Не прогоняйте уже разделённую минусовку через разделение второй раз в надежде дочистить остатки. На втором проходе модель работает с тем, что сама же и придумала, и результат становится глуше, а призрак голоса никуда не девается.


Часть 6 · Цифры

Как вообще меряют, хорошо или плохо

У задачи есть общепринятая метрика: SDR, отношение сигнала к искажениям, в децибелах. Считают её на стандартном наборе записей, у которых известны исходные дорожки, поэтому результаты моделей можно честно сравнивать между собой.

Цифры из описания Demucs (открыто 14.09.2026)

Четвёртая версия построена на гибридной архитектуре с трансформером и даёт 9,00 децибела SDR на наборе MUSDB HQ. С разреженным вниманием для расширения обзора модели и дообучением под каждый источник авторы сообщают о 9,20 децибела. Отдельно в README приведена таблица, где общий SDR считается как среднее по четырём источникам, плюс субъективные оценки качества и загрязнённости по пятибалльной шкале.

Практический смысл этих цифр простой: разница между хорошей и очень хорошей моделью составляет доли децибела, а разница между хорошим и плохим исходником это пропасть. Смена файла на версию лучшего качества улучшает результат сильнее, чем смена инструмента.


Часть 7 · Право

Что с минусовкой можно делать, а что нет

Коротко про права

Минусовка чужой песни это переработка чужой фонограммы. Сделать её для себя, чтобы разучить партию или спеть дома, одно. Выложить в общий доступ, вставить в свой ролик или продать совсем другое: на это нужны права, которых у вас нет.

  • Кавер на площадке. Площадки обычно определяют оригинал автоматически и либо делят доход с правообладателем, либо блокируют загрузку.
  • Фон для ролика. Минус чужого трека остаётся чужим треком. Для роликов берут музыку с подходящей лицензией.
  • Свой материал. Если нужен минус под свой голос, дешевле и безопаснее сгенерировать музыку: про это есть отдельный разбор создания песни нейросетью и работы в Suno.
  • Личное использование. Разучить партию, разобрать аранжировку, потренироваться: вопросов не возникает, пока результат не покидает ваш компьютер.

Памятка

Порядок действий целиком

Коротко

  • Начните с поиска исходника лучшего качества, не с сервиса.
  • Для минуса хватает двух дорожек, больше нужно для аранжировки.
  • Стерео разделяется лучше моно, это принципиально.
  • Эхо после голоса чистится отдельно, а не повторным прогоном.
  • Бэк-вокал уходит не весь, это нормально.
  • Второй прогон по минусовке только ухудшает звук.
  • Локальный запуск снимает лимиты и оставляет музыку у вас.
  • Публиковать минус чужой песни нельзя, для публикации нужна своя музыка или лицензия.

Источники

Откуда взяты цифры

  • README проекта Demucs (adefossez/demucs), открыт 14.09.2026: четвёртая версия построена на Hybrid Transformer Demucs, SDR 9,00 децибела на наборе MUSDB HQ и 9,20 при использовании разреженного внимания и дообучения под каждый источник; модель htdemucs используется по умолчанию, htdemucs_ft работает в четыре раза дольше, htdemucs_6s добавляет гитару и пианино с оговоркой авторов про качество пианино; ключ с двумя дорожками по вокалу назван режимом караоке; на выходе четыре стереофайла с частотой 44,1 кГц.
  • README проекта Spleeter (deezer/spleeter), открыт 14.09.2026: предобученные модели на 2, 4 и 5 дорожек; код под лицензией MIT; разделение на четыре дорожки в сто раз быстрее реального времени на видеокарте; среди применений указан VirtualDJ.
  • Wordstat, Россия, 14.09.2026: частотность запросов про удаление вокала из песни и про отделение голоса от музыки.

FAQ

Частые вопросы

Как убрать вокал из песни и получить минус

Прогнать запись через разделение на дорожки: модель раскладывает трек на голос и инструменты, и вам остаётся забрать всё, кроме голоса. В открытом проекте Demucs этот режим называется прямо: ключ с двумя дорожками по вокалу авторы называют режимом караоке. Онлайн-сервисы делают то же самое, просто прячут это за одной кнопкой.

Почему в минусовке остаётся эхо от голоса

Потому что в исходной записи голос обработан реверберацией, и хвост этого эха физически перемешан с музыкой. Модель уверенно забирает сам голос, а его отражения в зале часто относит к инструментам. Отсюда ощущение, что певец ушёл, а комната осталась.

Почему бэк-вокал не убирается

Потому что для модели это тоже голос, но тише и в другом месте по панораме. Часть бэк-вокала уходит с основным, часть остаётся в инструментальной дорожке. На плотных аранжировках с хором результат почти всегда неполный, и чинится это только ручным сведением.

Какое качество считается хорошим

Качество разделения измеряют показателем SDR в децибелах. В описании модели Demucs четвёртой версии указано 9,00 децибела на тестовом наборе MUSDB HQ, а с разреженным вниманием и дообучением под каждый источник 9,20. Это ориентир по верхней планке открытых моделей, а не гарантия для вашего конкретного трека.

Можно ли убрать вокал бесплатно

Да, и двумя путями. Онлайн-сервисы дают бесплатный лимит, обычно ограниченный длиной файла или числом треков в сутки. Открытые библиотеки бесплатны совсем: код Spleeter от Deezer опубликован под лицензией MIT, Demucs тоже открыт. Платить приходится за удобство, а не за саму технологию.

Сколько времени занимает разделение

На сервисе минуту-две на трек, львиная доля из которых это загрузка. Локально всё зависит от железа: в описании Spleeter указано, что разделение на четыре дорожки идёт в сто раз быстрее реального времени на видеокарте. На процессоре в разы медленнее, но всё равно это минуты, а не часы.

Что такое стемы и сколько их бывает

Стемы это отдельные дорожки одного трека. У Spleeter есть готовые модели на 2, 4 и 5 дорожек: голос и аккомпанемент; голос, ударные, бас и остальное; то же самое плюс пианино. У Demucs четвёртой версии есть вариант на шесть источников с гитарой и пианино, причём авторы честно отмечают, что пианино пока работает не очень хорошо.

Почему на старой записи получается плохо

Из-за моно и из-за качества исходника. Модели обучались на стереозаписях, где голос обычно в центре, а инструменты разведены по сторонам, и эта разница помогает разделению. В монофонической записи такой подсказки нет. Плюс сильное сжатие в mp3 низкого битрейта уже уничтожило часть высоких частот, по которым голос отличается от инструментов.

Можно ли выложить минусовку чужой песни

Публиковать её и тем более продавать нельзя: минус это переработка чужой фонограммы, права на которую вам не принадлежат. Разделение на дорожки для личного использования и разучивания партии это одно, а выкладывание результата в общий доступ совсем другое. Для публикации нужна либо лицензия, либо своя музыка.

Чем это отличается от генерации песни нейросетью

Направлением работы. Здесь берётся готовая запись и раскладывается на составляющие, а при генерации музыка создаётся с нуля по описанию или по тексту. Инструменты разные, и путать их не стоит: генератор песен не умеет разбирать чужой трек, а разделитель дорожек не умеет ничего сочинять.


Читать дальше

ИИ-офис
Собери свой ИИ-офис и перестань делать руками то, что делает нейросеть

Платформа и сообщество, где я по шагам показываю, как поставить ИИ на рутину: контент, код, продажи, аналитика. Заходи и забирай рабочие связки, которыми пользуюсь сам.

Посмотреть, что внутри

telegram

Канал с полезными материалами про нейросети

Разборы, новые инструменты и приёмы по ИИ — то, чем пользуюсь сам, без воды. Подпишись, чтобы не потерять.

Перейти в канал
Кирилл Сандаков

Об авторе

Кирилл Сандаков

Вайбкодер, предприниматель, продюсер

Завайбкодил контент-ферму на США в Instagram (более 300 тыс. подписчиков, среди читателей Дональд Трамп Младший), создатель платформы и сообщества ИИ-офис, автор блога о нейросетях «Выжимаем из ИИ Максимум».

Все статьи автора