Минус для караоке, для репетиции, для кавера. Разберём, как трек раскладывают на дорожки, почему остаётся эхо и бэк-вокал и что можно делать с результатом по закону.
Вокал из песни убирают разделением записи на дорожки: модель раскладывает сведённый трек обратно на голос, ударные, бас и остальные инструменты, после чего голосовую дорожку просто не берут в сборку. Так работают все онлайн-сервисы и открытые библиотеки, разница только в интерфейсе и лимитах. Идеального результата не даёт ни один инструмент: голос уходит хорошо, а его эхо, бэк-вокал и придыхания часто остаются, потому что в исходной записи они физически перемешаны с музыкой.
Ниже механика на пальцах, таблица по типу записи, четыре способа от браузера до одной команды в терминале, разбор типичных дефектов и короткий блок про права: с минусовкой чужой песни можно не всё. Технические цифры взяты из описаний открытых проектов Demucs и Spleeter, открытых 14 сентября 2026 года.
Что узнаешь из гайда
Часть 1 · Механика
Готовая песня это одна звуковая волна, в которой всё уже смешано. Ни голоса, ни баса отдельно в файле нет. Задача модели обратная сведению: по одной смеси восстановить, как звучала каждая составляющая до смешивания.
Опор у неё две. Первая: голос и инструменты по-разному устроены по частотам и по времени, у голоса свои гармоники и своя манера меняться. Вторая: в стереозаписи голос обычно стоит по центру, а инструменты разведены по сторонам. Обе опоры пропадают на плохом исходнике, и отсюда все дальнейшие проблемы.
Сколько дорожек бывает (Demucs и Spleeter, README открыты 14.09.2026)
У Spleeter от Deezer готовые модели на 2, 4 и 5 дорожек: голос и аккомпанемент; голос, ударные, бас и остальное; то же плюс пианино. У Demucs четвёртой версии основной набор из четырёх дорожек, а вариант на шесть источников добавляет гитару и пианино, причём про пианино авторы прямо пишут, что оно пока работает не очень хорошо.
Для минусовки хватает двух дорожек: голос и всё остальное. Четыре и больше нужны, когда вы хотите не просто минус, а переработать аранжировку: убрать только ударные, вытащить бас, заменить партию.
Часть 2 · Определитель
| Что за запись | Что получится | Что делать |
|---|---|---|
| Современное студийное стерео, один солист | чистый минус, следов почти нет | любой инструмент, два стема |
| Плотная аранжировка с хором | бэк-вокал частично остаётся | четыре стема и ручное сведение остатков |
| Голос с сильной реверберацией | певца нет, эхо есть | подавление хвостов после разделения |
| Старая монозапись | бульканье, инструменты искажены | искать студийный релиз, а не чинить копию |
| mp3 низкого битрейта из соцсети | металлический призвук на высоких | взять исходник лучшего качества |
| Живой концерт с залом | публика уходит в дорожку инструментов | ожидания снизить, чистого минуса не будет |
Часть 3 · Способы
Часть 4 · Локально
Полезно один раз увидеть, насколько простая операция скрыта за кнопкой онлайн-сервиса. В документации Demucs режим для минусовки описан буквально одним ключом, и авторы сами называют его режимом караоке.
# два стема: vocals.wav и no_vocals.wav
demucs --two-stems=vocals track.mp3
# полный набор: drums, bass, other, vocals
demucs track.mp3На выходе появляется папка с готовыми стереофайлами с частотой дискретизации 44,1 кГц. По умолчанию используется модель htdemucs. Есть дообученный вариант, который, по словам авторов, работает в четыре раза дольше и может дать чуть лучший результат: это честный размен времени на качество, и он окупается не всегда.
Когда треков много
Разовую задачу проще решить в браузере, а вот пачку из пятидесяти песен имеет смысл прогонять локально: там нет очередей и лимитов, и всю пачку запускает один цикл. Как такие цепочки собираются у нас есть разбор конвейера на нейросетях.
Часть 5 · Дефекты
Четыре типичных дефекта, и у каждого своя причина. Лечится каждый по-своему, поэтому сначала определите, что именно у вас звучит не так.
Чего делать не надо
Не прогоняйте уже разделённую минусовку через разделение второй раз в надежде дочистить остатки. На втором проходе модель работает с тем, что сама же и придумала, и результат становится глуше, а призрак голоса никуда не девается.
Часть 6 · Цифры
У задачи есть общепринятая метрика: SDR, отношение сигнала к искажениям, в децибелах. Считают её на стандартном наборе записей, у которых известны исходные дорожки, поэтому результаты моделей можно честно сравнивать между собой.
Цифры из описания Demucs (открыто 14.09.2026)
Четвёртая версия построена на гибридной архитектуре с трансформером и даёт 9,00 децибела SDR на наборе MUSDB HQ. С разреженным вниманием для расширения обзора модели и дообучением под каждый источник авторы сообщают о 9,20 децибела. Отдельно в README приведена таблица, где общий SDR считается как среднее по четырём источникам, плюс субъективные оценки качества и загрязнённости по пятибалльной шкале.
Практический смысл этих цифр простой: разница между хорошей и очень хорошей моделью составляет доли децибела, а разница между хорошим и плохим исходником это пропасть. Смена файла на версию лучшего качества улучшает результат сильнее, чем смена инструмента.
Часть 7 · Право
Коротко про права
Минусовка чужой песни это переработка чужой фонограммы. Сделать её для себя, чтобы разучить партию или спеть дома, одно. Выложить в общий доступ, вставить в свой ролик или продать совсем другое: на это нужны права, которых у вас нет.
Памятка
Коротко
Источники
FAQ
Прогнать запись через разделение на дорожки: модель раскладывает трек на голос и инструменты, и вам остаётся забрать всё, кроме голоса. В открытом проекте Demucs этот режим называется прямо: ключ с двумя дорожками по вокалу авторы называют режимом караоке. Онлайн-сервисы делают то же самое, просто прячут это за одной кнопкой.
Потому что в исходной записи голос обработан реверберацией, и хвост этого эха физически перемешан с музыкой. Модель уверенно забирает сам голос, а его отражения в зале часто относит к инструментам. Отсюда ощущение, что певец ушёл, а комната осталась.
Потому что для модели это тоже голос, но тише и в другом месте по панораме. Часть бэк-вокала уходит с основным, часть остаётся в инструментальной дорожке. На плотных аранжировках с хором результат почти всегда неполный, и чинится это только ручным сведением.
Качество разделения измеряют показателем SDR в децибелах. В описании модели Demucs четвёртой версии указано 9,00 децибела на тестовом наборе MUSDB HQ, а с разреженным вниманием и дообучением под каждый источник 9,20. Это ориентир по верхней планке открытых моделей, а не гарантия для вашего конкретного трека.
Да, и двумя путями. Онлайн-сервисы дают бесплатный лимит, обычно ограниченный длиной файла или числом треков в сутки. Открытые библиотеки бесплатны совсем: код Spleeter от Deezer опубликован под лицензией MIT, Demucs тоже открыт. Платить приходится за удобство, а не за саму технологию.
На сервисе минуту-две на трек, львиная доля из которых это загрузка. Локально всё зависит от железа: в описании Spleeter указано, что разделение на четыре дорожки идёт в сто раз быстрее реального времени на видеокарте. На процессоре в разы медленнее, но всё равно это минуты, а не часы.
Стемы это отдельные дорожки одного трека. У Spleeter есть готовые модели на 2, 4 и 5 дорожек: голос и аккомпанемент; голос, ударные, бас и остальное; то же самое плюс пианино. У Demucs четвёртой версии есть вариант на шесть источников с гитарой и пианино, причём авторы честно отмечают, что пианино пока работает не очень хорошо.
Из-за моно и из-за качества исходника. Модели обучались на стереозаписях, где голос обычно в центре, а инструменты разведены по сторонам, и эта разница помогает разделению. В монофонической записи такой подсказки нет. Плюс сильное сжатие в mp3 низкого битрейта уже уничтожило часть высоких частот, по которым голос отличается от инструментов.
Публиковать её и тем более продавать нельзя: минус это переработка чужой фонограммы, права на которую вам не принадлежат. Разделение на дорожки для личного использования и разучивания партии это одно, а выкладывание результата в общий доступ совсем другое. Для публикации нужна либо лицензия, либо своя музыка.
Направлением работы. Здесь берётся готовая запись и раскладывается на составляющие, а при генерации музыка создаётся с нуля по описанию или по тексту. Инструменты разные, и путать их не стоит: генератор песен не умеет разбирать чужой трек, а разделитель дорожек не умеет ничего сочинять.
Платформа и сообщество, где я по шагам показываю, как поставить ИИ на рутину: контент, код, продажи, аналитика. Заходи и забирай рабочие связки, которыми пользуюсь сам.
Посмотреть, что внутриtelegram
Канал с полезными материалами про нейросети
Разборы, новые инструменты и приёмы по ИИ — то, чем пользуюсь сам, без воды. Подпишись, чтобы не потерять.