Открытые нейросети для музыки и звука

Аудиомодели создают музыку, джинглы и звуковые эффекты по текстовому описанию, а некоторые умеют разделять трек на дорожки. Это фон для роликов, подкастов и рекламы без покупки стоков. Главное здесь лицензия: проверьте, разрешено ли коммерческое использование результата.

В подборке 22 семейства открытых моделей.Обновлено 22.09.2026Открыть весь каталог с фильтрами
Музыка и звукGGUF2025–2026

YuE

M-A-P и HKUST · Китай

Генерация полноценных песен с вокалом и аккомпанементом по тексту и описанию стиля: английский, китайский, японский, корейский.

  • Песни и джинглы по тексту
  • Демо-версии композиций
  • Музыка для роликов
Размеры
0.5B – 7B
Железо
от: 1 видеокарта
Коммерция с условиямиПодробнее
Музыка и звук2026

HeartMuLa

HeartMuLa Team · не указана

Открытая модель генерации песен с вокалом на китайском, английском, японском, корейском и испанском, плюс кодек и модель расшифровки текста песен.

  • Песни и джинглы по тексту
  • Музыка для роликов
  • Расшифровка текста песен
Размеры
3B
Железо
от: 1 видеокарта
Можно в коммерциюПодробнее
Музыка и звукGGUF2022–2026

MERT

m-a-p (Multimodal Art Projection) · Великобритания / Китай

Энкодер музыки: превращает трек в числовое описание, по которому определяют жанр, настроение, тональность и ритм. MERT-v2 работает с целыми песнями до 6 минут.

  • Автоматическая разметка музыкального каталога
  • Поиск похожих треков
  • Определение жанра, настроения и темпа
Размеры
95M – 632M
Железо
от: Ноутбук
Только некоммерческоеПодробнее
ВидеоGGUF2025–2026

MAGI

Sand AI · Китай

Видео, которое генерируется по кускам друг за другом, поэтому ролик можно продлевать бесконечно. MAGI-2 делает видео сразу со звуком.

  • Длинные ролики с продолжением
  • Видео со звуком
  • Оживление изображений
Размеры
4.5B – 114B-A6B
Железо
от: 1 видеокарта
Можно в коммерциюПодробнее
Голос: спикеры и звук2022–2026

UVR / MDX-Net / RoFormer (разделение звука)

Сообщество: Ultimate Vocal Remover (Anjok07), ZFTurbo, MVSep · Международное сообщество

Большая открытая коллекция моделей для отделения голоса от музыки и шумов: MDX-Net, BS-RoFormer, Mel-RoFormer, SCNet. Лидеры по качеству вокала среди открытых решений.

  • Чистый голос из записи с музыкой
  • Минусовки и стемы для караоке
  • Удаление фоновой музыки и шума из роликов
Размеры
от десятков до сотен миллионов параметров
Железо
от: Ноутбук
Коммерция с условиямиПодробнее
Видео2024–2026

LTX-Video / LTX-2

Lightricks · Израиль

Быстрая видеомодель, которая с LTX-2 генерирует видео сразу со звуком и речью. Можно управлять камерой и позой, есть облегчённые версии.

  • Рекламные ролики со звуком
  • Видео из фото товара
  • Озвученные сцены для соцсетей
Размеры
2B – 22B
Железо
от: 1 видеокарта
Коммерция с условиямиПодробнее
Голос: спикеры и звук2022–2026

Demucs

Meta AI, затем Александр Дефоссе · Франция

Классическая модель, которая разделяет трек на голос, барабаны, бас и остальное. Версия v4 с гибридным трансформером остаётся эталоном; сейчас проект поддерживает автор в своём репозитории.

  • Отделить голос от музыки в записи
  • Минусовки и дорожки для караоке
  • Очистка речи в видео с фоновой музыкой
Размеры
десятки миллионов параметров
Железо
от: Ноутбук
Можно в коммерциюПодробнее
Музыка и звукRUGGUF2025–2026

ACE-Step

ACE Studio и StepFun · Китай

Быстрая генерация песен с вокалом на 19 языках, включая русский: полная песня за секунды, правка отдельных фрагментов и смена стиля.

  • Песни и джинглы для рекламы
  • Фоновая музыка для роликов
  • Демо-версии композиций
Размеры
около 2B – 4B
Железо
от: Ноутбук
Можно в коммерциюПодробнее
Музыка и звукGGUF2024–2026

Stable Audio

Stability AI · Великобритания

Генерация коротких музыкальных фрагментов и звуковых эффектов по описанию. Третья версия разделена на модели для музыки и для звуков.

  • Звуковые эффекты для роликов и игр
  • Фоновая музыка и джинглы
  • Звуки для интерфейсов
Размеры
около 0.5B – 2.3B
Железо
от: Ноутбук
Коммерция с условиямиПодробнее
Музыка и звук2025–2026

ThinkSound / PrismAudio

Alibaba Tongyi (FunAudioLLM) · Китай

Генерирует и редактирует звук к видео, тексту или аудио, сначала «рассуждая» о сцене через мультимодальную модель. PrismAudio — следующая версия для звука к видео.

  • Звук к видео по сцене
  • Редактирование отдельных звуков в дорожке
  • Звуковые эффекты по описанию
Размеры
размер на карточке не указан
Железо
от: 1 видеокарта
Можно в коммерциюПодробнее
Аватары2026

daVinci-MagiHuman

SII-GAIR и Sand.ai · Китай

Генерирует видео с говорящим человеком сразу со звуком: один трансформер обрабатывает текст, видео и аудио. Речь на 7 языках, русского в списке нет. Есть дистиллированные быстрые версии.

  • Видео с ведущим по сценарию
  • Рекламные ролики с говорящим персонажем
  • Обучающие видео с диктором
Размеры
15B
Железо
от: 1 видеокарта
Можно в коммерциюПодробнее
ВидеоGGUF2026

MOVA

OpenMOSS / MOSI · Китай

Генерирует видео сразу со звуком: речь с синхронными губами, эффекты и окружение в одном проходе. MoE-архитектура на 32B параметров, есть версии 360p и 720p.

  • Короткие ролики с речью и звуком по описанию
  • Рекламные сцены с диалогами
  • Прототипы видео для сторибордов
Размеры
32B-A18B
Железо
от: 1 видеокарта
Можно в коммерциюПодробнее
Голос: спикеры и звук2025

SAM Audio

Meta · США

Модель вырезает из записи нужный звук по текстовому описанию, по отметке на видео или по отрезку: голос, инструмент, шум. Доступ к весам выдают по заявке.

  • Выделить голос одного человека из шумной записи
  • Убрать посторонний звук из видео
  • Разобрать запись на отдельные источники звука
Размеры
small, base, large (от 5 до 15 ГБ весов)
Железо
от: 1 видеокарта
Коммерция с условиямиПодробнее
Компьютерное зрение2025

Perception Encoder (PE)

Meta · США

Семейство энкодеров Meta для картинок и видео, а с версией PE-AV — и для звука. PE-Core ищет по тексту точнее SigLIP 2 (по данным Meta), есть малые версии.

  • Поиск фото и видео по описанию
  • Разметка и теги каталога
  • Поиск по звуку и видео (PE-AV)
Размеры
размер на карточке не указан
Железо
от: Ноутбук
Можно в коммерциюПодробнее
Видео2025

Ovi

Character.AI · США

Генерирует видео вместе со звуком и речью по тексту или картинке: две ветви (видео на базе Wan 2.2 и аудио 5B) работают синхронно. Нужно 24–32 ГБ видеопамяти.

  • Короткие ролики с говорящими персонажами
  • Оживление картинки с озвучкой
  • Прототипы рекламных сцен
Размеры
11B
Железо
от: 1 видеокарта
Можно в коммерциюПодробнее
Музыка и звук2025

DiffRhythm

ASLP-lab (Северо-Западный политехнический университет) · Китай

Быстрая генерация полной песни с вокалом по тексту и образцу стиля, до нескольких минут звучания.

  • Песни и джинглы по тексту
  • Музыка для роликов
  • Демо-версии композиций
Размеры
около 1.1B
Железо
от: Ноутбук
Можно в коммерциюПодробнее
Музыка и звук2025

HunyuanVideo-Foley

Tencent Hunyuan · Китай

Генерирует звук студийного качества (48 кГц) к видео по картинке и текстовой подсказке: шаги, удары, окружение, синхронно с действием в кадре.

  • Фоли и звуковые эффекты к видео
  • Озвучка ИИ-роликов для рекламы
  • Саунд-дизайн для коротких видео
Размеры
не указан в карточке (веса около 10 ГБ; XL-версия с выгрузкой в память)
Железо
от: 1 видеокарта
Коммерция с условиямиПодробнее
Музыка и звук2024

MMAudio

Иллинойсский университет и Sony AI · США / Япония

Озвучивает немое видео: генерирует шумы и звуковые эффекты, синхронные с происходящим в кадре, по видео и текстовой подсказке. Одна из первых сильных открытых моделей фоли.

  • Звуковые эффекты к немому видео
  • Озвучка роликов от ИИ-генераторов
  • Черновой саунд-дизайн для монтажа
Размеры
размер на карточке не указан
Железо
от: Ноутбук
Только некоммерческоеПодробнее
Музыка и звук2024

MuQ / MuQ-MuLan

Tencent AI Lab · Китай

Музыкальный энкодер MuQ и модель MuQ-MuLan, которая сопоставляет музыку и текст: можно искать треки по описанию на английском или китайском.

  • Поиск музыки по текстовому описанию
  • Разметка треков по жанру и настроению
  • Подбор похожей музыки
Размеры
300M – 700M
Железо
от: Ноутбук
Только некоммерческоеПодробнее
Музыка и звук2023–2024

MusicGen (AudioCraft)

Meta · США

Генерация инструментальной музыки по текстовому описанию или по мелодии-образцу. Одна из первых открытых моделей такого рода.

  • Черновые музыкальные наброски
  • Музыка для прототипов роликов
  • Исследования
Размеры
300M – 3.3B
Железо
от: Ноутбук
Только некоммерческоеПодробнее
Музыка и звукНе развивается2023

CLAP (LAION)

LAION · Германия

Аналог CLIP для звука: переводит аудио и текст в общее пространство. Можно искать звуки и музыку по описанию и классифицировать их без обучения. Текст — английский.

  • Поиск звуков и музыки по описанию
  • Автоматические теги для аудиотеки
  • Распознавание типа звука (сирена, стекло, голос)
Размеры
размер на карточке не указан
Железо
от: Ноутбук
Можно в коммерциюПодробнее
Музыка и звукНе развивается2022

AST (Audio Spectrogram Transformer)

MIT · США

Классическая модель 2021 года для распознавания звуков: определяет 527 классов событий AudioSet (сирена, лай, стекло, музыка). Лёгкая, работает без видеокарты, с 2022 года в Transformers.

  • Распознавание звуковых событий
  • Разметка аудиоархива
  • Детекция тревожных звуков
Размеры
около 87M
Железо
от: Ноутбук
Можно в коммерциюПодробнее

Подборки

Нужна модель под вашу задачу?

Открытую модель можно поставить на свой сервер: данные не уходят в чужое облако, нет оплаты за каждый запрос, модель можно дообучить на ваших документах.

  1. ПодберуМодель и размер под задачу и бюджет на железо
  2. ПоставлюНа ваш сервер или в закрытый контур, с API
  3. ДообучуНа ваших данных или подключу базу знаний
  4. ВстроюВ CRM, 1С, бота, сайт или рабочий чат
Обсудить внедрение