Музыка и звукВидео

ThinkSound / PrismAudio

Генерирует и редактирует звук к видео, тексту или аудио, сначала «рассуждая» о сцене через мультимодальную модель. PrismAudio — следующая версия для звука к видео.

Разработчик
Alibaba Tongyi (FunAudioLLM), Китай
Первый выпуск
июл 2025
Последний выпуск
мар 2026
Размеры
размер на карточке не указан
Лицензия
Можно в коммерциюApache 2.0 (ThinkSound), MIT (PrismAudio)
Запуск
Через свой серверНужна видеокарта
Сферы
Медиа и продакшн, Маркетинг и контент

Какие задачи решает

  • Звук к видео по сцене
  • Редактирование отдельных звуков в дорожке
  • Звуковые эффекты по описанию

Где применяется

ВидеопродакшнРекламаГеймдев

Требования к железу

НоутбукНоутбук или обычный ПК, до 8 ГБ видеопамяти — младшие версии
нет версий
1 видеокартаОдна видеокарта на 16–80 ГБ — средние версии
подходит
КластерСервер с несколькими видеокартами — флагманские версии
нет версий

Версии

  1. PrismAudio
  2. ThinkSound

Как внедряю у заказчика

  1. ПодборВыбираю размер модели под задачу и ваше железо, проверяю на ваших примерах.
  2. УстановкаРазворачиваю на вашем сервере или в закрытом контуре, отдаю API.
  3. ДообучениеДообучаю на ваших данных (LoRA) или подключаю базу знаний — что дешевле для задачи.
  4. ВстраиваниеПодключаю к CRM, 1С, боту, сайту или рабочему чату, настраиваю мониторинг.

Похожие модели