Голос: спикеры и звук

ClearerVoice (MossFormer)

Набор моделей Alibaba для чистки речи: шумоподавление, разделение наложенных голосов, повышение качества звука до 48 кГц и выделение голоса по видео с лицом говорящего.

Разработчик
Alibaba (Tongyi Lab), Китай
Первый выпуск
ноя 2024
Последний выпуск
авг 2025
Размеры
менее 1B
Лицензия
Можно в коммерциюApache 2.0

Какие задачи решает

  • Шумоподавление записей разговоров
  • Разделение двух голосов, говорящих одновременно
  • Улучшение старых и телефонных записей

Где применяется

Колл-центрыМедиа и архивыВидеосвязь

Требования к железу

НоутбукНоутбук или обычный ПК, до 8 ГБ видеопамяти — младшие версии
подходит
1 видеокартаОдна видеокарта на 16–80 ГБ — средние версии
подходит
КластерСервер с несколькими видеокартами — флагманские версии
нет версий

Версии

  1. Аудиовизуальные модели выделения голоса
  2. MossFormer2 SR 48K
  3. MossFormer2 SE/SS, FRCRN

Как внедряю у заказчика

  1. ПодборВыбираю размер модели под задачу и ваше железо, проверяю на ваших примерах.
  2. УстановкаРазворачиваю на вашем сервере или в закрытом контуре, отдаю API.
  3. ДообучениеДообучаю на ваших данных (LoRA) или подключаю базу знаний — что дешевле для задачи.
  4. ВстраиваниеПодключаю к CRM, 1С, боту, сайту или рабочему чату, настраиваю мониторинг.

Похожие модели