Синтез речи

CosyVoice / Fun-CosyVoice

Синтез речи с клонированием голоса по короткому образцу и потоковой выдачей для живого диалога. Третья версия поддерживает 9 языков, включая русский.

Разработчик
Alibaba (Tongyi, FunAudioLLM), Китай
Первый выпуск
июл 2024
Последний выпуск
дек 2025
Размеры
300M – 0.5B
Лицензия
Можно в коммерциюApache 2.0

Какие задачи решает

  • Голос для бота и ассистента
  • Клонирование фирменного голоса
  • Озвучка роликов
  • Многоязычная озвучка

Где применяется

Колл-центрыМедиа и маркетингОнлайн-обучениеГолосовые боты

Требования к железу

НоутбукНоутбук или обычный ПК, до 8 ГБ видеопамяти — младшие версии
подходит
1 видеокартаОдна видеокарта на 16–80 ГБ — средние версии
нет версий
КластерСервер с несколькими видеокартами — флагманские версии
нет версий

Версии

  1. Fun-CosyVoice 3 0.5B
  2. CosyVoice 2 0.5B
  3. CosyVoice 300M

Как внедряю у заказчика

  1. ПодборВыбираю размер модели под задачу и ваше железо, проверяю на ваших примерах.
  2. УстановкаРазворачиваю на вашем сервере или в закрытом контуре, отдаю API.
  3. ДообучениеДообучаю на ваших данных (LoRA) или подключаю базу знаний — что дешевле для задачи.
  4. ВстраиваниеПодключаю к CRM, 1С, боту, сайту или рабочему чату, настраиваю мониторинг.

Похожие модели