Синтез речи

Coqui XTTS

Популярная модель клонирования голоса по короткому образцу на 17 языках, включая русский. Компания Coqui закрылась, развитие остановлено.

Разработчик
Coqui, Германия
Первый выпуск
сен 2023
Последний выпуск
окт 2023
Размеры
около 470M
Лицензия
Только некоммерческоеCoqui Public Model License — только некоммерческое использование

Какие задачи решает

  • Клонирование голоса по образцу
  • Озвучка на нескольких языках
  • Исследования и прототипы

Где применяется

ИсследованияОбразованиеНекоммерческие проекты

Требования к железу

НоутбукНоутбук или обычный ПК, до 8 ГБ видеопамяти — младшие версии
подходит
1 видеокартаОдна видеокарта на 16–80 ГБ — средние версии
нет версий
КластерСервер с несколькими видеокартами — флагманские версии
нет версий

Версии

  1. XTTS v2
  2. XTTS v1

Как внедряю у заказчика

  1. ПодборВыбираю размер модели под задачу и ваше железо, проверяю на ваших примерах.
  2. УстановкаРазворачиваю на вашем сервере или в закрытом контуре, отдаю API.
  3. ДообучениеДообучаю на ваших данных (LoRA) или подключаю базу знаний — что дешевле для задачи.
  4. ВстраиваниеПодключаю к CRM, 1С, боту, сайту или рабочему чату, настраиваю мониторинг.

Похожие модели