Синтез речи

StyleTTS 2

Лёгкая модель синтеза английской речи с естественной интонацией. На её основе построены многие другие модели, например Kokoro.

Разработчик
Колумбийский университет, США
Первый выпуск
ноя 2023
Последний выпуск
ноя 2023
Размеры
около 150M
Лицензия
Коммерция с условиямиКод MIT; у готовых весов условие — сообщать слушателям, что голос синтезирован

Какие задачи решает

  • Озвучка текстов на английском
  • Основа для дообучения своего голоса
  • Прототипы голосовых сервисов

Где применяется

Разработка продуктовОбразованиеМедиа

Требования к железу

НоутбукНоутбук или обычный ПК, до 8 ГБ видеопамяти — младшие версии
подходит
1 видеокартаОдна видеокарта на 16–80 ГБ — средние версии
нет версий
КластерСервер с несколькими видеокартами — флагманские версии
нет версий

Версии

  1. StyleTTS 2 (LJSpeech, LibriTTS)

Как внедряю у заказчика

  1. ПодборВыбираю размер модели под задачу и ваше железо, проверяю на ваших примерах.
  2. УстановкаРазворачиваю на вашем сервере или в закрытом контуре, отдаю API.
  3. ДообучениеДообучаю на ваших данных (LoRA) или подключаю базу знаний — что дешевле для задачи.
  4. ВстраиваниеПодключаю к CRM, 1С, боту, сайту или рабочему чату, настраиваю мониторинг.

Похожие модели