Синтез речи

Parler-TTS

Синтез речи, где голос задаётся текстовым описанием («спокойный женский голос, чистая запись»). Английский и 8 европейских языков, русского нет.

Разработчик
Hugging Face, США
Первый выпуск
апр 2024
Последний выпуск
ноя 2024
Размеры
880M – 2.2B
Лицензия
Можно в коммерциюApache 2.0

Какие задачи решает

  • Подбор голоса по описанию
  • Озвучка роликов
  • Прототипы голосовых сервисов

Где применяется

МедиаМаркетингОнлайн-обучение

Требования к железу

НоутбукНоутбук или обычный ПК, до 8 ГБ видеопамяти — младшие версии
подходит
1 видеокартаОдна видеокарта на 16–80 ГБ — средние версии
нет версий
КластерСервер с несколькими видеокартами — флагманские версии
нет версий

Версии

  1. Parler-TTS Mini Multilingual v1.1
  2. Parler-TTS Mini и Large v1
  3. Parler-TTS Mini v0.1

Как внедряю у заказчика

  1. ПодборВыбираю размер модели под задачу и ваше железо, проверяю на ваших примерах.
  2. УстановкаРазворачиваю на вашем сервере или в закрытом контуре, отдаю API.
  3. ДообучениеДообучаю на ваших данных (LoRA) или подключаю базу знаний — что дешевле для задачи.
  4. ВстраиваниеПодключаю к CRM, 1С, боту, сайту или рабочему чату, настраиваю мониторинг.

Похожие модели