Синтез речи
StyleTTS 2
Лёгкая модель синтеза английской речи с естественной интонацией. На её основе построены многие другие модели, например Kokoro.
- Разработчик
- Колумбийский университет, США
- Первый выпуск
- ноя 2023
- Последний выпуск
- ноя 2023
- Размеры
- около 150M
- Лицензия
- Коммерция с условиямиКод MIT; у готовых весов условие — сообщать слушателям, что голос синтезирован
Какие задачи решает
- Озвучка текстов на английском
- Основа для дообучения своего голоса
- Прототипы голосовых сервисов
Где применяется
Разработка продуктовОбразованиеМедиа
Требования к железу
НоутбукНоутбук или обычный ПК, до 8 ГБ видеопамяти — младшие версии
подходит1 видеокартаОдна видеокарта на 16–80 ГБ — средние версии
нет версийКластерСервер с несколькими видеокартами — флагманские версии
нет версийВерсии
- StyleTTS 2 (LJSpeech, LibriTTS)
Как внедряю у заказчика
- ПодборВыбираю размер модели под задачу и ваше железо, проверяю на ваших примерах.
- УстановкаРазворачиваю на вашем сервере или в закрытом контуре, отдаю API.
- ДообучениеДообучаю на ваших данных (LoRA) или подключаю базу знаний — что дешевле для задачи.
- ВстраиваниеПодключаю к CRM, 1С, боту, сайту или рабочему чату, настраиваю мониторинг.
Похожие модели
Синтез речиKokorohexgrad (независимый разработчик) · не указанаМожно в коммерцию
Крошечная модель синтеза речи (82M), которая звучит на уровне крупных. Работает на обычном процессоре; английский и ещё несколько языков, русского нет.
ПодробнееСинтез речиPiperRhasspy / Open Home Foundation · СШАКоммерция с условиямиОчень быстрый синтез речи, который работает даже на Raspberry Pi. Готовые голоса на 35+ языках, есть несколько русских.
ПодробнееСинтез речиF5-TTSШанхайский университет Цзяотун и партнёры · КитайТолько некоммерческоеМодель клонирования голоса по нескольким секундам образца, английский и китайский. Сообщество выпустило много дообученных версий под другие языки, в том числе русский.
Подробнее

