Синтез речи

ESpeech-TTS

Русский синтез речи с клонированием голоса на архитектуре F5-TTS, обучен на собранных авторами наборах русской речи. Ударения расставляются автоматически. Несколько вариантов, в том числе «подкастер».

Разработчик
ESpeech (независимая группа русскоязычных разработчиков), Россия
Первый выпуск
авг 2025
Последний выпуск
авг 2025
Размеры
около 340M
Лицензия
Коммерция с условиямиApache 2.0 по карточке на HF; модель построена на архитектуре F5-TTS, официальные веса которой некоммерческие, — перед коммерческим запуском проверьте с юристом
Русский язык
Есть
Запуск
Через свой серверНужна видеокарта
Сферы
Медиа и продакшн, Поддержка клиентов, Образование

Какие задачи решает

  • Озвучка роликов и аудиокниг на русском
  • Клонирование голоса диктора по образцу
  • Голос для бота или ассистента на русском

Где применяется

Медиа и контентГолосовые ботыОбразование

Требования к железу

НоутбукНоутбук или обычный ПК, до 8 ГБ видеопамяти — младшие версии
подходит
1 видеокартаОдна видеокарта на 16–80 ГБ — средние версии
нет версий
КластерСервер с несколькими видеокартами — флагманские версии
нет версий

Версии

  1. ESpeech-TTS-1 (SFT-95K, SFT-256K, RL-V1, RL-V2, podcaster)

Как внедряю у заказчика

  1. ПодборВыбираю размер модели под задачу и ваше железо, проверяю на ваших примерах.
  2. УстановкаРазворачиваю на вашем сервере или в закрытом контуре, отдаю API.
  3. ДообучениеДообучаю на ваших данных (LoRA) или подключаю базу знаний — что дешевле для задачи.
  4. ВстраиваниеПодключаю к CRM, 1С, боту, сайту или рабочему чату, настраиваю мониторинг.

Похожие модели