Синтез речи

F5-TTS

Модель клонирования голоса по нескольким секундам образца, английский и китайский. Сообщество выпустило много дообученных версий под другие языки, в том числе русский.

Разработчик
Шанхайский университет Цзяотун и партнёры, Китай
Первый выпуск
окт 2024
Последний выпуск
мар 2025
Размеры
около 340M
Лицензия
Только некоммерческоеКод MIT, официальные веса CC BY-NC 4.0 — некоммерческие

Какие задачи решает

  • Клонирование голоса
  • Озвучка аудиокниг и роликов
  • Исследования и прототипы

Где применяется

ИсследованияМедиа (некоммерческие проекты)Образование

Требования к железу

НоутбукНоутбук или обычный ПК, до 8 ГБ видеопамяти — младшие версии
подходит
1 видеокартаОдна видеокарта на 16–80 ГБ — средние версии
нет версий
КластерСервер с несколькими видеокартами — флагманские версии
нет версий

Версии

  1. F5-TTS v1
  2. F5-TTS

Как внедряю у заказчика

  1. ПодборВыбираю размер модели под задачу и ваше железо, проверяю на ваших примерах.
  2. УстановкаРазворачиваю на вашем сервере или в закрытом контуре, отдаю API.
  3. ДообучениеДообучаю на ваших данных (LoRA) или подключаю базу знаний — что дешевле для задачи.
  4. ВстраиваниеПодключаю к CRM, 1С, боту, сайту или рабочему чату, настраиваю мониторинг.

Похожие модели