Синтез речи
F5-TTS
Модель клонирования голоса по нескольким секундам образца, английский и китайский. Сообщество выпустило много дообученных версий под другие языки, в том числе русский.
- Разработчик
- Шанхайский университет Цзяотун и партнёры, Китай
- Первый выпуск
- окт 2024
- Последний выпуск
- мар 2025
- Размеры
- около 340M
- Лицензия
- Только некоммерческоеКод MIT, официальные веса CC BY-NC 4.0 — некоммерческие
Какие задачи решает
- Клонирование голоса
- Озвучка аудиокниг и роликов
- Исследования и прототипы
Где применяется
ИсследованияМедиа (некоммерческие проекты)Образование
Требования к железу
НоутбукНоутбук или обычный ПК, до 8 ГБ видеопамяти — младшие версии
подходит1 видеокартаОдна видеокарта на 16–80 ГБ — средние версии
нет версийКластерСервер с несколькими видеокартами — флагманские версии
нет версийВерсии
- F5-TTS v1
- F5-TTS
Как внедряю у заказчика
- ПодборВыбираю размер модели под задачу и ваше железо, проверяю на ваших примерах.
- УстановкаРазворачиваю на вашем сервере или в закрытом контуре, отдаю API.
- ДообучениеДообучаю на ваших данных (LoRA) или подключаю базу знаний — что дешевле для задачи.
- ВстраиваниеПодключаю к CRM, 1С, боту, сайту или рабочему чату, настраиваю мониторинг.
Похожие модели
Синтез речиCosyVoice / Fun-CosyVoiceAlibaba (Tongyi, FunAudioLLM) · КитайМожно в коммерцию
Синтез речи с клонированием голоса по короткому образцу и потоковой выдачей для живого диалога. Третья версия поддерживает 9 языков, включая русский.
ПодробнееСинтез речиChatterboxResemble AI · СШАМожно в коммерциюСинтез речи с клонированием голоса и настройкой эмоциональности. Многоязычная версия поддерживает 23 языка, включая русский; Turbo и Flash ускорены для живого диалога.
ПодробнееСинтез речиVoxCPMOpenBMB (ModelBest, Университет Цинхуа) · КитайМожно в коммерциюСинтез речи с клонированием голоса и естественной интонацией. VoxCPM2 поддерживает 30 языков, включая русский.
Подробнее

