Синтез речи

Fish Speech / OpenAudio

Синтез речи с клонированием голоса и управлением эмоциями на 80+ языках, включая русский. Качество близко к платным сервисам, но веса только для исследований.

Разработчик
Fish Audio, США / Китай
Первый выпуск
апр 2024
Последний выпуск
мар 2026
Размеры
0.5B – около 4.5B
Лицензия
Только некоммерческоеРанние версии CC BY-NC-SA 4.0, S2-Pro — Fish Audio Research License; коммерция только по отдельному договору

Какие задачи решает

  • Клонирование голоса
  • Эмоциональная озвучка
  • Озвучка на многих языках

Где применяется

ИсследованияМедиаРазработка прототипов

Требования к железу

НоутбукНоутбук или обычный ПК, до 8 ГБ видеопамяти — младшие версии
подходит
1 видеокартаОдна видеокарта на 16–80 ГБ — средние версии
подходит
КластерСервер с несколькими видеокартами — флагманские версии
нет версий

Версии

  1. Fish Audio S2-Pro
  2. OpenAudio S1-mini
  3. Fish Speech 1.5
  4. Fish Speech 1.0

Как внедряю у заказчика

  1. ПодборВыбираю размер модели под задачу и ваше железо, проверяю на ваших примерах.
  2. УстановкаРазворачиваю на вашем сервере или в закрытом контуре, отдаю API.
  3. ДообучениеДообучаю на ваших данных (LoRA) или подключаю базу знаний — что дешевле для задачи.
  4. ВстраиваниеПодключаю к CRM, 1С, боту, сайту или рабочему чату, настраиваю мониторинг.

Похожие модели