Синтез речиРечь в текст

Higgs Audio

Выразительный синтез речи и диалогов с клонированием голоса, плюс модели распознавания. Третья версия синтеза поддерживает около 100 языков, включая русский, но некоммерческая.

Разработчик
Boson AI, США
Первый выпуск
июл 2025
Последний выпуск
июн 2026
Размеры
около 3B – 8B
Лицензия
Коммерция с условиямиHiggs Audio v2 — Boson Community License на основе лицензии Llama 3 (свыше 100 тыс. пользователей в год нужна отдельная лицензия); модели распознавания v3 — Apache 2.0; higgs-tts-3 — только некоммерческое

Какие задачи решает

  • Выразительная озвучка роликов
  • Озвучка диалогов
  • Клонирование голоса
  • Расшифровка речи

Где применяется

МедиаИгрыМаркетинг

Требования к железу

НоутбукНоутбук или обычный ПК, до 8 ГБ видеопамяти — младшие версии
нет версий
1 видеокартаОдна видеокарта на 16–80 ГБ — средние версии
подходит
КластерСервер с несколькими видеокартами — флагманские версии
нет версий

Версии

  1. Higgs TTS 3 (4B)
  2. Higgs Audio v3 8B STT v2
  3. Higgs Audio v3 STT
  4. Higgs Audio v2 (3B)

Как внедряю у заказчика

  1. ПодборВыбираю размер модели под задачу и ваше железо, проверяю на ваших примерах.
  2. УстановкаРазворачиваю на вашем сервере или в закрытом контуре, отдаю API.
  3. ДообучениеДообучаю на ваших данных (LoRA) или подключаю базу знаний — что дешевле для задачи.
  4. ВстраиваниеПодключаю к CRM, 1С, боту, сайту или рабочему чату, настраиваю мониторинг.

Похожие модели