Синтез речиРечь в текст
Higgs Audio
Выразительный синтез речи и диалогов с клонированием голоса, плюс модели распознавания. Третья версия синтеза поддерживает около 100 языков, включая русский, но некоммерческая.
- Разработчик
- Boson AI, США
- Первый выпуск
- июл 2025
- Последний выпуск
- июн 2026
- Размеры
- около 3B – 8B
- Лицензия
- Коммерция с условиямиHiggs Audio v2 — Boson Community License на основе лицензии Llama 3 (свыше 100 тыс. пользователей в год нужна отдельная лицензия); модели распознавания v3 — Apache 2.0; higgs-tts-3 — только некоммерческое
Какие задачи решает
- Выразительная озвучка роликов
- Озвучка диалогов
- Клонирование голоса
- Расшифровка речи
Где применяется
МедиаИгрыМаркетинг
Требования к железу
НоутбукНоутбук или обычный ПК, до 8 ГБ видеопамяти — младшие версии
нет версий1 видеокартаОдна видеокарта на 16–80 ГБ — средние версии
подходитКластерСервер с несколькими видеокартами — флагманские версии
нет версийВерсии
- Higgs TTS 3 (4B)
- Higgs Audio v3 8B STT v2
- Higgs Audio v3 STT
- Higgs Audio v2 (3B)
Как внедряю у заказчика
- ПодборВыбираю размер модели под задачу и ваше железо, проверяю на ваших примерах.
- УстановкаРазворачиваю на вашем сервере или в закрытом контуре, отдаю API.
- ДообучениеДообучаю на ваших данных (LoRA) или подключаю базу знаний — что дешевле для задачи.
- ВстраиваниеПодключаю к CRM, 1С, боту, сайту или рабочему чату, настраиваю мониторинг.
Похожие модели
Синтез речиMOSS-TTS / MOSS-TTSDOpenMOSS (Фуданьский университет) · КитайМожно в коммерцию
Семейство синтеза речи: озвучка диалогов на несколько голосов (TTSD), быстрый синтез для живого общения и крошечная Nano. Версия 1.5 поддерживает 30+ языков, включая русский.
ПодробнееРечь в текстVibeVoiceMicrosoft · СШАМожно в коммерциюРечевые модели Microsoft: синтез длинных диалогов на несколько голосов, быстрый синтез для живого общения и распознавание длинных записей с разделением по говорящим, в том числе на русском.
ПодробнееСинтез речиFish Speech / OpenAudioFish Audio · США / КитайТолько некоммерческоеСинтез речи с клонированием голоса и управлением эмоциями на 80+ языках, включая русский. Качество близко к платным сервисам, но веса только для исследований.
Подробнее

