Открытые модели для синтеза речи

Модели синтеза речи озвучивают текст живым голосом: для голосовых ботов, автоответчиков, роликов и обучающих курсов. Часть моделей умеет клонировать голос по короткому образцу. Обратите внимание на качество русской речи и ударений, скорость генерации, лицензию и права на использование чужого голоса.

В подборке 31 семейство открытых моделей.Обновлено 22.09.2026Открыть весь каталог с фильтрами
Речь в текстRUGGUF2025–2026

VibeVoice

Microsoft · США

Речевые модели Microsoft: синтез длинных диалогов на несколько голосов, быстрый синтез для живого общения и распознавание длинных записей с разделением по говорящим, в том числе на русском.

  • Расшифровка длинных встреч с разметкой говорящих
  • Озвучка подкастов и диалогов
  • Голос для ассистентов в реальном времени
Размеры
0.5B – 9B
Железо
от: Ноутбук
Можно в коммерциюПодробнее
Синтез речиGGUF2025–2026

IndexTTS

bilibili · Китай

Синтез речи с клонированием голоса и точным контролем длительности, удобен для дубляжа видео. Управляет эмоциями отдельно от тембра.

  • Дубляж видео с попаданием в тайминг
  • Клонирование голоса
  • Эмоциональная озвучка
Размеры
около 1B – 2B
Железо
от: Ноутбук
Коммерция с условиямиПодробнее
ТекстGGUF2025–2026

LongCat

Meituan · Китай

Модели Meituan (крупнейший сервис доставки Китая). LongCat-Flash динамически меняет объём вычислений под сложность запроса; LongCat-2.0 — 1,6 трлн параметров под MIT. Есть омни-модели (Flash-Omni, Next) и синтез речи AudioDiT.

  • Агенты для заказов и сервисных процессов
  • Корпоративный ассистент
  • Разбор длинных документов
Размеры
1B – 1.6T-A48B
Железо
от: Ноутбук
Можно в коммерциюПодробнее
Синтез речиRUGGUF2025–2026

Higgs Audio

Boson AI · США

Выразительный синтез речи и диалогов с клонированием голоса, плюс модели распознавания. Третья версия синтеза поддерживает около 100 языков, включая русский, но некоммерческая.

  • Выразительная озвучка роликов
  • Озвучка диалогов
  • Клонирование голоса
Размеры
около 3B – 8B
Железо
от: 1 видеокарта
Коммерция с условиямиПодробнее
Синтез речиRUGGUF2025–2026

Zonos

Zyphra · США

Синтез речи с клонированием голоса и тонкой настройкой эмоций, скорости и высоты голоса.

  • Клонирование голоса
  • Эмоциональная озвучка
  • Озвучка роликов
Размеры
около 1.6B
Железо
от: Ноутбук
Можно в коммерциюПодробнее
Синтез речиRUGGUF2025–2026

Chatterbox

Resemble AI · США

Синтез речи с клонированием голоса и настройкой эмоциональности. Многоязычная версия поддерживает 23 языка, включая русский; Turbo и Flash ускорены для живого диалога.

  • Голос для бота и ассистента
  • Клонирование фирменного голоса
  • Озвучка роликов
Размеры
около 350M – 500M
Железо
от: Ноутбук
Можно в коммерциюПодробнее
Синтез речиRU2025–2026

MOSS-TTS / MOSS-TTSD

OpenMOSS (Фуданьский университет) · Китай

Семейство синтеза речи: озвучка диалогов на несколько голосов (TTSD), быстрый синтез для живого общения и крошечная Nano. Версия 1.5 поддерживает 30+ языков, включая русский.

  • Озвучка подкастов и диалогов
  • Голос для ассистента
  • Клонирование голоса
Размеры
100M – 8.5B
Железо
от: Ноутбук
Можно в коммерциюПодробнее
Синтез речиRU2025–2026

Supertonic

Supertone · Южная Корея

Очень быстрый лёгкий синтез речи для работы прямо на устройстве, без видеокарты и облака. Supertonic 3 говорит на 31 языке, включая русский.

  • Озвучка ответов голосового бота на обычном сервере
  • Озвучка в офлайн- и мобильных приложениях
  • Чтение текстов и уведомлений вслух
Размеры
около 99M
Железо
от: Ноутбук
Коммерция с условиямиПодробнее
Синтез речиRUGGUF2025–2026

VoxCPM

OpenBMB (ModelBest, Университет Цинхуа) · Китай

Синтез речи с клонированием голоса и естественной интонацией. VoxCPM2 поддерживает 30 языков, включая русский.

  • Клонирование голоса
  • Озвучка роликов и аудиокниг
  • Голос для ассистента
Размеры
0.5B – 2.3B
Железо
от: Ноутбук
Можно в коммерциюПодробнее
Синтез речи2025–2026

Kyutai STT, TTS и Pocket TTS

Kyutai · Франция

Потоковые модели распознавания и синтеза речи от авторов Moshi: начинают говорить и расшифровывать, не дожидаясь конца фразы. Pocket TTS (100M) работает на процессоре. Английский, французский и ещё несколько европейских языков, русского нет.

  • Потоковая расшифровка речи для голосовых ботов
  • Озвучка ответов с минимальной задержкой
  • Синтез речи на сервере без видеокарты (Pocket TTS)
Размеры
100M (Pocket TTS) – 2.6B
Железо
от: Ноутбук
Можно в коммерциюПодробнее
Речь в текстRUGGUF2025–2026

Voxtral

Mistral AI · Франция

Речевые модели Mistral: понимают аудио, расшифровывают и отвечают на вопросы по записи. Realtime-версия распознаёт в реальном времени и поддерживает русский; есть синтез речи.

  • Расшифровка и краткое содержание записей
  • Вопросы к аудио
  • Распознавание в реальном времени
Размеры
3B – 24B
Железо
от: Ноутбук
Коммерция с условиямиПодробнее
Синтез речиRU2024–2026

Fish Speech / OpenAudio

Fish Audio · США / Китай

Синтез речи с клонированием голоса и управлением эмоциями на 80+ языках, включая русский. Качество близко к платным сервисам, но веса только для исследований.

  • Клонирование голоса
  • Эмоциональная озвучка
  • Озвучка на многих языках
Размеры
0.5B – около 4.5B
Железо
от: Ноутбук
Только некоммерческоеПодробнее
Синтез речиRU2026

OmniVoice

k2-fsa (Next-gen Kaldi) · Китай

Синтез речи с клонированием голоса по короткому образцу на 646 языках, включая русский и языки народов России. Можно описать голос словами. Веса только для некоммерческого использования.

  • Озвучка на редких языках
  • Клонирование голоса по образцу
  • Исследования и прототипы многоязычной озвучки
Размеры
0.6B
Железо
от: Ноутбук
Только некоммерческоеПодробнее
Синтез речиRUGGUF2026

Qwen3-TTS

Alibaba (Qwen) · Китай

Синтез речи на 10 языках, включая русский: клонирование голоса по 3 секундам, готовые голоса и создание голоса по текстовому описанию.

  • Голос для бота и ассистента
  • Клонирование фирменного голоса
  • Подбор голоса по описанию
Размеры
0.6B – 1.7B
Железо
от: Ноутбук
Можно в коммерциюПодробнее
Синтез речиRU2024–2025

CosyVoice / Fun-CosyVoice

Alibaba (Tongyi, FunAudioLLM) · Китай

Синтез речи с клонированием голоса по короткому образцу и потоковой выдачей для живого диалога. Третья версия поддерживает 9 языков, включая русский.

  • Голос для бота и ассистента
  • Клонирование фирменного голоса
  • Озвучка роликов
Размеры
300M – 0.5B
Железо
от: Ноутбук
Можно в коммерциюПодробнее
Синтез речиRU2022–2025

Silero TTS

Silero · Россия

Лёгкий синтез русской речи, работает на обычном процессоре. Версия v5 добавила языки СНГ и народов России: татарский, башкирский, якутский, казахский и другие.

  • Озвучка ответов голосового бота
  • Чтение текстов на русском
  • Голоса на языках народов России
Размеры
десятки мегабайт
Железо
от: Ноутбук
Коммерция с условиямиПодробнее
Синтез речи2025

Dia

Nari Labs · Южная Корея

Модель, которая озвучивает целые диалоги на два голоса со смехом, вздохами и паузами. Только английский.

  • Озвучка диалогов и подкастов
  • Рекламные ролики с живой речью
  • Сценки для обучения
Размеры
1B – 2B
Железо
от: Ноутбук
Можно в коммерциюПодробнее
Речь в текстRU2023–2025

Vosk (русские модели)

Alpha Cephei · Россия

Офлайн-распознавание русской речи, которое работает даже на Raspberry Pi и телефоне, без интернета. Есть потоковые модели для живого звука и простой русский синтез речи Vosk TTS.

  • Расшифровка звонков и записей на русском без облака
  • Голосовое управление в приложениях и киосках
  • Распознавание речи в потоке с малой задержкой
Размеры
около 45 МБ – 1,8 ГБ
Железо
от: Ноутбук
Можно в коммерциюПодробнее
Синтез речиRU2025

ESpeech-TTS

ESpeech (независимая группа русскоязычных разработчиков) · Россия

Русский синтез речи с клонированием голоса на архитектуре F5-TTS, обучен на собранных авторами наборах русской речи. Ударения расставляются автоматически. Несколько вариантов, в том числе «подкастер».

  • Озвучка роликов и аудиокниг на русском
  • Клонирование голоса диктора по образцу
  • Голос для бота или ассистента на русском
Размеры
около 340M
Железо
от: Ноутбук
Коммерция с условиямиПодробнее
Голос: спикеры и звук2024–2025

GPT-SoVITS

RVC-Boss и сообщество · Китай

Синтез речи с клонированием голоса: хватает 5 секунд образца, а после дообучения на минуте записи голос звучит заметно точнее. Использовать только с согласия владельца голоса.

  • Озвучка текстов голосом конкретного диктора
  • Голос для бота или ассистента
  • Дубляж обучающих роликов
Размеры
менее 1B
Железо
от: Ноутбук
Можно в коммерциюПодробнее
Синтез речиRUGGUF2023–2025

Piper

Rhasspy / Open Home Foundation · США

Очень быстрый синтез речи, который работает даже на Raspberry Pi. Готовые голоса на 35+ языках, есть несколько русских.

  • Озвучка уведомлений и ответов бота
  • Голос для устройств без интернета
  • Голосовые меню
Размеры
около 5M – 30M
Железо
от: Ноутбук
Коммерция с условиямиПодробнее
Синтез речиGGUF2024–2025

F5-TTS

Шанхайский университет Цзяотун и партнёры · Китай

Модель клонирования голоса по нескольким секундам образца, английский и китайский. Сообщество выпустило много дообученных версий под другие языки, в том числе русский.

  • Клонирование голоса
  • Озвучка аудиокниг и роликов
  • Исследования и прототипы
Размеры
около 340M
Железо
от: Ноутбук
Только некоммерческоеПодробнее
Синтез речиGGUF2025

Orpheus TTS

Canopy Labs · США

Синтез речи на основе языковой модели с живыми интонациями и эмоциональными вставками. Быстро отвечает, подходит для голосовых ассистентов. В основном английский.

  • Голос для ассистента в реальном времени
  • Эмоциональная озвучка
  • Клонирование голоса
Размеры
3B
Железо
от: Ноутбук
Можно в коммерциюПодробнее
Синтез речиGGUF2025

Sesame CSM

Sesame · США

Модель разговорной речи, которая учитывает контекст беседы и звучит как живой собеседник. Только английский.

  • Голос для разговорного ассистента
  • Озвучка диалогов
  • Прототипы голосовых продуктов
Размеры
1B
Железо
от: Ноутбук
Можно в коммерциюПодробнее
Синтез речиGGUF2024–2025

Kokoro

hexgrad (независимый разработчик) · не указана

Крошечная модель синтеза речи (82M), которая звучит на уровне крупных. Работает на обычном процессоре; английский и ещё несколько языков, русского нет.

  • Озвучка статей и уведомлений
  • Голос для приложений без видеокарты
  • Массовая озвучка текстов
Размеры
82M
Железо
от: Ноутбук
Можно в коммерциюПодробнее
Синтез речиGGUF2024

Parler-TTS

Hugging Face · США

Синтез речи, где голос задаётся текстовым описанием («спокойный женский голос, чистая запись»). Английский и 8 европейских языков, русского нет.

  • Подбор голоса по описанию
  • Озвучка роликов
  • Прототипы голосовых сервисов
Размеры
880M – 2.2B
Железо
от: Ноутбук
Можно в коммерциюПодробнее
Голос: спикеры и звукНе развивается2024

OpenVoice

MyShell и MIT · США

Мгновенное клонирование голоса по короткому образцу с управлением эмоцией и акцентом, V2 говорит на нескольких языках. Использовать только с согласия владельца голоса.

  • Озвучка роликов голосом диктора компании
  • Голосовой бот с узнаваемым голосом бренда
  • Перенос тембра на готовый синтез речи
Размеры
менее 1B
Железо
от: Ноутбук
Можно в коммерциюПодробнее
Синтез речиНе развивается2024

MeloTTS

MyShell и MIT · США

Лёгкий многоязычный синтез речи, который успевает в реальном времени на обычном процессоре. Английский с акцентами, испанский, французский, китайский, японский и корейский; русского нет.

  • Озвучка ответов ботов на иностранных языках
  • Озвучка обучающих материалов
  • Чтение текстов вслух на сервере без видеокарты
Размеры
небольшая, работает в реальном времени на процессоре
Железо
от: Ноутбук
Можно в коммерциюПодробнее
Синтез речиНе развивается2023

StyleTTS 2

Колумбийский университет · США

Лёгкая модель синтеза английской речи с естественной интонацией. На её основе построены многие другие модели, например Kokoro.

  • Озвучка текстов на английском
  • Основа для дообучения своего голоса
  • Прототипы голосовых сервисов
Размеры
около 150M
Железо
от: Ноутбук
Коммерция с условиямиПодробнее
Синтез речиRUНе развивается2023

Coqui XTTS

Coqui · Германия

Популярная модель клонирования голоса по короткому образцу на 17 языках, включая русский. Компания Coqui закрылась, развитие остановлено.

  • Клонирование голоса по образцу
  • Озвучка на нескольких языках
  • Исследования и прототипы
Размеры
около 470M
Железо
от: Ноутбук
Только некоммерческоеПодробнее
Синтез речиRUGGUFНе развивается2023

Bark

Suno · США

Одна из первых открытых моделей, которая озвучивает текст с интонациями, смехом и паузами. Поддерживает около десятка языков, включая русский. Сейчас устарела.

  • Черновая озвучка роликов
  • Прототипы голосовых сервисов
  • Звуковые эффекты в речи
Размеры
около 300M – 1B
Железо
от: Ноутбук
Можно в коммерциюПодробнее

Подборки

Нужна модель под вашу задачу?

Открытую модель можно поставить на свой сервер: данные не уходят в чужое облако, нет оплаты за каждый запрос, модель можно дообучить на ваших документах.

  1. ПодберуМодель и размер под задачу и бюджет на железо
  2. ПоставлюНа ваш сервер или в закрытый контур, с API
  3. ДообучуНа ваших данных или подключу базу знаний
  4. ВстроюВ CRM, 1С, бота, сайт или рабочий чат
Обсудить внедрение