Речь в текстRUGGUF2025–2026
Microsoft · США
Речевые модели Microsoft: синтез длинных диалогов на несколько голосов, быстрый синтез для живого общения и распознавание длинных записей с разделением по говорящим, в том числе на русском.
- Расшифровка длинных встреч с разметкой говорящих
- Озвучка подкастов и диалогов
- Голос для ассистентов в реальном времени
- Размеры
- 0.5B – 9B
- Железо
- от: Ноутбук
Синтез речиGGUF2025–2026
bilibili · Китай
Синтез речи с клонированием голоса и точным контролем длительности, удобен для дубляжа видео. Управляет эмоциями отдельно от тембра.
- Дубляж видео с попаданием в тайминг
- Клонирование голоса
- Эмоциональная озвучка
- Размеры
- около 1B – 2B
- Железо
- от: Ноутбук
ТекстGGUF2025–2026
Meituan · Китай
Модели Meituan (крупнейший сервис доставки Китая). LongCat-Flash динамически меняет объём вычислений под сложность запроса; LongCat-2.0 — 1,6 трлн параметров под MIT. Есть омни-модели (Flash-Omni, Next) и синтез речи AudioDiT.
- Агенты для заказов и сервисных процессов
- Корпоративный ассистент
- Разбор длинных документов
- Размеры
- 1B – 1.6T-A48B
- Железо
- от: Ноутбук
Синтез речиRUGGUF2025–2026
Boson AI · США
Выразительный синтез речи и диалогов с клонированием голоса, плюс модели распознавания. Третья версия синтеза поддерживает около 100 языков, включая русский, но некоммерческая.
- Выразительная озвучка роликов
- Озвучка диалогов
- Клонирование голоса
- Размеры
- около 3B – 8B
- Железо
- от: 1 видеокарта
Синтез речиRUGGUF2025–2026
Zyphra · США
Синтез речи с клонированием голоса и тонкой настройкой эмоций, скорости и высоты голоса.
- Клонирование голоса
- Эмоциональная озвучка
- Озвучка роликов
- Размеры
- около 1.6B
- Железо
- от: Ноутбук
Синтез речиRUGGUF2025–2026
Resemble AI · США
Синтез речи с клонированием голоса и настройкой эмоциональности. Многоязычная версия поддерживает 23 языка, включая русский; Turbo и Flash ускорены для живого диалога.
- Голос для бота и ассистента
- Клонирование фирменного голоса
- Озвучка роликов
- Размеры
- около 350M – 500M
- Железо
- от: Ноутбук
Синтез речиRU2025–2026
OpenMOSS (Фуданьский университет) · Китай
Семейство синтеза речи: озвучка диалогов на несколько голосов (TTSD), быстрый синтез для живого общения и крошечная Nano. Версия 1.5 поддерживает 30+ языков, включая русский.
- Озвучка подкастов и диалогов
- Голос для ассистента
- Клонирование голоса
- Размеры
- 100M – 8.5B
- Железо
- от: Ноутбук
Синтез речиRU2025–2026
Supertone · Южная Корея
Очень быстрый лёгкий синтез речи для работы прямо на устройстве, без видеокарты и облака. Supertonic 3 говорит на 31 языке, включая русский.
- Озвучка ответов голосового бота на обычном сервере
- Озвучка в офлайн- и мобильных приложениях
- Чтение текстов и уведомлений вслух
- Размеры
- около 99M
- Железо
- от: Ноутбук
Синтез речиRUGGUF2025–2026
OpenBMB (ModelBest, Университет Цинхуа) · Китай
Синтез речи с клонированием голоса и естественной интонацией. VoxCPM2 поддерживает 30 языков, включая русский.
- Клонирование голоса
- Озвучка роликов и аудиокниг
- Голос для ассистента
- Размеры
- 0.5B – 2.3B
- Железо
- от: Ноутбук
Синтез речи2025–2026
Kyutai · Франция
Потоковые модели распознавания и синтеза речи от авторов Moshi: начинают говорить и расшифровывать, не дожидаясь конца фразы. Pocket TTS (100M) работает на процессоре. Английский, французский и ещё несколько европейских языков, русского нет.
- Потоковая расшифровка речи для голосовых ботов
- Озвучка ответов с минимальной задержкой
- Синтез речи на сервере без видеокарты (Pocket TTS)
- Размеры
- 100M (Pocket TTS) – 2.6B
- Железо
- от: Ноутбук
Речь в текстRUGGUF2025–2026
Mistral AI · Франция
Речевые модели Mistral: понимают аудио, расшифровывают и отвечают на вопросы по записи. Realtime-версия распознаёт в реальном времени и поддерживает русский; есть синтез речи.
- Расшифровка и краткое содержание записей
- Вопросы к аудио
- Распознавание в реальном времени
- Размеры
- 3B – 24B
- Железо
- от: Ноутбук
Синтез речиRU2024–2026
Fish Audio · США / Китай
Синтез речи с клонированием голоса и управлением эмоциями на 80+ языках, включая русский. Качество близко к платным сервисам, но веса только для исследований.
- Клонирование голоса
- Эмоциональная озвучка
- Озвучка на многих языках
- Размеры
- 0.5B – около 4.5B
- Железо
- от: Ноутбук
Синтез речиRU2026
k2-fsa (Next-gen Kaldi) · Китай
Синтез речи с клонированием голоса по короткому образцу на 646 языках, включая русский и языки народов России. Можно описать голос словами. Веса только для некоммерческого использования.
- Озвучка на редких языках
- Клонирование голоса по образцу
- Исследования и прототипы многоязычной озвучки
- Размеры
- 0.6B
- Железо
- от: Ноутбук
Синтез речиRUGGUF2026
Alibaba (Qwen) · Китай
Синтез речи на 10 языках, включая русский: клонирование голоса по 3 секундам, готовые голоса и создание голоса по текстовому описанию.
- Голос для бота и ассистента
- Клонирование фирменного голоса
- Подбор голоса по описанию
- Размеры
- 0.6B – 1.7B
- Железо
- от: Ноутбук
Синтез речиRU2024–2025
Alibaba (Tongyi, FunAudioLLM) · Китай
Синтез речи с клонированием голоса по короткому образцу и потоковой выдачей для живого диалога. Третья версия поддерживает 9 языков, включая русский.
- Голос для бота и ассистента
- Клонирование фирменного голоса
- Озвучка роликов
- Размеры
- 300M – 0.5B
- Железо
- от: Ноутбук
Синтез речиRU2022–2025
Silero · Россия
Лёгкий синтез русской речи, работает на обычном процессоре. Версия v5 добавила языки СНГ и народов России: татарский, башкирский, якутский, казахский и другие.
- Озвучка ответов голосового бота
- Чтение текстов на русском
- Голоса на языках народов России
- Размеры
- десятки мегабайт
- Железо
- от: Ноутбук
Синтез речи2025
Nari Labs · Южная Корея
Модель, которая озвучивает целые диалоги на два голоса со смехом, вздохами и паузами. Только английский.
- Озвучка диалогов и подкастов
- Рекламные ролики с живой речью
- Сценки для обучения
- Размеры
- 1B – 2B
- Железо
- от: Ноутбук
Речь в текстRU2023–2025
Alpha Cephei · Россия
Офлайн-распознавание русской речи, которое работает даже на Raspberry Pi и телефоне, без интернета. Есть потоковые модели для живого звука и простой русский синтез речи Vosk TTS.
- Расшифровка звонков и записей на русском без облака
- Голосовое управление в приложениях и киосках
- Распознавание речи в потоке с малой задержкой
- Размеры
- около 45 МБ – 1,8 ГБ
- Железо
- от: Ноутбук
Синтез речиRU2025
ESpeech (независимая группа русскоязычных разработчиков) · Россия
Русский синтез речи с клонированием голоса на архитектуре F5-TTS, обучен на собранных авторами наборах русской речи. Ударения расставляются автоматически. Несколько вариантов, в том числе «подкастер».
- Озвучка роликов и аудиокниг на русском
- Клонирование голоса диктора по образцу
- Голос для бота или ассистента на русском
- Размеры
- около 340M
- Железо
- от: Ноутбук
Голос: спикеры и звук2024–2025
RVC-Boss и сообщество · Китай
Синтез речи с клонированием голоса: хватает 5 секунд образца, а после дообучения на минуте записи голос звучит заметно точнее. Использовать только с согласия владельца голоса.
- Озвучка текстов голосом конкретного диктора
- Голос для бота или ассистента
- Дубляж обучающих роликов
- Размеры
- менее 1B
- Железо
- от: Ноутбук
Синтез речиRUGGUF2023–2025
Rhasspy / Open Home Foundation · США
Очень быстрый синтез речи, который работает даже на Raspberry Pi. Готовые голоса на 35+ языках, есть несколько русских.
- Озвучка уведомлений и ответов бота
- Голос для устройств без интернета
- Голосовые меню
- Размеры
- около 5M – 30M
- Железо
- от: Ноутбук
Синтез речиGGUF2024–2025
Шанхайский университет Цзяотун и партнёры · Китай
Модель клонирования голоса по нескольким секундам образца, английский и китайский. Сообщество выпустило много дообученных версий под другие языки, в том числе русский.
- Клонирование голоса
- Озвучка аудиокниг и роликов
- Исследования и прототипы
- Размеры
- около 340M
- Железо
- от: Ноутбук
Синтез речиGGUF2025
Canopy Labs · США
Синтез речи на основе языковой модели с живыми интонациями и эмоциональными вставками. Быстро отвечает, подходит для голосовых ассистентов. В основном английский.
- Голос для ассистента в реальном времени
- Эмоциональная озвучка
- Клонирование голоса
- Размеры
- 3B
- Железо
- от: Ноутбук
Синтез речиGGUF2025
Sesame · США
Модель разговорной речи, которая учитывает контекст беседы и звучит как живой собеседник. Только английский.
- Голос для разговорного ассистента
- Озвучка диалогов
- Прототипы голосовых продуктов
- Размеры
- 1B
- Железо
- от: Ноутбук
Синтез речиGGUF2024–2025
hexgrad (независимый разработчик) · не указана
Крошечная модель синтеза речи (82M), которая звучит на уровне крупных. Работает на обычном процессоре; английский и ещё несколько языков, русского нет.
- Озвучка статей и уведомлений
- Голос для приложений без видеокарты
- Массовая озвучка текстов
- Размеры
- 82M
- Железо
- от: Ноутбук
Синтез речиGGUF2024
Hugging Face · США
Синтез речи, где голос задаётся текстовым описанием («спокойный женский голос, чистая запись»). Английский и 8 европейских языков, русского нет.
- Подбор голоса по описанию
- Озвучка роликов
- Прототипы голосовых сервисов
- Размеры
- 880M – 2.2B
- Железо
- от: Ноутбук
Голос: спикеры и звукНе развивается2024
MyShell и MIT · США
Мгновенное клонирование голоса по короткому образцу с управлением эмоцией и акцентом, V2 говорит на нескольких языках. Использовать только с согласия владельца голоса.
- Озвучка роликов голосом диктора компании
- Голосовой бот с узнаваемым голосом бренда
- Перенос тембра на готовый синтез речи
- Размеры
- менее 1B
- Железо
- от: Ноутбук
Синтез речиНе развивается2024
MyShell и MIT · США
Лёгкий многоязычный синтез речи, который успевает в реальном времени на обычном процессоре. Английский с акцентами, испанский, французский, китайский, японский и корейский; русского нет.
- Озвучка ответов ботов на иностранных языках
- Озвучка обучающих материалов
- Чтение текстов вслух на сервере без видеокарты
- Размеры
- небольшая, работает в реальном времени на процессоре
- Железо
- от: Ноутбук
Синтез речиНе развивается2023
Колумбийский университет · США
Лёгкая модель синтеза английской речи с естественной интонацией. На её основе построены многие другие модели, например Kokoro.
- Озвучка текстов на английском
- Основа для дообучения своего голоса
- Прототипы голосовых сервисов
- Размеры
- около 150M
- Железо
- от: Ноутбук
Синтез речиRUНе развивается2023
Coqui · Германия
Популярная модель клонирования голоса по короткому образцу на 17 языках, включая русский. Компания Coqui закрылась, развитие остановлено.
- Клонирование голоса по образцу
- Озвучка на нескольких языках
- Исследования и прототипы
- Размеры
- около 470M
- Железо
- от: Ноутбук
Синтез речиRUGGUFНе развивается2023
Suno · США
Одна из первых открытых моделей, которая озвучивает текст с интонациями, смехом и паузами. Поддерживает около десятка языков, включая русский. Сейчас устарела.
- Черновая озвучка роликов
- Прототипы голосовых сервисов
- Звуковые эффекты в речи
- Размеры
- около 300M – 1B
- Железо
- от: Ноутбук