Открытые модели для голосовых ассистентов

Эти модели ведут разговор голосом: слушают собеседника и отвечают речью без отдельной цепочки из распознавания, текста и озвучки. На них строят голосовых ботов для звонков и ассистентов в приложениях. Смотрите на задержку ответа, поддержку русского, лицензию и требования к видеокарте.

В подборке 15 семейств открытых моделей.Обновлено 22.09.2026Открыть весь каталог с фильтрами
ТекстGGUF2025–2026

MiMo

Xiaomi · Китай

Модели Xiaomi для рассуждений и агентов: от компактной MiMo-7B до MiMo-V2.6-Pro на 1,02 трлн параметров. Старшие версии понимают текст, картинки, видео и звук, контекст — 1 млн токенов. Языки: английский и китайский.

  • Логические и расчётные задачи
  • Агенты с инструментами
  • Помощь программистам
Размеры
7B – 1,02T-A42B
Железо
от: Ноутбук
Можно в коммерциюПодробнее
ТекстRU2024–2026

GigaChat

Сбер · Россия

Открытые модели Сбера, обученные с упором на русский язык: хорошо пишут и понимают по-русски, знают местные реалии. Есть лёгкая 10B-A1.8B и флагманы до 702B, всё под MIT. GigaChat3.1-Audio понимает звук и записи до двух часов, GFusion — быстрая диффузионная версия для текста.

  • Русскоязычный ассистент для сотрудников на своём сервере
  • Ответы клиентам и разбор обращений на русском
  • Работа с договорами и внутренними регламентами
Размеры
10B-A1.8B – 702B-A36B
Железо
от: Ноутбук
Можно в коммерциюПодробнее
Голосовые ассистенты2026

Samsone

Samsung · Южная Корея

Крошечные модели понимания звука для смартфона: слушают речь, музыку и звуки вокруг и отвечают текстом — описывают запись и отвечают на вопросы о ней. Работают прямо на устройстве, вопросы и ответы — на английском: других языков в обучающих данных нет.

  • Описание аудиозаписи словами
  • Ответы на вопросы о звуке
  • Определение типа звука и обстановки
Размеры
99M – 356M
Железо
от: Ноутбук
Только некоммерческоеПодробнее
ТекстOllama2024–2026

NVIDIA Nemotron

NVIDIA · США

Модели NVIDIA для агентов и рассуждений, заточенные под быстрый запуск на её видеокартах. Nemotron 3 это гибрид Mamba и MoE от 4B до 550B; Nano Omni разбирает видео, аудио и картинки (только английский).

  • Агенты с вызовом инструментов
  • Задачи с рассуждением и расчётами
  • Ответы по длинным документам
Размеры
4B – 550B-A55B
Железо
от: Ноутбук
Коммерция с условиямиПодробнее
ТекстRUOllama2025–2026

Liquid LFM

Liquid AI · США

Модели новой архитектуры для работы прямо на устройстве: быстрые на обычном процессоре и в телефоне. Есть версии для извлечения данных, RAG и инструментов, а также LFM2.5-VL для картинок и голосовая LFM2.5-Audio.

  • Ассистент на ноутбуке или телефоне без интернета
  • Извлечение данных из документов
  • Вызов инструментов в приложениях
Размеры
230M – 24B-A2B
Железо
от: Ноутбук
Коммерция с условиямиПодробнее
ТекстGGUF2025–2026

LongCat

Meituan · Китай

Модели Meituan (крупнейший сервис доставки Китая). LongCat-Flash динамически меняет объём вычислений под сложность запроса; LongCat-2.0 — 1,6 трлн параметров под MIT. Есть омни-модели (Flash-Omni, Next) и синтез речи AudioDiT.

  • Агенты для заказов и сервисных процессов
  • Корпоративный ассистент
  • Разбор длинных документов
Размеры
1B – 1.6T-A48B
Железо
от: Ноутбук
Можно в коммерциюПодробнее
ТекстGGUF2025–2026

Step

StepFun · Китай

MoE-модели StepFun, рассчитанные на быструю и дешёвую работу: при 196 млрд параметров Step-3.5/3.7-Flash задействуют около 11 млрд на токен. Есть компактные Step3-VL-10B для картинок и голосовая Step-Audio 2 mini.

  • Агенты с высокой нагрузкой
  • Разбор документов со схемами и скриншотами
  • Помощь программистам
Размеры
8B – 321B
Железо
от: 1 видеокарта
Можно в коммерциюПодробнее
Голосовые ассистенты2024–2026

Audio Flamingo

NVIDIA · США

Модели, которые слушают речь, звуки и музыку и отвечают на вопросы о них. Audio Flamingo Next разбирает записи до 30 минут. Только для исследований.

  • Подробное описание аудиозаписей
  • Вопросы и ответы по длинной записи
  • Разметка музыки и звуков
Размеры
0.5B – 8B
Железо
от: Ноутбук
Только некоммерческоеПодробнее
Голосовые ассистенты2024–2026

Moshi / Hibiki

Kyutai · Франция

Голосовой ассистент, который слушает и говорит одновременно, без задержки на распознавание и синтез. Hibiki — синхронный перевод речи в речь между несколькими европейскими языками.

  • Голосовой собеседник в реальном времени
  • Синхронный перевод речи
  • Голосовые интерфейсы без задержки
Размеры
2B – 7B
Железо
от: Ноутбук
Коммерция с условиямиПодробнее
Голосовые ассистентыGGUF2025–2026

MiniCPM-o

OpenBMB (ModelBest, Университет Цинхуа) · Китай

Небольшая модель, которая видит, слышит и отвечает голосом в реальном времени, может клонировать голос. Голосовой диалог на английском и китайском, текст — на 30+ языках.

  • Голосовой ассистент на своём сервере
  • Разбор видео и документов
  • Ответы голосом по картинке с камеры
Размеры
8B – 9B
Железо
от: Ноутбук
Можно в коммерциюПодробнее
Голосовые ассистентыGGUF2026

PersonaPlex

NVIDIA · США

Голосовой собеседник на основе Moshi, который слушает и говорит одновременно, позволяет себя перебивать. Роль задаётся текстом, голос — образцом записи. Только английский.

  • Голосовой ассистент с заданной ролью
  • Тренажёр разговоров для обучения персонала
  • Голосовые интерфейсы без задержки
Размеры
7B
Железо
от: 1 видеокарта
Коммерция с условиямиПодробнее
ТекстRUGGUF2024–2025

Vikhr

Vikhr Models · Россия

Русскоязычные дообучения открытых моделей (Mistral, Qwen, Llama) от независимой команды Vikhr: улучшают русский язык, есть компактные версии для обычного ПК. Borealis — аудио-модель для распознавания и понимания русской речи.

  • Русскоязычный ассистент на своём ПК или сервере
  • Ответы по базе знаний (RAG)
  • Тексты и письма на русском
Размеры
0.5B – 24B
Железо
от: Ноутбук
Можно в коммерциюПодробнее
Голосовые ассистентыRUGGUF2025

Qwen Omni

Alibaba (Qwen) · Китай

Модели, которые понимают текст, картинки, аудио и видео и отвечают голосом в реальном времени. Qwen3-Omni говорит на 10 языках, включая русский.

  • Голосовой ассистент для клиентов
  • Разбор звонков и видео
  • Ответы голосом по документам и картинкам
Размеры
3B – 30B-A3B
Железо
от: Ноутбук
Можно в коммерциюПодробнее
Голосовые ассистенты2025

Kimi-Audio

Moonshot AI · Китай

Универсальная аудиомодель: распознаёт речь, отвечает на вопросы о звуке, определяет эмоции и ведёт голосовой диалог. Обучена на 13 млн часов аудио, языки — английский и китайский.

  • Распознавание речи
  • Определение эмоций и звуковых событий
  • Голосовой диалог речь-в-речь
Размеры
7B
Железо
от: 1 видеокарта
Можно в коммерциюПодробнее
Голосовые ассистентыRUНе развивается2023

SeamlessM4T / Seamless

Meta · США

Перевод речи и текста примерно между сотней языков, включая русский: речь в текст, речь в речь, потоковый перевод с сохранением интонации.

  • Перевод речи в речь
  • Перевод и расшифровка записей
  • Потоковый перевод
Размеры
281M – 2.3B
Железо
от: Ноутбук
Только некоммерческоеПодробнее

Подборки

Нужна модель под вашу задачу?

Открытую модель можно поставить на свой сервер: данные не уходят в чужое облако, нет оплаты за каждый запрос, модель можно дообучить на ваших документах.

  1. ПодберуМодель и размер под задачу и бюджет на железо
  2. ПоставлюНа ваш сервер или в закрытый контур, с API
  3. ДообучуНа ваших данных или подключу базу знаний
  4. ВстроюВ CRM, 1С, бота, сайт или рабочий чат
Обсудить внедрение