Эти модели ведут разговор голосом: слушают собеседника и отвечают речью без отдельной цепочки из распознавания, текста и озвучки. На них строят голосовых ботов для звонков и ассистентов в приложениях. Смотрите на задержку ответа, поддержку русского, лицензию и требования к видеокарте.
Модели Xiaomi для рассуждений и агентов: от компактной MiMo-7B до MiMo-V2.6-Pro на 1,02 трлн параметров. Старшие версии понимают текст, картинки, видео и звук, контекст — 1 млн токенов. Языки: английский и китайский.
Открытые модели Сбера, обученные с упором на русский язык: хорошо пишут и понимают по-русски, знают местные реалии. Есть лёгкая 10B-A1.8B и флагманы до 702B, всё под MIT. GigaChat3.1-Audio понимает звук и записи до двух часов, GFusion — быстрая диффузионная версия для текста.
Русскоязычный ассистент для сотрудников на своём сервере
Крошечные модели понимания звука для смартфона: слушают речь, музыку и звуки вокруг и отвечают текстом — описывают запись и отвечают на вопросы о ней. Работают прямо на устройстве, вопросы и ответы — на английском: других языков в обучающих данных нет.
Модели NVIDIA для агентов и рассуждений, заточенные под быстрый запуск на её видеокартах. Nemotron 3 это гибрид Mamba и MoE от 4B до 550B; Nano Omni разбирает видео, аудио и картинки (только английский).
Модели новой архитектуры для работы прямо на устройстве: быстрые на обычном процессоре и в телефоне. Есть версии для извлечения данных, RAG и инструментов, а также LFM2.5-VL для картинок и голосовая LFM2.5-Audio.
Модели Meituan (крупнейший сервис доставки Китая). LongCat-Flash динамически меняет объём вычислений под сложность запроса; LongCat-2.0 — 1,6 трлн параметров под MIT. Есть омни-модели (Flash-Omni, Next) и синтез речи AudioDiT.
MoE-модели StepFun, рассчитанные на быструю и дешёвую работу: при 196 млрд параметров Step-3.5/3.7-Flash задействуют около 11 млрд на токен. Есть компактные Step3-VL-10B для картинок и голосовая Step-Audio 2 mini.
Голосовой ассистент, который слушает и говорит одновременно, без задержки на распознавание и синтез. Hibiki — синхронный перевод речи в речь между несколькими европейскими языками.
Небольшая модель, которая видит, слышит и отвечает голосом в реальном времени, может клонировать голос. Голосовой диалог на английском и китайском, текст — на 30+ языках.
Голосовой собеседник на основе Moshi, который слушает и говорит одновременно, позволяет себя перебивать. Роль задаётся текстом, голос — образцом записи. Только английский.
Русскоязычные дообучения открытых моделей (Mistral, Qwen, Llama) от независимой команды Vikhr: улучшают русский язык, есть компактные версии для обычного ПК. Borealis — аудио-модель для распознавания и понимания русской речи.
Универсальная аудиомодель: распознаёт речь, отвечает на вопросы о звуке, определяет эмоции и ведёт голосовой диалог. Обучена на 13 млн часов аудио, языки — английский и китайский.
Открытую модель можно поставить на свой сервер: данные не уходят в чужое облако, нет оплаты за каждый запрос, модель можно дообучить на ваших документах.
ПодберуМодель и размер под задачу и бюджет на железо
ПоставлюНа ваш сервер или в закрытый контур, с API