Открытые модели для распознавания речи

Модели распознавания речи превращают звонки, совещания и голосовые сообщения в текст, который дальше можно искать и анализировать. Локальный запуск важен, если записи разговоров нельзя передавать наружу. Проверьте качество на русском и с фоновым шумом, поддержку разделения по спикерам, лицензию и скорость на вашем железе.

В подборке 20 семейств открытых моделей.Обновлено 22.09.2026Открыть весь каталог с фильтрами
Речь в текстRUGGUF2025–2026

VibeVoice

Microsoft · США

Речевые модели Microsoft: синтез длинных диалогов на несколько голосов, быстрый синтез для живого общения и распознавание длинных записей с разделением по говорящим, в том числе на русском.

  • Расшифровка длинных встреч с разметкой говорящих
  • Озвучка подкастов и диалогов
  • Голос для ассистентов в реальном времени
Размеры
0.5B – 9B
Железо
от: Ноутбук
Можно в коммерциюПодробнее
ТекстGGUF2025–2026

MiMo

Xiaomi · Китай

Модели Xiaomi для рассуждений и агентов: от компактной MiMo-7B до MiMo-V2.6-Pro на 1,02 трлн параметров. Старшие версии понимают текст, картинки, видео и звук, контекст — 1 млн токенов. Языки: английский и китайский.

  • Логические и расчётные задачи
  • Агенты с инструментами
  • Помощь программистам
Размеры
7B – 1,02T-A42B
Железо
от: Ноутбук
Можно в коммерциюПодробнее
Речь в текстGGUF2024–2026

Moonshine

Moonshine AI (Useful Sensors) · США

Очень маленькие и быстрые модели распознавания речи для телефонов, планшетов и встраиваемых устройств. Вторая версия работает потоково и выдаёт текст, пока человек ещё говорит.

  • Голосовое управление устройствами
  • Распознавание на телефоне без интернета
  • Живые субтитры
Размеры
27M – 245M
Железо
от: Ноутбук
Можно в коммерциюПодробнее
Речь в текстGGUF2025–2026

Granite Speech

IBM · США

Речевые модели IBM для распознавания и перевода речи на английском и нескольких европейских языках и японском. Рассчитаны на корпоративное использование.

  • Расшифровка деловых встреч
  • Перевод речи в текст на другом языке
  • Голосовые ассистенты
Размеры
470M – 8B
Железо
от: Ноутбук
Можно в коммерциюПодробнее
Речь в текстRUGGUF2024–2026

GigaAM

Сбер · Россия

Модели Сбера для распознавания русской речи, одни из самых точных для русского языка. Есть распознавание эмоций, версия v3 с пунктуацией и многоязычная версия (русский, казахский, киргизский, узбекский).

  • Расшифровка звонков на русском
  • Протоколы совещаний
  • Голосовое управление сервисами
Размеры
220M – 600M
Железо
от: Ноутбук
Можно в коммерциюПодробнее
Речь в текстRUGGUF2026

Qwen3-ASR

Alibaba (Qwen) · Китай

Модели распознавания речи от команды Qwen на 50+ языков, включая русский. Хорошо справляются с шумом, пением и акцентами.

  • Расшифровка звонков и встреч
  • Субтитры к видео
  • Распознавание на нескольких языках
Размеры
0.6B – 1.7B
Железо
от: Ноутбук
Можно в коммерциюПодробнее
Речь в текстGGUF2026

Cohere Transcribe

Cohere · Канада

Модель распознавания речи от Cohere на 14 языков (русского в списке нет), отдельная версия для арабского. Рассчитана на точную расшифровку деловых записей.

  • Расшифровка встреч и интервью
  • Субтитры
  • Поиск по аудиоархиву
Размеры
2B
Железо
от: Ноутбук
Можно в коммерциюПодробнее
Синтез речиRUGGUF2025–2026

Higgs Audio

Boson AI · США

Выразительный синтез речи и диалогов с клонированием голоса, плюс модели распознавания. Третья версия синтеза поддерживает около 100 языков, включая русский, но некоммерческая.

  • Выразительная озвучка роликов
  • Озвучка диалогов
  • Клонирование голоса
Размеры
около 3B – 8B
Железо
от: 1 видеокарта
Коммерция с условиямиПодробнее
Речь в текстRU2023–2026

NVIDIA Parakeet / Canary / Nemotron Speech

NVIDIA · США

Быстрые модели распознавания речи от NVIDIA, в том числе потоковые для работы в реальном времени. Parakeet TDT v3 и Nemotron 3.5 ASR понимают русский.

  • Расшифровка звонков и совещаний
  • Субтитры к видео
  • Голосовой ввод в реальном времени
Размеры
110M – 2.5B
Железо
от: Ноутбук
Коммерция с условиямиПодробнее
Синтез речи2025–2026

Kyutai STT, TTS и Pocket TTS

Kyutai · Франция

Потоковые модели распознавания и синтеза речи от авторов Moshi: начинают говорить и расшифровывать, не дожидаясь конца фразы. Pocket TTS (100M) работает на процессоре. Английский, французский и ещё несколько европейских языков, русского нет.

  • Потоковая расшифровка речи для голосовых ботов
  • Озвучка ответов с минимальной задержкой
  • Синтез речи на сервере без видеокарты (Pocket TTS)
Размеры
100M (Pocket TTS) – 2.6B
Железо
от: Ноутбук
Можно в коммерциюПодробнее
Речь в текстRUGGUF2025–2026

Voxtral

Mistral AI · Франция

Речевые модели Mistral: понимают аудио, расшифровывают и отвечают на вопросы по записи. Realtime-версия распознаёт в реальном времени и поддерживает русский; есть синтез речи.

  • Расшифровка и краткое содержание записей
  • Вопросы к аудио
  • Распознавание в реальном времени
Размеры
3B – 24B
Железо
от: Ноутбук
Коммерция с условиямиПодробнее
Речь в текстRU2025

Omnilingual ASR

Meta · США

Распознавание речи на 1600+ языках, включая русский и редкие языки, которые раньше не поддерживала ни одна система. Новый язык можно добавить по нескольким примерам.

  • Расшифровка на редких и местных языках
  • Оцифровка устных архивов
  • Субтитры на многих языках
Размеры
300M – 7B
Железо
от: Ноутбук
Можно в коммерциюПодробнее
Речь в текст2024–2025

SenseVoice / Paraformer / Fun-ASR

Alibaba (Tongyi, FunAudioLLM) · Китай

Набор моделей Alibaba для быстрого распознавания речи, в первую очередь китайской и азиатских языков. SenseVoice дополнительно определяет эмоции и звуковые события.

  • Расшифровка звонков
  • Определение эмоций в голосе
  • Распознавание смеха, музыки и других звуков
Размеры
около 230M – 800M
Железо
от: Ноутбук
Коммерция с условиямиПодробнее
ТекстRUGGUF2024–2025

Vikhr

Vikhr Models · Россия

Русскоязычные дообучения открытых моделей (Mistral, Qwen, Llama) от независимой команды Vikhr: улучшают русский язык, есть компактные версии для обычного ПК. Borealis — аудио-модель для распознавания и понимания русской речи.

  • Русскоязычный ассистент на своём ПК или сервере
  • Ответы по базе знаний (RAG)
  • Тексты и письма на русском
Размеры
0.5B – 24B
Железо
от: Ноутбук
Можно в коммерциюПодробнее
Речь в текстRU2023–2025

Vosk (русские модели)

Alpha Cephei · Россия

Офлайн-распознавание русской речи, которое работает даже на Raspberry Pi и телефоне, без интернета. Есть потоковые модели для живого звука и простой русский синтез речи Vosk TTS.

  • Расшифровка звонков и записей на русском без облака
  • Голосовое управление в приложениях и киосках
  • Распознавание речи в потоке с малой задержкой
Размеры
около 45 МБ – 1,8 ГБ
Железо
от: Ноутбук
Можно в коммерциюПодробнее
Голос: спикеры и звук2022–2025

pyannote (диаризация)

pyannoteAI (Эрве Бредин) · Франция

Самый распространённый открытый инструмент, который размечает запись по спикерам: кто и когда говорил. Обычно ставится в связку с распознаванием речи. Веса выдаются после короткой анкеты на HF.

  • Разметка звонков: где оператор, где клиент
  • Протоколы совещаний с подписью спикеров
  • Подготовка записей к расшифровке и анализу
Размеры
несколько миллионов параметров
Железо
от: Ноутбук
Можно в коммерциюПодробнее
Речь в текстRU2025

T-one

Т-Банк · Россия

Компактная потоковая модель Т-Банка для распознавания русской речи в телефонных разговорах. Работает в реальном времени даже без видеокарты.

  • Расшифровка телефонных звонков
  • Голосовые роботы на линии
  • Контроль качества разговоров
Размеры
72M
Железо
от: Ноутбук
Можно в коммерциюПодробнее
Голосовые ассистенты2025

Kimi-Audio

Moonshot AI · Китай

Универсальная аудиомодель: распознаёт речь, отвечает на вопросы о звуке, определяет эмоции и ведёт голосовой диалог. Обучена на 13 млн часов аудио, языки — английский и китайский.

  • Распознавание речи
  • Определение эмоций и звуковых событий
  • Голосовой диалог речь-в-речь
Размеры
7B
Железо
от: 1 видеокарта
Можно в коммерциюПодробнее
Речь в текстRUGGUF2022–2025

Whisper

OpenAI · США

Распознавание речи на 99 языках, включая русский. Стандарт де-факто для расшифровки звонков и встреч. Ускоренные Distil-Whisper от Hugging Face — только для английского.

  • Расшифровка звонков и созвонов
  • Субтитры к видео
  • Голосовые сообщения в текст
Размеры
39M – 1,5B
Железо
от: Ноутбук
Можно в коммерциюПодробнее
Голосовые ассистентыRUНе развивается2023

SeamlessM4T / Seamless

Meta · США

Перевод речи и текста примерно между сотней языков, включая русский: речь в текст, речь в речь, потоковый перевод с сохранением интонации.

  • Перевод речи в речь
  • Перевод и расшифровка записей
  • Потоковый перевод
Размеры
281M – 2.3B
Железо
от: Ноутбук
Только некоммерческоеПодробнее

Подборки

Нужна модель под вашу задачу?

Открытую модель можно поставить на свой сервер: данные не уходят в чужое облако, нет оплаты за каждый запрос, модель можно дообучить на ваших документах.

  1. ПодберуМодель и размер под задачу и бюджет на железо
  2. ПоставлюНа ваш сервер или в закрытый контур, с API
  3. ДообучуНа ваших данных или подключу базу знаний
  4. ВстроюВ CRM, 1С, бота, сайт или рабочий чат
Обсудить внедрение