GigaAM или Vosk: что выбрать для распознавания речи
Обе модели российские, работают с русским языком, запускаются без видеокарты и разрешают коммерческое использование: GigaAM под MIT, Vosk под Apache 2.0. GigaAM от Сбера шире по функциям разговорной аналитики: есть распознавание эмоций, версия v3 с пунктуацией и многоязычная версия с казахским, киргизским и узбекским; последнее обновление 2026-07. Vosk сильнее там, где нужен офлайн на слабом железе: модели от 45 МБ идут на Raspberry Pi и телефоне, есть потоковые версии для живого звука и простой синтез речи Vosk TTS. Если вы используете Vosk TTS для озвучки, помните, что клонировать чужой голос можно только с согласия его владельца. Выбор сводится к тому, что важнее: аналитика разговора или автономность на месте.
Сравнение по данным каталога
| Параметр | GigaAM | Vosk (русские модели) |
|---|---|---|
| Направление | Речь в текст | Речь в текст, Синтез речи |
| Разработчик | Сбер, Россия | Alpha Cephei, Россия |
| Выпуски | апр 2024 – июл 2026 | фев 2023 – сен 2025 |
| Размеры | 220M – 600M | около 45 МБ – 1,8 ГБ |
| Железо | Ноутбук | Ноутбук |
| Коммерция | Можно в коммерцию | Можно в коммерцию |
| Лицензия | MIT | Apache 2.0 |
| Русский язык | Есть | Есть |
| Ollama | Нет | Нет |
| Без видеокарты | Да | Да |
| Задачи |
|
|
Выбирайте GigaAM, если
- Нужна пунктуация в расшифровке и разметка эмоций в разговоре
- Задачи банка, госсектора или колл-центра с разбором звонков на русском
- Нужны соседние языки: казахский, киргизский, узбекский в Multilingual
Выбирайте Vosk (русские модели), если
- Распознавание должно идти офлайн на слабом устройстве или телефоне
- Нужен потоковый режим с малой задержкой для живого звука
- В одном проекте нужны и распознавание, и простой синтез речи на русском
Другие сравнения
- Whisper или GigaAM: что выбрать для бизнеса
- Whisper или Parakeet: что выбрать для бизнеса
- Silero или Piper: что выбрать для бизнеса
- Saiga или Vikhr: какое русское дообучение выбрать
- XTTS или F5-TTS: что выбрать для клонирования голоса
- Piper или Kokoro: что выбрать для синтеза речи
- F5-TTS или Fish Speech: что выбрать для озвучки
- Parakeet или Qwen3-ASR: что выбрать для расшифровки
- pyannote или WeSpeaker: что выбрать для работы с голосами
- Qwen или GigaChat: что выбрать для бизнеса
- Qwen или Llama: что выбрать для бизнеса
- GigaChat или YandexGPT: что выбрать для бизнеса
Нужна модель под вашу задачу?
Открытую модель можно поставить на свой сервер: данные не уходят в чужое облако, нет оплаты за каждый запрос, модель можно дообучить на ваших документах.
- ПодберуМодель и размер под задачу и бюджет на железо
- ПоставлюНа ваш сервер или в закрытый контур, с API
- ДообучуНа ваших данных или подключу базу знаний
- ВстроюВ CRM, 1С, бота, сайт или рабочий чат


