Речь в текст
GigaAM
Модели Сбера для распознавания русской речи, одни из самых точных для русского языка. Есть распознавание эмоций, версия v3 с пунктуацией и многоязычная версия (русский, казахский, киргизский, узбекский).
- Разработчик
- Сбер, Россия
- Первый выпуск
- апр 2024
- Последний выпуск
- июл 2026
- Размеры
- 220M – 600M
- Лицензия
- Можно в коммерциюMIT
Какие задачи решает
- Расшифровка звонков на русском
- Протоколы совещаний
- Голосовое управление сервисами
- Анализ эмоций в разговоре
Где применяется
Колл-центрыБанки и страхованиеГоссекторРитейл
Требования к железу
НоутбукНоутбук или обычный ПК, до 8 ГБ видеопамяти — младшие версии
подходит1 видеокартаОдна видеокарта на 16–80 ГБ — средние версии
нет версийКластерСервер с несколькими видеокартами — флагманские версии
нет версийВерсии
- GigaAM Multilingual
- GigaAM-v3 и v3-e2e
- GigaAM-v2
- GigaAM-RNNT
- GigaAM (CTC, Emo)
Как внедряю у заказчика
- ПодборВыбираю размер модели под задачу и ваше железо, проверяю на ваших примерах.
- УстановкаРазворачиваю на вашем сервере или в закрытом контуре, отдаю API.
- ДообучениеДообучаю на ваших данных (LoRA) или подключаю базу знаний — что дешевле для задачи.
- ВстраиваниеПодключаю к CRM, 1С, боту, сайту или рабочему чату, настраиваю мониторинг.
Похожие модели
Речь в текстT-oneТ-Банк · РоссияМожно в коммерцию
Компактная потоковая модель Т-Банка для распознавания русской речи в телефонных разговорах. Работает в реальном времени даже без видеокарты.
ПодробнееРечь в текстWhisperOpenAI · СШАМожно в коммерциюРаспознавание речи на 99 языках, включая русский. Стандарт де-факто для расшифровки звонков и встреч.
ПодробнееРечь в текстNVIDIA Parakeet / Canary / Nemotron SpeechNVIDIA · СШАКоммерция с условиямиБыстрые модели распознавания речи от NVIDIA, в том числе потоковые для работы в реальном времени. Parakeet TDT v3 и Nemotron 3.5 ASR понимают русский.
Подробнее

