Речь в текст

GigaAM

Модели Сбера для распознавания русской речи, одни из самых точных для русского языка. Есть распознавание эмоций, версия v3 с пунктуацией и многоязычная версия (русский, казахский, киргизский, узбекский).

Разработчик
Сбер, Россия
Первый выпуск
апр 2024
Последний выпуск
июл 2026
Размеры
220M – 600M
Лицензия
Можно в коммерциюMIT

Какие задачи решает

  • Расшифровка звонков на русском
  • Протоколы совещаний
  • Голосовое управление сервисами
  • Анализ эмоций в разговоре

Где применяется

Колл-центрыБанки и страхованиеГоссекторРитейл

Требования к железу

НоутбукНоутбук или обычный ПК, до 8 ГБ видеопамяти — младшие версии
подходит
1 видеокартаОдна видеокарта на 16–80 ГБ — средние версии
нет версий
КластерСервер с несколькими видеокартами — флагманские версии
нет версий

Версии

  1. GigaAM Multilingual
  2. GigaAM-v3 и v3-e2e
  3. GigaAM-v2
  4. GigaAM-RNNT
  5. GigaAM (CTC, Emo)

Как внедряю у заказчика

  1. ПодборВыбираю размер модели под задачу и ваше железо, проверяю на ваших примерах.
  2. УстановкаРазворачиваю на вашем сервере или в закрытом контуре, отдаю API.
  3. ДообучениеДообучаю на ваших данных (LoRA) или подключаю базу знаний — что дешевле для задачи.
  4. ВстраиваниеПодключаю к CRM, 1С, боту, сайту или рабочему чату, настраиваю мониторинг.

Похожие модели