Открытая альтернатива облачным сервисам расшифровки: Whisper на своём сервере

Расшифровка звонков, встреч и голосовых — та задача, где облако выглядит удобнее всего и где утечка обходится дороже всего: в записях звучат клиенты, цены и внутренние решения. Открытые модели распознавания речи ставятся на ваш сервер или даже на ноутбук, запись не покидает компанию, а расшифровывать можно любой объём архива без оплаты за минуту. Для русского языка выбор здесь особенно хороший: есть и универсальные модели на десятки языков, и специально русские, включая модели для телефонного звука и офлайн-распознавания на слабом железе. Чего не хватает по сравнению с готовым сервисом — обвязки: разметку по спикерам, хранение, поиск по расшифровкам и выжимки нужно собирать самим. На шумных записях, перебиваниях и специальной терминологии ошибки остаются, поэтому важные фрагменты приходится вычитывать.

Чем заменить

Речь в текстRUGGUF2022–2025

Whisper

OpenAI · США

Распознавание речи на 99 языках, включая русский. Стандарт де-факто для расшифровки звонков и встреч. Ускоренные Distil-Whisper от Hugging Face — только для английского.

  • Расшифровка звонков и созвонов
  • Субтитры к видео
  • Голосовые сообщения в текст
Размеры
39M – 1,5B
Железо
от: Ноутбук
Можно в коммерциюПодробнее
Речь в текстRUGGUF2024–2026

GigaAM

Сбер · Россия

Модели Сбера для распознавания русской речи, одни из самых точных для русского языка. Есть распознавание эмоций, версия v3 с пунктуацией и многоязычная версия (русский, казахский, киргизский, узбекский).

  • Расшифровка звонков на русском
  • Протоколы совещаний
  • Голосовое управление сервисами
Размеры
220M – 600M
Железо
от: Ноутбук
Можно в коммерциюПодробнее
Речь в текстRU2025

T-one

Т-Банк · Россия

Компактная потоковая модель Т-Банка для распознавания русской речи в телефонных разговорах. Работает в реальном времени даже без видеокарты.

  • Расшифровка телефонных звонков
  • Голосовые роботы на линии
  • Контроль качества разговоров
Размеры
72M
Железо
от: Ноутбук
Можно в коммерциюПодробнее
Речь в текстRU2023–2025

Vosk (русские модели)

Alpha Cephei · Россия

Офлайн-распознавание русской речи, которое работает даже на Raspberry Pi и телефоне, без интернета. Есть потоковые модели для живого звука и простой русский синтез речи Vosk TTS.

  • Расшифровка звонков и записей на русском без облака
  • Голосовое управление в приложениях и киосках
  • Распознавание речи в потоке с малой задержкой
Размеры
около 45 МБ – 1,8 ГБ
Железо
от: Ноутбук
Можно в коммерциюПодробнее
Речь в текстRUGGUF2026

Qwen3-ASR

Alibaba (Qwen) · Китай

Модели распознавания речи от команды Qwen на 50+ языков, включая русский. Хорошо справляются с шумом, пением и акцентами.

  • Расшифровка звонков и встреч
  • Субтитры к видео
  • Распознавание на нескольких языках
Размеры
0.6B – 1.7B
Железо
от: Ноутбук
Можно в коммерциюПодробнее
Голос: спикеры и звук2022–2025

pyannote (диаризация)

pyannoteAI (Эрве Бредин) · Франция

Самый распространённый открытый инструмент, который размечает запись по спикерам: кто и когда говорил. Обычно ставится в связку с распознаванием речи. Веса выдаются после короткой анкеты на HF.

  • Разметка звонков: где оператор, где клиент
  • Протоколы совещаний с подписью спикеров
  • Подготовка записей к расшифровке и анализу
Размеры
несколько миллионов параметров
Железо
от: Ноутбук
Можно в коммерциюПодробнее

Все шесть в каталоге отмечены как разрешённые для коммерческого использования (MIT и Apache 2.0), у pyannote веса скачиваются после согласия с условиями на Hugging Face. Отдельно проверьте свою сторону: хранение записей разговоров требует согласия участников.

Другие альтернативы

Нужна модель под вашу задачу?

Открытую модель можно поставить на свой сервер: данные не уходят в чужое облако, нет оплаты за каждый запрос, модель можно дообучить на ваших документах.

  1. ПодберуМодель и размер под задачу и бюджет на железо
  2. ПоставлюНа ваш сервер или в закрытый контур, с API
  3. ДообучуНа ваших данных или подключу базу знаний
  4. ВстроюВ CRM, 1С, бота, сайт или рабочий чат
Обсудить внедрение