Стек под колл-центр: слышать, понимать, отвечать

В телефонии всё упирается в то, что звук это не текст. Пока разговор не расшифрован, ни одна языковая модель его не разберёт, а пока в расшифровке не отмечено, кто говорит, невозможно оценить работу оператора. Поэтому рабочий контур собирают из звеньев: распознавание речи, разделение говорящих, смысловой разбор и голосовой ответ. Так каждое звено можно менять и мерить отдельно, а сбой на одном участке не превращает весь контур в чёрный ящик.

Шаг 1. Расшифровать разговор

Распознавание речи переводит запись или живой поток в текст. От качества этого шага зависит буквально всё дальнейшее: если модель путает названия товаров и имена, разбор будет строиться на выдумке. Отдельно смотрите на телефонное качество звука, фоновый шум и то, как модель держит русский язык вперемешку с названиями на латинице. Без этого звена остаётся только ручное прослушивание выборки звонков.

Чем это делается

Речь в текстRUGGUF2022–2025

Whisper

OpenAI · США

Распознавание речи на 99 языках, включая русский. Стандарт де-факто для расшифровки звонков и встреч. Ускоренные Distil-Whisper от Hugging Face — только для английского.

  • Расшифровка звонков и созвонов
  • Субтитры к видео
  • Голосовые сообщения в текст
Размеры
39M – 1,5B
Железо
от: Ноутбук
Можно в коммерциюПодробнее
Речь в текстRUGGUF2024–2026

GigaAM

Сбер · Россия

Модели Сбера для распознавания русской речи, одни из самых точных для русского языка. Есть распознавание эмоций, версия v3 с пунктуацией и многоязычная версия (русский, казахский, киргизский, узбекский).

  • Расшифровка звонков на русском
  • Протоколы совещаний
  • Голосовое управление сервисами
Размеры
220M – 600M
Железо
от: Ноутбук
Можно в коммерциюПодробнее
Речь в текстRU2023–2026

NVIDIA Parakeet / Canary / Nemotron Speech

NVIDIA · США

Быстрые модели распознавания речи от NVIDIA, в том числе потоковые для работы в реальном времени. Parakeet TDT v3 и Nemotron 3.5 ASR понимают русский.

  • Расшифровка звонков и совещаний
  • Субтитры к видео
  • Голосовой ввод в реальном времени
Размеры
110M – 2.5B
Железо
от: Ноутбук
Коммерция с условиямиПодробнее

Шаг 2. Понять, кто говорит и где границы реплик

Диаризация размечает, какая фраза принадлежит оператору, а какая клиенту, и отделяет речь от пауз и шума. Без неё расшифровка превращается в сплошное полотно, по которому нельзя ни посчитать, кто больше говорил, ни проверить, прозвучал ли обязательный скрипт. Для живого разговора это же звено отвечает за момент, когда человек договорил и можно отвечать.

Чем это делается

Голос: спикеры и звук2022–2025

pyannote (диаризация)

pyannoteAI (Эрве Бредин) · Франция

Самый распространённый открытый инструмент, который размечает запись по спикерам: кто и когда говорил. Обычно ставится в связку с распознаванием речи. Веса выдаются после короткой анкеты на HF.

  • Разметка звонков: где оператор, где клиент
  • Протоколы совещаний с подписью спикеров
  • Подготовка записей к расшифровке и анализу
Размеры
несколько миллионов параметров
Железо
от: Ноутбук
Можно в коммерциюПодробнее
Голос: спикеры и звук2022–2025

NVIDIA Sortformer / TitaNet

NVIDIA · США

Модели NVIDIA для задачи «кто говорит»: TitaNet узнаёт голос конкретного человека, Sortformer размечает запись до 4 спикеров, в том числе потоково во время звонка.

  • Разметка разговоров по спикерам в реальном времени
  • Проверка, что звонит тот же человек (голосовой отпечаток)
  • Подготовка расшифровок совещаний
Размеры
23M (TitaNet) – 117M (Sortformer)
Железо
от: Ноутбук
Коммерция с условиямиПодробнее
Голос: спикеры и звукRU2020–2025

Silero VAD

Silero · Россия

Самый популярный открытый детектор речи: отличает голос от тишины и шума. Обрабатывает фрагмент звука меньше чем за миллисекунду на одном ядре процессора, обучен на записях более чем 6000 языков.

  • Нарезка звонков и записей перед распознаванием речи
  • Определение, когда клиент говорит, в голосовом боте
  • Отсев тишины и шума, экономия на расшифровке
Размеры
около 2 МБ
Железо
от: Ноутбук
Можно в коммерциюПодробнее

Шаг 3. Разобрать смысл и подготовить ответ

Языковая модель работает уже с текстом: вытаскивает причину обращения, тему, договорённости и следующий шаг, а в живом сценарии формулирует реплику. Тут же ставится проверка на соблюдение скрипта и пометка тяжёлых звонков для руководителя. Если выкинуть это звено, останутся расшифровки, которые никто не читает, потому что читать сотни страниц в день некому.

Чем это делается

ТекстRUOllama2023–2026

Qwen

Alibaba · Китай

Семейство языковых моделей с сильным русским языком: от маленьких версий для ноутбука до флагмана уровня коммерческих API.

  • Чат-бот и ассистент по базе знаний
  • Ответы на письма и обращения
  • Разбор и классификация документов
Размеры
0,6B – 2,4T-A95B
Железо
от: Ноутбук
Коммерция с условиямиПодробнее
ТекстRUGGUF2023–2025

Saiga

Илья Гусев (IlyaGusev) · Россия

Самая известная русскоязычная доучка сообщества: чужие открытые модели (Llama, Mistral, Gemma, YandexGPT) дообучены отвечать на русском как ассистент. Удобная отправная точка для русского чат-бота на своём сервере.

  • Чат-ассистент на русском языке
  • Ответы на вопросы по базе знаний компании
  • Черновики писем, описаний и постов на русском
Размеры
7B – 70B
Железо
от: Ноутбук
Коммерция с условиямиПодробнее
ТекстOllama2023–2025

Llama

Meta · США

Модели, с которых начался массовый open source в ИИ. Огромная экосистема дообученных версий и инструментов.

  • Ассистент для сотрудников
  • Суммаризация встреч и документов
  • Основа для дообучения под отрасль
Размеры
1B – 405B
Железо
от: Ноутбук
Коммерция с условиямиПодробнее

Шаг 4. Ответить голосом

Синтез речи озвучивает готовый текст. Здесь важны не только чистота голоса, но и скорость: в телефонном разговоре пауза дольше пары секунд читается как обрыв связи. Отдельно решите вопрос с интонацией и с тем, предупреждаете ли вы собеседника, что говорит робот. Без этого звена сценарий ограничен перепиской и уведомлениями, голосовой канал не закрывается.

Чем это делается

Синтез речиRUНе развивается2023

Coqui XTTS

Coqui · Германия

Популярная модель клонирования голоса по короткому образцу на 17 языках, включая русский. Компания Coqui закрылась, развитие остановлено.

  • Клонирование голоса по образцу
  • Озвучка на нескольких языках
  • Исследования и прототипы
Размеры
около 470M
Железо
от: Ноутбук
Только некоммерческоеПодробнее
Синтез речиRUGGUF2023–2025

Piper

Rhasspy / Open Home Foundation · США

Очень быстрый синтез речи, который работает даже на Raspberry Pi. Готовые голоса на 35+ языках, есть несколько русских.

  • Озвучка уведомлений и ответов бота
  • Голос для устройств без интернета
  • Голосовые меню
Размеры
около 5M – 30M
Железо
от: Ноутбук
Коммерция с условиямиПодробнее
Синтез речиRU2022–2025

Silero TTS

Silero · Россия

Лёгкий синтез русской речи, работает на обычном процессоре. Версия v5 добавила языки СНГ и народов России: татарский, башкирский, якутский, казахский и другие.

  • Озвучка ответов голосового бота
  • Чтение текстов на русском
  • Голоса на языках народов России
Размеры
десятки мегабайт
Железо
от: Ноутбук
Коммерция с условиямиПодробнее

На что смотреть до внедрения

Главная ловушка это ожидание, что модель будет разбирать звонки так же хорошо, как человек с опытом. Начинайте с разбора уже состоявшихся записей, а не с живого ответа клиенту: ошибка в аналитике стоит дёшево, ошибка в разговоре стоит клиента. Проверьте связку на своей реальной телефонии, а не на студийных записях. Запись разговоров, уведомление собеседника и хранение голоса регулируются, здесь это в общих чертах, конкретный случай смотрит юрист.

Другие стеки

Нужна модель под вашу задачу?

Открытую модель можно поставить на свой сервер: данные не уходят в чужое облако, нет оплаты за каждый запрос, модель можно дообучить на ваших документах.

  1. ПодберуМодель и размер под задачу и бюджет на железо
  2. ПоставлюНа ваш сервер или в закрытый контур, с API
  3. ДообучуНа ваших данных или подключу базу знаний
  4. ВстроюВ CRM, 1С, бота, сайт или рабочий чат
Обсудить внедрение