Живая расшифровка встреч от Microsoft: нужна ли бизнесу
Microsoft выпустила потоковый транскрибатор MAI-Transcribe-2-Streaming: 60 языков, черновой текст через 100 мс, вводная цена 54 цента за час. Разбираю, где живая расшифровка нужна, а где хватит пакетной, куда уходят записи с точки зрения 152-ФЗ и чем заменить облако.
Что выпустила Microsoft и что в этом подтверждено
Модель принимает звук потоком и сразу отдаёт текст. Сначала приходят черновые слова, потом модель их уточняет по мере того, как человек договаривает фразу, и закрепляет готовый вариант. Так работают живые субтитры: текст появляется, пока говорящий ещё не закончил предложение.
Что я сверил с анонсом Microsoft AI и документацией на Microsoft Learn:
Языков 60, определяются автоматически и по ходу разговора. Русский (код ru) стоит в таблице языков модели MAI-Transcribe-2 на Microsoft Learn. Первые черновые слова приходят чуть позже 100 мс. Цена 54 цента за час звука, и это вводный тариф до конца года. Обычную цену после акции я не нашёл, поэтому её здесь нет. Доступна модель в Microsoft Foundry, MAI Playground и Vercel. Про Azure Voice Live и LiveKit смотрите актуальный статус в анонсе.
Рядом существует пакетная версия MAI-Transcribe-2 для готовых файлов. По документации она умеет разделять говорящих, ставить метки времени по словам и подсказывать термины списком. Эти возможности описаны именно для пакетной версии, для потоковой я такого подтверждения не нашёл.
Когда нужен поток, а когда хватит файла после встречи
Поток стоит денег и усложняет систему, поэтому сначала честный вопрос: кому нужен текст прямо сейчас?
Живые субтитры. Совещание с человеком, который плохо слышит, или с участником на другом языке. Здесь задержка в доли секунды решает всё, пакетная расшифровка бесполезна.
Подсказка менеджеру во время звонка. Система слышит возражение клиента и сразу показывает карточку с ответом. Здесь без потока не обойтись.
Перевод для иностранного клиента. Расшифровка идёт в реальном времени, дальше текст уходит в переводчик. Качество перевода придётся проверять отдельно.
Всё остальное прекрасно живёт после встречи. Протокол совещания, разбор звонков отдела продаж, контроль качества, поиск по архиву записей: текст нужен через десять минут или к утру, а не сию секунду. Для этого есть пакетная расшифровка, я разбирал её в статье про расшифровку звонков и совещаний пачкой. Она дешевле, проще и даёт более чистый текст, потому что модель видит всю фразу целиком.
Куда уходят записи и при чём здесь 152-ФЗ
Модель работает как облачный сервис Microsoft. Вы отправляете звук на их серверы и получаете текст обратно. Весов модели нет, запустить её у себя нельзя.
Если в разговоре звучат имена, телефоны, адреса или другие данные людей, это персональные данные. Две нормы из закона 152-ФЗ о персональных данных надо держать в голове.
Часть 5 статьи 18 говорит про локализацию: запись, систематизация, накопление и хранение персональных данных граждан России при сборе должны идти с использованием баз данных на территории России, с исключениями, которые закон перечисляет. Часть 3 статьи 12 говорит про трансграничную передачу: оператор до её начала обязан уведомить Роскомнадзор. Тексты я сверял по КонсультантПлюс.
Подпадает ли ваш конкретный сценарий под эти нормы и как оформить согласия, зависит от ваших данных и договоров. Это вопрос к юристу, статья его не заменяет. Размер штрафов я здесь не называю: он зависит от нарушения, смотрите КоАП.
Про оплату из России: условия оплаты уточняйте. Я их не проверял и обещать не буду.
Чем заменить
Локальные модели. Whisper и его производные работают на вашем железе, звук никуда не уходит. Как это собрать, я описал в статьях про WhisperX и про локальную расшифровку созвонов. Обычный Whisper потока из коробки не даёт, для живых субтитров нужна надстройка с нарезкой звука, и задержка будет заметнее.
Российские сервисы. Yandex SpeechKit умеет потоковое распознавание: звук отправляется частями, а результаты, в том числе промежуточные, приходят в рамках одного соединения. Сбер даёт SaluteSpeech с потоковым gRPC-интерфейсом и промежуточными результатами. Условия, тарифы и размещение данных у каждого смотрите в их документации. Сравнения качества на русском между ними и MAI я не делал.
Что важно учесть
Акция действует до конца года. После неё цена другая, и какая, пока неизвестно. Считать окупаемость на вводной цене рискованно.
Цифра 2,5% ошибок и первое место в рейтинге Artificial Analysis это заявление самой Microsoft по общему тесту на множестве языков. На русском, в шуме, с перебиваниями и специальными терминами результат будет другим. Проверять нужно на своих записях.
Статус сервиса уточняйте перед запуском: на странице документации MAI-Transcribe-2 стоит пометка о публичном предпросмотре без соглашения об уровне сервиса.
Что можно сделать уже сейчас
Тест на десяти записях за вечер. Возьмите десять своих звонков разной сложности: тихий, шумный, с перебиванием, с названиями ваших товаров. Обезличьте их или используйте записи без чужих данных, прогоните через разные движки и сравните ошибки в именах, цифрах и терминах.
Разделите задачи на потоковые и пакетные. Выпишите, где текст нужен сразу. Обычно таких задач одна-две, остальное пакетное.
Решите вопрос с данными до выбора движка. Определите, звучат ли в записях персональные данные и коммерческая тайна. От ответа зависит, облако это, российский сервис или свой сервер.
Если нужен готовый контур, смотрите голосовой ИИ под ключ. Протокол встречи из текста собирается отдельно, об этом статья про ИИ-протокол совещания, а разбор звонков продаж описан в статье про ИИ, который слушает звонки.
Частые вопросы
Поддерживает ли MAI-Transcribe-2-Streaming русский?
Русский указан в таблице языков MAI-Transcribe-2 на Microsoft Learn, и потоковая модель заявлена с теми же 60 языками. Отдельной таблицы именно для потоковой версии я не видел, поэтому качество на русском проверяйте на своих записях.
Можно ли расшифровывать звонки клиентов в зарубежном облаке?
Зависит от того, есть ли в записях персональные данные и как вы построили согласия и договоры. Нормы о локализации и трансграничной передаче есть в 152-ФЗ, детали обсуждайте с юристом. Если не хочется рисковать, берите локальную модель или российский сервис.
Живая расшифровка точнее пакетной?
Обычно нет. Пакетная версия видит всю фразу и весь контекст, поэтому для протоколов и аналитики она подходит лучше и стоит меньше. Поток нужен, когда ждать нельзя.
Коротко о главном
MAI-Transcribe-2-Streaming даёт живой текст с задержкой около 100 мс, знает 60 языков, включая русский, и сейчас стоит 54 цента за час по акции до конца года. Это облачный сервис без открытых весов, поэтому для российских записей сначала решается вопрос данных, а уже потом качества. Потоковый режим нужен для субтитров, подсказок во время звонка и живого перевода, для остальных задач хватает пакетной расшифровки.
Хотите понять, нужна ли вам живая расшифровка и какой движок подойдёт под ваши записи? Напишите мне в Telegram слово «ПОТОК». Разберём ваши сценарии и соберём тест на ваших же звонках.
Что я делаю для бизнеса
- Боты в Telegram, MAX, VK
- Автоматизация процессов и CRM
- Аналитика и дашборды
- Сайты и лендинги под ключ
Бесплатно: чек-лист «Готов ли ваш бизнес к 152-ФЗ»
12 пунктов, которые проверяют готовность за час: данные, согласия, уведомление в РКН, локализация, защита. Отметьте, что уже сделано, и увидите дыры, за которые сейчас штрафуют.
Готовы обсудить вашу задачу?
Бесплатная консультация — разберём, как внедрить это в вашем бизнесе под ключ. Без форм, пишите напрямую.
Разборы, кейсы и практика — без воды. Выходит регулярно, читать 3–5 минут.


