Речь в текстСинтез речи

Voxtral

Речевые модели Mistral: понимают аудио, расшифровывают и отвечают на вопросы по записи. Realtime-версия распознаёт в реальном времени и поддерживает русский; есть синтез речи.

Разработчик
Mistral AI, Франция
Первый выпуск
июл 2025
Последний выпуск
мар 2026
Размеры
3B – 24B
Лицензия
Коммерция с условиямиМодели распознавания (Mini 3B, Small 24B, Mini 4B Realtime) — Apache 2.0; Voxtral-4B-TTS — CC BY-NC 4.0, только некоммерческое

Какие задачи решает

  • Расшифровка и краткое содержание записей
  • Вопросы к аудио
  • Распознавание в реальном времени
  • Озвучка текстов (некоммерческая)

Где применяется

Колл-центрыМедиаЮристы и консалтингГолосовые ассистенты

Требования к железу

НоутбукНоутбук или обычный ПК, до 8 ГБ видеопамяти — младшие версии
подходит
1 видеокартаОдна видеокарта на 16–80 ГБ — средние версии
подходит
КластерСервер с несколькими видеокартами — флагманские версии
нет версий

Версии

  1. Voxtral 4B TTS
  2. Voxtral Mini 4B Realtime
  3. Voxtral Mini 3B и Small 24B

Как внедряю у заказчика

  1. ПодборВыбираю размер модели под задачу и ваше железо, проверяю на ваших примерах.
  2. УстановкаРазворачиваю на вашем сервере или в закрытом контуре, отдаю API.
  3. ДообучениеДообучаю на ваших данных (LoRA) или подключаю базу знаний — что дешевле для задачи.
  4. ВстраиваниеПодключаю к CRM, 1С, боту, сайту или рабочему чату, настраиваю мониторинг.

Похожие модели