Речь в текстСинтез речи
Voxtral
Речевые модели Mistral: понимают аудио, расшифровывают и отвечают на вопросы по записи. Realtime-версия распознаёт в реальном времени и поддерживает русский; есть синтез речи.
- Разработчик
- Mistral AI, Франция
- Первый выпуск
- июл 2025
- Последний выпуск
- мар 2026
- Размеры
- 3B – 24B
- Лицензия
- Коммерция с условиямиМодели распознавания (Mini 3B, Small 24B, Mini 4B Realtime) — Apache 2.0; Voxtral-4B-TTS — CC BY-NC 4.0, только некоммерческое
Какие задачи решает
- Расшифровка и краткое содержание записей
- Вопросы к аудио
- Распознавание в реальном времени
- Озвучка текстов (некоммерческая)
Где применяется
Колл-центрыМедиаЮристы и консалтингГолосовые ассистенты
Требования к железу
НоутбукНоутбук или обычный ПК, до 8 ГБ видеопамяти — младшие версии
подходит1 видеокартаОдна видеокарта на 16–80 ГБ — средние версии
подходитКластерСервер с несколькими видеокартами — флагманские версии
нет версийВерсии
- Voxtral 4B TTS
- Voxtral Mini 4B Realtime
- Voxtral Mini 3B и Small 24B
Как внедряю у заказчика
- ПодборВыбираю размер модели под задачу и ваше железо, проверяю на ваших примерах.
- УстановкаРазворачиваю на вашем сервере или в закрытом контуре, отдаю API.
- ДообучениеДообучаю на ваших данных (LoRA) или подключаю базу знаний — что дешевле для задачи.
- ВстраиваниеПодключаю к CRM, 1С, боту, сайту или рабочему чату, настраиваю мониторинг.
Похожие модели
Речь в текстWhisperOpenAI · СШАМожно в коммерцию
Распознавание речи на 99 языках, включая русский. Стандарт де-факто для расшифровки звонков и встреч.
ПодробнееРечь в текстQwen3-ASRAlibaba (Qwen) · КитайМожно в коммерциюМодели распознавания речи от команды Qwen на 50+ языков, включая русский. Хорошо справляются с шумом, пением и акцентами.
ПодробнееТекстMistralMistral AI · ФранцияМожно в коммерциюЕвропейские модели с упором на скорость. Mixtral — одна из первых открытых моделей на архитектуре «смесь экспертов».
Подробнее

