Голосовые ассистентыРечь в текст

Kimi-Audio

Универсальная аудиомодель: распознаёт речь, отвечает на вопросы о звуке, определяет эмоции и ведёт голосовой диалог. Обучена на 13 млн часов аудио, языки — английский и китайский.

Разработчик
Moonshot AI, Китай
Первый выпуск
апр 2025
Последний выпуск
апр 2025
Размеры
7B
Лицензия
Можно в коммерциюMIT (часть кода на основе Qwen 2.5 — Apache 2.0)
Русский язык
Нет
Запуск
Через свой серверНужна видеокарта
Сферы
Поддержка клиентов, Медиа и продакшн

Какие задачи решает

  • Распознавание речи
  • Определение эмоций и звуковых событий
  • Голосовой диалог речь-в-речь

Где применяется

Колл-центрыМедиаГолосовые боты

Требования к железу

НоутбукНоутбук или обычный ПК, до 8 ГБ видеопамяти — младшие версии
нет версий
1 видеокартаОдна видеокарта на 16–80 ГБ — средние версии
подходит
КластерСервер с несколькими видеокартами — флагманские версии
нет версий

Версии

  1. Kimi-Audio-7B и 7B-Instruct

Как внедряю у заказчика

  1. ПодборВыбираю размер модели под задачу и ваше железо, проверяю на ваших примерах.
  2. УстановкаРазворачиваю на вашем сервере или в закрытом контуре, отдаю API.
  3. ДообучениеДообучаю на ваших данных (LoRA) или подключаю базу знаний — что дешевле для задачи.
  4. ВстраиваниеПодключаю к CRM, 1С, боту, сайту или рабочему чату, настраиваю мониторинг.

Похожие модели