Синтез речи
Sesame CSM
Модель разговорной речи, которая учитывает контекст беседы и звучит как живой собеседник. Только английский.
- Разработчик
- Sesame, США
- Первый выпуск
- мар 2025
- Последний выпуск
- мар 2025
- Размеры
- 1B
- Лицензия
- Можно в коммерциюApache 2.0
Какие задачи решает
- Голос для разговорного ассистента
- Озвучка диалогов
- Прототипы голосовых продуктов
Где применяется
Голосовые ботыРазработка продуктовМедиа
Требования к железу
НоутбукНоутбук или обычный ПК, до 8 ГБ видеопамяти — младшие версии
подходит1 видеокартаОдна видеокарта на 16–80 ГБ — средние версии
нет версийКластерСервер с несколькими видеокартами — флагманские версии
нет версийВерсии
- CSM-1B
Как внедряю у заказчика
- ПодборВыбираю размер модели под задачу и ваше железо, проверяю на ваших примерах.
- УстановкаРазворачиваю на вашем сервере или в закрытом контуре, отдаю API.
- ДообучениеДообучаю на ваших данных (LoRA) или подключаю базу знаний — что дешевле для задачи.
- ВстраиваниеПодключаю к CRM, 1С, боту, сайту или рабочему чату, настраиваю мониторинг.
Похожие модели
Синтез речиOrpheus TTSCanopy Labs · СШАМожно в коммерцию
Синтез речи на основе языковой модели с живыми интонациями и эмоциональными вставками. Быстро отвечает, подходит для голосовых ассистентов. В основном английский.
ПодробнееГолосовые ассистентыMoshi / HibikiKyutai · ФранцияКоммерция с условиямиГолосовой ассистент, который слушает и говорит одновременно, без задержки на распознавание и синтез. Hibiki — синхронный перевод речи в речь между несколькими европейскими языками.
ПодробнееСинтез речиDiaNari Labs · Южная КореяМожно в коммерциюМодель, которая озвучивает целые диалоги на два голоса со смехом, вздохами и паузами. Только английский.
Подробнее

