mmBERT
Многоязычный энкодер, обученный более чем на 1800 языках. В список входят татарский, башкирский, чувашский, удмуртский, бурятский, коми, ингушский и другие языки народов России. Основа для классификаторов и поиска по таким текстам.
- Разработчик
- Университет Джонса Хопкинса (JHU CLSP), США
- Первый выпуск
- июл 2025
- Последний выпуск
- авг 2025
- Размеры
- 140M и 307M
- Лицензия
- Можно в коммерциюMIT
- Русский язык
- Есть
- Готовые сборки
- GGUF
- Запуск
- Через свой серверРаботает и без видеокарты
- Сферы
- Документы и бухгалтерия, Поддержка клиентов, Наука, Медиа и продакшн
Какие задачи решает
- Классификация обращений и документов на национальных языках
- Поиск по смыслу в текстах на редких языках
- Извлечение имён, дат и названий из текста
- Основа для дообучения под свою задачу
Где применяется
Требования к железу
Версии
- mmBERT-small, 140M
- mmBERT-base, 307M
Как запустить
Ставлю и настраиваю под ключ: подберу размер модели, разверну на вашем сервере, подключу к вашим системам. Квантование — сжатие модели: она занимает меньше видеопамяти и работает на более скромном железе. Отвечает при этом чуть иначе, поэтому качество проверяют на своих примерах.
Частые вопросы
Можно ли использовать mmBERT в коммерческом проекте?
Да. Лицензия: MIT. Это разрешает коммерческое использование, но перед запуском лицензию всё равно стоит показать юристу.
Какое железо нужно для mmBERT?
Минимум: Ноутбук или обычный ПК, до 8 ГБ видеопамяти — младшие версии. Есть версии, которые работают и без видеокарты, на обычном процессоре. Точный объём видеопамяти под ваш размер модели и контекст можно посчитать в калькуляторе железа.
Поддерживает ли mmBERT русский язык?
Да, русский язык заявлен в карточке модели.
Где скачать mmBERT и сколько это стоит?
Веса mmBERT лежат в открытом доступе и скачиваются бесплатно. Платить нужно только за железо, на котором модель работает, и за настройку. Ссылки на первоисточник — в конце страницы.
Как внедряю у заказчика
- ПодборВыбираю размер модели под задачу и ваше железо, проверяю на ваших примерах.
- УстановкаРазворачиваю на вашем сервере или в закрытом контуре, отдаю API.
- ДообучениеДообучаю на ваших данных (LoRA) или подключаю базу знаний — что дешевле для задачи.
- ВстраиваниеПодключаю к CRM, 1С, боту, сайту или рабочему чату, настраиваю мониторинг.
Похожие модели
Классический многоязычный энкодер на 100 языков, включая русский. Основа многих моделей тональности, NER и эмбеддингов, в том числе BGE-M3.
ПодробнееРазбор текстаModernBERTAnswer.AI и LightOn · США / ФранцияМожно в коммерциюСовременная замена классическому BERT: быстрее, читает до 8 тысяч токенов за раз. Основа для своих классификаторов. Обучена на английском и коде, для русского есть RuModernBERT.
ПодробнееРазбор текстаGlotLIDCIS, Университет Людвига-Максимилиана в Мюнхене · ГерманияМожно в коммерциюОпределяет, на каком языке написан текст: в третьей версии более двух тысяч меток, включая татарский, башкирский, чувашский, удмуртский, марийский, эрзянский, коми и другие языки народов России.
ПодробнееИсточник: huggingface.co/jhu-clsp/mmBERT-base. Данные сверены с карточкой модели 22.09.2026. Лицензию перед коммерческим запуском проверьте с юристом.


