Разбор текстаПоиск и RAG

mmBERT

Многоязычный энкодер, обученный более чем на 1800 языках. В список входят татарский, башкирский, чувашский, удмуртский, бурятский, коми, ингушский и другие языки народов России. Основа для классификаторов и поиска по таким текстам.

Разработчик
Университет Джонса Хопкинса (JHU CLSP), США
Первый выпуск
июл 2025
Последний выпуск
авг 2025
Размеры
140M и 307M
Лицензия
Можно в коммерциюMIT
Русский язык
Есть
Готовые сборки
GGUF
Запуск
Через свой серверРаботает и без видеокарты
Сферы
Документы и бухгалтерия, Поддержка клиентов, Наука, Медиа и продакшн

Какие задачи решает

  • Классификация обращений и документов на национальных языках
  • Поиск по смыслу в текстах на редких языках
  • Извлечение имён, дат и названий из текста
  • Основа для дообучения под свою задачу

Где применяется

Документооборот и архивыПоддержка клиентовНаука и языковые проекты

Требования к железу

НоутбукНоутбук или обычный ПК, до 8 ГБ видеопамяти — младшие версии
подходит
1 видеокартаОдна видеокарта на 16–80 ГБ — средние версии
нет версий
КластерСервер с несколькими видеокартами — флагманские версии
нет версий

Версии

  1. mmBERT-small, 140M
  2. mmBERT-base, 307M

Как запустить

На своём сервереВеса скачиваются с Hugging Face, запуск — через vLLM (нагрузка и API) или llama.cpp (скромное железо). Так модель работает в закрытом контуре, без оплаты за запросы.Hugging Face
Сколько нужно железаПосчитайте видеопамять под нужный размер модели, контекст и число одновременных запросов.Открыть калькулятор железа

Ставлю и настраиваю под ключ: подберу размер модели, разверну на вашем сервере, подключу к вашим системам. Квантование — сжатие модели: она занимает меньше видеопамяти и работает на более скромном железе. Отвечает при этом чуть иначе, поэтому качество проверяют на своих примерах.

Частые вопросы

Можно ли использовать mmBERT в коммерческом проекте?

Да. Лицензия: MIT. Это разрешает коммерческое использование, но перед запуском лицензию всё равно стоит показать юристу.

Какое железо нужно для mmBERT?

Минимум: Ноутбук или обычный ПК, до 8 ГБ видеопамяти — младшие версии. Есть версии, которые работают и без видеокарты, на обычном процессоре. Точный объём видеопамяти под ваш размер модели и контекст можно посчитать в калькуляторе железа.

Поддерживает ли mmBERT русский язык?

Да, русский язык заявлен в карточке модели.

Где скачать mmBERT и сколько это стоит?

Веса mmBERT лежат в открытом доступе и скачиваются бесплатно. Платить нужно только за железо, на котором модель работает, и за настройку. Ссылки на первоисточник — в конце страницы.

Как внедряю у заказчика

  1. ПодборВыбираю размер модели под задачу и ваше железо, проверяю на ваших примерах.
  2. УстановкаРазворачиваю на вашем сервере или в закрытом контуре, отдаю API.
  3. ДообучениеДообучаю на ваших данных (LoRA) или подключаю базу знаний — что дешевле для задачи.
  4. ВстраиваниеПодключаю к CRM, 1С, боту, сайту или рабочему чату, настраиваю мониторинг.

Похожие модели

Источник: huggingface.co/jhu-clsp/mmBERT-base. Данные сверены с карточкой модели 22.09.2026. Лицензию перед коммерческим запуском проверьте с юристом.