GlotLID
Определяет, на каком языке написан текст: в третьей версии более двух тысяч меток, включая татарский, башкирский, чувашский, удмуртский, марийский, эрзянский, коми и другие языки народов России.
Последняя открытая версия вышла в апр 2024. Семейство давно не обновлялось: это не значит, что модель не работает, но свежих исправлений и новых размеров ждать не стоит.
- Разработчик
- CIS, Университет Людвига-Максимилиана в Мюнхене, Германия
- Первый выпуск
- окт 2023
- Последний выпуск
- апр 2024
- Размеры
- модель FastText, число параметров на карточке не указано
- Лицензия
- Можно в коммерциюApache 2.0 с дополнительными уведомлениями (файл LICENSE в репозитории)
- Русский язык
- Есть
- Запуск
- Через свой серверРаботает и без видеокарты
- Сферы
- Документы и бухгалтерия, Медиа и продакшн, Наука, Поддержка клиентов
Какие задачи решает
- Разбор смешанных архивов текстов по языкам
- Отсев мусора и чужих языков перед обучением моделей
- Маршрутизация обращений на нужного оператора или модель
- Проверка разметки языковых корпусов
Где применяется
Требования к железу
Версии
- GlotLID v3, более двух тысяч меток языков
- GlotLID v1
Как запустить
Ставлю и настраиваю под ключ: подберу размер модели, разверну на вашем сервере, подключу к вашим системам.
Частые вопросы
Можно ли использовать GlotLID в коммерческом проекте?
Да. Лицензия: Apache 2.0 с дополнительными уведомлениями (файл LICENSE в репозитории). Это разрешает коммерческое использование, но перед запуском лицензию всё равно стоит показать юристу.
Какое железо нужно для GlotLID?
Минимум: Ноутбук или обычный ПК, до 8 ГБ видеопамяти — младшие версии. Есть версии, которые работают и без видеокарты, на обычном процессоре. Точный объём видеопамяти под ваш размер модели и контекст можно посчитать в калькуляторе железа.
Поддерживает ли GlotLID русский язык?
Да, русский язык заявлен в карточке модели.
Где скачать GlotLID и сколько это стоит?
Веса GlotLID лежат в открытом доступе и скачиваются бесплатно. Платить нужно только за железо, на котором модель работает, и за настройку. Ссылки на первоисточник — в конце страницы.
Как внедряю у заказчика
- ПодборВыбираю размер модели под задачу и ваше железо, проверяю на ваших примерах.
- УстановкаРазворачиваю на вашем сервере или в закрытом контуре, отдаю API.
- ДообучениеДообучаю на ваших данных (LoRA) или подключаю базу знаний — что дешевле для задачи.
- ВстраиваниеПодключаю к CRM, 1С, боту, сайту или рабочему чату, настраиваю мониторинг.
Похожие модели
Многоязычный энкодер, обученный более чем на 1800 языках. В список входят татарский, башкирский, чувашский, удмуртский, бурятский, коми, ингушский и другие языки народов России. Основа для классификаторов и поиска по таким текстам.
ПодробнееРазбор текстаXLM-RoBERTaMeta · СШАМожно в коммерциюКлассический многоязычный энкодер на 100 языков, включая русский. Основа многих моделей тональности, NER и эмбеддингов, в том числе BGE-M3.
ПодробнееПоиск и RAGBGE-M3BAAI · КитайМожно в коммерциюМодель для поиска по смыслу на сотне языков. Основа RAG: бот находит нужный кусок документа перед ответом.
ПодробнееИсточник: huggingface.co/cis-lmu/glotlid. Данные сверены с карточкой модели 22.09.2026. Лицензию перед коммерческим запуском проверьте с юристом.


