Разбор текстаПоиск и RAG

ruBERT, ruRoBERTa, ruELECTRA (ai-forever)

Русскоязычные энкодеры Сбера, обученные на больших русских корпусах. Основа для классификаторов, NER и поиска по смыслу на русском.

Разработчик
SberDevices (ai-forever), Россия
Первый выпуск
ноя 2020
Последний выпуск
июл 2024
Размеры
около 30M – 430M
Лицензия
Можно в коммерциюApache 2.0 и MIT; у ruRoBERTa-large лицензия на карточке не указана — уточнять

Какие задачи решает

  • Классификация обращений на русском
  • Извлечение имён, сумм и дат после дообучения
  • Определение тональности отзывов

Где применяется

Банки и страхованиеСлужбы поддержкиДокументооборот

Требования к железу

НоутбукНоутбук или обычный ПК, до 8 ГБ видеопамяти — младшие версии
подходит
1 видеокартаОдна видеокарта на 16–80 ГБ — средние версии
нет версий
КластерСервер с несколькими видеокартами — флагманские версии
нет версий

Версии

  1. ru-en-RoSBERTa
  2. ruELECTRA large
  3. ruELECTRA small и medium
  4. ruBERT base и large, ruRoBERTa-large
  5. sbert_large_nlu_ru

Как внедряю у заказчика

  1. ПодборВыбираю размер модели под задачу и ваше железо, проверяю на ваших примерах.
  2. УстановкаРазворачиваю на вашем сервере или в закрытом контуре, отдаю API.
  3. ДообучениеДообучаю на ваших данных (LoRA) или подключаю базу знаний — что дешевле для задачи.
  4. ВстраиваниеПодключаю к CRM, 1С, боту, сайту или рабочему чату, настраиваю мониторинг.

Похожие модели