ТекстРазбор текста
FRED-T5
Русская модель «текст в текст» от Сбера, наследница ruT5 (2021). Небольшая и быстрая: её дообучают на пересказ, перефразирование и исправление ошибок в русском тексте, есть готовые версии проверки орфографии SAGE.
- Разработчик
- Сбер (ai-forever), Россия
- Первый выпуск
- янв 2023
- Последний выпуск
- мар 2024
- Размеры
- 95M – 1.7B
- Лицензия
- Можно в коммерциюApache 2.0 (FRED-T5), MIT (версии для исправления орфографии)
Какие задачи решает
- Исправление орфографии и опечаток в русском тексте
- Краткий пересказ и перефразирование
- Нормализация заявок и обращений перед обработкой
- Основа для дешёвого узкого дообучения
Где применяется
Поддержка клиентовКонтент и редакцииОбработка обращений и анкет
Требования к железу
НоутбукНоутбук или обычный ПК, до 8 ГБ видеопамяти — младшие версии
подходит1 видеокартаОдна видеокарта на 16–80 ГБ — средние версии
нет версийКластерСервер с несколькими видеокартами — флагманские версии
нет версийВерсии
- SAGE FRED-T5 large и distilled 95M
- FRED-T5 large spell (орфография)
- FRED-T5 large (820M)
- FRED-T5 1.7B
Как внедряю у заказчика
- ПодборВыбираю размер модели под задачу и ваше железо, проверяю на ваших примерах.
- УстановкаРазворачиваю на вашем сервере или в закрытом контуре, отдаю API.
- ДообучениеДообучаю на ваших данных (LoRA) или подключаю базу знаний — что дешевле для задачи.
- ВстраиваниеПодключаю к CRM, 1С, боту, сайту или рабочему чату, настраиваю мониторинг.
Похожие модели
ТекстFlan-T5 и Flan-UL2Google · СШАМожно в коммерцию
Компактные модели «вход-выход», обученные выполнять инструкции. До сих пор используются как дешёвая основа для классификации, извлечения и коротких ответов.
ПодробнееРазбор текстаruBERT, ruRoBERTa, ruELECTRA (ai-forever)SberDevices (ai-forever) · РоссияМожно в коммерциюРусскоязычные энкодеры Сбера, обученные на больших русских корпусах. Основа для классификаторов, NER и поиска по смыслу на русском.
ПодробнееТекстruGPT-3.5Сбер (ai-forever) · РоссияМожно в коммерциюБазовая русскоязычная модель Сбера на 13 млрд параметров, из дообученной версии которой вырос GigaChat. Продолжает тексты на русском и английском, контекст всего 2048 токенов; сегодня интересна как основа для узкого дообучения.
Подробнее

