Разбор текста

ReaderLM (Jina)

Маленькие модели, которые превращают сырой HTML веб-страниц в чистый Markdown или JSON. Удобно готовить сайты для базы знаний. Лицензия только некоммерческая.

Разработчик
Jina AI, Германия
Первый выпуск
сен 2024
Последний выпуск
янв 2025
Размеры
0.5B – 1.5B
Лицензия
Только некоммерческоеCC-BY-NC 4.0
Русский язык
Есть
Запуск
Есть в OllamaРаботает и без видеокарты
Сферы
Разработка ПО, Документы и бухгалтерия, Маркетинг и контент

Какие задачи решает

  • Очистка страниц сайтов для базы знаний
  • Извлечение данных со страниц в JSON
  • Подготовка текстов для RAG

Где применяется

IT и разработкаМаркетинг и аналитика конкурентовВнутренние базы знаний

Требования к железу

НоутбукНоутбук или обычный ПК, до 8 ГБ видеопамяти — младшие версии
подходит
1 видеокартаОдна видеокарта на 16–80 ГБ — средние версии
нет версий
КластерСервер с несколькими видеокартами — флагманские версии
нет версий

Версии

  1. ReaderLM-v2 (1.5B, 29 языков)
  2. reader-lm 0.5b и 1.5b

Как внедряю у заказчика

  1. ПодборВыбираю размер модели под задачу и ваше железо, проверяю на ваших примерах.
  2. УстановкаРазворачиваю на вашем сервере или в закрытом контуре, отдаю API.
  3. ДообучениеДообучаю на ваших данных (LoRA) или подключаю базу знаний — что дешевле для задачи.
  4. ВстраиваниеПодключаю к CRM, 1С, боту, сайту или рабочему чату, настраиваю мониторинг.

Похожие модели