Открытые модели для анализа и разбора текста

Эти модели классифицируют обращения, определяют тональность отзывов и извлекают из текста имена, адреса, даты и суммы. Они легче больших языковых моделей и быстро работают на обычном сервере. Проверьте поддержку русского, возможность дообучить модель на своих примерах и лицензию.

В подборке 31 семейство открытых моделей.Обновлено 22.09.2026Открыть весь каталог с фильтрами
Разбор текста2024–2026

GLiNER

Урчаде Заратиана и Fastino AI · Франция / США

Находит в тексте нужные сущности без обучения: просто перечисляете, что искать (имя, сумма, дата). GLiNER2 заодно классифицирует текст. Многоязычные версии понимают русский.

  • Извлечение имён, сумм и дат из писем и договоров
  • Разбор заявок на поля CRM
  • Классификация обращений по темам
Размеры
около 50M – 500M
Железо
от: Ноутбук
Можно в коммерциюПодробнее
Модерация и безопасность2024–2026

GLiNER-PII

Сообщество GLiNER (Fastino, Knowledgator, NVIDIA и др.) · США

Маленькие модели на основе GLiNER для поиска персональных данных: паспортов, телефонов, счетов, адресов. Типы данных задаются словами. Русский официально не заявлен.

  • Маскирование персональных данных перед облачным ИИ
  • Поиск паспортных данных и реквизитов в документах
  • Проверка выгрузок на утечки
Размеры
около 200M – 500M
Железо
от: Ноутбук
Можно в коммерциюПодробнее
Модерация и безопасность2026

OpenAI Privacy Filter

OpenAI · США

Находит и скрывает персональные данные: имена, адреса, телефоны, почту, номера счетов, пароли. Работает даже в браузере. Обучена в основном на английском.

  • Очистка текста от персональных данных перед отправкой в облачный ИИ
  • Поиск паролей и ключей в текстах
  • Обезличивание переписки для аналитики
Размеры
1.5B (50M активных)
Железо
от: Ноутбук
Можно в коммерциюПодробнее
Разбор текстаOllama2024–2026

NuExtract

NuMind · Франция

Модели для извлечения данных по шаблону: даёте документ или скан и JSON-шаблон полей, получаете заполненный JSON. NuExtract3 (4B) заодно переводит сканы в Markdown.

  • Извлечение реквизитов, сумм и дат из счетов и договоров в JSON
  • Разбор чеков, накладных и анкет по заданному шаблону
  • Перевод сканов в Markdown для поиска
Размеры
0.5B – 8B
Железо
от: Ноутбук
Можно в коммерциюПодробнее
ТекстRU2024–2026

Meno (Иван Бондаренко)

Иван Бондаренко (bond005), НГУ · Россия

Русскоязычные модели для работы с документами, а не для болтовни: ответы по базе знаний, извлечение сущностей и фактов из текста на русском, длинный контекст.

  • Ответы на вопросы по внутренним документам
  • Извлечение имён, дат и сумм из договоров
  • Краткое изложение длинных текстов на русском
Размеры
1.5B – 7.6B
Железо
от: Ноутбук
Можно в коммерциюПодробнее
Детекция подделок2023–2025

RADAR

IBM Research и The Chinese University of Hong Kong · США

Детектор ИИ-текста, обученный вместе с перефразировщиком: его специально учили не сдаваться, когда текст переписали своими словами. Ошибается в обе стороны, вывод проверяет человек.

  • Проверка текстов, которые могли переписать после генерации
  • Предварительный отсев в редакции или приёмной комиссии
  • Сравнение с более простыми детекторами
Размеры
около 355M (RoBERTa-large)
Железо
от: Ноутбук
Коммерция с условиямиПодробнее
Поиск и RAGGGUF2024–2025

JobBERT (TechWolf)

TechWolf · Бельгия

Модель бельгийской HR-компании: превращает названия должностей в векторы, чтобы находить похожие вакансии и резюме. Решение о кандидате принимает человек, автоматический отбор без проверки использовать нельзя.

  • Сопоставление названий должностей из разных источников
  • Поиск похожих вакансий и резюме по смыслу
  • Наведение порядка в справочнике должностей компании
Размеры
109M – 278M
Железо
от: Ноутбук
Можно в коммерциюПодробнее
Разбор текстаRU2023–2025

RuModernBERT и USER (deepvk)

deepvk (VK) · Россия

Русские энкодеры от команды VK: RuModernBERT читает длинные тексты, USER даёт векторы для поиска, GeRaCl классифицирует тексты по темам без обучения.

  • Классификация обращений без размеченных данных
  • Поиск по базе знаний на русском
  • Разбор длинных договоров
Размеры
35M – 360M
Железо
от: Ноутбук
Можно в коммерциюПодробнее
Детекция подделок2025

Desklib AI Text Detector

Desklib · Индия

Свежий открытый детектор ИИ-текста на DeBERTa-v3-large, обучен на наборе RAID; есть отдельная версия под учебные работы. Ошибается в обе стороны — итог всегда проверяет человек.

  • Проверка присланных статей и отчётов
  • Отсев шаблонных отзывов и откликов
  • Предварительная проверка учебных работ
Размеры
0,4B (DeBERTa-v3-large)
Железо
от: Ноутбук
Можно в коммерциюПодробнее
Поиск и RAG2025

CareerBERT

Авторы статьи CareerBERT, немецкие университеты · Германия

Немецкоязычная модель, которая сопоставляет резюме с профессиями из европейского справочника ESCO и подсказывает подходящие направления. Решение о кандидате принимает человек, автоматический отбор без проверки использовать нельзя.

  • Подбор профессий под опыт кандидата
  • Сопоставление резюме и описаний вакансий
  • Подсказки по карьерным переходам внутри компании
Размеры
110M
Железо
от: Ноутбук
Коммерция с условиямиПодробнее
Разбор текстаGGUF2024–2025

ModernBERT

Answer.AI и LightOn · США / Франция

Современная замена классическому BERT: быстрее, читает до 8 тысяч токенов за раз. Основа для своих классификаторов. Обучена на английском и коде, для русского есть RuModernBERT.

  • Классификация обращений и документов
  • Поиск нужных фрагментов в длинных текстах
  • Основа для своего классификатора после дообучения
Размеры
150M – 395M
Железо
от: Ноутбук
Можно в коммерциюПодробнее
Разбор текстаRUOllama2024–2025

ReaderLM (Jina)

Jina AI · Германия

Маленькие модели, которые превращают сырой HTML веб-страниц в чистый Markdown или JSON. Удобно готовить сайты для базы знаний. Лицензия только некоммерческая.

  • Очистка страниц сайтов для базы знаний
  • Извлечение данных со страниц в JSON
  • Подготовка текстов для RAG
Размеры
0.5B – 1.5B
Железо
от: Ноутбук
Только некоммерческоеПодробнее
Поиск и RAG2024

ConTeXT-Skill-Extraction

TechWolf · Бельгия

Находит в тексте вакансии или резюме упоминания навыков и сопоставляет их со справочником компании. Решение о кандидате принимает человек, автоматический отбор без проверки использовать нельзя.

  • Извлечение навыков из описания вакансии
  • Сопоставление навыков кандидата с требованиями
  • Карта компетенций по подразделениям
Размеры
109M
Железо
от: Ноутбук
Коммерция с условиямиПодробнее
Кибербезопасность2024

Phishing Email Detection DistilBERT

cybersectony · не раскрыта

Очень лёгкий классификатор писем и ссылок на признаки фишинга. Ошибается в обе стороны, поэтому спорные письма всё равно смотрит человек.

  • Отметка подозрительных входящих писем
  • Проверка ссылок из переписки перед переходом
  • Фильтр первого уровня в почтовом шлюзе
Размеры
около 66M
Железо
от: Ноутбук
Можно в коммерциюПодробнее
Модерация и безопасность2024

Piiranha

iiiorg · не указана

Популярный детектор 17 типов персональных данных на шести европейских языках. Русского нет, лицензия некоммерческая — подходит для проб и исследований.

  • Поиск персональных данных в текстах
  • Сравнение качества детекторов PII
Размеры
278M
Железо
от: Ноутбук
Только некоммерческоеПодробнее
Проверка фактов и оценка ответовOllamaНе развивается2024

MiniCheck

UT Austin и Bespoke Labs · США

Проверяет, подтверждается ли каждое утверждение в ответе ИИ исходными документами. Малые версии свободные, старшая 7B есть в Ollama, но некоммерческая.

  • Проверка ответов RAG-бота по документам
  • Поиск неподтверждённых утверждений в отчётах и пересказах
  • Автоматический контроль качества ИИ-ответов
Размеры
0.4B – 7B
Железо
от: Ноутбук
Коммерция с условиямиПодробнее
Разбор текстаRUНе развивается2020–2024

ruBERT, ruRoBERTa, ruELECTRA (ai-forever)

SberDevices (ai-forever) · Россия

Русскоязычные энкодеры Сбера, обученные на больших русских корпусах. Основа для классификаторов, NER и поиска по смыслу на русском.

  • Классификация обращений на русском
  • Извлечение имён, сумм и дат после дообучения
  • Определение тональности отзывов
Размеры
около 30M – 430M
Железо
от: Ноутбук
Можно в коммерциюПодробнее
Проверка фактов и оценка ответовНе развивается2023–2024

HHEM (Vectara)

Vectara · США

Маленькая модель, которая проверяет, опирается ли ответ ИИ на исходный текст или выдуман. Работает на процессоре, удобна как фильтр в RAG-системах.

  • Проверка ответов чат-бота по базе знаний на выдумки
  • Контроль качества пересказов документов
  • Сравнение языковых моделей по склонности к ошибкам
Размеры
110M
Железо
от: Ноутбук
Можно в коммерциюПодробнее
Детекция подделокНе развивается2024

MAGE

UC Santa Barbara и соавторы · США

Детектор ИИ-текста на Longformer: держит длинный документ целиком и обучен на текстах от множества разных языковых моделей. Ошибается в обе стороны, его вывод — повод для проверки человеком.

  • Проверка длинных статей и отчётов целиком
  • Отсев машинного текста в потоке публикаций
  • Сравнение детекторов на своих данных
Размеры
около 150M (Longformer-base)
Железо
от: Ноутбук
Можно в коммерциюПодробнее
Разбор текстаНе развивается2024

OccCANINE

University of Southern Denmark · Дания

Переводит свободное описание профессии в стандартный код HISCO на 13 языках. Создана для исторических архивов, но годится и для наведения порядка в справочниках должностей. Решение о кандидате принимает человек, автоматический отбор без проверки использовать нельзя.

  • Приведение разнородных названий профессий к единому коду
  • Разбор архивов кадровых и статистических данных
  • Подготовка данных для отчётности
Размеры
на базе CANINE-s, размер на карточке не указан
Железо
от: Ноутбук
Можно в коммерциюПодробнее
ТекстRUНе развивается2023–2024

FRED-T5

Сбер (ai-forever) · Россия

Русская модель «текст в текст» от Сбера, наследница ruT5 (2021). Небольшая и быстрая: её дообучают на пересказ, перефразирование и исправление ошибок в русском тексте, есть готовые версии проверки орфографии SAGE.

  • Исправление орфографии и опечаток в русском тексте
  • Краткий пересказ и перефразирование
  • Нормализация заявок и обращений перед обработкой
Размеры
95M – 1.7B
Железо
от: Ноутбук
Можно в коммерциюПодробнее
Детекция подделокНе развивается2023

HC3 ChatGPT Detector

Hello-SimpleAI · Китай

Один из первых открытых классификаторов ИИ-текста, обучен на корпусе HC3 из пар ответов человека и ЧатГПТ. Ошибается в обе стороны: его вывод — повод поговорить с автором, а не доказательство.

  • Предварительная проверка учебных работ
  • Отсев шаблонных откликов и отзывов
  • Разметка подозрительных текстов для ручной проверки
Размеры
около 125M (RoBERTa-base)
Железо
от: Ноутбук
Коммерция с условиямиПодробнее
Разбор текстаНе развивается2022–2023

ESCOXLM-R и JobBERT (ITU Copenhagen)

Mike Zhang, Rob van der Goot, Barbara Plank (IT University of Copenhagen и LMU Munich) · Дания

Научная линейка моделей для текстов рынка труда: обучены на объявлениях о работе и европейском справочнике профессий ESCO, вытаскивают из вакансий навыки и требования. Решение о кандидате принимает человек, автоматический отбор без проверки использовать нельзя.

  • Извлечение навыков и требований из текста вакансии
  • Приведение навыков к единому справочнику ESCO
  • Классификация вакансий и должностей
Размеры
110M – 560M
Железо
от: Ноутбук
Коммерция с условиямиПодробнее
КибербезопасностьНе развивается2022–2023

SecureBERT

Ehsan Aghaei и соавторы · США

Компактный языковой энкодер, обученный на текстах по кибербезопасности: разметка отчётов об угрозах, поиск сущностей и классификация.

  • Разметка отчётов об угрозах и бюллетеней по уязвимостям
  • Извлечение сущностей из текстов по безопасности
  • Классификация и поиск по внутренней базе инцидентов
Размеры
около 125M
Железо
от: Ноутбук
Коммерция с условиямиПодробнее
Разбор текстаRUНе развивается2022–2023

Русские классификаторы токсичности и тональности

Давид Дале (cointegrated) и сообщество · Россия

Готовые крошечные модели на rubert-tiny для русского текста: находят грубость и оскорбления, определяют тональность и эмоции. Работают на процессоре за миллисекунды.

  • Фильтр оскорблений в чатах и комментариях на русском
  • Разметка отзывов на позитив, нейтрал и негатив
  • Поиск раздражённых клиентов в обращениях
Размеры
12M – 29M
Железо
от: Ноутбук
Коммерция с условиямиПодробнее
Документы и OCRНе развивается2022

LiLT

SCUT DLVC Lab, Южно-Китайский технологический университет · Китай

Лёгкая модель, которая учитывает и текст, и расположение блоков на странице: обучается на одном языке и переносится на другие. Подходит для разметки полей резюме и анкет. Решение о кандидате принимает человек, автоматический отбор без проверки использовать нельзя.

  • Разметка полей в резюме и анкетах
  • Извлечение данных из форм и бланков
  • Разбор документов на нескольких языках
Размеры
около 130M английская и около 280M многоязычная версия
Железо
от: Ноутбук
Можно в коммерциюПодробнее
Разбор текстаНе развивается2020–2022

LayoutLM (v1–v3, LayoutXLM)

Microsoft · США

Классические модели понимания документов: учитывают текст, его расположение на странице и картинку. Их дообучают под извлечение полей из форм и чеков. Коммерчески свободна только первая версия.

  • Извлечение полей из анкет, форм и чеков после дообучения
  • Классификация типов документов
  • Ответы на вопросы по отсканированной странице
Размеры
около 110M – 370M
Железо
от: Ноутбук
Коммерция с условиямиПодробнее
Разбор текстаRUНе развивается2019–2022

XLM-RoBERTa

Meta · США

Классический многоязычный энкодер на 100 языков, включая русский. Основа многих моделей тональности, NER и эмбеддингов, в том числе BGE-M3.

  • Определение тональности отзывов на разных языках
  • Извлечение имён и организаций после дообучения
  • Классификация обращений
Размеры
270M – 10.7B
Железо
от: Ноутбук
Можно в коммерциюПодробнее
Разбор текстаRUНе развивается2021

DeBERTa-v3 и mDeBERTa-v3

Microsoft · США

Проверенный временем энкодер, на котором построено множество классификаторов и NER-моделей (в том числе GLiNER). Многоязычная mDeBERTa-v3 понимает русский.

  • Классификация отзывов по тональности
  • Извлечение сущностей после дообучения
  • Проверка, следует ли вывод из текста
Размеры
70M – 435M
Железо
от: Ноутбук
Можно в коммерциюПодробнее
Разбор текстаRUНе развивается2021

rubert-tiny

Давид Дале (cointegrated) · Россия

Очень маленький русско-английский BERT, работает быстро на обычном процессоре. Есть готовые дообученные версии для тональности, токсичности и эмоций.

  • Определение тональности отзывов
  • Фильтр грубых сообщений в чате
  • Быстрая классификация обращений
Размеры
12M – 29M
Железо
от: Ноутбук
Можно в коммерциюПодробнее
ФинансыНе развивается2020

FinBERT

Prosus · Нидерланды

Классическая модель, которая определяет тон финансовых новостей: позитив, негатив или нейтрально. Только английский, быстро работает на процессоре.

  • Оценка тона новостей о компаниях
  • Разметка отчётов и пресс-релизов
  • Сигналы для аналитических дашбордов
Размеры
110M
Железо
от: Ноутбук
Можно в коммерциюПодробнее

Подборки

Нужна модель под вашу задачу?

Открытую модель можно поставить на свой сервер: данные не уходят в чужое облако, нет оплаты за каждый запрос, модель можно дообучить на ваших документах.

  1. ПодберуМодель и размер под задачу и бюджет на железо
  2. ПоставлюНа ваш сервер или в закрытый контур, с API
  3. ДообучуНа ваших данных или подключу базу знаний
  4. ВстроюВ CRM, 1С, бота, сайт или рабочий чат
Обсудить внедрение