Разбор текста2024–2026
Урчаде Заратиана и Fastino AI · Франция / США
Находит в тексте нужные сущности без обучения: просто перечисляете, что искать (имя, сумма, дата). GLiNER2 заодно классифицирует текст. Многоязычные версии понимают русский.
- Извлечение имён, сумм и дат из писем и договоров
- Разбор заявок на поля CRM
- Классификация обращений по темам
- Размеры
- около 50M – 500M
- Железо
- от: Ноутбук
Модерация и безопасность2024–2026
Сообщество GLiNER (Fastino, Knowledgator, NVIDIA и др.) · США
Маленькие модели на основе GLiNER для поиска персональных данных: паспортов, телефонов, счетов, адресов. Типы данных задаются словами. Русский официально не заявлен.
- Маскирование персональных данных перед облачным ИИ
- Поиск паспортных данных и реквизитов в документах
- Проверка выгрузок на утечки
- Размеры
- около 200M – 500M
- Железо
- от: Ноутбук
Модерация и безопасность2026
OpenAI · США
Находит и скрывает персональные данные: имена, адреса, телефоны, почту, номера счетов, пароли. Работает даже в браузере. Обучена в основном на английском.
- Очистка текста от персональных данных перед отправкой в облачный ИИ
- Поиск паролей и ключей в текстах
- Обезличивание переписки для аналитики
- Размеры
- 1.5B (50M активных)
- Железо
- от: Ноутбук
Разбор текстаOllama2024–2026
NuMind · Франция
Модели для извлечения данных по шаблону: даёте документ или скан и JSON-шаблон полей, получаете заполненный JSON. NuExtract3 (4B) заодно переводит сканы в Markdown.
- Извлечение реквизитов, сумм и дат из счетов и договоров в JSON
- Разбор чеков, накладных и анкет по заданному шаблону
- Перевод сканов в Markdown для поиска
- Размеры
- 0.5B – 8B
- Железо
- от: Ноутбук
ТекстRU2024–2026
Иван Бондаренко (bond005), НГУ · Россия
Русскоязычные модели для работы с документами, а не для болтовни: ответы по базе знаний, извлечение сущностей и фактов из текста на русском, длинный контекст.
- Ответы на вопросы по внутренним документам
- Извлечение имён, дат и сумм из договоров
- Краткое изложение длинных текстов на русском
- Размеры
- 1.5B – 7.6B
- Железо
- от: Ноутбук
Детекция подделок2023–2025
IBM Research и The Chinese University of Hong Kong · США
Детектор ИИ-текста, обученный вместе с перефразировщиком: его специально учили не сдаваться, когда текст переписали своими словами. Ошибается в обе стороны, вывод проверяет человек.
- Проверка текстов, которые могли переписать после генерации
- Предварительный отсев в редакции или приёмной комиссии
- Сравнение с более простыми детекторами
- Размеры
- около 355M (RoBERTa-large)
- Железо
- от: Ноутбук
Поиск и RAGGGUF2024–2025
TechWolf · Бельгия
Модель бельгийской HR-компании: превращает названия должностей в векторы, чтобы находить похожие вакансии и резюме. Решение о кандидате принимает человек, автоматический отбор без проверки использовать нельзя.
- Сопоставление названий должностей из разных источников
- Поиск похожих вакансий и резюме по смыслу
- Наведение порядка в справочнике должностей компании
- Размеры
- 109M – 278M
- Железо
- от: Ноутбук
Разбор текстаRU2023–2025
deepvk (VK) · Россия
Русские энкодеры от команды VK: RuModernBERT читает длинные тексты, USER даёт векторы для поиска, GeRaCl классифицирует тексты по темам без обучения.
- Классификация обращений без размеченных данных
- Поиск по базе знаний на русском
- Разбор длинных договоров
- Размеры
- 35M – 360M
- Железо
- от: Ноутбук
Детекция подделок2025
Desklib · Индия
Свежий открытый детектор ИИ-текста на DeBERTa-v3-large, обучен на наборе RAID; есть отдельная версия под учебные работы. Ошибается в обе стороны — итог всегда проверяет человек.
- Проверка присланных статей и отчётов
- Отсев шаблонных отзывов и откликов
- Предварительная проверка учебных работ
- Размеры
- 0,4B (DeBERTa-v3-large)
- Железо
- от: Ноутбук
Поиск и RAG2025
Авторы статьи CareerBERT, немецкие университеты · Германия
Немецкоязычная модель, которая сопоставляет резюме с профессиями из европейского справочника ESCO и подсказывает подходящие направления. Решение о кандидате принимает человек, автоматический отбор без проверки использовать нельзя.
- Подбор профессий под опыт кандидата
- Сопоставление резюме и описаний вакансий
- Подсказки по карьерным переходам внутри компании
- Размеры
- 110M
- Железо
- от: Ноутбук
Разбор текстаGGUF2024–2025
Answer.AI и LightOn · США / Франция
Современная замена классическому BERT: быстрее, читает до 8 тысяч токенов за раз. Основа для своих классификаторов. Обучена на английском и коде, для русского есть RuModernBERT.
- Классификация обращений и документов
- Поиск нужных фрагментов в длинных текстах
- Основа для своего классификатора после дообучения
- Размеры
- 150M – 395M
- Железо
- от: Ноутбук
Разбор текстаRUOllama2024–2025
Jina AI · Германия
Маленькие модели, которые превращают сырой HTML веб-страниц в чистый Markdown или JSON. Удобно готовить сайты для базы знаний. Лицензия только некоммерческая.
- Очистка страниц сайтов для базы знаний
- Извлечение данных со страниц в JSON
- Подготовка текстов для RAG
- Размеры
- 0.5B – 1.5B
- Железо
- от: Ноутбук
Поиск и RAG2024
TechWolf · Бельгия
Находит в тексте вакансии или резюме упоминания навыков и сопоставляет их со справочником компании. Решение о кандидате принимает человек, автоматический отбор без проверки использовать нельзя.
- Извлечение навыков из описания вакансии
- Сопоставление навыков кандидата с требованиями
- Карта компетенций по подразделениям
- Размеры
- 109M
- Железо
- от: Ноутбук
Кибербезопасность2024
cybersectony · не раскрыта
Очень лёгкий классификатор писем и ссылок на признаки фишинга. Ошибается в обе стороны, поэтому спорные письма всё равно смотрит человек.
- Отметка подозрительных входящих писем
- Проверка ссылок из переписки перед переходом
- Фильтр первого уровня в почтовом шлюзе
- Размеры
- около 66M
- Железо
- от: Ноутбук
Модерация и безопасность2024
iiiorg · не указана
Популярный детектор 17 типов персональных данных на шести европейских языках. Русского нет, лицензия некоммерческая — подходит для проб и исследований.
- Поиск персональных данных в текстах
- Сравнение качества детекторов PII
- Размеры
- 278M
- Железо
- от: Ноутбук
Проверка фактов и оценка ответовOllamaНе развивается2024
UT Austin и Bespoke Labs · США
Проверяет, подтверждается ли каждое утверждение в ответе ИИ исходными документами. Малые версии свободные, старшая 7B есть в Ollama, но некоммерческая.
- Проверка ответов RAG-бота по документам
- Поиск неподтверждённых утверждений в отчётах и пересказах
- Автоматический контроль качества ИИ-ответов
- Размеры
- 0.4B – 7B
- Железо
- от: Ноутбук
Разбор текстаRUНе развивается2020–2024
SberDevices (ai-forever) · Россия
Русскоязычные энкодеры Сбера, обученные на больших русских корпусах. Основа для классификаторов, NER и поиска по смыслу на русском.
- Классификация обращений на русском
- Извлечение имён, сумм и дат после дообучения
- Определение тональности отзывов
- Размеры
- около 30M – 430M
- Железо
- от: Ноутбук
Проверка фактов и оценка ответовНе развивается2023–2024
Vectara · США
Маленькая модель, которая проверяет, опирается ли ответ ИИ на исходный текст или выдуман. Работает на процессоре, удобна как фильтр в RAG-системах.
- Проверка ответов чат-бота по базе знаний на выдумки
- Контроль качества пересказов документов
- Сравнение языковых моделей по склонности к ошибкам
- Размеры
- 110M
- Железо
- от: Ноутбук
Детекция подделокНе развивается2024
UC Santa Barbara и соавторы · США
Детектор ИИ-текста на Longformer: держит длинный документ целиком и обучен на текстах от множества разных языковых моделей. Ошибается в обе стороны, его вывод — повод для проверки человеком.
- Проверка длинных статей и отчётов целиком
- Отсев машинного текста в потоке публикаций
- Сравнение детекторов на своих данных
- Размеры
- около 150M (Longformer-base)
- Железо
- от: Ноутбук
Разбор текстаНе развивается2024
University of Southern Denmark · Дания
Переводит свободное описание профессии в стандартный код HISCO на 13 языках. Создана для исторических архивов, но годится и для наведения порядка в справочниках должностей. Решение о кандидате принимает человек, автоматический отбор без проверки использовать нельзя.
- Приведение разнородных названий профессий к единому коду
- Разбор архивов кадровых и статистических данных
- Подготовка данных для отчётности
- Размеры
- на базе CANINE-s, размер на карточке не указан
- Железо
- от: Ноутбук
ТекстRUНе развивается2023–2024
Сбер (ai-forever) · Россия
Русская модель «текст в текст» от Сбера, наследница ruT5 (2021). Небольшая и быстрая: её дообучают на пересказ, перефразирование и исправление ошибок в русском тексте, есть готовые версии проверки орфографии SAGE.
- Исправление орфографии и опечаток в русском тексте
- Краткий пересказ и перефразирование
- Нормализация заявок и обращений перед обработкой
- Размеры
- 95M – 1.7B
- Железо
- от: Ноутбук
Детекция подделокНе развивается2023
Hello-SimpleAI · Китай
Один из первых открытых классификаторов ИИ-текста, обучен на корпусе HC3 из пар ответов человека и ЧатГПТ. Ошибается в обе стороны: его вывод — повод поговорить с автором, а не доказательство.
- Предварительная проверка учебных работ
- Отсев шаблонных откликов и отзывов
- Разметка подозрительных текстов для ручной проверки
- Размеры
- около 125M (RoBERTa-base)
- Железо
- от: Ноутбук
Разбор текстаНе развивается2022–2023
Mike Zhang, Rob van der Goot, Barbara Plank (IT University of Copenhagen и LMU Munich) · Дания
Научная линейка моделей для текстов рынка труда: обучены на объявлениях о работе и европейском справочнике профессий ESCO, вытаскивают из вакансий навыки и требования. Решение о кандидате принимает человек, автоматический отбор без проверки использовать нельзя.
- Извлечение навыков и требований из текста вакансии
- Приведение навыков к единому справочнику ESCO
- Классификация вакансий и должностей
- Размеры
- 110M – 560M
- Железо
- от: Ноутбук
КибербезопасностьНе развивается2022–2023
Ehsan Aghaei и соавторы · США
Компактный языковой энкодер, обученный на текстах по кибербезопасности: разметка отчётов об угрозах, поиск сущностей и классификация.
- Разметка отчётов об угрозах и бюллетеней по уязвимостям
- Извлечение сущностей из текстов по безопасности
- Классификация и поиск по внутренней базе инцидентов
- Размеры
- около 125M
- Железо
- от: Ноутбук
Разбор текстаRUНе развивается2022–2023
Давид Дале (cointegrated) и сообщество · Россия
Готовые крошечные модели на rubert-tiny для русского текста: находят грубость и оскорбления, определяют тональность и эмоции. Работают на процессоре за миллисекунды.
- Фильтр оскорблений в чатах и комментариях на русском
- Разметка отзывов на позитив, нейтрал и негатив
- Поиск раздражённых клиентов в обращениях
- Размеры
- 12M – 29M
- Железо
- от: Ноутбук
Документы и OCRНе развивается2022
SCUT DLVC Lab, Южно-Китайский технологический университет · Китай
Лёгкая модель, которая учитывает и текст, и расположение блоков на странице: обучается на одном языке и переносится на другие. Подходит для разметки полей резюме и анкет. Решение о кандидате принимает человек, автоматический отбор без проверки использовать нельзя.
- Разметка полей в резюме и анкетах
- Извлечение данных из форм и бланков
- Разбор документов на нескольких языках
- Размеры
- около 130M английская и около 280M многоязычная версия
- Железо
- от: Ноутбук
Разбор текстаНе развивается2020–2022
Microsoft · США
Классические модели понимания документов: учитывают текст, его расположение на странице и картинку. Их дообучают под извлечение полей из форм и чеков. Коммерчески свободна только первая версия.
- Извлечение полей из анкет, форм и чеков после дообучения
- Классификация типов документов
- Ответы на вопросы по отсканированной странице
- Размеры
- около 110M – 370M
- Железо
- от: Ноутбук
Разбор текстаRUНе развивается2019–2022
Meta · США
Классический многоязычный энкодер на 100 языков, включая русский. Основа многих моделей тональности, NER и эмбеддингов, в том числе BGE-M3.
- Определение тональности отзывов на разных языках
- Извлечение имён и организаций после дообучения
- Классификация обращений
- Размеры
- 270M – 10.7B
- Железо
- от: Ноутбук
Разбор текстаRUНе развивается2021
Microsoft · США
Проверенный временем энкодер, на котором построено множество классификаторов и NER-моделей (в том числе GLiNER). Многоязычная mDeBERTa-v3 понимает русский.
- Классификация отзывов по тональности
- Извлечение сущностей после дообучения
- Проверка, следует ли вывод из текста
- Размеры
- 70M – 435M
- Железо
- от: Ноутбук
Разбор текстаRUНе развивается2021
Давид Дале (cointegrated) · Россия
Очень маленький русско-английский BERT, работает быстро на обычном процессоре. Есть готовые дообученные версии для тональности, токсичности и эмоций.
- Определение тональности отзывов
- Фильтр грубых сообщений в чате
- Быстрая классификация обращений
- Размеры
- 12M – 29M
- Железо
- от: Ноутбук
ФинансыНе развивается2020
Prosus · Нидерланды
Классическая модель, которая определяет тон финансовых новостей: позитив, негатив или нейтрально. Только английский, быстро работает на процессоре.
- Оценка тона новостей о компаниях
- Разметка отчётов и пресс-релизов
- Сигналы для аналитических дашбордов
- Размеры
- 110M
- Железо
- от: Ноутбук