Открытые модели для модерации контента

Модели модерации проверяют сообщения, отзывы и ответы чат-ботов на токсичность, запрещённые темы и попытки обойти ограничения. Их ставят фильтром перед публикацией контента или перед ответом ассистента. Смотрите, какие категории нарушений модель различает, насколько хорошо работает на русском и можно ли настроить правила под себя.

В подборке 16 семейств открытых моделей.Обновлено 22.09.2026Открыть весь каталог с фильтрами
ТекстRUOllama2023–2026

Mistral

Mistral AI · Франция

Европейские модели с упором на скорость. Mixtral — одна из первых открытых моделей на архитектуре «смесь экспертов»; есть версии с картинками (Pixtral, Medium 3.5), для доказательств в Lean и модерации (Shieldstral).

  • Быстрые ответы в чате
  • Извлечение данных из текста
  • Перевод и работа с несколькими языками
Размеры
3B – 675B
Железо
от: Ноутбук
Коммерция с условиямиПодробнее
Модерация и безопасность2024–2026

GLiNER-PII

Сообщество GLiNER (Fastino, Knowledgator, NVIDIA и др.) · США

Маленькие модели на основе GLiNER для поиска персональных данных: паспортов, телефонов, счетов, адресов. Типы данных задаются словами. Русский официально не заявлен.

  • Маскирование персональных данных перед облачным ИИ
  • Поиск паспортных данных и реквизитов в документах
  • Проверка выгрузок на утечки
Размеры
около 200M – 500M
Железо
от: Ноутбук
Можно в коммерциюПодробнее
Модерация и безопасность2024–2026

Aegis / Nemotron Safety Guard

NVIDIA · США

Фильтры контента NVIDIA для ботов, с отдельными моделями для контроля темы разговора и поиска взлома. Safety Guard v3 обучена на 9 языках, русский проверяли только без дообучения.

  • Проверка запросов и ответов бота
  • Удержание бота в рамках своей темы
  • Поиск попыток обойти правила
Размеры
4B – 8B
Железо
от: Ноутбук
Коммерция с условиямиПодробнее
Модерация и безопасностьOllama2024–2026

Granite Guardian

IBM · США

Модели-судьи IBM: ловят вред, мат, попытки взлома, а в RAG и агентах проверяют, опирается ли ответ на документы. Можно задать своё правило словами.

  • Проверка запросов и ответов бота
  • Поиск выдуманных фактов в ответах по базе знаний
  • Проверка своих правил, заданных текстом
Размеры
38M – 8B
Железо
от: Ноутбук
Можно в коммерциюПодробнее
Модерация и безопасность2026

OpenAI Privacy Filter

OpenAI · США

Находит и скрывает персональные данные: имена, адреса, телефоны, почту, номера счетов, пароли. Работает даже в браузере. Обучена в основном на английском.

  • Очистка текста от персональных данных перед отправкой в облачный ИИ
  • Поиск паролей и ключей в текстах
  • Обезличивание переписки для аналитики
Размеры
1.5B (50M активных)
Железо
от: Ноутбук
Можно в коммерциюПодробнее
Модерация и безопасность2025

AprielGuard

ServiceNow · США

Guard-модель, которая ловит и опасный контент, и атаки на ИИ (prompt injection, джейлбрейки), в том числе в работе агентов с инструментами.

  • Проверка запросов к чат-боту на атаки и взлом
  • Фильтр опасных ответов модели
  • Контроль действий ИИ-агента с инструментами
Размеры
8B
Железо
от: Ноутбук
Можно в коммерциюПодробнее
Модерация и безопасностьOllama2025

gpt-oss-safeguard

OpenAI · США

Модерация по вашим правилам: политику пишете обычным текстом, модель рассуждает и выносит решение с объяснением. Построена на gpt-oss.

  • Модерация по внутренним правилам компании
  • Разметка спорных сообщений с объяснением
  • Проверка отзывов и объявлений перед публикацией
Размеры
20B – 120B
Железо
от: 1 видеокарта
Можно в коммерциюПодробнее
Модерация и безопасностьRUGGUF2025

Qwen3Guard

Alibaba (Qwen) · Китай

Фильтры безопасности на 119 языков, русский в их числе. Версия Stream проверяет ответ бота прямо во время его генерации и может оборвать его на лету.

  • Фильтр запросов к боту на русском
  • Остановка опасного ответа во время генерации
  • Разметка сообщений по категориям риска
Размеры
0.6B – 8B
Железо
от: Ноутбук
Можно в коммерциюПодробнее
Модерация и безопасностьOllama2023–2025

Llama Guard

Meta · США

Модели-фильтры, которые проверяют запросы к чат-боту и его ответы на опасные темы по списку категорий. Версия 4 проверяет и картинки. Русский официально не заявлен.

  • Проверка вопросов пользователей к боту
  • Проверка ответов бота перед отправкой
  • Отчёт, какая категория правил нарушена
Размеры
1B – 12B
Железо
от: Ноутбук
Коммерция с условиямиПодробнее
Модерация и безопасность2024–2025

Prompt Guard

Meta · США

Крошечные классификаторы, которые ловят попытки взломать бота: промпт-инъекции и обход правил. Версия 86M многоязычная, 22M только английский.

  • Защита бота от промпт-инъекций
  • Проверка писем и документов, которые попадают в ИИ-агента
  • Быстрый фильтр перед большой моделью
Размеры
22M – 86M
Железо
от: Ноутбук
Коммерция с условиямиПодробнее
Модерация и безопасность2023–2025

NSFW-классификаторы (Falconsai, Freepik)

Falconsai и Freepik · США и Испания

Небольшие модели, которые отличают откровенные картинки от обычных. Freepik различает четыре уровня откровенности. Работают на процессоре.

  • Фильтр пользовательских фото и аватаров
  • Проверка картинок от генераторов перед публикацией
  • Разметка медиатеки
Размеры
86M
Железо
от: Ноутбук
Можно в коммерциюПодробнее
Модерация и безопасностьOllama2024–2025

ShieldGemma

Google · США

Фильтры на базе Gemma: проверяют текст на опасный и оскорбительный контент, а ShieldGemma 2 проверяет картинки. Ориентированы на английский.

  • Модерация сообщений пользователей
  • Проверка ответов бота
  • Проверка сгенерированных картинок перед публикацией
Размеры
2B – 27B
Железо
от: Ноутбук
Коммерция с условиямиПодробнее
Кибербезопасность2024

Phishing Email Detection DistilBERT

cybersectony · не раскрыта

Очень лёгкий классификатор писем и ссылок на признаки фишинга. Ошибается в обе стороны, поэтому спорные письма всё равно смотрит человек.

  • Отметка подозрительных входящих писем
  • Проверка ссылок из переписки перед переходом
  • Фильтр первого уровня в почтовом шлюзе
Размеры
около 66M
Железо
от: Ноутбук
Можно в коммерциюПодробнее
Модерация и безопасность2024

Piiranha

iiiorg · не указана

Популярный детектор 17 типов персональных данных на шести европейских языках. Русского нет, лицензия некоммерческая — подходит для проб и исследований.

  • Поиск персональных данных в текстах
  • Сравнение качества детекторов PII
Размеры
278M
Железо
от: Ноутбук
Только некоммерческоеПодробнее
Модерация и безопасностьGGUFНе развивается2024

WildGuard

Ai2 (Allen Institute for AI) · США

Открытый фильтр Ai2: одним проходом определяет, опасен ли запрос, опасен ли ответ и не отказал ли бот зря. Работает на английском.

  • Проверка запросов к боту
  • Проверка ответов бота
  • Поиск лишних отказов бота на безобидные вопросы
Размеры
7B
Железо
от: 1 видеокарта
Можно в коммерциюПодробнее
Разбор текстаRUНе развивается2022–2023

Русские классификаторы токсичности и тональности

Давид Дале (cointegrated) и сообщество · Россия

Готовые крошечные модели на rubert-tiny для русского текста: находят грубость и оскорбления, определяют тональность и эмоции. Работают на процессоре за миллисекунды.

  • Фильтр оскорблений в чатах и комментариях на русском
  • Разметка отзывов на позитив, нейтрал и негатив
  • Поиск раздражённых клиентов в обращениях
Размеры
12M – 29M
Железо
от: Ноутбук
Коммерция с условиямиПодробнее

Подборки

Нужна модель под вашу задачу?

Открытую модель можно поставить на свой сервер: данные не уходят в чужое облако, нет оплаты за каждый запрос, модель можно дообучить на ваших документах.

  1. ПодберуМодель и размер под задачу и бюджет на железо
  2. ПоставлюНа ваш сервер или в закрытый контур, с API
  3. ДообучуНа ваших данных или подключу базу знаний
  4. ВстроюВ CRM, 1С, бота, сайт или рабочий чат
Обсудить внедрение