Модели модерации проверяют сообщения, отзывы и ответы чат-ботов на токсичность, запрещённые темы и попытки обойти ограничения. Их ставят фильтром перед публикацией контента или перед ответом ассистента. Смотрите, какие категории нарушений модель различает, насколько хорошо работает на русском и можно ли настроить правила под себя.
Европейские модели с упором на скорость. Mixtral — одна из первых открытых моделей на архитектуре «смесь экспертов»; есть версии с картинками (Pixtral, Medium 3.5), для доказательств в Lean и модерации (Shieldstral).
Сообщество GLiNER (Fastino, Knowledgator, NVIDIA и др.) · США
Маленькие модели на основе GLiNER для поиска персональных данных: паспортов, телефонов, счетов, адресов. Типы данных задаются словами. Русский официально не заявлен.
Маскирование персональных данных перед облачным ИИ
Фильтры контента NVIDIA для ботов, с отдельными моделями для контроля темы разговора и поиска взлома. Safety Guard v3 обучена на 9 языках, русский проверяли только без дообучения.
Находит и скрывает персональные данные: имена, адреса, телефоны, почту, номера счетов, пароли. Работает даже в браузере. Обучена в основном на английском.
Очистка текста от персональных данных перед отправкой в облачный ИИ
Модели-фильтры, которые проверяют запросы к чат-боту и его ответы на опасные темы по списку категорий. Версия 4 проверяет и картинки. Русский официально не заявлен.
Популярный детектор 17 типов персональных данных на шести европейских языках. Русского нет, лицензия некоммерческая — подходит для проб и исследований.
Готовые крошечные модели на rubert-tiny для русского текста: находят грубость и оскорбления, определяют тональность и эмоции. Работают на процессоре за миллисекунды.
Фильтр оскорблений в чатах и комментариях на русском
Открытую модель можно поставить на свой сервер: данные не уходят в чужое облако, нет оплаты за каждый запрос, модель можно дообучить на ваших документах.
ПодберуМодель и размер под задачу и бюджет на железо
ПоставлюНа ваш сервер или в закрытый контур, с API