Открытые модели для проверки фактов и оценки ответов ИИ

Модели-оценщики проверяют ответы других нейросетей: ищут выдуманные факты, сверяют ответ с источником и ставят оценку качества. Их используют для контроля чат-ботов и ассистентов перед запуском и в работе. Смотрите, по каким критериям модель оценивает, как работает на русском и что разрешает лицензия.

В подборке 12 семейств открытых моделей.Обновлено 22.09.2026Открыть весь каталог с фильтрами
Проверка фактов и оценка ответовRU2025–2026

POLLUX Judge (ai-forever)

SberDevices (ai-forever) · Россия

Модели-судьи для оценки ответов других нейросетей на русском языке: ставят балл по заданному критерию и объясняют оценку текстом.

  • Автоматическая проверка качества ответов чат-бота на русском
  • Сравнение нескольких моделей перед выбором
  • Контроль ответов после дообучения
Размеры
4B – 32B
Железо
от: Ноутбук
Можно в коммерциюПодробнее
Проверка фактов и оценка ответов2024–2025

CompassJudger / CompassVerifier

OpenCompass (Шанхайская лаборатория ИИ) · Китай

Линейка судей от команды открытых тестов моделей: оценивают ответы и сверяют их с эталоном. Судья сам ошибается, на важных задачах ручную проверку он не заменяет.

  • Оценка ответов моделей по заданным критериям
  • Сверка ответа с эталонным решением
  • Сравнение нескольких моделей на своих данных
Размеры
1.5B – 32B
Железо
от: Ноутбук
Можно в коммерциюПодробнее
Проверка фактов и оценка ответов2024–2025

Skywork-Reward

Skywork (Kunlun Tech) · Китай

Модели-оценщики: ставят балл ответу языковой модели, насколько он хорош для пользователя. Нужны для дообучения своих моделей и отбора лучшего из нескольких ответов.

  • Выбор лучшего из нескольких ответов бота
  • Оценка качества ответов при дообучении модели
  • Сравнение моделей перед внедрением
Размеры
0.6B – 27B
Железо
от: Ноутбук
Коммерция с условиямиПодробнее
Проверка фактов и оценка ответовRU2024–2025

Nemotron Reward / GenRM

NVIDIA · США

Крупные оценщики NVIDIA для отбора и дообучения ответов. У мультиязычной версии GenRM в списке языков есть русский. Оценщик сам ошибается и ручную проверку на важных задачах не заменяет.

  • Отбор лучшего ответа из нескольких вариантов
  • Подготовка данных для дообучения своей модели
  • Оценка ответов помощника на русском и других языках
Размеры
49B, 70B и 340B
Железо
от: Кластер
Коммерция с условиямиПодробнее
Проверка фактов и оценка ответов2025

Atla Selene

Atla · Великобритания

Модель-судья на 8B: оценивает ответ другой модели по вашим критериям и пишет обоснование. Судья сам ошибается, на важных задачах ручную проверку он не заменяет.

  • Оценка ответов чат-бота по своим критериям
  • Сравнение двух версий подсказки или модели
  • Отбраковка слабых ответов перед отправкой человеку
Размеры
8B
Железо
от: 1 видеокарта
Коммерция с условиямиПодробнее
Проверка фактов и оценка ответов2024

GLIDER (Patronus)

Patronus AI · США

Небольшой судья: ставит оценку по вашим критериям и показывает, какой кусок ответа к ней привёл. Лицензия некоммерческая. Судья сам ошибается и ручную проверку не заменяет.

  • Оценка ответов по своим критериям с пояснением
  • Разбор, за что снижена оценка
  • Массовая проверка диалогов помощника
Размеры
3.8B (на базе Phi-3.5-mini)
Железо
от: Ноутбук
Только некоммерческоеПодробнее
Проверка фактов и оценка ответов2024

Flow Judge

Flow AI · не раскрыта

Маленькая модель-судья: проверяет ответ по вашей инструкции и ставит оценку с пояснением. Помещается на скромный сервер. Судья сам ошибается и ручную проверку не заменяет.

  • Проверка ответов ИИ-помощника на соответствие инструкции
  • Массовая оценка выгрузки диалогов
  • Контроль качества перед выкаткой изменений
Размеры
3.8B (на базе Phi-3.5-mini)
Железо
от: Ноутбук
Можно в коммерциюПодробнее
Проверка фактов и оценка ответовOllamaНе развивается2024

MiniCheck

UT Austin и Bespoke Labs · США

Проверяет, подтверждается ли каждое утверждение в ответе ИИ исходными документами. Малые версии свободные, старшая 7B есть в Ollama, но некоммерческая.

  • Проверка ответов RAG-бота по документам
  • Поиск неподтверждённых утверждений в отчётах и пересказах
  • Автоматический контроль качества ИИ-ответов
Размеры
0.4B – 7B
Железо
от: Ноутбук
Коммерция с условиямиПодробнее
Проверка фактов и оценка ответовНе развивается2023–2024

HHEM (Vectara)

Vectara · США

Маленькая модель, которая проверяет, опирается ли ответ ИИ на исходный текст или выдуман. Работает на процессоре, удобна как фильтр в RAG-системах.

  • Проверка ответов чат-бота по базе знаний на выдумки
  • Контроль качества пересказов документов
  • Сравнение языковых моделей по склонности к ошибкам
Размеры
110M
Железо
от: Ноутбук
Можно в коммерциюПодробнее
Проверка фактов и оценка ответовНе развивается2024

Patronus Lynx

Patronus AI · США

Проверяет, не придумал ли чат-бот факт, которого нет в исходных документах. Лицензия некоммерческая. Проверяющая модель сама ошибается и ручную проверку на важных задачах не заменяет.

  • Поиск выдуманных фактов в ответах ИИ-помощника
  • Проверка ответов на опору в приложенных документах
  • Отбраковка ответов перед отправкой клиенту
Размеры
8B и 70B
Железо
от: 1 видеокарта
Только некоммерческоеПодробнее
Проверка фактов и оценка ответовНе развивается2024

ArmoRM (RLHFlow)

RLHFlow · США

Оценщик ответов, который выдаёт не один общий балл, а разбор сразу по нескольким признакам. Оценщик сам ошибается и ручную проверку на важных задачах не заменяет.

  • Отбор лучшего из нескольких вариантов ответа
  • Подготовка данных для дообучения модели
  • Оценка ответов помощника по нескольким признакам
Размеры
8B
Железо
от: 1 видеокарта
Коммерция с условиямиПодробнее
Проверка фактов и оценка ответовНе развивается2023–2024

Prometheus 2

KAIST и LG AI Research (prometheus-eval) · Южная Корея

Открытая модель-судья: оценивает ответы других моделей по вашим критериям и объясняет оценку. Замена платным моделям в роли проверяющего.

  • Оценка ответов чат-бота по своей шкале
  • Сравнение двух вариантов ответа
  • Проверка качества перед запуском ИИ-сервиса
Размеры
7B – 8x7B
Железо
от: Ноутбук
Можно в коммерциюПодробнее

Подборки

Нужна модель под вашу задачу?

Открытую модель можно поставить на свой сервер: данные не уходят в чужое облако, нет оплаты за каждый запрос, модель можно дообучить на ваших документах.

  1. ПодберуМодель и размер под задачу и бюджет на железо
  2. ПоставлюНа ваш сервер или в закрытый контур, с API
  3. ДообучуНа ваших данных или подключу базу знаний
  4. ВстроюВ CRM, 1С, бота, сайт или рабочий чат
Обсудить внедрение