Проверка фактов и оценка ответовRU2025–2026
SberDevices (ai-forever) · Россия
Модели-судьи для оценки ответов других нейросетей на русском языке: ставят балл по заданному критерию и объясняют оценку текстом.
- Автоматическая проверка качества ответов чат-бота на русском
- Сравнение нескольких моделей перед выбором
- Контроль ответов после дообучения
- Размеры
- 4B – 32B
- Железо
- от: Ноутбук
Проверка фактов и оценка ответов2024–2025
OpenCompass (Шанхайская лаборатория ИИ) · Китай
Линейка судей от команды открытых тестов моделей: оценивают ответы и сверяют их с эталоном. Судья сам ошибается, на важных задачах ручную проверку он не заменяет.
- Оценка ответов моделей по заданным критериям
- Сверка ответа с эталонным решением
- Сравнение нескольких моделей на своих данных
- Размеры
- 1.5B – 32B
- Железо
- от: Ноутбук
Проверка фактов и оценка ответов2024–2025
Skywork (Kunlun Tech) · Китай
Модели-оценщики: ставят балл ответу языковой модели, насколько он хорош для пользователя. Нужны для дообучения своих моделей и отбора лучшего из нескольких ответов.
- Выбор лучшего из нескольких ответов бота
- Оценка качества ответов при дообучении модели
- Сравнение моделей перед внедрением
- Размеры
- 0.6B – 27B
- Железо
- от: Ноутбук
Проверка фактов и оценка ответовRU2024–2025
NVIDIA · США
Крупные оценщики NVIDIA для отбора и дообучения ответов. У мультиязычной версии GenRM в списке языков есть русский. Оценщик сам ошибается и ручную проверку на важных задачах не заменяет.
- Отбор лучшего ответа из нескольких вариантов
- Подготовка данных для дообучения своей модели
- Оценка ответов помощника на русском и других языках
- Размеры
- 49B, 70B и 340B
- Железо
- от: Кластер
Проверка фактов и оценка ответов2025
Atla · Великобритания
Модель-судья на 8B: оценивает ответ другой модели по вашим критериям и пишет обоснование. Судья сам ошибается, на важных задачах ручную проверку он не заменяет.
- Оценка ответов чат-бота по своим критериям
- Сравнение двух версий подсказки или модели
- Отбраковка слабых ответов перед отправкой человеку
- Размеры
- 8B
- Железо
- от: 1 видеокарта
Проверка фактов и оценка ответов2024
Patronus AI · США
Небольшой судья: ставит оценку по вашим критериям и показывает, какой кусок ответа к ней привёл. Лицензия некоммерческая. Судья сам ошибается и ручную проверку не заменяет.
- Оценка ответов по своим критериям с пояснением
- Разбор, за что снижена оценка
- Массовая проверка диалогов помощника
- Размеры
- 3.8B (на базе Phi-3.5-mini)
- Железо
- от: Ноутбук
Проверка фактов и оценка ответов2024
Flow AI · не раскрыта
Маленькая модель-судья: проверяет ответ по вашей инструкции и ставит оценку с пояснением. Помещается на скромный сервер. Судья сам ошибается и ручную проверку не заменяет.
- Проверка ответов ИИ-помощника на соответствие инструкции
- Массовая оценка выгрузки диалогов
- Контроль качества перед выкаткой изменений
- Размеры
- 3.8B (на базе Phi-3.5-mini)
- Железо
- от: Ноутбук
Проверка фактов и оценка ответовOllamaНе развивается2024
UT Austin и Bespoke Labs · США
Проверяет, подтверждается ли каждое утверждение в ответе ИИ исходными документами. Малые версии свободные, старшая 7B есть в Ollama, но некоммерческая.
- Проверка ответов RAG-бота по документам
- Поиск неподтверждённых утверждений в отчётах и пересказах
- Автоматический контроль качества ИИ-ответов
- Размеры
- 0.4B – 7B
- Железо
- от: Ноутбук
Проверка фактов и оценка ответовНе развивается2023–2024
Vectara · США
Маленькая модель, которая проверяет, опирается ли ответ ИИ на исходный текст или выдуман. Работает на процессоре, удобна как фильтр в RAG-системах.
- Проверка ответов чат-бота по базе знаний на выдумки
- Контроль качества пересказов документов
- Сравнение языковых моделей по склонности к ошибкам
- Размеры
- 110M
- Железо
- от: Ноутбук
Проверка фактов и оценка ответовНе развивается2024
Patronus AI · США
Проверяет, не придумал ли чат-бот факт, которого нет в исходных документах. Лицензия некоммерческая. Проверяющая модель сама ошибается и ручную проверку на важных задачах не заменяет.
- Поиск выдуманных фактов в ответах ИИ-помощника
- Проверка ответов на опору в приложенных документах
- Отбраковка ответов перед отправкой клиенту
- Размеры
- 8B и 70B
- Железо
- от: 1 видеокарта
Проверка фактов и оценка ответовНе развивается2024
RLHFlow · США
Оценщик ответов, который выдаёт не один общий балл, а разбор сразу по нескольким признакам. Оценщик сам ошибается и ручную проверку на важных задачах не заменяет.
- Отбор лучшего из нескольких вариантов ответа
- Подготовка данных для дообучения модели
- Оценка ответов помощника по нескольким признакам
- Размеры
- 8B
- Железо
- от: 1 видеокарта
Проверка фактов и оценка ответовНе развивается2023–2024
KAIST и LG AI Research (prometheus-eval) · Южная Корея
Открытая модель-судья: оценивает ответы других моделей по вашим критериям и объясняет оценку. Замена платным моделям в роли проверяющего.
- Оценка ответов чат-бота по своей шкале
- Сравнение двух вариантов ответа
- Проверка качества перед запуском ИИ-сервиса
- Размеры
- 7B – 8x7B
- Железо
- от: Ноутбук