Лица2021–2026
InsightFace (deepinsight) · Китай
Самый распространённый открытый набор для поиска и распознавания лиц. На нём стоят многие генераторы с сохранением лица. Готовые веса некоммерческие.
- Поиск и сравнение лиц на фото
- Пропуск по лицу в прототипах
- Обработка лиц как часть других ИИ-систем
- Размеры
- пакеты 16 МБ – 407 МБ
- Железо
- от: Ноутбук
3D2024–2026
NAVER LABS Europe · Франция (NAVER, Южная Корея)
Семейство, с которого началась 3D-реконструкция «в один проход» по паре или набору фото без калибровки камер. MASt3R добавил сопоставление точек и масштаб, MUSt3R и BLASt3R — работу с видео.
- 3D-сцена по нескольким фото без калибровки
- Сопоставление точек между снимками
- Построение карты по видео (SLAM)
- Размеры
- 0.57B – 0.69B
- Железо
- от: Ноутбук
Автономное вождение2020–2026
comma.ai · США
Открытая система помощи водителю: нейросеть по камере держит полосу и управляет скоростью, плюс модель контроля внимания водителя. Модели лежат прямо в репозитории и обновляются постоянно.
- Исследовательский стенд систем помощи водителю
- Изучение контроля внимания водителя по камере в салоне
- Сравнение со своими алгоритмами удержания полосы
- Размеры
- компактная, рассчитана на бортовое устройство
- Железо
- от: Ноутбук
Детекция подделок2023–2026
Adobe Research и University of Surrey · США
Водяной знак для картинок любого разрешения, сделанный для инициативы Content Authenticity: умеет и ставить метку, и снимать её. Детектор ошибается в обе стороны — вывод проверяет человек.
- Пометка изображений на выходе из своего пайплайна
- Проверка происхождения присланной картинки
- Связка с метаданными о происхождении контента
- Размеры
- варианты моделей Q и P, разная ёмкость метки
- Железо
- от: Ноутбук
Компьютерное зрение2024–2026
Microsoft Research · США
Восстанавливает 3D-геометрию сцены по одной фотографии: глубину в метрах, облако точек и нормали поверхностей.
- Замеры помещений и объектов по фото
- 3D-облако точек из снимка
- Подготовка данных для роботов и AR
- Размеры
- ViT-S – ViT-G
- Железо
- от: Ноутбук
Детекция подделок2025–2026
University of Michigan · США
Лёгкий детектор сгенерированных картинок, обученный на 2,7 млн примеров почти от 5000 разных генераторов. Ошибается в обе стороны: результат — повод для проверки человеком, а не доказательство.
- Проверка присланных фото и иллюстраций
- Фильтрация ИИ-картинок в потоке контента
- Разметка подозрительных изображений для ручной проверки
- Размеры
- 22M
- Железо
- от: Ноутбук
Детекция подделок2023–2026
University of Wisconsin-Madison · США
Ранний и до сих пор используемый подход: поверх замороженного CLIP обучается простой классификатор, который переносится на незнакомые генераторы. Ошибается в обе стороны — вывод требует проверки человеком.
- Проверка изображений от новых, незнакомых генераторов
- Базовая линия при сравнении детекторов
- Быстрое внедрение проверки без дообучения крупной модели
- Размеры
- линейный классификатор поверх CLIP ViT-L/14
- Железо
- от: Ноутбук
Компьютерное зрение2025–2026
Roboflow · США
Детектор объектов в реальном времени, открытая замена YOLO без AGPL. Умеет сегментацию (контуры объектов), с 2026 года — ключевые точки.
- Детекция объектов на видео и фото
- Точные контуры деталей и дефектов
- Дообучение под свои классы объектов
- Размеры
- Nano – 2XL
- Железо
- от: Ноутбук
Картинка + текст2023–2026
Shanghai AI Lab (OpenGVLab) · Китай
Семейство моделей для видео: энкодеры для поиска и классификации роликов и чат-модели, которые разбирают длинные видео. InternVideo 3 рассчитан на многочасовые записи.
- Поиск по видеоархиву текстовым запросом
- Распознавание действий на видео
- Ответы на вопросы по длинной записи
- Размеры
- малые энкодеры – 9B
- Железо
- от: Ноутбук
3D2025–2026
Meta и Оксфордский университет (VGG) · США / Великобритания
Восстанавливает 3D-сцену по одной, нескольким или сотням фотографий за секунды: положение камер, глубину и облако точек. Лучшая статья CVPR 2025.
- 3D-модель помещения или объекта по серии фото
- Определение положения камер для фотограмметрии
- Облако точек для обмеров и сравнения с планом
- Размеры
- около 1.2B
- Железо
- от: 1 видеокарта
Компьютерное зрение2024–2026
Meta · США
Модели Meta для анализа человека на фото: ключевые точки позы, разметка частей тела, нормали и глубина. Sapiens2 обучены на высоком разрешении и добавили маттинг людей.
- Определение позы и ключевых точек тела
- Разметка частей тела и одежды
- Отделение человека от фона
- Размеры
- 0.1B – 5B
- Железо
- от: Ноутбук
Компьютерное зрение2023–2026
Meta · США
Выделяет любой объект на фото и видео по клику или рамке. Основа для удаления фона и подсчёта объектов.
- Удаление фона с фото товара
- Подсчёт объектов на фото
- Разметка данных для обучения
- Размеры
- 91M – ~0,85B
- Железо
- от: Ноутбук
Компьютерное зрение2023–2026
Ultralytics · США
Самый распространённый детектор объектов в реальном времени: находит и выделяет предметы на видео даже на слабом железе. YOLOv5 вышел ещё в 2020, в каталоге отсчёт от YOLOv8.
- Подсчёт людей, машин, товаров на видео
- Контроль касок и спецодежды
- Поиск брака на конвейере
- Размеры
- 2.4M – 68M
- Железо
- от: Ноутбук
Компьютерное зрениеGGUF2024–2025
ByteDance и Гонконгский университет · Китай
Определяет глубину — расстояние до каждой точки — по одной обычной фотографии или видео. DA3 восстанавливает геометрию сцены с нескольких кадров.
- Оценка расстояний и объёмов по камере
- Эффекты глубины для фото и видео
- Навигация роботов и дронов
- Размеры
- 25M – 1.4B
- Железо
- от: Ноутбук
3D2025
Meta и Университет Карнеги — Меллон · США
Одна модель собирает метрическую 3D-реконструкцию из фото, а если есть данные о камерах, глубине или позах — учитывает и их. Есть версия весов под Apache 2.0.
- 3D-реконструкция объекта или помещения по фото
- Экспорт сцены в формат COLMAP для дальнейшей обработки
- Оценка глубины и положения камер
- Размеры
- около 1.2B
- Железо
- от: 1 видеокарта
3D2025
Shanghai AI Lab · Китай
Восстанавливает 3D-сцену и положения камер по набору фото или видео, не опираясь на «опорный» кадр. Pi3X даёт более гладкие облака точек и примерный масштаб в метрах.
- 3D-реконструкция сцены по видео
- Оценка положения камеры по кадрам
- Облака точек для исследований и прототипов
- Размеры
- 0.96B – 1.4B
- Железо
- от: 1 видеокарта
3D2025
Tencent Hunyuan · Китай
Генерирует 3D-анимацию движения человека по текстовому описанию: скелетная анимация сразу подходит для 3D-редакторов и игровых движков. Понимает английский и китайский.
- Анимация персонажа по текстовому описанию
- Черновая анимация для игр и роликов
- Библиотека движений для аватаров
- Размеры
- 0.46B – 1B
- Железо
- от: 1 видеокарта
Компьютерное зрение2025
Meta · США
Семейство энкодеров Meta для картинок и видео, а с версией PE-AV — и для звука. PE-Core ищет по тексту точнее SigLIP 2 (по данным Meta), есть малые версии.
- Поиск фото и видео по описанию
- Разметка и теги каталога
- Поиск по звуку и видео (PE-AV)
- Размеры
- размер на карточке не указан
- Железо
- от: Ноутбук
3DGGUF2025
Meta · США
Восстанавливает 3D-форму предмета или тела человека по одной обычной фотографии, даже если объект частично закрыт. Две модели: Objects и Body.
- 3D-модель предмета с фото из каталога
- Оценка позы и формы тела по фото
- Примерка и AR-сценарии
- Размеры
- н/д
- Железо
- от: 1 видеокарта
Компьютерное зрение2023–2025
Meta · США
Открытый повтор CLIP от Meta с прозрачным рецептом сбора данных. MetaCLIP 2 обучен на многоязычных данных со всего мира. Только некоммерческая лицензия.
- Поиск картинок по тексту
- Классификация изображений без обучения
- Исследования и прототипы поиска
- Размеры
- 0.15B – 3.6B
- Железо
- от: Ноутбук
Компьютерное зрение2023–2025
IDEA Research · Китай
Находит на картинке любые объекты по текстовому описанию, без обучения на своих данных: «красная коробка», «человек без каски». Rex-Omni — новое поколение на базе VLM.
- Поиск объектов по описанию без разметки
- Автоматическая разметка данных для обучения
- Проверка фото на соответствие требованиям
- Размеры
- 172M – 3B
- Железо
- от: Ноутбук
Компьютерное зрение2023–2025
Meta · США
Базовые модели, которые превращают картинку в числовой «отпечаток». На них строят поиск похожих изображений, классификацию и сегментацию без большой разметки.
- Поиск похожих товаров и фото
- Классификация изображений на малых данных
- Основа для своих моделей контроля качества
- Размеры
- 21M – 7B
- Железо
- от: Ноутбук
Лица2025
ByteDance · Китай
Распознавание лиц на трансформерах от ByteDance, одна из самых точных открытых моделей по тестам. Веса опубликованы в формате ONNX, но некоммерческие.
- Сравнение лиц и поиск по базе фотографий
- Исследование точности распознавания
- Прототипы систем доступа
- Размеры
- ViT-T – ViT-L
- Железо
- от: Ноутбук
Детекция подделок2023–2025
The Chinese University of Hong Kong, Shenzhen (SCLBD) · Китай
Набор из десятков открытых детекторов подмены лица на видео и фото под общим кодом и с готовыми весами. Детектор ошибается в обе стороны: его вывод — повод для проверки человеком, а не доказательство подделки.
- Первичная проверка присланного видео или селфи
- Сравнение нескольких детекторов на своих данных
- Дообучение детектора под свой поток заявок
- Размеры
- детекторы уровня Xception и EfficientNet, десятки миллионов параметров
- Железо
- от: Ноутбук
Медицина2025
Google · США
Лёгкий кодировщик медицинских снимков и текста от Google, тот же, что внутри MedGemma. Сортирует и ищет похожие снимки. Не заменяет врача, решения принимает специалист.
- Поиск похожих снимков в архиве клиники
- Предварительная сортировка снимков для врача
- Основа для своих классификаторов снимков
- Размеры
- около 0.9B
- Железо
- от: Ноутбук
Обработка фотоGGUF2024–2025
Нанькайский университет · Китай
Открытая модель точного выделения объекта и удаления фона под лицензией MIT. На ней построен RMBG-2.0. Есть версии для 2K и для волос и полупрозрачных краёв.
- Удаление фона с фото товаров потоком
- Точные маски для дизайна и печати
- Вырезка людей с волосами для рекламы
- Размеры
- около 220M (есть облегчённые lite)
- Железо
- от: Ноутбук
Детекция подделок2024–2025
Meta · США
Водяной знак для картинок, который можно поставить на отдельные участки: модель показывает, какая часть изображения помечена. Ошибается в обе стороны — итог проверяет человек.
- Пометка сгенерированных и отредактированных изображений
- Поиск помеченного фрагмента в коллаже
- Отслеживание, какие части картинки сделал ИИ
- Размеры
- кодировщик и декодировщик метки для изображений
- Железо
- от: Ноутбук
Детекция подделок2024–2025
Xiaohongshu, USTC и Shanghai Jiao Tong University · Китай
Детектор ИИ-картинок из нескольких экспертов: одни смотрят на визуальные артефакты, другие на шум. Вместе с ним выпущен сложный набор Chameleon. Ошибается в обе стороны — итог проверяет человек.
- Проверка реалистичных ИИ-изображений без явных артефактов
- Сравнение детекторов на сложных примерах
- Дообучение под свой тип контента
- Размеры
- несколько экспертов на базе ConvNeXt и CLIP
- Железо
- от: 1 видеокарта
Детекция подделок2022–2025
GRIP, University Federico II of Naples · Италия
Ищет следы монтажа и показывает картой, какие участки изображения выглядят изменёнными: подходит для сканов договоров, справок и фото документов. Ошибается в обе стороны — решение принимает человек.
- Проверка сканов справок и договоров на правку
- Подсветка изменённых участков фото для эксперта
- Отсев явно перерисованных документов до ручной проверки
- Размеры
- трансформерная модель с картой подозрительных областей
- Железо
- от: 1 видеокарта
Модерация и безопасность2023–2025
Falconsai и Freepik · США и Испания
Небольшие модели, которые отличают откровенные картинки от обычных. Freepik различает четыре уровня откровенности. Работают на процессоре.
- Фильтр пользовательских фото и аватаров
- Проверка картинок от генераторов перед публикацией
- Разметка медиатеки
- Размеры
- 86M
- Железо
- от: Ноутбук
Компьютерное зрение2023–2025
Google · США
Модели, которые переводят картинки и текст в общее пространство: можно искать фото по словам и классифицировать изображения без обучения. CLIP от OpenAI (2021) — предшественник.
- Поиск картинок по текстовому запросу
- Автоматическая разметка и теги каталога
- Фильтрация недопустимого контента
- Размеры
- около 0.2B – 2B
- Железо
- от: Ноутбук
Агенты для компьютера2024–2025
Microsoft · США
Разбирает скриншот на кнопки, поля и иконки с подписями, чтобы обычная языковая модель понимала экран и могла им управлять. Сам не кликает, а служит «глазами» агента.
- Разметка экранов старых программ для автоматизации
- Подготовка агента к работе в интерфейсе
- Проверка, что на экране есть нужные элементы
- Размеры
- менее 1B (детектор + подписи)
- Железо
- от: Ноутбук
Медицина2024–2025
Bioptimus · Франция
Базовые модели патологии французской Bioptimus на 1,1B параметров, плюс компактная H0-mini. Первая версия открыта под Apache 2.0. Не заменяет врача, решения принимает специалист.
- Признаки участков гистологических стекол для исследовательских моделей
- Прототип сортировки препаратов по типу ткани
- Научные проекты по связи морфологии и молекулярных данных
- Размеры
- 86M (H0-mini) – 1,1B
- Железо
- от: Ноутбук
Компьютерное зрение2022–2025
Сиднейский университет и JD Explore Academy · Австралия / Китай
Простая и точная модель определения позы человека по ключевым точкам. Версия ViTPose++ умеет позы людей, животных и всего тела; встроена в библиотеку Transformers.
- Ключевые точки тела на фото и видео
- Анализ движений в спорте и реабилитации
- Контроль рабочих поз и техники безопасности
- Размеры
- 33M – около 1B
- Железо
- от: Ноутбук
Медицина2024–2025
Mahmood Lab (Mass General Brigham, Гарвард) · США
Базовая модель для гистологических препаратов: превращает участки цифровых стекол в признаки для классификации тканей. Не заменяет врача, решения принимает специалист.
- Исследовательские классификаторы типов тканей по цифровым стеклам
- Поиск похожих случаев в архиве препаратов
- Подготовка признаков для научных моделей прогноза
- Размеры
- около 300M (UNI) – около 680M (UNI2-h)
- Железо
- от: Ноутбук
Медицина2024
Mahmood Lab (Mass General Brigham, Гарвард) · США
Модели «картинка + текст» для патологии: поиск препаратов по описанию на английском, классификация без дообучения, TITAN описывает целое стекло. Не заменяет врача, решения принимает специалист.
- Поиск по архиву стекол по текстовому запросу для исследований
- Черновые описания препаратов для научных проектов
- Классификация тканей без разметки на старте исследования
- Размеры
- около 160M – 300M
- Железо
- от: Ноутбук
МедицинаНе развивается2024
Paige · США
Базовая модель патологии от Paige, обученная на миллионах цифровых стекол. Первая версия под Apache 2.0, вторая только для науки. Не заменяет врача, решения принимает специалист.
- Признаки участков стекол для исследовательских классификаторов
- Отбор препаратов для пересмотра в научных проектах
- Сравнение с другими моделями патологии на своём архиве
- Размеры
- около 632M
- Железо
- от: Ноутбук
Картинка + текстНе развивается2024
Microsoft · США
Очень маленькая модель зрения: подписи, поиск объектов, сегментация и чтение текста по одной команде. Работает даже на процессоре.
- Чтение текста на фото
- Поиск и выделение объектов
- Автоматические подписи к фото
- Размеры
- 0.23B – 0.77B
- Железо
- от: Ноутбук
Детекция подделокНе развивается2023–2024
Sichuan University и соавторы · Китай
Открытая модель поиска подделок в изображениях: выдаёт попиксельную маску изменённых участков. Ошибается в обе стороны, её карта — подсказка эксперту, а не доказательство подделки.
- Поиск вклеенных и затёртых фрагментов на фото
- Проверка сканов документов на правку
- Базовая линия при сравнении моделей поиска монтажа
- Размеры
- модель на базе Vision Transformer
- Железо
- от: 1 видеокарта
Компьютерное зрениеНе развивается2021–2022
OpenAI · США
Модель 2021 года, которая первой связала картинки и текст: поиск фото по словам и классификация без обучения. Понимает только английский, сейчас чаще берут SigLIP 2 или PE.
- Поиск картинок по текстовому запросу
- Автоматические теги для каталога
- Поиск похожих изображений
- Размеры
- около 0.15B – 0.6B
- Железо
- от: Ноутбук
Компьютерное зрениеНе развивается2022
Microsoft · США
По картинке определяет, что за документ перед ней: резюме, диплом, справка, договор. Помогает раскладывать пакеты файлов от кандидатов по типам. Решение о кандидате принимает человек, автоматический отбор без проверки использовать нельзя.
- Сортировка входящих документов кандидатов по типам
- Проверка комплектности пакета документов
- Поиск нужного скана в архиве
- Размеры
- версии base и large
- Железо
- от: Ноутбук
Компьютерное зрениеRUНе развивается2022
Сбер AI и SberDevices (ai-forever) · Россия
Русская версия CLIP: сопоставляет картинки и подписи на русском. Позволяет искать фото по описанию и раскладывать изображения по категориям без обучения.
- Поиск товаров по фото и по русскому описанию
- Сортировка картинок по категориям без разметки
- Проверка соответствия фото и подписи
- Размеры
- 150M – 430M
- Железо
- от: Ноутбук
Детекция подделокНе развивается2020
MiniVision Technology · Китай
Практически единственный полностью открытый набор весов для проверки живого лица по одному кадру: отличает человека от фото, экрана или маски. Ошибается в обе стороны — отказ должен уметь оспорить человек.
- Проверка живого лица при входе по селфи
- Защита пропускной системы от фото на телефоне
- Проверка при удалённой идентификации клиента
- Размеры
- две модели примерно по 1,8 МБ
- Железо
- от: Ноутбук