Открытые модели компьютерного зрения

Модели компьютерного зрения находят, выделяют и считают объекты на фото и видео: людей в зале, товары на полке, дефекты на конвейере. Многие из них лёгкие и работают прямо на камере или небольшом сервере. Смотрите на скорость, возможность дообучить модель на своих данных и условия лицензии.

В подборке 43 семейства открытых моделей.Обновлено 22.09.2026Открыть весь каталог с фильтрами
Лица2021–2026

InsightFace

InsightFace (deepinsight) · Китай

Самый распространённый открытый набор для поиска и распознавания лиц. На нём стоят многие генераторы с сохранением лица. Готовые веса некоммерческие.

  • Поиск и сравнение лиц на фото
  • Пропуск по лицу в прототипах
  • Обработка лиц как часть других ИИ-систем
Размеры
пакеты 16 МБ – 407 МБ
Железо
от: Ноутбук
Только некоммерческоеПодробнее
3D2024–2026

DUSt3R / MASt3R

NAVER LABS Europe · Франция (NAVER, Южная Корея)

Семейство, с которого началась 3D-реконструкция «в один проход» по паре или набору фото без калибровки камер. MASt3R добавил сопоставление точек и масштаб, MUSt3R и BLASt3R — работу с видео.

  • 3D-сцена по нескольким фото без калибровки
  • Сопоставление точек между снимками
  • Построение карты по видео (SLAM)
Размеры
0.57B – 0.69B
Железо
от: Ноутбук
Только некоммерческоеПодробнее
Автономное вождение2020–2026

comma.ai openpilot (supercombo)

comma.ai · США

Открытая система помощи водителю: нейросеть по камере держит полосу и управляет скоростью, плюс модель контроля внимания водителя. Модели лежат прямо в репозитории и обновляются постоянно.

  • Исследовательский стенд систем помощи водителю
  • Изучение контроля внимания водителя по камере в салоне
  • Сравнение со своими алгоритмами удержания полосы
Размеры
компактная, рассчитана на бортовое устройство
Железо
от: Ноутбук
Можно в коммерциюПодробнее
Детекция подделок2023–2026

TrustMark

Adobe Research и University of Surrey · США

Водяной знак для картинок любого разрешения, сделанный для инициативы Content Authenticity: умеет и ставить метку, и снимать её. Детектор ошибается в обе стороны — вывод проверяет человек.

  • Пометка изображений на выходе из своего пайплайна
  • Проверка происхождения присланной картинки
  • Связка с метаданными о происхождении контента
Размеры
варианты моделей Q и P, разная ёмкость метки
Железо
от: Ноутбук
Можно в коммерциюПодробнее
Компьютерное зрение2024–2026

MoGe

Microsoft Research · США

Восстанавливает 3D-геометрию сцены по одной фотографии: глубину в метрах, облако точек и нормали поверхностей.

  • Замеры помещений и объектов по фото
  • 3D-облако точек из снимка
  • Подготовка данных для роботов и AR
Размеры
ViT-S – ViT-G
Железо
от: Ноутбук
Можно в коммерциюПодробнее
Детекция подделок2025–2026

Community Forensics

University of Michigan · США

Лёгкий детектор сгенерированных картинок, обученный на 2,7 млн примеров почти от 5000 разных генераторов. Ошибается в обе стороны: результат — повод для проверки человеком, а не доказательство.

  • Проверка присланных фото и иллюстраций
  • Фильтрация ИИ-картинок в потоке контента
  • Разметка подозрительных изображений для ручной проверки
Размеры
22M
Железо
от: Ноутбук
Можно в коммерциюПодробнее
Детекция подделок2023–2026

UniversalFakeDetect

University of Wisconsin-Madison · США

Ранний и до сих пор используемый подход: поверх замороженного CLIP обучается простой классификатор, который переносится на незнакомые генераторы. Ошибается в обе стороны — вывод требует проверки человеком.

  • Проверка изображений от новых, незнакомых генераторов
  • Базовая линия при сравнении детекторов
  • Быстрое внедрение проверки без дообучения крупной модели
Размеры
линейный классификатор поверх CLIP ViT-L/14
Железо
от: Ноутбук
Можно в коммерциюПодробнее
Компьютерное зрение2025–2026

RF-DETR

Roboflow · США

Детектор объектов в реальном времени, открытая замена YOLO без AGPL. Умеет сегментацию (контуры объектов), с 2026 года — ключевые точки.

  • Детекция объектов на видео и фото
  • Точные контуры деталей и дефектов
  • Дообучение под свои классы объектов
Размеры
Nano – 2XL
Железо
от: Ноутбук
Можно в коммерциюПодробнее
Картинка + текст2023–2026

InternVideo

Shanghai AI Lab (OpenGVLab) · Китай

Семейство моделей для видео: энкодеры для поиска и классификации роликов и чат-модели, которые разбирают длинные видео. InternVideo 3 рассчитан на многочасовые записи.

  • Поиск по видеоархиву текстовым запросом
  • Распознавание действий на видео
  • Ответы на вопросы по длинной записи
Размеры
малые энкодеры – 9B
Железо
от: Ноутбук
Можно в коммерциюПодробнее
3D2025–2026

VGGT

Meta и Оксфордский университет (VGG) · США / Великобритания

Восстанавливает 3D-сцену по одной, нескольким или сотням фотографий за секунды: положение камер, глубину и облако точек. Лучшая статья CVPR 2025.

  • 3D-модель помещения или объекта по серии фото
  • Определение положения камер для фотограмметрии
  • Облако точек для обмеров и сравнения с планом
Размеры
около 1.2B
Железо
от: 1 видеокарта
Коммерция с условиямиПодробнее
Компьютерное зрение2024–2026

Sapiens

Meta · США

Модели Meta для анализа человека на фото: ключевые точки позы, разметка частей тела, нормали и глубина. Sapiens2 обучены на высоком разрешении и добавили маттинг людей.

  • Определение позы и ключевых точек тела
  • Разметка частей тела и одежды
  • Отделение человека от фона
Размеры
0.1B – 5B
Железо
от: Ноутбук
Коммерция с условиямиПодробнее
Компьютерное зрение2023–2026

Segment Anything (SAM)

Meta · США

Выделяет любой объект на фото и видео по клику или рамке. Основа для удаления фона и подсчёта объектов.

  • Удаление фона с фото товара
  • Подсчёт объектов на фото
  • Разметка данных для обучения
Размеры
91M – ~0,85B
Железо
от: Ноутбук
Коммерция с условиямиПодробнее
Компьютерное зрение2023–2026

YOLO (Ultralytics)

Ultralytics · США

Самый распространённый детектор объектов в реальном времени: находит и выделяет предметы на видео даже на слабом железе. YOLOv5 вышел ещё в 2020, в каталоге отсчёт от YOLOv8.

  • Подсчёт людей, машин, товаров на видео
  • Контроль касок и спецодежды
  • Поиск брака на конвейере
Размеры
2.4M – 68M
Железо
от: Ноутбук
Коммерция с условиямиПодробнее
Компьютерное зрениеGGUF2024–2025

Depth Anything

ByteDance и Гонконгский университет · Китай

Определяет глубину — расстояние до каждой точки — по одной обычной фотографии или видео. DA3 восстанавливает геометрию сцены с нескольких кадров.

  • Оценка расстояний и объёмов по камере
  • Эффекты глубины для фото и видео
  • Навигация роботов и дронов
Размеры
25M – 1.4B
Железо
от: Ноутбук
Коммерция с условиямиПодробнее
3D2025

MapAnything

Meta и Университет Карнеги — Меллон · США

Одна модель собирает метрическую 3D-реконструкцию из фото, а если есть данные о камерах, глубине или позах — учитывает и их. Есть версия весов под Apache 2.0.

  • 3D-реконструкция объекта или помещения по фото
  • Экспорт сцены в формат COLMAP для дальнейшей обработки
  • Оценка глубины и положения камер
Размеры
около 1.2B
Железо
от: 1 видеокарта
Можно в коммерциюПодробнее
3D2025

Pi3 (π³)

Shanghai AI Lab · Китай

Восстанавливает 3D-сцену и положения камер по набору фото или видео, не опираясь на «опорный» кадр. Pi3X даёт более гладкие облака точек и примерный масштаб в метрах.

  • 3D-реконструкция сцены по видео
  • Оценка положения камеры по кадрам
  • Облака точек для исследований и прототипов
Размеры
0.96B – 1.4B
Железо
от: 1 видеокарта
Только некоммерческоеПодробнее
3D2025

HY-Motion

Tencent Hunyuan · Китай

Генерирует 3D-анимацию движения человека по текстовому описанию: скелетная анимация сразу подходит для 3D-редакторов и игровых движков. Понимает английский и китайский.

  • Анимация персонажа по текстовому описанию
  • Черновая анимация для игр и роликов
  • Библиотека движений для аватаров
Размеры
0.46B – 1B
Железо
от: 1 видеокарта
Коммерция с условиямиПодробнее
Компьютерное зрение2025

Perception Encoder (PE)

Meta · США

Семейство энкодеров Meta для картинок и видео, а с версией PE-AV — и для звука. PE-Core ищет по тексту точнее SigLIP 2 (по данным Meta), есть малые версии.

  • Поиск фото и видео по описанию
  • Разметка и теги каталога
  • Поиск по звуку и видео (PE-AV)
Размеры
размер на карточке не указан
Железо
от: Ноутбук
Можно в коммерциюПодробнее
3DGGUF2025

SAM 3D

Meta · США

Восстанавливает 3D-форму предмета или тела человека по одной обычной фотографии, даже если объект частично закрыт. Две модели: Objects и Body.

  • 3D-модель предмета с фото из каталога
  • Оценка позы и формы тела по фото
  • Примерка и AR-сценарии
Размеры
н/д
Железо
от: 1 видеокарта
Коммерция с условиямиПодробнее
Компьютерное зрение2023–2025

MetaCLIP / MetaCLIP 2

Meta · США

Открытый повтор CLIP от Meta с прозрачным рецептом сбора данных. MetaCLIP 2 обучен на многоязычных данных со всего мира. Только некоммерческая лицензия.

  • Поиск картинок по тексту
  • Классификация изображений без обучения
  • Исследования и прототипы поиска
Размеры
0.15B – 3.6B
Железо
от: Ноутбук
Только некоммерческоеПодробнее
Компьютерное зрение2023–2025

Grounding DINO / Rex-Omni

IDEA Research · Китай

Находит на картинке любые объекты по текстовому описанию, без обучения на своих данных: «красная коробка», «человек без каски». Rex-Omni — новое поколение на базе VLM.

  • Поиск объектов по описанию без разметки
  • Автоматическая разметка данных для обучения
  • Проверка фото на соответствие требованиям
Размеры
172M – 3B
Железо
от: Ноутбук
Коммерция с условиямиПодробнее
Компьютерное зрение2023–2025

DINOv2 / DINOv3

Meta · США

Базовые модели, которые превращают картинку в числовой «отпечаток». На них строят поиск похожих изображений, классификацию и сегментацию без большой разметки.

  • Поиск похожих товаров и фото
  • Классификация изображений на малых данных
  • Основа для своих моделей контроля качества
Размеры
21M – 7B
Железо
от: Ноутбук
Коммерция с условиямиПодробнее
Лица2025

LVFace

ByteDance · Китай

Распознавание лиц на трансформерах от ByteDance, одна из самых точных открытых моделей по тестам. Веса опубликованы в формате ONNX, но некоммерческие.

  • Сравнение лиц и поиск по базе фотографий
  • Исследование точности распознавания
  • Прототипы систем доступа
Размеры
ViT-T – ViT-L
Железо
от: Ноутбук
Только некоммерческоеПодробнее
Детекция подделок2023–2025

DeepfakeBench

The Chinese University of Hong Kong, Shenzhen (SCLBD) · Китай

Набор из десятков открытых детекторов подмены лица на видео и фото под общим кодом и с готовыми весами. Детектор ошибается в обе стороны: его вывод — повод для проверки человеком, а не доказательство подделки.

  • Первичная проверка присланного видео или селфи
  • Сравнение нескольких детекторов на своих данных
  • Дообучение детектора под свой поток заявок
Размеры
детекторы уровня Xception и EfficientNet, десятки миллионов параметров
Железо
от: Ноутбук
Только некоммерческоеПодробнее
Медицина2025

MedSigLIP

Google · США

Лёгкий кодировщик медицинских снимков и текста от Google, тот же, что внутри MedGemma. Сортирует и ищет похожие снимки. Не заменяет врача, решения принимает специалист.

  • Поиск похожих снимков в архиве клиники
  • Предварительная сортировка снимков для врача
  • Основа для своих классификаторов снимков
Размеры
около 0.9B
Железо
от: Ноутбук
Коммерция с условиямиПодробнее
Обработка фотоGGUF2024–2025

BiRefNet

Нанькайский университет · Китай

Открытая модель точного выделения объекта и удаления фона под лицензией MIT. На ней построен RMBG-2.0. Есть версии для 2K и для волос и полупрозрачных краёв.

  • Удаление фона с фото товаров потоком
  • Точные маски для дизайна и печати
  • Вырезка людей с волосами для рекламы
Размеры
около 220M (есть облегчённые lite)
Железо
от: Ноутбук
Можно в коммерциюПодробнее
Детекция подделок2024–2025

Watermark Anything (WAM)

Meta · США

Водяной знак для картинок, который можно поставить на отдельные участки: модель показывает, какая часть изображения помечена. Ошибается в обе стороны — итог проверяет человек.

  • Пометка сгенерированных и отредактированных изображений
  • Поиск помеченного фрагмента в коллаже
  • Отслеживание, какие части картинки сделал ИИ
Размеры
кодировщик и декодировщик метки для изображений
Железо
от: Ноутбук
Можно в коммерциюПодробнее
Детекция подделок2024–2025

AIDE

Xiaohongshu, USTC и Shanghai Jiao Tong University · Китай

Детектор ИИ-картинок из нескольких экспертов: одни смотрят на визуальные артефакты, другие на шум. Вместе с ним выпущен сложный набор Chameleon. Ошибается в обе стороны — итог проверяет человек.

  • Проверка реалистичных ИИ-изображений без явных артефактов
  • Сравнение детекторов на сложных примерах
  • Дообучение под свой тип контента
Размеры
несколько экспертов на базе ConvNeXt и CLIP
Железо
от: 1 видеокарта
Коммерция с условиямиПодробнее
Детекция подделок2022–2025

TruFor

GRIP, University Federico II of Naples · Италия

Ищет следы монтажа и показывает картой, какие участки изображения выглядят изменёнными: подходит для сканов договоров, справок и фото документов. Ошибается в обе стороны — решение принимает человек.

  • Проверка сканов справок и договоров на правку
  • Подсветка изменённых участков фото для эксперта
  • Отсев явно перерисованных документов до ручной проверки
Размеры
трансформерная модель с картой подозрительных областей
Железо
от: 1 видеокарта
Только некоммерческоеПодробнее
Модерация и безопасность2023–2025

NSFW-классификаторы (Falconsai, Freepik)

Falconsai и Freepik · США и Испания

Небольшие модели, которые отличают откровенные картинки от обычных. Freepik различает четыре уровня откровенности. Работают на процессоре.

  • Фильтр пользовательских фото и аватаров
  • Проверка картинок от генераторов перед публикацией
  • Разметка медиатеки
Размеры
86M
Железо
от: Ноутбук
Можно в коммерциюПодробнее
Компьютерное зрение2023–2025

SigLIP (наследник CLIP)

Google · США

Модели, которые переводят картинки и текст в общее пространство: можно искать фото по словам и классифицировать изображения без обучения. CLIP от OpenAI (2021) — предшественник.

  • Поиск картинок по текстовому запросу
  • Автоматическая разметка и теги каталога
  • Фильтрация недопустимого контента
Размеры
около 0.2B – 2B
Железо
от: Ноутбук
Можно в коммерциюПодробнее
Агенты для компьютера2024–2025

OmniParser

Microsoft · США

Разбирает скриншот на кнопки, поля и иконки с подписями, чтобы обычная языковая модель понимала экран и могла им управлять. Сам не кликает, а служит «глазами» агента.

  • Разметка экранов старых программ для автоматизации
  • Подготовка агента к работе в интерфейсе
  • Проверка, что на экране есть нужные элементы
Размеры
менее 1B (детектор + подписи)
Железо
от: Ноутбук
Коммерция с условиямиПодробнее
Медицина2024–2025

Bioptimus H-optimus

Bioptimus · Франция

Базовые модели патологии французской Bioptimus на 1,1B параметров, плюс компактная H0-mini. Первая версия открыта под Apache 2.0. Не заменяет врача, решения принимает специалист.

  • Признаки участков гистологических стекол для исследовательских моделей
  • Прототип сортировки препаратов по типу ткани
  • Научные проекты по связи морфологии и молекулярных данных
Размеры
86M (H0-mini) – 1,1B
Железо
от: Ноутбук
Коммерция с условиямиПодробнее
Компьютерное зрение2022–2025

ViTPose

Сиднейский университет и JD Explore Academy · Австралия / Китай

Простая и точная модель определения позы человека по ключевым точкам. Версия ViTPose++ умеет позы людей, животных и всего тела; встроена в библиотеку Transformers.

  • Ключевые точки тела на фото и видео
  • Анализ движений в спорте и реабилитации
  • Контроль рабочих поз и техники безопасности
Размеры
33M – около 1B
Железо
от: Ноутбук
Можно в коммерциюПодробнее
Медицина2024–2025

MahmoodLab UNI / UNI 2

Mahmood Lab (Mass General Brigham, Гарвард) · США

Базовая модель для гистологических препаратов: превращает участки цифровых стекол в признаки для классификации тканей. Не заменяет врача, решения принимает специалист.

  • Исследовательские классификаторы типов тканей по цифровым стеклам
  • Поиск похожих случаев в архиве препаратов
  • Подготовка признаков для научных моделей прогноза
Размеры
около 300M (UNI) – около 680M (UNI2-h)
Железо
от: Ноутбук
Только некоммерческоеПодробнее
Медицина2024

MahmoodLab CONCH / TITAN

Mahmood Lab (Mass General Brigham, Гарвард) · США

Модели «картинка + текст» для патологии: поиск препаратов по описанию на английском, классификация без дообучения, TITAN описывает целое стекло. Не заменяет врача, решения принимает специалист.

  • Поиск по архиву стекол по текстовому запросу для исследований
  • Черновые описания препаратов для научных проектов
  • Классификация тканей без разметки на старте исследования
Размеры
около 160M – 300M
Железо
от: Ноутбук
Только некоммерческоеПодробнее
МедицинаНе развивается2024

Paige Virchow

Paige · США

Базовая модель патологии от Paige, обученная на миллионах цифровых стекол. Первая версия под Apache 2.0, вторая только для науки. Не заменяет врача, решения принимает специалист.

  • Признаки участков стекол для исследовательских классификаторов
  • Отбор препаратов для пересмотра в научных проектах
  • Сравнение с другими моделями патологии на своём архиве
Размеры
около 632M
Железо
от: Ноутбук
Коммерция с условиямиПодробнее
Картинка + текстНе развивается2024

Florence-2

Microsoft · США

Очень маленькая модель зрения: подписи, поиск объектов, сегментация и чтение текста по одной команде. Работает даже на процессоре.

  • Чтение текста на фото
  • Поиск и выделение объектов
  • Автоматические подписи к фото
Размеры
0.23B – 0.77B
Железо
от: Ноутбук
Можно в коммерциюПодробнее
Детекция подделокНе развивается2023–2024

IML-ViT

Sichuan University и соавторы · Китай

Открытая модель поиска подделок в изображениях: выдаёт попиксельную маску изменённых участков. Ошибается в обе стороны, её карта — подсказка эксперту, а не доказательство подделки.

  • Поиск вклеенных и затёртых фрагментов на фото
  • Проверка сканов документов на правку
  • Базовая линия при сравнении моделей поиска монтажа
Размеры
модель на базе Vision Transformer
Железо
от: 1 видеокарта
Можно в коммерциюПодробнее
Компьютерное зрениеНе развивается2021–2022

CLIP (OpenAI)

OpenAI · США

Модель 2021 года, которая первой связала картинки и текст: поиск фото по словам и классификация без обучения. Понимает только английский, сейчас чаще берут SigLIP 2 или PE.

  • Поиск картинок по текстовому запросу
  • Автоматические теги для каталога
  • Поиск похожих изображений
Размеры
около 0.15B – 0.6B
Железо
от: Ноутбук
Можно в коммерциюПодробнее
Компьютерное зрениеНе развивается2022

DiT (Document Image Transformer)

Microsoft · США

По картинке определяет, что за документ перед ней: резюме, диплом, справка, договор. Помогает раскладывать пакеты файлов от кандидатов по типам. Решение о кандидате принимает человек, автоматический отбор без проверки использовать нельзя.

  • Сортировка входящих документов кандидатов по типам
  • Проверка комплектности пакета документов
  • Поиск нужного скана в архиве
Размеры
версии base и large
Железо
от: Ноутбук
Коммерция с условиямиПодробнее
Компьютерное зрениеRUНе развивается2022

ruCLIP (ai-forever)

Сбер AI и SberDevices (ai-forever) · Россия

Русская версия CLIP: сопоставляет картинки и подписи на русском. Позволяет искать фото по описанию и раскладывать изображения по категориям без обучения.

  • Поиск товаров по фото и по русскому описанию
  • Сортировка картинок по категориям без разметки
  • Проверка соответствия фото и подписи
Размеры
150M – 430M
Железо
от: Ноутбук
Можно в коммерциюПодробнее
Детекция подделокНе развивается2020

Silent-Face-Anti-Spoofing (MiniFASNet)

MiniVision Technology · Китай

Практически единственный полностью открытый набор весов для проверки живого лица по одному кадру: отличает человека от фото, экрана или маски. Ошибается в обе стороны — отказ должен уметь оспорить человек.

  • Проверка живого лица при входе по селфи
  • Защита пропускной системы от фото на телефоне
  • Проверка при удалённой идентификации клиента
Размеры
две модели примерно по 1,8 МБ
Железо
от: Ноутбук
Можно в коммерциюПодробнее

Подборки

Нужна модель под вашу задачу?

Открытую модель можно поставить на свой сервер: данные не уходят в чужое облако, нет оплаты за каждый запрос, модель можно дообучить на ваших документах.

  1. ПодберуМодель и размер под задачу и бюджет на железо
  2. ПоставлюНа ваш сервер или в закрытый контур, с API
  3. ДообучуНа ваших данных или подключу базу знаний
  4. ВстроюВ CRM, 1С, бота, сайт или рабочий чат
Обсудить внедрение