Стек под производство: камера, которая замечает и объясняет

Камеры на производстве обычно уже стоят, но записи никто не смотрит: человек внимателен первые полчаса смены. Модели зрения закрывают именно монотонную часть, и делают это в несколько шагов. Сначала находят объекты в кадре, потом аккуратно выделяют границы дефекта, потом описывают, что видно, и только потом это превращается в отчёт. Разделение на звенья позволяет ставить пороги отдельно на каждом и не будить мастера по каждой тени.

Шаг 1. Найти объекты в кадре

Модель детекции обводит на кадре то, что вас интересует: деталь, коробку, паллету, человека в зоне, каску. Работает быстро и прямо на площадке, без отправки видео наружу. Часть моделей ищет по текстовому описанию, что удобно, когда классов много и они меняются. Без этого звена нет ни счётчиков, ни срабатываний, и вся дальнейшая логика просто не на чем держится.

Чем это делается

Компьютерное зрение2023–2026

YOLO (Ultralytics)

Ultralytics · США

Самый распространённый детектор объектов в реальном времени: находит и выделяет предметы на видео даже на слабом железе. YOLOv5 вышел ещё в 2020, в каталоге отсчёт от YOLOv8.

  • Подсчёт людей, машин, товаров на видео
  • Контроль касок и спецодежды
  • Поиск брака на конвейере
Размеры
2.4M – 68M
Железо
от: Ноутбук
Коммерция с условиямиПодробнее
Компьютерное зрение2025–2026

RF-DETR

Roboflow · США

Детектор объектов в реальном времени, открытая замена YOLO без AGPL. Умеет сегментацию (контуры объектов), с 2026 года — ключевые точки.

  • Детекция объектов на видео и фото
  • Точные контуры деталей и дефектов
  • Дообучение под свои классы объектов
Размеры
Nano – 2XL
Железо
от: Ноутбук
Можно в коммерциюПодробнее
Компьютерное зрение2023–2025

Grounding DINO / Rex-Omni

IDEA Research · Китай

Находит на картинке любые объекты по текстовому описанию, без обучения на своих данных: «красная коробка», «человек без каски». Rex-Omni — новое поколение на базе VLM.

  • Поиск объектов по описанию без разметки
  • Автоматическая разметка данных для обучения
  • Проверка фото на соответствие требованиям
Размеры
172M – 3B
Железо
от: Ноутбук
Коммерция с условиямиПодробнее

Шаг 2. Выделить область и оценить геометрию

Сегментация обводит объект по контуру, а не прямоугольником, и это принципиально для дефектов: скол, потёк, зазор нужно померить, а не просто заметить. Оценка глубины добавляет понимание расстояний, если камера одна. Без этого звена система умеет сказать только, что деталь в кадре, но не то, что с ней не так, и на брак она не реагирует.

Чем это делается

Компьютерное зрение2023–2026

Segment Anything (SAM)

Meta · США

Выделяет любой объект на фото и видео по клику или рамке. Основа для удаления фона и подсчёта объектов.

  • Удаление фона с фото товара
  • Подсчёт объектов на фото
  • Разметка данных для обучения
Размеры
91M – ~0,85B
Железо
от: Ноутбук
Коммерция с условиямиПодробнее
Компьютерное зрениеGGUF2024–2025

Depth Anything

ByteDance и Гонконгский университет · Китай

Определяет глубину — расстояние до каждой точки — по одной обычной фотографии или видео. DA3 восстанавливает геометрию сцены с нескольких кадров.

  • Оценка расстояний и объёмов по камере
  • Эффекты глубины для фото и видео
  • Навигация роботов и дронов
Размеры
25M – 1.4B
Железо
от: Ноутбук
Коммерция с условиямиПодробнее

Шаг 3. Описать, что видно на снимке

Модель, понимающая картинки и текст, превращает срабатывание в человеческую фразу: что за объект, что с ним не так, насколько уверенно. Это звено соединяет зрение с отчётностью, потому что мастеру нужны слова, а не координаты рамки. Без него в журнале остаются номера классов и кадры, и разбираться в них будет только тот, кто настраивал систему.

Чем это делается

Картинка + текстRUOllama2023–2025

Qwen-VL

Alibaba (команда Qwen) · Китай

Одна из сильнейших открытых моделей зрения: читает документы, таблицы, графики, видео, работает с интерфейсами. С Qwen3.5 зрение встроено прямо в основную модель Qwen.

  • Извлечение данных из сканов счетов и накладных
  • Разбор фотографий товаров и витрин
  • Анализ видео и записей с камер
Размеры
2B – 235B-A22B
Железо
от: Ноутбук
Можно в коммерциюПодробнее
Картинка + текстНе развивается2024

Florence-2

Microsoft · США

Очень маленькая модель зрения: подписи, поиск объектов, сегментация и чтение текста по одной команде. Работает даже на процессоре.

  • Чтение текста на фото
  • Поиск и выделение объектов
  • Автоматические подписи к фото
Размеры
0.23B – 0.77B
Железо
от: Ноутбук
Можно в коммерциюПодробнее
Картинка + текстOllama2024–2026

Moondream

Moondream (M87 Labs) · США

Небольшая и быстрая модель зрения для продуктовых задач: ответы на вопросы, поиск и указание объектов, подписи. Moondream 3.1 — MoE на 9B с 2B активных.

  • Поиск объектов и подсчёт на фото
  • Проверка фото из полевых отчётов
  • Подписи и теги для каталога
Размеры
2B – 9B-A2B
Железо
от: Ноутбук
Коммерция с условиямиПодробнее

Шаг 4. Собрать отчёт за смену

Языковая модель сводит срабатывания за смену в короткий текст: сколько, где, что повторяется, на что смотреть в первую очередь. Вместо тысячи уведомлений руководитель получает одну сводку, а тревожные события уходят сразу. Без этого звена система заваливает чат уведомлениями, их перестают читать через неделю, и внедрение тихо умирает.

Чем это делается

ТекстRUOllama2023–2026

Qwen

Alibaba · Китай

Семейство языковых моделей с сильным русским языком: от маленьких версий для ноутбука до флагмана уровня коммерческих API.

  • Чат-бот и ассистент по базе знаний
  • Ответы на письма и обращения
  • Разбор и классификация документов
Размеры
0,6B – 2,4T-A95B
Железо
от: Ноутбук
Коммерция с условиямиПодробнее
ТекстOllama2024–2026

Gemma

Google · США

Компактные модели Google: хорошо работают на одном компьютере, старшие версии понимают картинки. Есть CodeGemma для кода, FunctionGemma 270M для вызова функций и быстрая DiffusionGemma.

  • Ассистент на ноутбуке без интернета
  • Разбор фото документов и чеков
  • Классификация обращений
Размеры
270M – 31B
Железо
от: Ноутбук
Можно в коммерциюПодробнее

На что смотреть до внедрения

Всё решают камеры и свет, а не выбор модели. Блик, контровой свет, грязный объектив и пар обесценивают любую точность на бумаге. Перед внедрением снимите свои реальные условия, включая ночную смену, и соберите набор кадров с браком, которого обычно мало и он редкий. И сразу договоритесь, что делает система при срабатывании: останавливает линию, ставит метку или зовёт мастера. Видеонаблюдение за сотрудниками регулируется, здесь в общих чертах, конкретный случай смотрит юрист.

Другие стеки

Нужна модель под вашу задачу?

Открытую модель можно поставить на свой сервер: данные не уходят в чужое облако, нет оплаты за каждый запрос, модель можно дообучить на ваших документах.

  1. ПодберуМодель и размер под задачу и бюджет на железо
  2. ПоставлюНа ваш сервер или в закрытый контур, с API
  3. ДообучуНа ваших данных или подключу базу знаний
  4. ВстроюВ CRM, 1С, бота, сайт или рабочий чат
Обсудить внедрение