Экспертный блог 4 мин чтения

ИИ плохо видит: что показал Humanity's Sixth Sense в проверке по фото

7 октября 2026 года Scale Labs и Elorian опубликовали бенчмарк Humanity's Sixth Sense: люди 93,1%, лучшая из 25 моделей 53,6%. Разбираю по первоисточнику, что тест измерял и чего не говорит, и как владельцу бизнеса проверить ИИ на 30-50 своих фото с эталоном.

компьютерное зрениепроверка по фотобенчмарки ИИконтроль качества
Коротко. 7 октября 2026 года Scale Labs вместе с Elorian опубликовала бенчмарк Humanity's Sixth Sense (Шестое чувство человечества). Люди в нём набрали 93,1%, лучшая из 25 моделей, GPT-6 Astra, 53,6%, медиана 30,9%. Тест про сложные сцены: влезет ли машина между двумя припаркованными, почему человек замедлил шаг, кто в кадре главный. Чтение ценника на фото в нём не проверяли. Но модели пропускают решающие признаки в кадре, и это касается проверки по фото в бизнесе. Поэтому ИИ здесь подсказывает, а решение с последствиями подтверждает человек.
Хотите внедрить это у себя?

Сделаю под ключ: разберу задачу, назову срок и цену. Чтобы начать, напишите в Telegram одной фразой.

Компьютерное зрение под ключ

Что показал тест и что я проверил

Новость пришла через ML-канал, я открыл первоисточники: блог Scale Labs, страницу статьи и таблицу результатов на сайте Scale Labs, набор данных на Hugging Face. Статью на arXiv я не нашёл, Scale Labs ссылку на неё не даёт.

Подтверждено авторами: 522 задачи с открытыми ответами, 288 изображений и 234 видеофрагмента. Из 3 466 написанных задач экспертную проверку прошли 522. Людей-участников было 20, их точность 93,1%. Протестировали 25 мультимодальных моделей восьми разработчиков. В таблице результатов у GPT-6 Astra 53,6, у GPT-6.1 Sol 46,6, у Claude Opus 5.5 44,6, медиана 30,9. Замер сделан на максимальных настройках рассуждения, результат усреднён по трём попыткам, ответы оценивала языковая модель по рубрике, и задача считалась решённой только при выполнении всех критериев.

Одна оговорка к цифрам. У лидера доверительный интервал плюс-минус 4,1 пункта, у Sol и Opus 5.5 около 3,8. Первое и второе места статистически почти не разведены, поэтому ранжирование читайте как грубое.

Что именно проверяли

Авторы называют это интуитивным визуальным рассуждением. Задачи про то, что человек понимает с одного взгляда: хватит ли места между двумя припаркованными машинами, поместятся ли ещё две книги на полке, почему бегущая женщина замедлилась (потому что автобус остановился и ждёт её). В набор входят временные, пространственные, социальные и абстрактные задачи. Социальные сцены, включая роли, нормы и распределение силы в кадре, оказались самыми трудными: у 21 из 25 моделей они худшие, в среднем 24,4% против 34,1% в остальных группах. Видео сложнее картинок для 23 моделей из 25, в среднем на 7,3 пункта. В видео только изображение, звука нет.

Это важная рамка. Тест не про распознавание простых объектов и не про чтение текста на фото. Переносить 53,6% на такие задачи нельзя.

Где ломается модель

Авторы разобрали 8 573 неудачных ответа. В 94% причиной названо восприятие или скрытый вывод из увиденного: модель пропустила решающий признак в кадре (21%), или приняла один предмет, человека или роль за другого (20%). Ошибки в самой логике рассуждений составили 5%. На задачах, которые проваливают пять и больше моделей, медианная доля моделей с одной и той же причиной провала 80%.

Про вычислительный бюджет пересказ канала неточный. Модели тратили в среднем около 4 046 токенов рассуждения на задачу. Авторы пишут, что повышение усилия в целом помогает, но по отдельным типам задач вредит: у GPT-6 Astra на задачах о восстановлении предшествующих событий точность упала на 14 пунктов при переходе от высокого режима к максимальному. Пик часто приходится на промежуточную настройку.

С фокусировкой тоже не так, как в пересказе. Агентные сборки с кропом, зумом, повторной выборкой кадров и поиском в сети сузили разрыв, но не закрыли его. Лучшая сборка набрала 59,3% на подмножестве из 388 задач. Пропущенные признаки и неверно названные объекты инструменты исправляли, ошибки с глубиной нет. «Минимальный эффект» из канала в источнике я не нашёл.

Чего бенчмарк не говорит

Он не говорит, что модель не прочтёт номер на накладной. Чтение текста я разбирал в статье про OCR, там другая картина.

Он не говорит и обратного. Раз простые задачи тут не измеряли, надёжности на мелких и контекстных деталях тест не подтверждает. Нехватка одного ценника в углу полки, грязь за краем стола, скол на торце коробки относятся именно к тому классу ошибок, который авторы нашли: модель не заметила признак. Сами авторы оговаривают ограничения: медиа из открытой сети могли попасть в обучающие данные, а оценка задач на понимание намерений людей показывает согласие с разметчиками и не служит абсолютной истиной.

Где безопасно, а где нет

Ниже мои рекомендации, это не вывод бенчмарка.

Безопасно: первичная сортировка (на фото есть товар или нет), подсказка сотруднику перед отправкой отчёта, поиск явного брака, который виден сразу. Ошибка здесь стоит минуты проверки.

Опасно без человека: штраф сотруднику, отказ клиенту, приёмка партии, оценка повреждений для спора с перевозчиком. Модель может не заметить дефект, а может увидеть его там, где его нет, и оба случая стоят денег. Почему машина уверенно говорит неправду, я писал в статье про галлюцинации ИИ, а где проходит граница самостоятельности агента, в разборе границы автономности.

Что можно сделать уже сейчас

Проверьте свой сценарий на своих фото. Возьмите 30-50 реальных снимков, по которым человек уже вынес вердикт. Прогоните их через модель и сравните. Методику описывал в статье про свой тест на 30 вопросов. Условный пример: 40 снимков выкладки, из них 12 с нарушением. Считайте отдельно, сколько нарушений модель пропустила и сколько раз подняла ложную тревогу. Пропуск обычно дороже.

Ведите журнал ошибок. Каждое расхождение модели и человека записывайте: фото, что сказала модель, что на самом деле. Через месяц видно, какой класс ошибок повторяется.

Улучшите входные данные. Фото с рамкой-меткой или стикером-образцом, два-три ракурса вместо одного, свет без бликов, крупный план зоны, где ищем дефект. Это мои рекомендации из практики, тест их не проверял. Как готовить снимки, описано в статье про данные для компьютерного зрения.

Держите правило «ИИ предлагает, человек подтверждает». Вердикт модели уходит человеку с фото и пометкой. Штраф или отказ возможен только после его подтверждения. Рабочий вариант с выкладкой разобран в статье про проверку витрины по фото. Собрать такой контур под ваш процесс могу в рамках разработки по компьютерному зрению.

Частые вопросы

Значит ли тест, что ИИ нельзя доверять проверку по фото?

Нет. Тест проверял трудные сцены с социальным и пространственным смыслом. Ваша задача может быть проще или сложнее, и узнать это можно только на ваших фото с эталоном.

Поможет ли более дорогая модель или режим «подумать подольше»?

По данным авторов, не всегда. Усилие рассуждения в целом помогает, но в части задач точность падает. Если ошибка в том, что модель не увидела признак, дополнительные токены её не исправляют.

Сколько фото нужно для проверки?

Для первой оценки хватает 30-50 снимков с известным ответом. Для важных решений нужно больше, и в наборе должны быть редкие случаи, а не только типичные.

Коротко о главном

Лучшая модель решила 53,6% трудных задач на зрение, люди 93,1%, и 94% провалов связаны с восприятием. Для вашего процесса эти цифры ничего не доказывают в обе стороны, зато хорошо объясняют, зачем проверять свой сценарий на своих фото и оставлять финальное слово человеку.

Если хотите запустить пилот проверки по фото с контролем качества и журналом ошибок, напишите мне в Telegram кодовое слово «ГЛАЗА», пришлю шаблон набора для проверки.

Обсудим вашу задачу

Что я делаю для бизнеса

Напишите одной фразой, что нужно. Отвечу, что подойдёт, сколько займёт и сколько стоит. Сообщение уже подготовлено.

  • Боты в Telegram, MAX, VK
  • Автоматизация процессов и CRM
  • Аналитика и дашборды
  • Сайты и лендинги под ключ
Пишу о разработке, ИИ и законах для бизнеса

Разборы, кейсы и практика — без воды. Выходит регулярно, читать 3–5 минут.

Готовые решения под ключTurnkey solutionsSoluciones llave en mano交钥匙解决方案Түлхүүр гардуулах шийдэл 451 готовых IT-решений для бизнеса451 ready-made IT solutions for business451 soluciones IT listas para empresas451 个面向企业的现成 IT 解决方案Бизнест зориулсан 451 бэлэн IT шийдэл Автоматизация, боты, AI, 152-ФЗ и платформы · бесплатная консультацияAutomation, bots, AI, data privacy and platforms · free consultationAutomatización, bots, IA, privacidad de datos y plataformas · consulta gratis自动化、机器人、AI、数据合规与平台 · 免费咨询Автоматжуулалт, бот, AI, өгөгдлийн хамгаалалт ба платформ · үнэгүй зөвлөгөө Смотреть каталогView catalogVer catálogo查看目录Каталог үзэх