ИИ плохо видит: что показал Humanity's Sixth Sense в проверке по фото
7 октября 2026 года Scale Labs и Elorian опубликовали бенчмарк Humanity's Sixth Sense: люди 93,1%, лучшая из 25 моделей 53,6%. Разбираю по первоисточнику, что тест измерял и чего не говорит, и как владельцу бизнеса проверить ИИ на 30-50 своих фото с эталоном.
Сделаю под ключ: разберу задачу, назову срок и цену. Чтобы начать, напишите в Telegram одной фразой.
Компьютерное зрение под ключЧто показал тест и что я проверил
Новость пришла через ML-канал, я открыл первоисточники: блог Scale Labs, страницу статьи и таблицу результатов на сайте Scale Labs, набор данных на Hugging Face. Статью на arXiv я не нашёл, Scale Labs ссылку на неё не даёт.
Подтверждено авторами: 522 задачи с открытыми ответами, 288 изображений и 234 видеофрагмента. Из 3 466 написанных задач экспертную проверку прошли 522. Людей-участников было 20, их точность 93,1%. Протестировали 25 мультимодальных моделей восьми разработчиков. В таблице результатов у GPT-6 Astra 53,6, у GPT-6.1 Sol 46,6, у Claude Opus 5.5 44,6, медиана 30,9. Замер сделан на максимальных настройках рассуждения, результат усреднён по трём попыткам, ответы оценивала языковая модель по рубрике, и задача считалась решённой только при выполнении всех критериев.
Одна оговорка к цифрам. У лидера доверительный интервал плюс-минус 4,1 пункта, у Sol и Opus 5.5 около 3,8. Первое и второе места статистически почти не разведены, поэтому ранжирование читайте как грубое.
Что именно проверяли
Авторы называют это интуитивным визуальным рассуждением. Задачи про то, что человек понимает с одного взгляда: хватит ли места между двумя припаркованными машинами, поместятся ли ещё две книги на полке, почему бегущая женщина замедлилась (потому что автобус остановился и ждёт её). В набор входят временные, пространственные, социальные и абстрактные задачи. Социальные сцены, включая роли, нормы и распределение силы в кадре, оказались самыми трудными: у 21 из 25 моделей они худшие, в среднем 24,4% против 34,1% в остальных группах. Видео сложнее картинок для 23 моделей из 25, в среднем на 7,3 пункта. В видео только изображение, звука нет.
Это важная рамка. Тест не про распознавание простых объектов и не про чтение текста на фото. Переносить 53,6% на такие задачи нельзя.
Где ломается модель
Авторы разобрали 8 573 неудачных ответа. В 94% причиной названо восприятие или скрытый вывод из увиденного: модель пропустила решающий признак в кадре (21%), или приняла один предмет, человека или роль за другого (20%). Ошибки в самой логике рассуждений составили 5%. На задачах, которые проваливают пять и больше моделей, медианная доля моделей с одной и той же причиной провала 80%.
Про вычислительный бюджет пересказ канала неточный. Модели тратили в среднем около 4 046 токенов рассуждения на задачу. Авторы пишут, что повышение усилия в целом помогает, но по отдельным типам задач вредит: у GPT-6 Astra на задачах о восстановлении предшествующих событий точность упала на 14 пунктов при переходе от высокого режима к максимальному. Пик часто приходится на промежуточную настройку.
С фокусировкой тоже не так, как в пересказе. Агентные сборки с кропом, зумом, повторной выборкой кадров и поиском в сети сузили разрыв, но не закрыли его. Лучшая сборка набрала 59,3% на подмножестве из 388 задач. Пропущенные признаки и неверно названные объекты инструменты исправляли, ошибки с глубиной нет. «Минимальный эффект» из канала в источнике я не нашёл.
Чего бенчмарк не говорит
Он не говорит, что модель не прочтёт номер на накладной. Чтение текста я разбирал в статье про OCR, там другая картина.
Он не говорит и обратного. Раз простые задачи тут не измеряли, надёжности на мелких и контекстных деталях тест не подтверждает. Нехватка одного ценника в углу полки, грязь за краем стола, скол на торце коробки относятся именно к тому классу ошибок, который авторы нашли: модель не заметила признак. Сами авторы оговаривают ограничения: медиа из открытой сети могли попасть в обучающие данные, а оценка задач на понимание намерений людей показывает согласие с разметчиками и не служит абсолютной истиной.
Где безопасно, а где нет
Ниже мои рекомендации, это не вывод бенчмарка.
Безопасно: первичная сортировка (на фото есть товар или нет), подсказка сотруднику перед отправкой отчёта, поиск явного брака, который виден сразу. Ошибка здесь стоит минуты проверки.
Опасно без человека: штраф сотруднику, отказ клиенту, приёмка партии, оценка повреждений для спора с перевозчиком. Модель может не заметить дефект, а может увидеть его там, где его нет, и оба случая стоят денег. Почему машина уверенно говорит неправду, я писал в статье про галлюцинации ИИ, а где проходит граница самостоятельности агента, в разборе границы автономности.
Что можно сделать уже сейчас
Проверьте свой сценарий на своих фото. Возьмите 30-50 реальных снимков, по которым человек уже вынес вердикт. Прогоните их через модель и сравните. Методику описывал в статье про свой тест на 30 вопросов. Условный пример: 40 снимков выкладки, из них 12 с нарушением. Считайте отдельно, сколько нарушений модель пропустила и сколько раз подняла ложную тревогу. Пропуск обычно дороже.
Ведите журнал ошибок. Каждое расхождение модели и человека записывайте: фото, что сказала модель, что на самом деле. Через месяц видно, какой класс ошибок повторяется.
Улучшите входные данные. Фото с рамкой-меткой или стикером-образцом, два-три ракурса вместо одного, свет без бликов, крупный план зоны, где ищем дефект. Это мои рекомендации из практики, тест их не проверял. Как готовить снимки, описано в статье про данные для компьютерного зрения.
Держите правило «ИИ предлагает, человек подтверждает». Вердикт модели уходит человеку с фото и пометкой. Штраф или отказ возможен только после его подтверждения. Рабочий вариант с выкладкой разобран в статье про проверку витрины по фото. Собрать такой контур под ваш процесс могу в рамках разработки по компьютерному зрению.
Частые вопросы
Значит ли тест, что ИИ нельзя доверять проверку по фото?
Нет. Тест проверял трудные сцены с социальным и пространственным смыслом. Ваша задача может быть проще или сложнее, и узнать это можно только на ваших фото с эталоном.
Поможет ли более дорогая модель или режим «подумать подольше»?
По данным авторов, не всегда. Усилие рассуждения в целом помогает, но в части задач точность падает. Если ошибка в том, что модель не увидела признак, дополнительные токены её не исправляют.
Сколько фото нужно для проверки?
Для первой оценки хватает 30-50 снимков с известным ответом. Для важных решений нужно больше, и в наборе должны быть редкие случаи, а не только типичные.
Коротко о главном
Лучшая модель решила 53,6% трудных задач на зрение, люди 93,1%, и 94% провалов связаны с восприятием. Для вашего процесса эти цифры ничего не доказывают в обе стороны, зато хорошо объясняют, зачем проверять свой сценарий на своих фото и оставлять финальное слово человеку.
Если хотите запустить пилот проверки по фото с контролем качества и журналом ошибок, напишите мне в Telegram кодовое слово «ГЛАЗА», пришлю шаблон набора для проверки.
Что я делаю для бизнеса
Напишите одной фразой, что нужно. Отвечу, что подойдёт, сколько займёт и сколько стоит. Сообщение уже подготовлено.
- Боты в Telegram, MAX, VK
- Автоматизация процессов и CRM
- Аналитика и дашборды
- Сайты и лендинги под ключ
Разборы, кейсы и практика — без воды. Выходит регулярно, читать 3–5 минут.


