Содержание
PerceptionBench отделил способность AI видеть от способности рассуждать
Команда Moonshot AI, создатель Kimi, выпустила открытый бенчмарк PerceptionBench для проверки того, насколько мультимодальные модели действительно понимают изображения. В отличие от обычных тестов, здесь моделям не нужны сложные рассуждения или внешние знания: каждый вопрос можно решить, просто правильно рассмотрев картинку.
Ни одна модель не преодолела планку 60%
В тесте участвовали 16 ведущих моделей. Лучший результат показала GPT-5.6 Sol — 59,7%. Следом идут Kimi K3 с 58,5%, Claude Fable 5 с 57,2% и Gemini 3.1 Pro с 56,2%. Даже самые сильные системы ошибаются более чем в четырёх случаях из десяти, когда задача сводится к базовому визуальному восприятию.
Особенно слабым местом оказались зрительные галлюцинации — ситуации, когда модель замечает на изображении объект, которого там нет. Например, GPT-5.6 Sol лидирует в общем зачёте, но в этой категории набрала только 26,9%. При этом модели с близкими итоговыми баллами заметно отличаются по отдельным навыкам.
Что именно проверяет PerceptionBench
Авторы собрали 3 000 проверенных заданий и разделили зрительное восприятие на десять навыков: отношения между объектами, подсчёт, атрибуты, глубина и 3D, локализация, сравнение, распознавание мелких деталей, понимание контекста, OCR и галлюцинации. Категории вывели не теоретически, а из реальных ошибок моделей в 42 существующих бенчмарках.
Почему это важно пользователям и креаторам
Результаты показывают, что уверенный ответ AI о фотографии, макете, скриншоте или товарной карточке ещё не означает, что модель правильно увидела исходник. Ошибка, которую легко принять за сбой логики, может возникнуть раньше — на этапе чтения изображения. Поэтому визуальный анализ стоит перепроверять, особенно если важны количество объектов, мелкие детали, подписи и точное расположение элементов.
Moonshot AI открыла датасет и код оценки на GitHub. Это позволит разработчикам сравнивать модели не только по общему баллу, но и по конкретным зрительным навыкам, а пользователям — осознаннее выбирать инструмент для анализа изображений, документов и креативов.