Нейролюб
НовостьНейросетиMoonshot AIМультимодальные модели

AI-модели плохо «видят» изображения — ни одна не набрала 60% в новом тесте

Moonshot AI выпустила PerceptionBench: GPT-5.6 Sol, Kimi K3, Claude и Gemini проверили на базовом зрительном восприятии без сложных рассуждений.

Кирилл Киреев

15.08.2026 · 3 минут чтения · Нейросети

PerceptionBench проверяет, насколько точно AI-модели видят изображения

Содержание

PerceptionBench отделил способность AI видеть от способности рассуждать

Команда Moonshot AI, создатель Kimi, выпустила открытый бенчмарк PerceptionBench для проверки того, насколько мультимодальные модели действительно понимают изображения. В отличие от обычных тестов, здесь моделям не нужны сложные рассуждения или внешние знания: каждый вопрос можно решить, просто правильно рассмотрев картинку.

Ни одна модель не преодолела планку 60%

В тесте участвовали 16 ведущих моделей. Лучший результат показала GPT-5.6 Sol — 59,7%. Следом идут Kimi K3 с 58,5%, Claude Fable 5 с 57,2% и Gemini 3.1 Pro с 56,2%. Даже самые сильные системы ошибаются более чем в четырёх случаях из десяти, когда задача сводится к базовому визуальному восприятию.

Особенно слабым местом оказались зрительные галлюцинации — ситуации, когда модель замечает на изображении объект, которого там нет. Например, GPT-5.6 Sol лидирует в общем зачёте, но в этой категории набрала только 26,9%. При этом модели с близкими итоговыми баллами заметно отличаются по отдельным навыкам.

Что именно проверяет PerceptionBench

Авторы собрали 3 000 проверенных заданий и разделили зрительное восприятие на десять навыков: отношения между объектами, подсчёт, атрибуты, глубина и 3D, локализация, сравнение, распознавание мелких деталей, понимание контекста, OCR и галлюцинации. Категории вывели не теоретически, а из реальных ошибок моделей в 42 существующих бенчмарках.

Почему это важно пользователям и креаторам

Результаты показывают, что уверенный ответ AI о фотографии, макете, скриншоте или товарной карточке ещё не означает, что модель правильно увидела исходник. Ошибка, которую легко принять за сбой логики, может возникнуть раньше — на этапе чтения изображения. Поэтому визуальный анализ стоит перепроверять, особенно если важны количество объектов, мелкие детали, подписи и точное расположение элементов.

Moonshot AI открыла датасет и код оценки на GitHub. Это позволит разработчикам сравнивать модели не только по общему баллу, но и по конкретным зрительным навыкам, а пользователям — осознаннее выбирать инструмент для анализа изображений, документов и креативов.

Хочешь узнавать первым о таких новостях?

Переходи в наш телеграм канал где мы ежедневно публикуем самые свежие и интересные новости

Перейти в Телеграм

Хочешь узнавать первым о таких новостях?

Переходи в наш телеграм канал где мы ежедневно публикуем самые свежие и интересные новости

Чиби Новости