НовостьНейросетиOpenAIГенерация изображений

GPT Image 2 решил 37% пространственных задач, на которых ошибся GPT-5.4

Новый тест SpatialGen-Bench показал: генератор GPT Image 2 уступает GPT-5.4 по общему баллу, но находит правильные визуальные ответы в 37% ошибок текстовой модели.

Кирилл Киреев

25.07.2026 · 4 минут чтения · Нейросети

Схема визуальной оценки пространственного мышления ProVisE

Содержание

Почему нейросети иногда проще показать ответ, чем описать его

Исследователи представили ProVisE и SpatialGen-Bench — новую систему проверки пространственного мышления нейросетей. Вместо того чтобы заставлять генератор изображений выдавать координаты или словесный ответ, модель просят показать решение прямо на картинке: отметить область, нарисовать траекторию, выделить объект или построить карту глубины.

Что показало сравнение GPT-5.4 и GPT Image 2

В SpatialGen-Bench вошли 470 примеров, 14 типов задач и четыре уровня способностей — от восприятия до рассуждений и взаимодействия. Среди текстовых моделей лучший общий результат получил GPT-5.4 — 61,04 балла. Среди генераторов изображений лидировал GPT Image 2 с 54,49 балла. Для сравнения, результат человека составил 87,79 балла.

Главный вывод оказался не в общей таблице. GPT Image 2 правильно решил 71 пример, на котором ошибся GPT-5.4. Это 37% ошибок текстовой модели в парном сравнении. Иными словами, визуальные ответы не просто повторяют возможности языковой модели: в части задач генератор действительно видит решение иначе.

Где визуальный ответ помогает

Преимущество изображения заметнее там, где ответ естественно существует в пикселях: при оценке глубины, выделении отношений между объектами, поиске подходящей области или отображении пути. В таких случаях модели не нужно переводить визуальное понимание в точные координаты и затем снова объяснять их словами.

Текстовые модели пока сильнее в задачах, где требуется последовательно преобразовать исходные данные: считать объекты, сравнивать размеры, проверять выполнимость действия или мысленно менять сцену. Поэтому исследование не доказывает, что генераторы изображений рассуждают лучше в целом. Оно показывает, что формат ответа сильно влияет на результат.

Почему это важно для AI-инструментов

Для будущих креативных сервисов и AI-агентов это практический сигнал: сложную визуальную задачу полезно отдавать сразу двум интерфейсам. Языковая модель может построить план и проверить ограничения, а генератор — показать расположение объектов, маску, маршрут или вариант композиции. Такой подход особенно перспективен для дизайна, монтажа, робототехники и инструментов, которые редактируют изображение по инструкции.

SpatialGen-Bench остаётся исследовательским диагностическим тестом, а работа опубликована как препринт. Авторы отдельно предупреждают, что сравнение разных моделей и способов ответа нельзя считать доказательством превосходства одной модальности. Но результаты дают понятное объяснение, почему в визуальных задачах иногда лучше просить нейросеть не рассказывать, а показать.

Хочешь узнавать первым о таких новостях?

Переходи в наш телеграм канал где мы ежедневно публикуем самые свежие и интересные новости

Чиби Новости