Содержание
Почему нейросети иногда проще показать ответ, чем описать его
Исследователи представили ProVisE и SpatialGen-Bench — новую систему проверки пространственного мышления нейросетей. Вместо того чтобы заставлять генератор изображений выдавать координаты или словесный ответ, модель просят показать решение прямо на картинке: отметить область, нарисовать траекторию, выделить объект или построить карту глубины.
Что показало сравнение GPT-5.4 и GPT Image 2
В SpatialGen-Bench вошли 470 примеров, 14 типов задач и четыре уровня способностей — от восприятия до рассуждений и взаимодействия. Среди текстовых моделей лучший общий результат получил GPT-5.4 — 61,04 балла. Среди генераторов изображений лидировал GPT Image 2 с 54,49 балла. Для сравнения, результат человека составил 87,79 балла.
Главный вывод оказался не в общей таблице. GPT Image 2 правильно решил 71 пример, на котором ошибся GPT-5.4. Это 37% ошибок текстовой модели в парном сравнении. Иными словами, визуальные ответы не просто повторяют возможности языковой модели: в части задач генератор действительно видит решение иначе.
Где визуальный ответ помогает
Преимущество изображения заметнее там, где ответ естественно существует в пикселях: при оценке глубины, выделении отношений между объектами, поиске подходящей области или отображении пути. В таких случаях модели не нужно переводить визуальное понимание в точные координаты и затем снова объяснять их словами.
Текстовые модели пока сильнее в задачах, где требуется последовательно преобразовать исходные данные: считать объекты, сравнивать размеры, проверять выполнимость действия или мысленно менять сцену. Поэтому исследование не доказывает, что генераторы изображений рассуждают лучше в целом. Оно показывает, что формат ответа сильно влияет на результат.
Почему это важно для AI-инструментов
Для будущих креативных сервисов и AI-агентов это практический сигнал: сложную визуальную задачу полезно отдавать сразу двум интерфейсам. Языковая модель может построить план и проверить ограничения, а генератор — показать расположение объектов, маску, маршрут или вариант композиции. Такой подход особенно перспективен для дизайна, монтажа, робототехники и инструментов, которые редактируют изображение по инструкции.
SpatialGen-Bench остаётся исследовательским диагностическим тестом, а работа опубликована как препринт. Авторы отдельно предупреждают, что сравнение разных моделей и способов ответа нельзя считать доказательством превосходства одной модальности. Но результаты дают понятное объяснение, почему в визуальных задачах иногда лучше просить нейросеть не рассказывать, а показать.