Содержание
Почему настройки AI-агента оказались не менее важны, чем сама модель
OpenAI повторно проверила GPT-5.6 Sol на ARC-AGI-3 — наборе незнакомых двумерных игр, где AI должен самостоятельно понять правила и действовать без готовой инструкции. Оказалось, что низкий результат модели был связан не только с её способностями, но и с тем, как тестовая система управляла памятью между действиями.
Что изменили в тесте
В официальной конфигурации после каждого хода скрытые рассуждения модели удалялись, а при заполнении контекста самые ранние действия просто обрезались. Из-за этого AI снова разбирался в игре почти с нуля и со временем терял уже найденные закономерности.
OpenAI перенесла запуск на Responses API и включила две настройки: сохранение рассуждений между шагами и compaction — сжатие длинной истории вместо обычного удаления старых сообщений. Результат GPT-5.6 Sol на публичной части теста вырос с 13,3% до 38,3%, а число выходных токенов сократилось примерно в шесть раз. Для сравнения, средний результат людей в этих заданиях OpenAI оценила в 48%.
Почему это важно для AI-агентов
Эксперимент показывает: качество агента зависит не только от выбранной модели и промпта. Если система забывает промежуточные выводы, прошлые действия и причины принятых решений, она тратит больше токенов, повторяет анализ и хуже справляется с длинными задачами.
Для разработчиков рекомендация практичная: OpenAI советует использовать Responses API вместо устаревающего Chat Completions API, сохранять reasoning между вызовами инструментов и включать compaction для длинных сессий. Такой подход особенно полезен для агентов, которые работают с браузером, кодом, аналитикой или многошаговыми бизнес-процессами.
Что учитывать при сравнении моделей
Бенчмарк измеряет не «чистый интеллект» модели, а всю связку: модель, промпт, инструменты, управление контекстом и тестовый harness. Поэтому результаты разных AI стоит сравнивать только при сопоставимых настройках — иначе слабая инфраструктура может скрыть реальные возможности модели.