НовостьНейросетиOpenAIGPT‑5.6

Две настройки втрое улучшили GPT-5.6 на тесте ARC-AGI-3 — зачем AI-агентам память

OpenAI включила сохранение рассуждений и сжатие контекста — результат GPT-5.6 Sol в ARC-AGI-3 вырос с 13,3% до 38,3%, а расход выходных токенов сократился в шесть раз.

Кирилл Киреев

29.07.2026 · 3 минут чтения · Нейросети

Две настройки втрое улучшили GPT-5.6 на тесте ARC-AGI-3 — зачем AI-агентам память generated fallback cover

Содержание

Почему настройки AI-агента оказались не менее важны, чем сама модель

OpenAI повторно проверила GPT-5.6 Sol на ARC-AGI-3 — наборе незнакомых двумерных игр, где AI должен самостоятельно понять правила и действовать без готовой инструкции. Оказалось, что низкий результат модели был связан не только с её способностями, но и с тем, как тестовая система управляла памятью между действиями.

Что изменили в тесте

В официальной конфигурации после каждого хода скрытые рассуждения модели удалялись, а при заполнении контекста самые ранние действия просто обрезались. Из-за этого AI снова разбирался в игре почти с нуля и со временем терял уже найденные закономерности.

OpenAI перенесла запуск на Responses API и включила две настройки: сохранение рассуждений между шагами и compaction — сжатие длинной истории вместо обычного удаления старых сообщений. Результат GPT-5.6 Sol на публичной части теста вырос с 13,3% до 38,3%, а число выходных токенов сократилось примерно в шесть раз. Для сравнения, средний результат людей в этих заданиях OpenAI оценила в 48%.

Почему это важно для AI-агентов

Эксперимент показывает: качество агента зависит не только от выбранной модели и промпта. Если система забывает промежуточные выводы, прошлые действия и причины принятых решений, она тратит больше токенов, повторяет анализ и хуже справляется с длинными задачами.

Для разработчиков рекомендация практичная: OpenAI советует использовать Responses API вместо устаревающего Chat Completions API, сохранять reasoning между вызовами инструментов и включать compaction для длинных сессий. Такой подход особенно полезен для агентов, которые работают с браузером, кодом, аналитикой или многошаговыми бизнес-процессами.

Что учитывать при сравнении моделей

Бенчмарк измеряет не «чистый интеллект» модели, а всю связку: модель, промпт, инструменты, управление контекстом и тестовый harness. Поэтому результаты разных AI стоит сравнивать только при сопоставимых настройках — иначе слабая инфраструктура может скрыть реальные возможности модели.

Хочешь узнавать первым о таких новостях?

Переходи в наш телеграм канал где мы ежедневно публикуем самые свежие и интересные новости

Чиби Новости