Нейролюб
НовостьНейросетиOpenAIGPT‑5.6

OpenAI показала, как удешевить AI-агентов в 25 раз с GPT-5.6

OpenAI выпустила практический гайд по GPT-5.6: в одном из тестов Luna почти повторила результат GPT-5.5 при стоимости запроса в 25 раз ниже. Компания также объяснила, как экономить токены с помощью памяти рассуждений, сжатия контекста и мультиагентного режима.

Кирилл Киреев

13.08.2026 · 4 минут чтения · Нейросети

Архитектура AI-агентов на базе GPT-5.6

Содержание

OpenAI показала, как сделать AI-агентов дешевле и эффективнее на GPT-5.6

OpenAI опубликовала практический гайд для разработчиков по семейству GPT-5.6. Главный вывод: для многих агентных сценариев больше не обязательно использовать самую дорогую флагманскую модель на максимальном уровне рассуждений — меньшие GPT-5.6 Luna и Terra способны давать сопоставимый результат при заметно меньших расходах.

Почти тот же результат — за 4% прежней стоимости

В тесте BrowseComp, где модель ищет редкие факты в интернете, GPT-5.5 с максимальным уровнем рассуждений набрала 84,36% и потратила $33,27. GPT-5.6 Luna показала 84,04%, а стоимость составила $1,33 — примерно в 25 раз меньше. Для сервисов с большим потоком запросов это меняет экономику: Luna и Terra можно ставить на извлечение данных, сортировку документов и повторяющиеся шаги, оставляя Sol для задач, где действительно нужен максимум качества.

Что изменилось в Responses API

OpenAI выделяет три механизма для долгих агентных задач. Первый сохраняет рассуждения между вызовами и сжимает длинный контекст, чтобы агент не восстанавливал уже проделанную работу. Второй позволяет нативно распределять задачу между несколькими агентами. Третий переносит фильтрацию, объединение и обработку результатов инструментов в исполняемый код, не засоряя контекст модели промежуточными данными.

На бенчмарке ARC-AGI-3 одно только сохранение рассуждений вместе со сжатием контекста подняло результат GPT-5.6 Sol с 13,3% до 38,3%. При этом модель использовала примерно в шесть раз меньше выходных токенов. То есть правильная архитектура агента может дать почти трёхкратный прирост без замены самой модели.

Что это значит для продуктов и бизнеса

Для команд, которые строят поиск, аналитику, обработку документов или автоматизацию маркетинга, практический совет простой: подбирать модель для каждого шага, сохранять полезный контекст и выносить механическую работу в код. Дополнительно OpenAI увеличила минимальное время жизни кэша промптов до 30 минут и разрешила задавать точки кэширования внутри контекста — это помогает повторно использовать длинные инструкции и снижать задержки.

Гайд особенно полезен тем, кто уже работает с Responses API: вместо одного дорогого запроса можно собрать связку из недорогих моделей, параллельных агентов и программных инструментов. В результате сложные цепочки становятся быстрее, устойчивее и предсказуемее по бюджету.

Хочешь узнавать первым о таких новостях?

Переходи в наш телеграм канал где мы ежедневно публикуем самые свежие и интересные новости

Перейти в Телеграм

Хочешь узнавать первым о таких новостях?

Переходи в наш телеграм канал где мы ежедневно публикуем самые свежие и интересные новости

Чиби Новости