Содержание
OpenAI показала, как сделать AI-агентов дешевле и эффективнее на GPT-5.6
OpenAI опубликовала практический гайд для разработчиков по семейству GPT-5.6. Главный вывод: для многих агентных сценариев больше не обязательно использовать самую дорогую флагманскую модель на максимальном уровне рассуждений — меньшие GPT-5.6 Luna и Terra способны давать сопоставимый результат при заметно меньших расходах.
Почти тот же результат — за 4% прежней стоимости
В тесте BrowseComp, где модель ищет редкие факты в интернете, GPT-5.5 с максимальным уровнем рассуждений набрала 84,36% и потратила $33,27. GPT-5.6 Luna показала 84,04%, а стоимость составила $1,33 — примерно в 25 раз меньше. Для сервисов с большим потоком запросов это меняет экономику: Luna и Terra можно ставить на извлечение данных, сортировку документов и повторяющиеся шаги, оставляя Sol для задач, где действительно нужен максимум качества.
Что изменилось в Responses API
OpenAI выделяет три механизма для долгих агентных задач. Первый сохраняет рассуждения между вызовами и сжимает длинный контекст, чтобы агент не восстанавливал уже проделанную работу. Второй позволяет нативно распределять задачу между несколькими агентами. Третий переносит фильтрацию, объединение и обработку результатов инструментов в исполняемый код, не засоряя контекст модели промежуточными данными.
На бенчмарке ARC-AGI-3 одно только сохранение рассуждений вместе со сжатием контекста подняло результат GPT-5.6 Sol с 13,3% до 38,3%. При этом модель использовала примерно в шесть раз меньше выходных токенов. То есть правильная архитектура агента может дать почти трёхкратный прирост без замены самой модели.
Что это значит для продуктов и бизнеса
Для команд, которые строят поиск, аналитику, обработку документов или автоматизацию маркетинга, практический совет простой: подбирать модель для каждого шага, сохранять полезный контекст и выносить механическую работу в код. Дополнительно OpenAI увеличила минимальное время жизни кэша промптов до 30 минут и разрешила задавать точки кэширования внутри контекста — это помогает повторно использовать длинные инструкции и снижать задержки.
Гайд особенно полезен тем, кто уже работает с Responses API: вместо одного дорогого запроса можно собрать связку из недорогих моделей, параллельных агентов и программных инструментов. В результате сложные цепочки становятся быстрее, устойчивее и предсказуемее по бюджету.