Содержание
GPT-5.6 оптимизирует не только задачи пользователей, но и инфраструктуру самой OpenAI
OpenAI опубликовала технический разбор GPT-5.6 и впервые подробно показала, как новая модель помогает оптимизировать инфраструктуру, на которой работают ChatGPT Work и Codex. Главный результат: изменения в вычислительных ядрах и других компонентах снизили сквозную стоимость обслуживания моделей на 20%.
GPT-5.6 сама улучшала код для GPU
По данным OpenAI, GPT-5.6 Sol в Codex анализировала производственный трафик, находила перекосы в распределении нагрузки и тестировала новые стратегии маршрутизации запросов. Модель также автономно переписывала и оптимизировала вычислительные ядра на Triton и Gluon — языках для программирования GPU.
Отдельно команда улучшила speculative decoding: небольшая вспомогательная модель заранее предлагает несколько токенов, а основная проверяет их параллельно. GPT-5.6 Sol провела сотни экспериментов с архитектурой такого помощника и контролировала его обучение. В результате эффективность генерации токенов выросла более чем на 15%.
Почему AI-агенты должны стать быстрее
OpenAI также переработала агентный стек, который связывает модель, инструменты и рабочую среду пользователя. В долгих задачах агент может десятки раз обращаться к модели, читать файлы, запускать проверки и вызывать инструменты, поэтому даже небольшая задержка на каждом шаге заметно увеличивает общее время выполнения.
Чтобы уменьшить эти потери, инструменты, навыки и плагины теперь подгружаются только при необходимости, а вывод инструментов по умолчанию ограничивается 10 000 токенов. История взаимодействия сохраняется в предсказуемом порядке, что повышает долю попаданий в кэш промптов и сокращает повторные вычисления.
Что это значит для пользователей и бизнеса
Это не новая кнопка в ChatGPT, а важное инфраструктурное обновление. Чем меньше вычислений требуется для одного ответа или агентной задачи, тем проще OpenAI удерживать цены, повышать доступность моделей и ускорять сложные рабочие процессы. Особенно заметным эффект должен быть в Codex и ChatGPT Work, где один запрос превращается в длинную цепочку действий.