НовостьНейросетиOpenAIGPT‑5.6

OpenAI раскрыла, как GPT-5.6 снизила стоимость работы AI-моделей на 20%

OpenAI рассказала, как GPT-5.6 Sol помогла снизить стоимость обслуживания моделей на 20%, ускорить генерацию токенов и сделать AI-агентов эффективнее.

Кирилл Киреев

29.07.2026 · 4 минут чтения · Нейросети

GPT-5.6 и инфраструктура AI-агентов OpenAI

Содержание

GPT-5.6 оптимизирует не только задачи пользователей, но и инфраструктуру самой OpenAI

OpenAI опубликовала технический разбор GPT-5.6 и впервые подробно показала, как новая модель помогает оптимизировать инфраструктуру, на которой работают ChatGPT Work и Codex. Главный результат: изменения в вычислительных ядрах и других компонентах снизили сквозную стоимость обслуживания моделей на 20%.

GPT-5.6 сама улучшала код для GPU

По данным OpenAI, GPT-5.6 Sol в Codex анализировала производственный трафик, находила перекосы в распределении нагрузки и тестировала новые стратегии маршрутизации запросов. Модель также автономно переписывала и оптимизировала вычислительные ядра на Triton и Gluon — языках для программирования GPU.

Отдельно команда улучшила speculative decoding: небольшая вспомогательная модель заранее предлагает несколько токенов, а основная проверяет их параллельно. GPT-5.6 Sol провела сотни экспериментов с архитектурой такого помощника и контролировала его обучение. В результате эффективность генерации токенов выросла более чем на 15%.

Почему AI-агенты должны стать быстрее

OpenAI также переработала агентный стек, который связывает модель, инструменты и рабочую среду пользователя. В долгих задачах агент может десятки раз обращаться к модели, читать файлы, запускать проверки и вызывать инструменты, поэтому даже небольшая задержка на каждом шаге заметно увеличивает общее время выполнения.

Чтобы уменьшить эти потери, инструменты, навыки и плагины теперь подгружаются только при необходимости, а вывод инструментов по умолчанию ограничивается 10 000 токенов. История взаимодействия сохраняется в предсказуемом порядке, что повышает долю попаданий в кэш промптов и сокращает повторные вычисления.

Что это значит для пользователей и бизнеса

Это не новая кнопка в ChatGPT, а важное инфраструктурное обновление. Чем меньше вычислений требуется для одного ответа или агентной задачи, тем проще OpenAI удерживать цены, повышать доступность моделей и ускорять сложные рабочие процессы. Особенно заметным эффект должен быть в Codex и ChatGPT Work, где один запрос превращается в длинную цепочку действий.

Хочешь узнавать первым о таких новостях?

Переходи в наш телеграм канал где мы ежедневно публикуем самые свежие и интересные новости

Чиби Новости