Нейролюб
НовостьНейросетиOpenAIAI‑чипы

OpenAI раскрыла результаты AI-чипа Jalapeño: до 4,1 раза быстрее на интерактивных задачах

OpenAI опубликовала первые измерения собственного чипа Jalapeño для инференса. На трёх открытых моделях он показал в 1,5–1,9 раза больше работы на ватт и в 1,7–3,6 раза меньшую сквозную задержку, чем системы сравнения.

Кирилл Киреев

31.08.2026 · 5 минут чтения · Нейросети

OpenAI Jalapeno Chip Inference Results Cover

Содержание

Что показали тесты Jalapeño

OpenAI опубликовала первые измеренные результаты Jalapeño — своего первого специализированного чипа для инференса. Компания планирует начать развёртывание ускорителя в собственной вычислительной инфраструктуре до конца 2026 года. Отдельного доступа к чипу для разработчиков или облачного тарифа пока нет: ближайший практический эффект должен проявиться внутри продуктов и API OpenAI в виде более быстрых ответов, устойчивой работы агентов и роста доступной мощности.

Результаты на трёх открытых моделях

OpenAI протестировала Jalapeño на публичном бенчмарке InferenceX с GPT‑OSS 120B, DeepSeek R1 670B и Kimi K2.5 1T. По данным компании, на пике ускоритель выполнял в 1,5–1,9 раза больше AI-работы на ватт, а сквозная задержка была в 1,7–3,6 раза ниже, чем у коммерческих систем сравнения. В наиболее интерактивных режимах преимущество по производительности составило от 2,1 до 4,1 раза.

Для GPT‑OSS 120B OpenAI приводит 85 448 смешанных токенов в секунду на киловатт против 44 960 у системы на GB200. Минимальное время между токенами составило 0,69 мс против 1,87 мс. На DeepSeek R1 компания сравнивала Jalapeño с GB300: 19 641 против 11 781 смешанного токена в секунду на киловатт и 1,65 секунды сквозной задержки против 5,99 секунды. На Kimi K2.5 результат составил 18 195 против 11 862 токенов в секунду на киловатт, а задержка — 1,56 против 5,31 секунды.

Тесты проводила сама OpenAI. Компания нормализовала результаты по паспортной мощности ускорителей: 700 Вт для Jalapeño, 1 200 Вт для GB200 и 1 400 Вт для GB300. При этом OpenAI утверждает, что фактическое устойчивое потребление её чипа на проверенных нагрузках не превышало 550 Вт. Результаты стоит воспринимать как данные производителя: независимое воспроизведение всех сравнений в публикации не приведено.

Как устроен Jalapeño

Чип проектировали именно для генеративного инференса, где разные этапы запроса требуют разных ресурсов. Обработка входного промпта сильнее зависит от вычислительной мощности, генерация токенов — от пропускной способности памяти, а обмен данными между ускорителями добавляет задержку. OpenAI заявляет, что совместно спроектировала вычислительные блоки, память, сеть и серверную систему, чтобы реже перемещать состояние модели и держать KV-кэш ближе к вычислениям.

Jalapeño рассчитан как на высокую пакетную загрузку, так и на интерактивных AI-агентов. Для агентов задержка особенно заметна: если задача состоит из десятков последовательных действий, пауза на каждом шаге складывается в общее время выполнения. Именно поэтому OpenAI оценивает не только максимальное число токенов, но и производительность при фиксированной задержке для пользователя.

AI помог спроектировать и запрограммировать чип

По данным OpenAI, модели помогли пройти путь от начального проекта до передачи дизайна в производство за девять месяцев. AI использовали для перебора реализаций, проверки схем и оптимизации арифметических блоков. Позже Codex с GPT‑Astra помог перенести на Jalapeño три открытые модели за два месяца. На отдельных блоках attention и mixture-of-experts для GPT‑OSS сгенерированные AI реализации работали в 1,5–1,8 раза быстрее прежнего кода специалистов; это число относится к выбранным ядрам, а не к модели целиком.

Что будет дальше

OpenAI называет Jalapeño первым поколением собственной платформы: второе поколение уже находится в глубокой разработке, третье — на стадии формирования архитектуры. Перед массовым запуском компании ещё нужно завершить производственную квалификацию, доработать программный стек и проверить работу на большем числе моделей.

Собственный ускоритель не означает отказа от NVIDIA и других поставщиков. OpenAI прямо пишет, что продолжит широко использовать внешние чипы для обучения и инференса. Jalapeño добавляет компании отдельный путь для задач, где совместная оптимизация модели, софта и оборудования даёт лучший баланс скорости, энергопотребления и стоимости.

Источник и ограничения

В официальной публикации OpenAI приведены первичные результаты, методика и таблицы сравнения. Jalapeño предназначен для внутренней инфраструктуры OpenAI; отдельные продажи, облачный доступ и специальный API для этого чипа не анонсированы.

Частые вопросы

Когда OpenAI начнёт использовать Jalapeño?

Компания планирует начать внедрение чипа в свою вычислительную инфраструктуру до конца 2026 года.

Можно ли купить Jalapeño или подключить его через API?

Нет. Отдельные продажи, облачный доступ и специальный API для Jalapeño не анонсированы.

Какие модели использовали в тестах?

OpenAI проверила GPT‑OSS 120B, DeepSeek R1 670B и Kimi K2.5 1T на публичном бенчмарке InferenceX.

Откажется ли OpenAI от ускорителей NVIDIA?

Нет. OpenAI прямо заявила, что продолжит широко использовать NVIDIA и других партнёров для обучения и инференса.