Содержание
Что показали тесты Jalapeño
OpenAI опубликовала первые измеренные результаты Jalapeño — своего первого специализированного чипа для инференса. Компания планирует начать развёртывание ускорителя в собственной вычислительной инфраструктуре до конца 2026 года. Отдельного доступа к чипу для разработчиков или облачного тарифа пока нет: ближайший практический эффект должен проявиться внутри продуктов и API OpenAI в виде более быстрых ответов, устойчивой работы агентов и роста доступной мощности.
Результаты на трёх открытых моделях
OpenAI протестировала Jalapeño на публичном бенчмарке InferenceX с GPT‑OSS 120B, DeepSeek R1 670B и Kimi K2.5 1T. По данным компании, на пике ускоритель выполнял в 1,5–1,9 раза больше AI-работы на ватт, а сквозная задержка была в 1,7–3,6 раза ниже, чем у коммерческих систем сравнения. В наиболее интерактивных режимах преимущество по производительности составило от 2,1 до 4,1 раза.
Для GPT‑OSS 120B OpenAI приводит 85 448 смешанных токенов в секунду на киловатт против 44 960 у системы на GB200. Минимальное время между токенами составило 0,69 мс против 1,87 мс. На DeepSeek R1 компания сравнивала Jalapeño с GB300: 19 641 против 11 781 смешанного токена в секунду на киловатт и 1,65 секунды сквозной задержки против 5,99 секунды. На Kimi K2.5 результат составил 18 195 против 11 862 токенов в секунду на киловатт, а задержка — 1,56 против 5,31 секунды.
Тесты проводила сама OpenAI. Компания нормализовала результаты по паспортной мощности ускорителей: 700 Вт для Jalapeño, 1 200 Вт для GB200 и 1 400 Вт для GB300. При этом OpenAI утверждает, что фактическое устойчивое потребление её чипа на проверенных нагрузках не превышало 550 Вт. Результаты стоит воспринимать как данные производителя: независимое воспроизведение всех сравнений в публикации не приведено.
Как устроен Jalapeño
Чип проектировали именно для генеративного инференса, где разные этапы запроса требуют разных ресурсов. Обработка входного промпта сильнее зависит от вычислительной мощности, генерация токенов — от пропускной способности памяти, а обмен данными между ускорителями добавляет задержку. OpenAI заявляет, что совместно спроектировала вычислительные блоки, память, сеть и серверную систему, чтобы реже перемещать состояние модели и держать KV-кэш ближе к вычислениям.
Jalapeño рассчитан как на высокую пакетную загрузку, так и на интерактивных AI-агентов. Для агентов задержка особенно заметна: если задача состоит из десятков последовательных действий, пауза на каждом шаге складывается в общее время выполнения. Именно поэтому OpenAI оценивает не только максимальное число токенов, но и производительность при фиксированной задержке для пользователя.
AI помог спроектировать и запрограммировать чип
По данным OpenAI, модели помогли пройти путь от начального проекта до передачи дизайна в производство за девять месяцев. AI использовали для перебора реализаций, проверки схем и оптимизации арифметических блоков. Позже Codex с GPT‑Astra помог перенести на Jalapeño три открытые модели за два месяца. На отдельных блоках attention и mixture-of-experts для GPT‑OSS сгенерированные AI реализации работали в 1,5–1,8 раза быстрее прежнего кода специалистов; это число относится к выбранным ядрам, а не к модели целиком.
Что будет дальше
OpenAI называет Jalapeño первым поколением собственной платформы: второе поколение уже находится в глубокой разработке, третье — на стадии формирования архитектуры. Перед массовым запуском компании ещё нужно завершить производственную квалификацию, доработать программный стек и проверить работу на большем числе моделей.
Собственный ускоритель не означает отказа от NVIDIA и других поставщиков. OpenAI прямо пишет, что продолжит широко использовать внешние чипы для обучения и инференса. Jalapeño добавляет компании отдельный путь для задач, где совместная оптимизация модели, софта и оборудования даёт лучший баланс скорости, энергопотребления и стоимости.
Источник и ограничения
В официальной публикации OpenAI приведены первичные результаты, методика и таблицы сравнения. Jalapeño предназначен для внутренней инфраструктуры OpenAI; отдельные продажи, облачный доступ и специальный API для этого чипа не анонсированы.
Частые вопросы
Когда OpenAI начнёт использовать Jalapeño?
Компания планирует начать внедрение чипа в свою вычислительную инфраструктуру до конца 2026 года.
Можно ли купить Jalapeño или подключить его через API?
Нет. Отдельные продажи, облачный доступ и специальный API для Jalapeño не анонсированы.
Какие модели использовали в тестах?
OpenAI проверила GPT‑OSS 120B, DeepSeek R1 670B и Kimi K2.5 1T на публичном бенчмарке InferenceX.
Откажется ли OpenAI от ускорителей NVIDIA?
Нет. OpenAI прямо заявила, что продолжит широко использовать NVIDIA и других партнёров для обучения и инференса.