Нейролюб
НовостьНейросетиNVIDIAAI-ускорители

NVIDIA показала Groq 3 LPX: 3431 токен в секунду при контексте 100 тысяч токенов

NVIDIA раскрыла первый сторонний тест ускорителя Groq 3 LPX. Система выдала 3431 токен в секунду на Gemma 4 31B при входном контексте 100 тысяч токенов.

Кирилл Киреев

31.08.2026 · 4 минут чтения · Нейросети

Nvidia Groq 3 Lpx Long Context Inference Cover

Содержание

Что показал первый сторонний тест Groq 3 LPX

NVIDIA опубликовала первый сторонний результат тестирования ускорителя Groq 3 LPX для интерактивного AI-инференса. В бенчмарке Artificial Analysis модель Gemma 4 31B с входным контекстом 100 тысяч токенов генерировала ответы с медианной скоростью 3431 токен в секунду. При контексте 10 тысяч токенов медиана составила 3382 токена в секунду.

Архитектура для длинного контекста

Groq 3 LPX рассчитан на декодирование с малым размером пакета, когда задержка связи между вычислительными блоками становится критичной. В стойке используются 256 локальных процессоров LP30 и суммарно 128 ГБ SRAM. Каждый чип располагает 96 межчиповыми соединениями C2C со скоростью 112 Гбит/с на линию.

Компилятор заранее составляет расписание вычислений и пересылок данных вплоть до такта. NVIDIA утверждает, что это уменьшает задержку первого бита и позволяет перекрывать вычисления обменом данными на уровне 320-байтных векторов. Такой подход нужен для тензорного параллелизма при длинном KV-кэше и небольших пакетах запросов.

Результаты для агентного кода

На открытом наборе SPEED-Bench та же Gemma 4 31B показала медиану 4767 выходных токенов в секунду, а 80-й перцентиль достиг 5520 токенов в секунду. NVIDIA и Artificial Analysis сообщили, что в этих тестах не было снижения точности вычислений или качества выходов.

По оценке NVIDIA, генерация 5000 токенов на скорости 3431 токен в секунду занимает около 1,5 секунды. Это относится именно к этапу декодирования и не описывает полную задержку агентной системы с подготовкой контекста, вызовами инструментов и сетевым обменом.

Связка с Vera Rubin

Groq 3 LPX позиционируется как специализированное дополнение к платформе Vera Rubin NVL72. NVIDIA описывает три варианта совместной работы: раздельные этапы prefill и decode, разделение attention и feed-forward-слоёв, а также спекулятивное декодирование, где LPX запускает небольшую черновую модель, а Vera Rubin проверяет токены большой целевой моделью.

Компания ожидает, что такая связка позволит обслуживать многоагентные системы на моделях с числом параметров свыше 2 триллионов и длинным контекстом. Это пока проектная оценка NVIDIA, а опубликованный измеренный результат относится к плотной модели Gemma 4 на 31 млрд параметров.

Ограничения результата

Тест проводился на системе, развёрнутой NVIDIA в собственном дата-центре. Публичный сервис, самостоятельный доступ к Groq 3 LPX, цены и сроки широкой доступности в публикации не объявлены. Бенчмарк измеряет скорость генерации одной модели и не сравнивает полную стоимость владения, энергопотребление или задержку готового приложения.

Подробности архитектуры, методики и конфигураций опубликованы в официальном техническом блоге NVIDIA. Описание платформы доступно на странице NVIDIA Vera Rubin.

Главное о Groq 3 LPX

Какую скорость показал Groq 3 LPX?

Медиана составила 3431 выходной токен в секунду на Gemma 4 31B при входном контексте 100 тысяч токенов.

Какая модель использовалась в тесте?

Artificial Analysis тестировала плотную модель Gemma 4 с 31 млрд параметров.

Доступен ли Groq 3 LPX публично?

Нет. Тест прошёл на системе в дата-центре NVIDIA, а публичный сервис, цены и сроки широкой доступности не объявлены.

Что именно измеряет опубликованный результат?

Он измеряет скорость генерации токенов и не отражает полную задержку приложения, стоимость владения или энергопотребление системы.