Содержание
Что показал первый сторонний тест Groq 3 LPX
NVIDIA опубликовала первый сторонний результат тестирования ускорителя Groq 3 LPX для интерактивного AI-инференса. В бенчмарке Artificial Analysis модель Gemma 4 31B с входным контекстом 100 тысяч токенов генерировала ответы с медианной скоростью 3431 токен в секунду. При контексте 10 тысяч токенов медиана составила 3382 токена в секунду.
Архитектура для длинного контекста
Groq 3 LPX рассчитан на декодирование с малым размером пакета, когда задержка связи между вычислительными блоками становится критичной. В стойке используются 256 локальных процессоров LP30 и суммарно 128 ГБ SRAM. Каждый чип располагает 96 межчиповыми соединениями C2C со скоростью 112 Гбит/с на линию.
Компилятор заранее составляет расписание вычислений и пересылок данных вплоть до такта. NVIDIA утверждает, что это уменьшает задержку первого бита и позволяет перекрывать вычисления обменом данными на уровне 320-байтных векторов. Такой подход нужен для тензорного параллелизма при длинном KV-кэше и небольших пакетах запросов.
Результаты для агентного кода
На открытом наборе SPEED-Bench та же Gemma 4 31B показала медиану 4767 выходных токенов в секунду, а 80-й перцентиль достиг 5520 токенов в секунду. NVIDIA и Artificial Analysis сообщили, что в этих тестах не было снижения точности вычислений или качества выходов.
По оценке NVIDIA, генерация 5000 токенов на скорости 3431 токен в секунду занимает около 1,5 секунды. Это относится именно к этапу декодирования и не описывает полную задержку агентной системы с подготовкой контекста, вызовами инструментов и сетевым обменом.
Связка с Vera Rubin
Groq 3 LPX позиционируется как специализированное дополнение к платформе Vera Rubin NVL72. NVIDIA описывает три варианта совместной работы: раздельные этапы prefill и decode, разделение attention и feed-forward-слоёв, а также спекулятивное декодирование, где LPX запускает небольшую черновую модель, а Vera Rubin проверяет токены большой целевой моделью.
Компания ожидает, что такая связка позволит обслуживать многоагентные системы на моделях с числом параметров свыше 2 триллионов и длинным контекстом. Это пока проектная оценка NVIDIA, а опубликованный измеренный результат относится к плотной модели Gemma 4 на 31 млрд параметров.
Ограничения результата
Тест проводился на системе, развёрнутой NVIDIA в собственном дата-центре. Публичный сервис, самостоятельный доступ к Groq 3 LPX, цены и сроки широкой доступности в публикации не объявлены. Бенчмарк измеряет скорость генерации одной модели и не сравнивает полную стоимость владения, энергопотребление или задержку готового приложения.
Подробности архитектуры, методики и конфигураций опубликованы в официальном техническом блоге NVIDIA. Описание платформы доступно на странице NVIDIA Vera Rubin.
Главное о Groq 3 LPX
Какую скорость показал Groq 3 LPX?
Медиана составила 3431 выходной токен в секунду на Gemma 4 31B при входном контексте 100 тысяч токенов.
Какая модель использовалась в тесте?
Artificial Analysis тестировала плотную модель Gemma 4 с 31 млрд параметров.
Доступен ли Groq 3 LPX публично?
Нет. Тест прошёл на системе в дата-центре NVIDIA, а публичный сервис, цены и сроки широкой доступности не объявлены.
Что именно измеряет опубликованный результат?
Он измеряет скорость генерации токенов и не отражает полную задержку приложения, стоимость владения или энергопотребление системы.