Содержание
Cerebras CS-4 ускоряет ответы AI-моделей до 30 раз
Cerebras представила CS-4 — четвёртое поколение своей системы для запуска больших AI-моделей. В одной стойке работают три обновлённых процессора Wafer Scale Engine 3 Turbo: вместо множества отдельных чипов компания использует вычислительные пластины почти размером с кремниевую подложку.
Ответы без ожидания
По данным Cerebras, CS-4 генерирует токены до 30 раз быстрее работающих в продакшене GPU-систем. Для моделей размером более 10 трлн параметров заявлена скорость свыше 1000 токенов в секунду, а задержка связи между вычислительными пластинами снижена до двух микросекунд.
По сравнению с предыдущей CS-3 новая система даёт до десяти раз больше пропускной способности по токенам и до двух раз более высокую скорость. При этом это показатели внутренних тестов Cerebras и сторонних бенчмарков: реальная производительность будет зависеть от модели и конфигурации.
Почему это важно пользователям
Для обычного пользователя такие серверы означают более быстрые ответы чат-ботов, генерацию длинных материалов почти в реальном времени и возможность работать с гораздо более крупными моделями без пауз. Для сервисов и бизнеса важен другой эффект: одну систему можно одновременно использовать для быстрых интерактивных ответов и массовой обработки запросов.
CS-4 можно сочетать с другими ускорителями
Система поддерживает раздельный инференс: первичную обработку промпта можно выполнять на AMD Helios, AWS Trainium, GPU или других ASIC, а генерацию ответа передавать CS-4. Это позволяет компаниям добавлять новую платформу к существующей инфраструктуре, не перестраивая дата-центр целиком.
Первые поставки CS-4 начнутся уже в текущем квартале. Если заявленные показатели подтвердятся в независимых тестах, новый ускоритель усилит конкуренцию с NVIDIA и сделает моментальные ответы больших AI-моделей заметно доступнее для корпоративных сервисов.