Нейролюб
НовостьНейросетиGoogleGemma

Google раскрыла DiffusionGemma: открытая модель генерирует до 1 500 токенов в секунду

Google DeepMind опубликовала технический разбор DiffusionGemma — открытой модели, которая генерирует текст блоками по 256 токенов и достигает около 1 500 токенов в секунду на NVIDIA H100.

Кирилл Киреев

09.08.2026 · 4 минут чтения · Нейросети

Официальная обложка Google DiffusionGemma

Содержание

DiffusionGemma меняет привычную схему генерации текста

Google DeepMind подробно раскрыла устройство DiffusionGemma — экспериментальной открытой языковой модели, которая генерирует текст не по одному токену, а сразу блоками по 256 токенов. По данным технического отчёта, модель выдаёт около 1 500 токенов в секунду на одном NVIDIA H100 и создаёт в среднем 20 токенов за один проход.

Не «печатная машинка», а параллельная сборка текста

Большинство LLM строят ответ слева направо и не могут вернуться к уже выбранному слову. DiffusionGemma начинает с блока условного «шума», а затем несколько раз уточняет все позиции одновременно. Такой подход позволяет модели видеть будущие части ответа, исправлять ранние ошибки и быстрее справляться со структурированными задачами — например, заполнением кода, JSON и судоку.

Модель построена на Gemma 4 26B A4B: всего у неё 25,2 млрд параметров, но при каждом запросе активны только 3,8 млрд. Вместо обучения с нуля команда преобразовала готовую авторегрессионную модель в диффузионную, потратив менее 10% исходного тренировочного бюджета. Веса опубликованы под лицензией Apache 2.0.

Скорость выросла, но качество пока ниже

Главный компромисс — качество ответов. На большинстве тестов DiffusionGemma уступает обычной Gemma 4: например, на MMLU Pro результат составляет 77,6% против 82,6%, а на AIME 2026 — 69,1% против 88,3%. Google поэтому называет модель экспериментальной и рекомендует стандартную Gemma 4 для задач, где важнее максимальная точность.

Преимущество особенно заметно при локальной работе и небольшом числе одновременных запросов. При высокой серверной нагрузке обычные LLM эффективнее объединяют запросы в пакеты, поэтому после примерно 32 параллельных сессий разница в пропускной способности сокращается.

Что это даёт разработчикам и AI-продуктам

Для пользователей это шаг к интерфейсам, где AI отвечает почти мгновенно: редакторам текста в реальном времени, локальным помощникам, быстрым генераторам кода и интерактивным приложениям. DiffusionGemma поддерживает контекст до 256 тысяч токенов, изображения, видео, вызов функций и режим рассуждений; квантованная версия помещается примерно в 18 ГБ видеопамяти на современных потребительских GPU.

Хочешь узнавать первым о таких новостях?

Переходи в наш телеграм канал где мы ежедневно публикуем самые свежие и интересные новости

Перейти в Телеграм

Хочешь узнавать первым о таких новостях?

Переходи в наш телеграм канал где мы ежедневно публикуем самые свежие и интересные новости

Чиби Новости