Содержание
DiffusionGemma меняет привычную схему генерации текста
Google DeepMind подробно раскрыла устройство DiffusionGemma — экспериментальной открытой языковой модели, которая генерирует текст не по одному токену, а сразу блоками по 256 токенов. По данным технического отчёта, модель выдаёт около 1 500 токенов в секунду на одном NVIDIA H100 и создаёт в среднем 20 токенов за один проход.
Не «печатная машинка», а параллельная сборка текста
Большинство LLM строят ответ слева направо и не могут вернуться к уже выбранному слову. DiffusionGemma начинает с блока условного «шума», а затем несколько раз уточняет все позиции одновременно. Такой подход позволяет модели видеть будущие части ответа, исправлять ранние ошибки и быстрее справляться со структурированными задачами — например, заполнением кода, JSON и судоку.
Модель построена на Gemma 4 26B A4B: всего у неё 25,2 млрд параметров, но при каждом запросе активны только 3,8 млрд. Вместо обучения с нуля команда преобразовала готовую авторегрессионную модель в диффузионную, потратив менее 10% исходного тренировочного бюджета. Веса опубликованы под лицензией Apache 2.0.
Скорость выросла, но качество пока ниже
Главный компромисс — качество ответов. На большинстве тестов DiffusionGemma уступает обычной Gemma 4: например, на MMLU Pro результат составляет 77,6% против 82,6%, а на AIME 2026 — 69,1% против 88,3%. Google поэтому называет модель экспериментальной и рекомендует стандартную Gemma 4 для задач, где важнее максимальная точность.
Преимущество особенно заметно при локальной работе и небольшом числе одновременных запросов. При высокой серверной нагрузке обычные LLM эффективнее объединяют запросы в пакеты, поэтому после примерно 32 параллельных сессий разница в пропускной способности сокращается.
Что это даёт разработчикам и AI-продуктам
Для пользователей это шаг к интерфейсам, где AI отвечает почти мгновенно: редакторам текста в реальном времени, локальным помощникам, быстрым генераторам кода и интерактивным приложениям. DiffusionGemma поддерживает контекст до 256 тысяч токенов, изображения, видео, вызов функций и режим рассуждений; квантованная версия помещается примерно в 18 ГБ видеопамяти на современных потребительских GPU.