НовостьНейросетиHugging FaceГенерация изображений

Hugging Face ускорила локальную генерацию изображений и вдвое снизила расход видеопамяти

Nunchaku Lite теперь встроен в Diffusers: 4-битные модели изображений запускаются без отдельного движка, используют до 50% меньше VRAM и работают до 1,8 раза быстрее.

Кирилл Киреев

23.07.2026 · 3 минут чтения · Нейросети

Nunchaku Lite для 4-битной генерации изображений в Diffusers

Содержание

4-битный Nunchaku теперь запускается прямо в Diffusers

Hugging Face добавила в библиотеку Diffusers нативную поддержку Nunchaku Lite — технологии 4-битного сжатия диффузионных моделей. Теперь оптимизированные генераторы изображений можно загружать обычной командой from_pretrained(), без отдельного движка и ручной сборки CUDA. Это заметно упрощает локальный запуск современных моделей на потребительских видеокартах.

Вдвое меньше видеопамяти

Обычная модель для генерации изображений в формате BF16 часто требует 20–30 ГБ VRAM. Nunchaku одновременно сжимает веса и вычисления до 4 бит, поэтому экономит память и ускоряет сам процесс генерации. В примере Hugging Face изображение 1024 × 1024 создаётся примерно за 1,7 секунды на RTX 5090 с пиковым расходом около 12 ГБ вместо 24 ГБ у исходной версии.

В тесте на RTX PRO 6000 технология снизила пиковое потребление памяти с 31,1 до 20,6 ГБ, а дополнительное сжатие текстового энкодера — до 16 ГБ. Базовое ускорение составило около 30%, а вместе с torch.compile модель работала до 1,8 раза быстрее.

Какие видеокарты поддерживаются

Формат NVFP4 рассчитан на новые NVIDIA Blackwell, включая RTX 50-й серии. Для RTX 30-й и 40-й серий, а также A100 и L40S доступны INT4-версии. Оптимизированные модели сохраняют совместимость с привычными возможностями Diffusers: LoRA, выгрузкой части модели в оперативную память и компиляцией.

Почему это важно для AI-креаторов

Обновление снижает порог входа в локальную генерацию: модели высокого разрешения становятся доступнее без облачной подписки и дорогой профессиональной видеокарты. Авторы могут держать исходники и референсы у себя, быстрее тестировать промпты и подключать LoRA. Разработчики, в свою очередь, получили инструмент diffuse-compressor, чтобы самостоятельно сжимать новые архитектуры и публиковать готовые версии на Hugging Face Hub.

На старте доступны готовые 4-битные сборки для ERNIE Image Turbo, а в инструкции Hugging Face показан процесс оптимизации FLUX.2 Klein 4B. Поддержка встроена в стандартную экосистему Diffusers, поэтому новые совместимые чекпойнты смогут подключаться без создания отдельных пайплайнов.

Хочешь узнавать первым о таких новостях?

Переходи в наш телеграм канал где мы ежедневно публикуем самые свежие и интересные новости

Чиби Новости