Содержание
Что умеет новый генератор изображений Mage-Flow
Microsoft представила Mage-Flow — семейство открытых AI-моделей для генерации изображений по тексту и редактирования готовых картинок по инструкции. В линейку вошли базовые, дообученные и ускоренные Turbo-версии, а веса всех шести моделей уже опубликованы на Hugging Face.
Изображение за четыре шага
Mage-Flow-Turbo создаёт изображение 1024×1024 за 0,59 секунды на одной NVIDIA A100, а Mage-Flow-Edit-Turbo выполняет редактирование за 1,02 секунды. Обе Turbo-модели используют всего четыре шага генерации и требуют около 18–20 ГБ видеопамяти.
В основе семейства лежит компактная модель на 4 млрд параметров и новый кодировщик Mage-VAE. По данным разработчиков, он сокращает вычисления при кодировании примерно в 12 раз, а при декодировании — в 22 раза. Общая скорость обучения выросла примерно в 2,5 раза.
Гибкие форматы и редактирование по тексту
Mage-Flow работает с изображениями от 512 до 2048 пикселей и не привязан к нескольким заранее заданным соотношениям сторон. Это полезно для баннеров, вертикальных публикаций, карточек товаров и других форматов, где стандартного квадратного холста недостаточно.
Отдельная версия Mage-Flow-Edit умеет менять изображение по обычной текстовой команде: заменять объекты, корректировать детали и сохранять содержание исходного кадра. Microsoft также улучшила следование промпту, отрисовку текста и визуальное качество с помощью дополнительного обучения с обратной связью.
Почему это важно для креаторов
Главное в релизе — сочетание открытых весов, компактного размера и высокой скорости. Mage-Flow можно тестировать в демо, запускать на своей инфраструктуре и адаптировать под собственные творческие процессы. Для студий, маркетинга и разработчиков это потенциально более управляемая альтернатива закрытым генераторам, особенно когда важны пакетная обработка, приватность и контроль над моделью.