НовостьНейросетиMicrosoftAI-видео

Microsoft открыла Mage-VL — AI-модель анализирует потоковое видео в 3,5 раза быстрее

Microsoft выпустила открытую мультимодальную модель Mage-VL на 4 млрд параметров. Она понимает изображения и видео, сокращает число визуальных токенов более чем на 75% и ускоряет обработку до 3,5 раза.

Кирилл Киреев

26.07.2026 · 3 минут чтения · Нейросети

Microsoft открыла Mage-VL — AI-модель анализирует потоковое видео в 3,5 раза быстрее cover

Содержание

Microsoft Mage-VL: быстрая AI-модель для понимания изображений и потокового видео

Microsoft опубликовала Mage-VL — открытую мультимодальную модель, которая понимает изображения, обычные и длинные видео, а также непрерывный видеопоток. Модель использует языковую основу Qwen3-4B и собственный визуальный кодировщик Mage-ViT; веса и код доступны по лицензии Apache 2.0.

Вместо всех кадров — только важные изменения

Большинство видеомоделей равномерно выбирают кадры и превращают каждый из них в множество визуальных токенов. Mage-VL работает ближе к видеокодеку: полностью обрабатывает опорные кадры, а в промежуточных сохраняет участки с движением и новыми деталями. По данным авторов, это сокращает число визуальных токенов более чем на 75% и даёт до 3,5 раза более быструю обработку при сопоставимой точности.

Один чекпоинт поддерживает изображения, короткие и длинные ролики, H.264/HEVC-видео и потоковый режим. Внутри есть лёгкий «шлюз внимания»: он следит за происходящим и запускает полную модель только после значимого события. Поэтому система может не комментировать рутинные фрагменты и реагировать, например, на завершённый игровой момент или изменение сцены.

Компактная модель обошла базовую Qwen3-VL-4B на видео

В тестах с одинаковой языковой основой Mage-VL показала лучший результат, чем Qwen3-VL-4B, на всех заявленных авторами задачах понимания видео и временной локализации. Особенно заметен прирост в поиске нужного момента внутри ролика и пространственном анализе. При этом визуальный кодировщик обучили с нуля примерно на 100 млн изображений и видеокадров, без миллиардного набора пар «картинка — текст».

Почему это важно для креаторов и бизнеса

Подход Mage-VL может удешевить сервисы, которым нужно постоянно «смотреть» видео: автоматическую разметку архива, поиск сцен для монтажа, модерацию UGC, аналитику трансляций и мониторинг событий. Меньшее число токенов означает более длинные ролики в том же вычислительном бюджете, а событийный режим — меньше лишних запусков модели.

Сейчас Mage-VL скорее инструмент для разработчиков, чем готовый пользовательский редактор: модель нужно разворачивать самостоятельно и учитывать требования к видеокодекам. Но открытая лицензия и единый чекпоинт делают проект удобной основой для собственных AI-функций в видеоплатформах, медиа и сервисах для контента.

Хочешь узнавать первым о таких новостях?

Переходи в наш телеграм канал где мы ежедневно публикуем самые свежие и интересные новости

Чиби Новости