Содержание
Microsoft переводит генерацию изображений и голоса на собственные AI-модели
Microsoft представила две новые версии собственных моделей — MAI-Image-2.5-Pro для генерации изображений высокого качества и MAI-Voice-2-Flash для быстрых голосовых сценариев. Обе модели вышли в публичную предварительную версию и доступны разработчикам через Microsoft Foundry.
Bing и PowerPoint переходят на MAI-Image
Bing Image Creator теперь на 100% работает на внутренних технологиях Microsoft: MAI-Image-2.5 стала моделью по умолчанию для генерации и точного редактирования изображений. Та же модель уже используется в PowerPoint для преобразования картинок и, по данным компании, сокращает расходы на GPU до 84% по сравнению с GPT-Image-2.
В OneDrive MAI-Image-2.5 отвечает за ключевые функции редактирования. После внедрения доля сохранённых пользователями результатов выросла на 26%, задержка снизилась примерно на четверть, а эффективность в типичных рабочих нагрузках увеличилась в 2,5 раза.
Что умеют новые версии
MAI-Image-2.5-Pro рассчитана на задачи, где особенно важны детализация, точное размещение текста внутри изображения и правки по естественной команде. Это полезно для рекламных макетов, презентаций, обложек и других материалов, которые требуют нескольких итераций.
MAI-Voice-2-Flash ориентирована на голосовых агентов и массовые разговорные сервисы. Она работает вдвое быстрее базовой MAI-Voice-2 и стоит на 32% дешевле. Модель уже используется в Dynamics 365 Contact Center и подключена к Azure Voice Live для создания приложений с общением голосом в реальном времени.
Почему это важно креаторам и бизнесу
Для пользователей изменения означают, что генеративные функции глубже встраиваются в привычные продукты Microsoft: изображение можно создать или исправить прямо в презентации, файле OneDrive или Bing. Для бизнеса собственные модели дают компании больше контроля над стоимостью, скоростью и качеством — а разработчикам позволяют выбирать между максимальной детализацией и быстрым массовым производством контента.