НовостьНейросетиFLUXAI-видео

Создатели FLUX 3 научили модель управлять роботами на заводах Audi

Black Forest Labs и mimic представили FLUX-mimic — модель на базе FLUX 3, которая не только генерирует видео, но и управляет промышленными роботами. Систему уже тестируют и внедряют на производстве Audi.

Кирилл Киреев

24.07.2026 · 4 минут чтения · Нейросети

FLUX 3 x mimic — модель управления промышленными роботами

Содержание

FLUX 3 стала основой для роботов, которые понимают физический мир

Black Forest Labs вместе с компанией mimic представила FLUX-mimic — video-action-модель для управления промышленными роботами. В её основе лежит FLUX 3, знакомая креаторам как мультимодальная система для совместной генерации изображений, видео и звука. Теперь тот же фундамент научили предсказывать действия робота.

Как генератор видео превратился в модель для роботов

Логика разработчиков проста: чтобы создавать правдоподобное видео, нейросеть должна понимать движение, вес, контакт объектов, причины и последствия событий. По данным Black Forest Labs, обучение на видео занимает более 95% вычислительных затрат FLUX 3. Именно полученное представление о физическом мире стало базой для нового направления.

FLUX-mimic добавляет к визуальной модели компактный декодер действий. Во время обучения качество генерации видео сначала снизилось примерно на 10%, но через 3500 шагов полностью восстановилось — при этом модель уже умела предсказывать действия. Black Forest Labs утверждает, что один и тот же backbone теперь обслуживает и генеративный контент, и Physical AI.

Что показали испытания на производстве Audi

Систему тестировали на реальных производственных задачах: укладке деталей в лотки, установке электронных блоков в тесные крепления, сборке компонентов и работе с гибкими материалами вроде уплотнителей и кабелей. Именно такие операции традиционной автоматике сложно программировать под множество вариантов.

На одной видеокарте NVIDIA RTX 5090 основная модель обрабатывает входные данные менее чем за 80 мс, а полная реакция роботизированной системы занимает около 101 мс. Разработчики также отмечают, что робот способен самостоятельно повторить неудачный захват и завершить задачу, даже если такой сценарий не показывали в обучающих примерах.

Почему это важно для рынка генеративного AI

Релиз показывает, что модели для AI-видео становятся не только инструментами создания роликов. Обучаясь предсказывать кадры, звук и движение, они формируют представление о реальном мире, которое можно использовать в робототехнике, симуляциях и автоматизации. Для креаторов FLUX 3 остаётся генеративной платформой, но для бизнеса тот же технологический фундамент открывает путь к физическим AI-системам без отдельной модели с нуля.

Хочешь узнавать первым о таких новостях?

Переходи в наш телеграм канал где мы ежедневно публикуем самые свежие и интересные новости

Чиби Новости