НовостьНейросетиGoogle DeepMindAI-видео

Google DeepMind превратила видеогенератор в универсальную систему компьютерного зрения

Google DeepMind представила GenCeption — модель, которая использует видеогенератор для оценки глубины, сегментации, 3D-поз и других задач компьютерного зрения.

Кирилл Киреев

19.07.2026 · 3 минут чтения · Нейросети

GenCeption от Google DeepMind

Содержание

GenCeption: видеогенератор научили понимать глубину, объекты и движение

Исследователи Google DeepMind представили GenCeption — универсальную модель компьютерного зрения на базе заранее обученного видеогенератора. Вместо создания роликов система анализирует готовое видео: определяет глубину сцены, строит карты нормалей, оценивает движение камеры, выделяет объекты по текстовому запросу и распознаёт 3D-позы.

Одна модель вместо набора специализированных

В основе GenCeption лежит открытая модель Wan2.1. Авторы переделали многошаговый диффузионный процесс в один прямой проход и свели разные результаты к общему формату. Нужную задачу можно задавать текстом — например, попросить модель выделить конкретный объект или восстановить геометрию сцены.

По данным исследования, единая GenCeption сравнялась или превзошла специализированные решения в ряде тестов на оценку глубины, сегментацию, позы и положение камеры. При этом для дообучения ей потребовалось в 7–500 раз меньше данных, чем некоторым ведущим моделям. Основой стали преимущественно 7 500 синтетических видео.

Почему это важно для AI-видео

Работа показывает, что видеогенераторы учатся не только рисовать правдоподобные кадры. Внутри них формируются представления о пространстве, движении и связи текста с визуальной сценой. Эти навыки можно повторно использовать для монтажа, трекинга объектов, AR/VR, робототехники и инструментов, которые понимают содержание ролика, а не просто генерируют пиксели.

Особенно интересно обобщение: модель, обученная в основном на синтетических видео с людьми, смогла работать с реальными съёмками, несколькими персонажами, животными и роботами, которых не видела при дообучении. Для будущих креативных AI-инструментов это может означать более точное редактирование видео по тексту и меньше ручных масок и трекинга.

Пока это исследовательский прототип

GenCeption ещё не выпущена как пользовательский сервис. Обработка 81 кадра занимает около шести секунд у меньшей версии и около десяти секунд у модели на 14 млрд параметров, а совместное обучение иногда ухудшает качество отдельных задач. Но результаты усиливают идею, что следующий шаг в AI-видео — это модели, которые одновременно генерируют и понимают физическую структуру сцены.

Хочешь узнавать первым о таких новостях?

Переходи в наш телеграм канал где мы ежедневно публикуем самые свежие и интересные новости

Чиби Новости