Для роликов, где важны реалистичное движение, работа камеры и звук, нейросеть Veo от Google DeepMind создаёт видео по тексту и изображениям, умеет продолжать сцены и использовать референсные кадры. Актуальная основная версия — Veo 3.1, которая генерирует видео вместе с аудио и поддерживает дополнительные способы контроля композиции.
В text-to-video пользователь описывает сцену с нуля. В image-to-video фотография становится визуальной основой, после чего модель добавляет движение персонажа, объектов и камеры.
Veo 3.1 поддерживает нативный звук, горизонтальный и вертикальный формат, первый и последний кадр, продолжение созданного клипа и использование референсных изображений. В поддерживаемых режимах доступны 720p, 1080p и 4K.
Это делает модель удобной для рекламы, product video, коротких кинематографичных сцен и вертикального контента.
Основная линейка Google сейчас — Veo 3.1. Стандартная версия рассчитана на качество и сложную постановку, а Veo 3.1 Fast помогает быстрее получать варианты. Предыдущие Veo 3 и Veo 3 Fast всё ещё встречаются в инфраструктуре Google.
Отдельной модели «Veo Pro» нет: Google AI Pro — это подписка, а не версия генератора. «Veo Studio» обычно означает работу через Google AI Studio или другую среду Google.
Для оживления кадра загрузите изображение и опишите только необходимые изменения.
Используй изображение как первый кадр. Мужчина поднимает взгляд и медленно идёт вперёд. Камера плавно отъезжает назад. Сохрани его лицо, одежду, архитектуру и освещение. Слышны тихие шаги и городской шум вдали.
Если конечная композиция известна, можно задать первый и последний кадр. Тогда модель получает не только старт, но и точку, к которой должно привести движение.
Для повторяющегося персонажа или предмета пригодятся референсные изображения: они помогают удерживать визуальные детали между сценами.
Полезно описывать кадрирование, действие, движение камеры, окружение и звук.
Вместо «человек в поезде, cinematic» лучше написать:
Средний план мужчины у окна ночного поезда. За стеклом быстро проходят огни города. Камера медленно приближается к лицу. Слышен ритмичный звук колёс и приглушённый шум вагона.
Если нужен вертикальный ролик, формат лучше задать отдельно, а не рассчитывать на последующее кадрирование горизонтального видео.
Нейролюб Studio работает на русском, но в технической документации Gemini API для Veo основным языком промпта указан английский. Поэтому простой запрос можно сформулировать по-русски через интерфейс, а для сложной постановки с операторскими командами надёжнее использовать английский.
В Нейролюб Studio можно выбрать доступную версию Veo и создать ролик без перехода между сервисами. Для начала достаточно текста или фотографии; остальные настройки зависят от режима.
Если цель — финальный рекламный кадр, сначала полезно сделать простой тест движения, а затем запускать высокое разрешение. Так легче проверить лицо, физику сцены и соответствие промпту.
Основная актуальная модель — Veo 3.1. В линейке есть также ускоренный Veo 3.1 Fast.