Если нужно собрать ролик из текста, фотографии или нескольких референсов, Wan Video от Alibaba работает как семейство моделей для разных сценариев AI-видео. С его помощью можно создать сцену с нуля, анимировать первый кадр, задать конечное изображение, использовать референсы и генерировать звук в поддерживаемых версиях.
Wan подходит как для простого оживления фотографии, так и для постановочной сцены. В зависимости от версии модель работает с текстом, изображениями, видео и аудио. Основные сценарии:
На сентябрь 2026 года Alibaba уже развивает Wan 3.0. Новая ветка объединяет text-to-video, image-to-video и reference-based generation в одной системе и в отдельных режимах поддерживает ролики до 30 секунд.
Wan 2.7 при этом остаётся доступной и используется в API и сторонних интеграциях. В ней задачи разделены на модели для текста, изображения и референсов. Например, Wan 2.7 Image-to-Video поддерживает первый кадр, первый и последний кадр и продолжение сцены, а Reference-to-Video предназначен для сохранения персонажей и предметов.
Поэтому Wan 2.7 — не неработающая старая версия, а предыдущее поколение, которое всё ещё применяется для конкретных задач.
В image-to-video фотография задаёт визуальную основу. Промпт лучше посвятить движению, а не повторному описанию всей картинки.
Используй фото как первый кадр. Девушка медленно идёт вдоль витрины, затем смотрит в сторону камеры. Камера следует параллельно на уровне груди. Сохрани лицо, одежду и внешний вид улицы. Естественный городской звук, без музыки.
Если модель поддерживает последний кадр, можно дополнительно задать конечную композицию. Это полезно для перехода между двумя позами или ракурсами.
Wan умеет работать с несколькими планами. Сцену можно разделить по кадрам:
Shot 1: общий план автомобиля на пустой дороге. Shot 2: низкая камера движется рядом с передним колесом. Shot 3: крупный план водителя через боковое стекло.
Референсы помогают удерживать человека, предмет или среду. В Wan 3.0 мультимодальные материалы объединены в более общий рабочий процесс, поэтому задача не обязательно строится только вокруг стартового кадра.
Сначала опишите главное действие, затем движение камеры и атмосферу. Если нужна многошотовая сцена, перечислите планы в нужном порядке.
Не стоит смешивать противоречащие команды. Например, просьба одновременно оставить камеру статичной и выполнить активный orbit затруднит генерацию.
Официальная документация Wan для ряда версий ориентируется прежде всего на английские и китайские промпты. В Нейролюб Studio настройки доступны на русском, но сложную операторскую постановку надёжнее формулировать по-английски.
В Нейролюб Studio можно выбрать доступную модель Wan, добавить фотографию или задать сцену текстом. Тот же исходник легко сравнить с Kling, Seedance, Veo или Grok Imagine.
Для первого теста достаточно короткого действия и простой камеры. Если модель уверенно сохраняет героя или товар, следующий вариант можно усложнить звуком, дополнительными планами и референсами.
Новейшая ветка — Wan 3.0. Wan 2.7 остаётся доступной и используется в отдельных режимах и интеграциях.