Содержание
SANA-Video 2.0: быстрое AI-видео 720p на одной видеокарте
Исследовательская команда NVIDIA представила SANA-Video 2.0 — новую архитектуру для генерации видео, рассчитанную на высокое качество без огромных вычислительных затрат. Модель существует в версиях на 5 и 14 млрд параметров и умеет создавать ролики с разрешением до 720p на одной видеокарте NVIDIA H100.
Пять секунд видео — примерно за 13 секунд
Главный результат проекта — скорость. По данным авторов, оптимизированная версия SANA-Video 2.0 на 5 млрд параметров генерирует пятисекундный ролик 720p примерно за 13,06 секунды. В том же тесте она оказалась до 120 раз быстрее Wan 2.2-A14B, а при работе с минутными роликами вычислительная часть модели была в 3,2 раза быстрее сопоставимой архитектуры с обычным механизмом внимания.
Ускорение стало возможным благодаря гибридному вниманию: большая часть слоёв использует более экономичное линейное внимание, а периодические softmax-блоки помогают сохранять качество и связи между деталями кадра. Дополнительная оптимизация Sol-Engine — объединение операций, кэширование и разреженное внимание — ускорила весь конвейер ещё в 3,58 раза.
Качество не принесли в жертву скорости
SANA-Video 2.0 получила 84,30 балла в тесте VBench. Авторы утверждают, что модель сохраняет качество полноценных видеодиффузионных трансформеров, но лучше масштабируется на длинные последовательности. Это особенно важно для генерации более продолжительных роликов, где стоимость обычного внимания быстро растёт.
Что это значит для креаторов
Пока SANA-Video 2.0 — исследовательский проект, а не готовый массовый сервис, поэтому авторы и маркетологи ещё не могут просто открыть его в браузере и начать работу. Но технология показывает направление рынка: качественное AI-видео становится быстрее и дешевле, а модели постепенно перестают требовать сложных многопроцессорных систем. Для сервисов генерации контента это может означать более короткое ожидание, снижение цены рендера и появление длинных роликов без резкого роста затрат.