Содержание
Pika добавила AI-звук к генерации видео
Pika представила Soundtrack — модель, которая получает видео и создаёт для него цельную синхронную звуковую дорожку. В один проход система может добавить движения и удары, фоновую атмосферу, музыку и голос, стараясь привязать каждый звук к тому, что происходит в кадре.
Как работает Pika Soundtrack
Пользователь загружает ролик и при желании добавляет текстовую инструкцию: какие звуки подчеркнуть, что включить в сцену или, наоборот, исключить. Модель анализирует объекты, действия, материалы, движение камеры и смену сцен, после чего генерирует аудио с учётом тайминга и перспективы. Без промпта Soundtrack пытается собрать полный саундскейп самостоятельно.
В основе лежит латентная diffusion-модель на трансформере, которая связывает сжатые токены видео, текста и аудио. Для ускорения Pika использует дистилляцию, кэширование контекста и активаций, а также разреженное внимание. По внутренним тестам компании система показала лучшую смысловую привязку звука к изображению и наименьшую рассинхронизацию среди сравниваемых решений, хотя условия запуска разных моделей отличались.
Что получат видеокреаторы
Soundtrack может быстро добавить Foley к AI-видео, оживить немой черновик, собрать атмосферу для рекламной сцены или предложить несколько вариантов звукового дизайна. Это особенно полезно для коротких роликов и UGC, где ручной подбор эффектов, музыки и фоновых шумов часто занимает больше времени, чем создание изображения.
Где доступна модель
Pika Soundtrack уже работает в Pika API Club. Релиз входит в новое семейство Pika Audio вместе с моделями Music для песен, SFX для отдельных звуковых эффектов и Speech для синтеза и клонирования голоса. Пока основной сценарий рассчитан на разработчиков и сервисы с API, а не на привычный веб-редактор Pika.