Содержание
Как Gemini теперь анализирует видео
Google запустила agentic video understanding для моделей Gemini 3.7 Flash, Gemini 3.6 Flash и Gemini 3.5 Flash-Lite. Функция уже доступна разработчикам через Gemini API в Google AI Studio и в Gemini Enterprise Agent Platform. Она работает с загруженными файлами и публичными видео YouTube.
Что изменилось
Обычный режим обрабатывает видео статически: извлекает кадры с фиксированной частотой — по умолчанию один кадр в секунду — и помещает их в контекст за один проход. Новый агентный режим сначала оценивает задачу, а затем сам перемещается по таймлайну, выбирает нужные интервалы и при необходимости запрашивает кадры, аудио или расшифровку. Для важных моментов модель может повысить частоту кадров и разрешение, а неважные части ролика пропустить.
Такой подход рассчитан прежде всего на длинные записи и точечные вопросы: поиск короткого события в многочасовом видео, анализ лекций, обнаружение аномалий, подсчёт повторяющихся действий и объектов. Google отдельно отмечает, что режим способен находить события короче секунды, которые легко пропустить при статической выборке в 1 FPS.
Результаты и цена
По данным Google, на тестах длинного видео агентный режим сокращал общее число токенов до 88%, стоимость анализа — до 66%, а качество ответов повышал до 7%. Наибольший выигрыш компания получила на роликах продолжительностью от десяти минут до нескольких часов. Лучшее сочетание точности и стоимости среди протестированных вариантов показала Gemini 3.7 Flash.
Отдельной платы за функцию нет: действует стандартная цена токенов выбранной модели Gemini API. При этом фактический расход зависит от сложности видео и стратегии навигации модели. Рассуждения во время поиска учитываются как thought tokens, а загруженные по запросу кадры, аудио и расшифровка — как tool use tokens.
Ограничения
Для коротких роликов до пяти минут агентный режим может немного увеличить время до первого токена: модели требуется этап навигации. Статический режим остаётся предпочтительным для задач с жёсткими требованиями к задержке и для покадрового анализа всего клипа. Настройка собственной фиксированной частоты кадров также доступна только в статическом режиме.
Функция поддерживается только Gemini 3.7 Flash, 3.6 Flash и 3.5 Flash-Lite. В приложении Gemini она пока не запущена для всех пользователей: Google обещает начать развёртывание позже. Текущий публичный доступ относится к API и корпоративной платформе.
Где попробовать
Агентное понимание видео доступно через Google AI Studio. Поддерживаемые модели, формат запросов и способы проверки работы режима описаны в официальной документации Gemini API. Анонс и результаты тестов опубликованы в блоге Google.
Как включить агентный анализ видео
Откройте Google AI Studio
Войдите в сервис и подготовьте ключ Gemini API для проекта.Выберите поддерживаемую модель
Используйте Gemini 3.7 Flash, Gemini 3.6 Flash или Gemini 3.5 Flash-Lite через Interactions API.Добавьте видео
Загрузите видеофайл через Files API либо передайте ссылку на публичное видео YouTube.Включите агентную обработку
Укажите значение agentic в поле processing объекта с видео и сформулируйте вопрос к записи.Проверьте выполнение
Найдите processing_call и processing_result в interaction.steps — эти события подтверждают динамическую навигацию по видео.Главное о новом режиме
Какие модели поддерживают агентное понимание видео?
Gemini 3.7 Flash, Gemini 3.6 Flash и Gemini 3.5 Flash-Lite. Для остальных моделей используется статическая обработка.
Функция уже доступна пользователям?
Да, через Gemini API в Google AI Studio и Gemini Enterprise Agent Platform. Массовое развёртывание в приложении Gemini начнётся позже.
Нужно ли доплачивать за агентный режим?
Нет отдельной платы за функцию. Запросы тарифицируются по стандартной цене токенов выбранной модели Gemini API.
Когда лучше оставить статическую обработку?
Для коротких роликов с жёсткими требованиями к задержке, покадрового анализа всего клипа и собственной фиксированной частоты кадров.