Содержание
Gemini Robotics ER 2 стал «мозгом» для роботов с доступом через API
Google DeepMind представила Gemini Robotics ER 2 — новую модель воплощённого мышления для управления роботами на высоком уровне. Она понимает речь и происходящее вокруг, планирует многошаговые задачи, а конкретные движения передаёт нижнеуровневой VLA-модели или API робота.
Что изменилось в ER 2
Главное обновление — непрерывная работа с видеопотоком. Модель отслеживает прогресс прямо во время выполнения задания, замечает сбои и может повторить неудачный этап, не запуская весь процесс заново. Одновременно робот продолжает действовать: Gemini Robotics ER 2 обдумывает следующий шаг без длинных пауз между командами.
Модель также умеет вызывать Google Search и пользовательские функции. Разработчик может подключить навигацию, манипулятор, VLA-модель и другие управляющие интерфейсы как инструменты, а на вход передавать видео, звук и текст через Gemini Live API.
Точнее понимает момент завершения
В тестах ER 2 показала точность 57,4% при классификации прогресса задачи и 91,3% при поиске критического момента в видеопотоке. Средняя ошибка определения события составила 0,96 секунды, а выполнение стало в четыре раза быстрее — это важно для действий вроде остановки наливания жидкости или перехода к следующему этапу сборки.
Ещё одно заметное новшество — координация нескольких роботов. Машины разных типов могут использовать общее понимание задачи, передавать друг другу этапы и вместе выполнять сценарии, которые не под силу одному устройству.
Почему это важно
Gemini Robotics ER 2 уже доступна разработчикам через Gemini API и Google AI Studio, а для корпоративной платформы Google запущено закрытое превью. Google также выложила примеры кода: это превращает новую модель из исследовательской демонстрации в инструмент для прототипирования роботов в логистике, производстве и сервисных сценариях.