Содержание
GEN-1.5 превращает демонстрацию в физический промпт для робота
Стартап Generalist AI представил робототехническую модель GEN-1.5, которая может освоить новое действие по единственной демонстрации продолжительностью от 3 до 12 секунд. Пример загружается в контекст модели как «физический промпт», после чего робот пытается выполнить задачу сразу — без обновления весов и отдельного цикла обучения.
Что умеет GEN-1.5
Модель получает видео, показания датчиков, языковые команды и данные о положении робота, а на выходе формирует траектории движений с частотой 100 Гц. В её контекст помещается до 30 секунд опыта. В демонстрациях GEN-1.5 открывала банку, расстёгивала пенал, доставала деньги из кошелька и работала с незнакомыми инструментами.
Generalist AI также показала составные сценарии: два отдельных физических промпта можно объединить, и модель сама выстроит переход между действиями. Кроме того, робот частично переносит навыки из симуляции в реальный мир и в некоторых случаях повторяет движения, которые человек показывает собственными руками.
Результаты и ограничения
В десяти тестовых задачах один пример дал в среднем 59% успешных попыток. После десяти шагов дообучения на пяти минутах данных показатель вырос до 83%. Компания подчёркивает, что речь пока идёт о простых коротких действиях, а освоенные без дообучения навыки остаются менее устойчивыми.
Есть и важная оговорка: результаты опубликованы самой Generalist AI и пока не подтверждены независимыми тестами. Тем не менее подход интересен тем, что программирование робота начинает напоминать работу с генеративной моделью — нужное поведение можно не описывать кодом, а просто показать.
Почему это важно
Если качество и надёжность таких моделей вырастут, бизнесу будет проще перестраивать роботов под новые операции на складе, производстве или в сервисе. Вместо долгого сбора датасета и обучения под каждую задачу сотрудник сможет записать несколько примеров, собрать из них последовательность и быстро проверить результат в реальных условиях.