Содержание
Xiaomi-Robotics-1 показала, как масштабировать обучение роботов
Xiaomi представила Xiaomi-Robotics-1 — базовую vision-language-action модель, которая понимает текстовые команды и управляет роботами в незнакомой обстановке. Главная ставка разработчиков — не на максимальный размер модели, а на масштаб и разнообразие данных: для предварительного обучения собрали более 100 тысяч часов реальных движений в 1700 сценариях.
Как собрали столько данных
Вместо дорогих роботов команда использовала переносные манипуляторы с камерами: человек выполнял ими бытовые и производственные действия, а система записывала траектории. Затем vision-language модель автоматически разбила записи на фрагменты и описала словами, как менялись сцена, положение захвата и объектов. Так Xiaomi получила большой набор размеченных примеров без ручного описания каждого движения.
После предварительного обучения модель дополнительно адаптировали на 7200 часах данных от настоящих роботов. По данным Xiaomi, рост объёма данных давал более заметный эффект, чем простое увеличение модели: успешность выполнения задач в незнакомой среде росла предсказуемо и пока не показала признаков насыщения.
Новые навыки — с минимумом примеров
Для проверки модель учили четырём новым задачам: упаковывать смартфон, загружать бельё в стиральную машину, подавать бумагу в принтер и складывать предметы в коробку. При среднем объёме менее 10 часов демонстраций на задачу Xiaomi-Robotics-1 достигла 75% успешных попыток, тогда как сравниваемая модель π0.5 показала 40%. При увеличении данных до менее чем 40 часов результат Xiaomi вырос до 85%.
На симуляционных тестах модель также заняла первое место в RoboCasa, RoboCasa365, VLABench и RoboDojo. Практический смысл подхода — в том, что одному базовому AI можно быстрее добавлять новые навыки для дома, склада или производства, не собирая огромный датасет отдельно под каждую операцию.
Что важно учитывать
Пока Xiaomi-Robotics-1 остаётся исследовательским проектом, а не готовым бытовым роботом. Компания опубликовала описание, статью и демонстрации, но код и веса модели обещает выпустить позже. Результаты также заявлены самой командой и ещё должны пройти независимую проверку. Тем не менее работа показывает важный сдвиг: для физического AI главным ограничением всё чаще становится не размер нейросети, а доступ к большим и разнообразным данным о реальных действиях.