Содержание
Photon-1 учится действовать, наблюдая за работой людей
Стартап Induction Labs представил Photon-1 — экспериментальную AI-модель, которая учится работать за компьютером по обычным видеозаписям экрана. Во время предварительного обучения ей не показывали подписи к кликам и нажатиям клавиш: модель сама училась предсказывать, как должен измениться экран дальше.
Как устроено обучение без разметки действий
Photon-1 — разреженная MoE-модель на 106 млрд параметров, из которых для каждого запроса активны около 5 млрд. Команда собрала примерно 2 млн записей работы за компьютером — 575 млн кадров, или эквивалент 18 лет видео при частоте один кадр в секунду. Каждый кадр сжимается до 960 токенов, а модель предсказывает следующее состояние не в пикселях, а в компактном внутреннем представлении.
После дополнительного обучения на менее чем 35 тыс. траекторий и этапа reinforcement learning Photon-1 научился сначала «представлять» нужное состояние экрана, а затем выбирать действие, которое к нему приведёт. В демонстрациях модель открывает сайты, работает в приложениях и даже использует внутренний аналог ChatGPT как инструмент для решения задач.
Что показали тесты
По внутреннему тесту Induction Labs, Photon-1 обошёл Gemini 3.1 Flash-Lite в задачах управления компьютером, хотя на предварительное обучение потребовалось как минимум в 30 раз меньше вычислений, а заявленная стоимость инференса оказалась примерно втрое ниже. Результаты пока не подтверждены независимыми бенчмарками, поэтому сравнение стоит воспринимать как раннюю оценку разработчиков.
Модель также смогли дообучить играть в шашки и моделировать движение бильярдных шаров. Это важная часть эксперимента: авторы хотят показать, что обучение по видео даёт не только навык нажимать кнопки, но и более общее понимание того, как меняются состояния системы.
Почему это важно для AI-инструментов
Если подход масштабируется, компьютерные агенты смогут осваивать программы и рабочие процессы по огромным массивам обучающих видео, без дорогой ручной разметки каждого действия. Для авторов, маркетинга и бизнеса это может означать более универсальную автоматизацию: агент сможет наблюдать за процессом в редакторе, CRM или сервисе публикации, а затем воспроизводить его. Пока Photon-1 остаётся исследовательской моделью, а не доступным пользователям продуктом.