НовостьНейросетиAI-агентыНейросети

Photon-1 научился управлять компьютером, наблюдая за видео без разметки действий

Induction Labs представила Photon-1 — AI-модель на 106 млрд параметров, которую обучили на 18 годах видеозаписей работы за компьютером без разметки действий.

Кирилл Киреев

23.07.2026 · 4 минут чтения · Нейросети

Photon-1 обучается управлению компьютером по видеозаписям экрана

Содержание

Photon-1 учится действовать, наблюдая за работой людей

Стартап Induction Labs представил Photon-1 — экспериментальную AI-модель, которая учится работать за компьютером по обычным видеозаписям экрана. Во время предварительного обучения ей не показывали подписи к кликам и нажатиям клавиш: модель сама училась предсказывать, как должен измениться экран дальше.

Как устроено обучение без разметки действий

Photon-1 — разреженная MoE-модель на 106 млрд параметров, из которых для каждого запроса активны около 5 млрд. Команда собрала примерно 2 млн записей работы за компьютером — 575 млн кадров, или эквивалент 18 лет видео при частоте один кадр в секунду. Каждый кадр сжимается до 960 токенов, а модель предсказывает следующее состояние не в пикселях, а в компактном внутреннем представлении.

После дополнительного обучения на менее чем 35 тыс. траекторий и этапа reinforcement learning Photon-1 научился сначала «представлять» нужное состояние экрана, а затем выбирать действие, которое к нему приведёт. В демонстрациях модель открывает сайты, работает в приложениях и даже использует внутренний аналог ChatGPT как инструмент для решения задач.

Что показали тесты

По внутреннему тесту Induction Labs, Photon-1 обошёл Gemini 3.1 Flash-Lite в задачах управления компьютером, хотя на предварительное обучение потребовалось как минимум в 30 раз меньше вычислений, а заявленная стоимость инференса оказалась примерно втрое ниже. Результаты пока не подтверждены независимыми бенчмарками, поэтому сравнение стоит воспринимать как раннюю оценку разработчиков.

Модель также смогли дообучить играть в шашки и моделировать движение бильярдных шаров. Это важная часть эксперимента: авторы хотят показать, что обучение по видео даёт не только навык нажимать кнопки, но и более общее понимание того, как меняются состояния системы.

Почему это важно для AI-инструментов

Если подход масштабируется, компьютерные агенты смогут осваивать программы и рабочие процессы по огромным массивам обучающих видео, без дорогой ручной разметки каждого действия. Для авторов, маркетинга и бизнеса это может означать более универсальную автоматизацию: агент сможет наблюдать за процессом в редакторе, CRM или сервисе публикации, а затем воспроизводить его. Пока Photon-1 остаётся исследовательской моделью, а не доступным пользователям продуктом.

Хочешь узнавать первым о таких новостях?

Переходи в наш телеграм канал где мы ежедневно публикуем самые свежие и интересные новости

Чиби Новости