Содержание
Почему результат NVIDIA AVO важен для будущих AI-агентов
NVIDIA представила результаты проекта Agentic Variation Operators (AVO) — архитектуры для AI-агентов, рассчитанных на долгую автономную работу. В связке с Claude Opus 5 система набрала 100,00 балла RHAE на публичном наборе ARC-AGI-3: она прошла все 25 игровых сред и завершила 183 уровня.
Модель — только часть агента
ARC-AGI-3 проверяет не умение ответить на один запрос, а способность действовать в незнакомой среде без инструкции: исследовать её, находить правила, запоминать последствия действий и менять стратегию после ошибок. NVIDIA подчёркивает, что результат обеспечила вся агентная система, а не только базовая модель.
В AVO есть постоянная память, которая переносит накопленные выводы между этапами, и отдельный супервизор. Он следит за общей траекторией работы и перенаправляет основного агента, если тот застрял или повторяет неудачные действия. На тесте система выполнила задачу за 6624 действия — примерно на 12% меньше, чем приведённый NVIDIA результат VISTA с той же моделью, хотя компания предупреждает, что это не строго контролируемое сравнение.
От игр к реальным рабочим задачам
Та же архитектура ранее семь дней автономно оптимизировала GPU-ядра: исследовала более 500 направлений и создала 40 рабочих версий. Полученные ядра внимания оказались до 3,5% быстрее cuDNN и до 10,5% быстрее FlashAttention-4 в протестированных конфигурациях. Это показывает, что подход переносится с программирования на совершенно другой тип интерактивных задач.
Для разработчиков и бизнеса вывод практичный: при выборе AI-агента недостаточно сравнивать названия моделей и результаты обычных бенчмарков. Надёжность долгих процессов зависит от памяти, инструментов, обратной связи, восстановления после ошибок и контроля за ходом задачи — то есть от всей обвязки вокруг модели.
Что изменится для пользователей
В ближайшей перспективе такие архитектуры могут сделать стабильнее агентов для исследований, работы с документами, программирования и многоэтапной автоматизации. Вместо постоянного ручного контроля пользователь сможет ставить более длинную задачу, а система — сохранять прогресс, замечать тупиковые стратегии и возвращаться к цели. При этом результат NVIDIA относится только к публичной части ARC-AGI-3 и не подтверждает прохождение закрытых наборов соревнования.