НовостьНейросетиClaudeAI-агенты

Claude Opus 5 возглавил тест AI-бизнеса и заработал $11 тысяч за виртуальный год

Claude Opus 5 занял первое место в Vending-Bench 2: модель год управляла виртуальным вендинговым бизнесом и закончила тест с балансом $11,2 тысячи.

Кирилл Киреев

29.07.2026 · 3 минут чтения · Нейросети

Claude Opus 5 возглавил Vending-Bench 2

Содержание

Claude Opus 5 стал лучшим AI-управляющим в Vending-Bench 2

Andon Labs обновила Vending-Bench 2 — тест, в котором AI-агенты целый виртуальный год самостоятельно управляют вендинговым бизнесом. Модели получают стартовые $500, ищут поставщиков, ведут переговоры, заказывают товары, управляют запасами, назначают цены и разбираются с возвратами.

Claude Opus 5 обошёл GPT-5.6 Sol

Первое место занял Claude Opus 5 со средним итоговым балансом $11 181,87 по пяти запускам. Следом идут Claude Opus 4.7 с $10 936,76 и GPT-5.6 Sol с $9 619,37. Среди лидеров также оказались GLM-5.2, Claude Opus 4.6 и GPT-5.5.

По наблюдениям Andon Labs, лучшие модели сохраняют стабильную работу с инструментами на протяжении всей симуляции и умеют находить товары по выгодной цене. В обновлённом тесте поставщики могут завышать цены и применять подмену условий, доставки задерживаются, надёжные партнёры исчезают, а покупатели требуют возвраты — то есть агенту приходится не просто отвечать на вопросы, а долго удерживать контекст и перестраивать план.

Хороший результат ещё не означает автономность

Один прогон длится 3–6 тысяч сообщений и требует от модели 60–100 млн выходных токенов. При этом исследователи оценивают сильную стратегию примерно в $63 тысячи за год — почти в шесть раз выше результата лидера. Даже лучшие AI-агенты пока далеки от оптимального управления и могут упускать прибыльные товары, слабее торговаться или принимать непоследовательные решения.

Что это значит для бизнеса

Бенчмарк показывает, что современные модели уже способны месяцами по меркам симуляции вести многошаговый процесс и пользоваться набором инструментов. Но отдавать им цены, закупки, возвраты и переговоры без ограничений пока рано. Практичный сценарий — поручать AI подготовку решений и рутинные действия, оставляя человеку лимиты расходов, контроль исключений и финальное подтверждение рискованных операций.

Хочешь узнавать первым о таких новостях?

Переходи в наш телеграм канал где мы ежедневно публикуем самые свежие и интересные новости

Чиби Новости