Содержание
Claude Opus 5 установил новый рекорд в тесте на решение незнакомых задач
Claude Opus 5 стал новым лидером ARC-AGI-3 — независимого теста, который проверяет, как AI разбирается с незнакомыми интерактивными задачами. По подтверждённым результатам ARC Prize модель набрала 30,16%, тогда как предыдущий лучший результат составлял 7,8%.
Что именно проверяет ARC-AGI-3
Вместо вопросов на знания модели дают игровые среды с неизвестными правилами. Нейросети нужно самостоятельно понять механику, спланировать последовательность действий и выполнить её. Такой формат проверяет способность адаптироваться к новому, а не просто воспроизводить знакомые ответы из обучающих данных.
Claude Opus 5 прошёл пять дополнительных публичных сред, которые до него не смогла завершить ни одна модель. ARC Prize связывает результат с более сильным логическим рассуждением: во время тестов Claude переводил задачи в алгебраическую форму и самостоятельно выводил уравнения отражения.
Почему это важно пользователям и бизнесу
Результат особенно интересен для AI-агентов, которым приходится работать без готового сценария: исследовать интерфейсы, планировать цепочки действий, исправлять ошибки и доводить задачу до результата. Для креаторов и команд это может означать более надёжную автоматизацию сложных процессов — от анализа материалов до сборки многошаговых рабочих сценариев.
На более старых тестах Claude Opus 5 также показал 97,5% в ARC-AGI-1 и 90,4% в полу-приватной версии ARC-AGI-2. При этом ARC Prize отмечает, что эти результаты достигнуты с немного более высокой стоимостью, чем у некоторых прежних лидеров.
Что важно учитывать
Один бенчмарк не доказывает появление универсального искусственного интеллекта и не гарантирует такой же четырёхкратный прирост в реальной работе. Но скачок показывает заметный прогресс именно в адаптации к незнакомым задачам — это один из ключевых навыков для следующего поколения автономных AI-инструментов.