Содержание
Что показала совместная проверка Kimi K3
Американский Center for AI Standards and Innovation при NIST и британский AI Security Institute совместно проверили кибервозможности модели Kimi K3 от Moonshot AI. Главный результат: в одном из десяти запусков модель самостоятельно завершила учебный сценарий атаки на небольшую корпоративную сеть — при условии, что ей уже дали первоначальный доступ.
Как проходил тест
Эксперимент The Last Ones имитирует корпоративную инфраструктуру примерно из 20 компьютеров и сервисов. Агенту нужно пройти цепочку из 32 шагов: исследовать сеть, находить уязвимости и продвигаться к целям. Человеку-эксперту такой сценарий потребовал бы около 20 часов. В среднем Kimi K3 дошла до 17-го шага, тогда как лучшие американские модели — до 28,5 шага.
Полностью пройти сценарий Kimi K3 удалось только в одной из десяти попыток и в пределах очень большого лимита — 100 миллионов токенов. Авторы оценки подчёркивают, что это контролируемая среда без активных защитников и систем обнаружения атак, а в самой сети заранее предусмотрен уязвимый маршрут. Результат не означает, что модель способна незаметно взломать любую реальную компанию.
Где Kimi K3 сильнее открытых моделей
На ExploitBench, где проверяется создание эксплойтов для 41 уязвимости движка V8, Kimi K3 набрала 32% против 24% у GLM-5.2 — предыдущего лидера среди моделей с открытыми весами. Но до наиболее сильных закрытых систем ей далеко: модель ни разу не смогла довести атаку до выполнения произвольного кода, тогда как лидеры в среднем справлялись с 20 задачами из 41.
Почему это важно
Для бизнеса вывод двойной. AI уже может автоматизировать значительную часть поиска уязвимостей и действий внутри слабозащищённой сети, поэтому базовая кибергигиена, сегментация доступа и мониторинг становятся ещё важнее. Одновременно такие модели могут помогать защитникам быстрее проверять инфраструктуру и воспроизводить атаки в безопасной среде.
Оценка пока предварительная и основана на ограниченном наборе тестов. Открытая версия Kimi K3 заявлена к выпуску 27 июля 2026 года, поэтому результаты NIST и UK AISI дают раннее представление о том, какие возможности вместе с моделью могут получить разработчики и специалисты по безопасности.