Содержание
Kimi K3 лидирует во фронтенд‑коде — и заметно уступает в математике
У модели Kimi K3 появились два новых независимых результата, которые хорошо показывают её сильные и слабые стороны. В пользовательском бенчмарке Code Arena: Frontend модель Moonshot AI набрала 1679 баллов и заняла первое место, опередив Claude Fable 5 с 1631 баллом и GPT‑5.6 Sol с 1618 баллами.
Почему результат во фронтенде важен
Code Arena оценивает не абстрактные тесты, а веб‑интерфейсы, созданные моделями по заданиям. Пользователи сравнивают варианты и выбирают лучший, поэтому рейтинг отражает качество реального результата: композицию, визуальную аккуратность и то, насколько хорошо работает сгенерированный интерфейс. Kimi K3 стала первой китайской моделью, поднявшейся на вершину этого рейтинга.
Для дизайнеров, маркетологов, создателей лендингов и быстрых прототипов это практичный сигнал: Kimi K3 стоит добавить в набор инструментов и сравнивать с Claude и ChatGPT на задачах по созданию страниц, рекламных макетов и интерфейсов. Но лидерство в одном тесте ещё не означает универсального превосходства.
С математикой картина обратная
На FrontierMath Tier 4 от Epoch AI — наборе самых сложных экспертных математических задач — Kimi K3 показала около 39% точности. Лучшие модели OpenAI и Anthropic в отдельных случаях приближаются к 90%, то есть разрыв здесь остаётся очень большим.
Это важное напоминание для бизнеса и креаторов: выбирать нейросеть лучше под конкретную работу. Kimi K3 выглядит особенно убедительно в визуальном программировании и фронтенде, но для сложных расчётов, аналитики и задач, где ошибка дорого стоит, ответы нужно перепроверять или использовать более сильную специализированную модель.
Что учитывать на практике
Бенчмарки не гарантируют одинаковый результат на каждом промпте, однако помогают увидеть профиль модели. Для рабочего процесса разумно протестировать Kimi K3 на собственных примерах интерфейсов, а математические выводы проверять отдельными инструментами и не переносить успех во фронтенде на все типы задач.