НовостьНейросетиAI-исследованияAI для бизнеса

AI уже решает бизнес-кейсы на 88%: новый тест проверил реальную офисную работу

BusinessCaseBench проверил Claude, GPT и Gemini на 615 задачах из бизнес-школ. Лучшие AI-модели набрали до 88,4% по экспертным критериям.

Кирилл Киреев

17.07.2026 · 3 минут чтения · Нейросети

BusinessCaseBench — тест AI на задачах из бизнес-школ

Содержание

Что показал BusinessCaseBench и почему это важно для бизнеса

Исследователи из Wharton, Harvard Business School и Carnegie Mellon представили BusinessCaseBench — тест, который проверяет нейросети не на фактах, математике или коде, а на задачах, похожих на повседневную работу аналитиков, менеджеров и консультантов. В него вошли 615 открытых вопросов из 238 учебных бизнес-кейсов по 18 дисциплинам: от стратегии и финансов до лидерства и операций.

Лучшие модели набрали больше 80%

Ответы оценивали по критериям, составленным на основе экспертных решений преподавателей. Claude Sonnet 4.6 получил 88,4% с частичным зачётом, GPT-5.4 — 87,2%, а Gemini 3 Flash Preview — 81,6%. Авторы отдельно проверили результаты разными моделями-судьями: общий порядок участников сохранился.

При этом идеальный полный ответ остаётся более сложной планкой, а результаты не означают, что AI может заменить специалиста целиком. Бенчмарк измеряет качество анализа по заданному кейсу, но не проверяет ответственность за решение, работу с людьми, доступ к внутренним данным компании и исполнение рекомендаций в реальном мире.

Что это меняет для команд

Практический вывод для бизнеса — нейросети уже полезно подключать не только к черновикам писем, но и к разбору рынка, сравнению стратегий, подготовке аргументов и проверке гипотез. Сильный сценарий работы: дать модели полный контекст, попросить перечислить допущения и риски, затем сравнить несколько вариантов решения по заранее заданным критериям.

Главный навык — постановка задачи и проверка

Исследование показывает, что преимущество всё чаще получает не тот, кто просто «умеет спросить у ChatGPT», а тот, кто способен собрать качественный контекст, сформулировать критерии хорошего ответа и заметить пропущенные ограничения. Для авторов, маркетологов и небольших команд это возможность быстрее получать уровень структурированного анализа, который раньше требовал отдельного специалиста или долгой подготовки.

BusinessCaseBench пока стоит воспринимать как ориентир, а не как универсальный рейтинг офисных профессий. Авторы сами отмечают ограничения сопоставления учебных кейсов с реальной работой, однако результат важен: разрыв между AI-бенчмарками и экономически полезными задачами начинают измерять на материалах, близких к практике.

Хочешь узнавать первым о таких новостях?

Переходи в наш телеграм канал где мы ежедневно публикуем самые свежие и интересные новости

Чиби Новости