Нейролюб
НовостьНейросетиИсследованияLLM

Ai2 открыла BenchMIRT — инструмент показывает, что на самом деле измеряют LLM-бенчмарки

Allen Institute for AI выпустил код и данные BenchMIRT для аудита отдельных заданий в LLM-бенчмарках. Метод разделяет сигналы безопасности и рассуждений, выявляет смешанные метрики и помогает сокращать тесты без большой потери информации.

Кирилл Киреев

01.09.2026 · 5 минут чтения · Нейросети

Allenai Benchmirt LLM Benchmark Audit Cover

Содержание

Как BenchMIRT разбирает оценки LLM по отдельным заданиям

Allen Institute for AI (Ai2) представил BenchMIRT — открытый метод аудита LLM-бенчмарков на уровне отдельных вопросов и заданий. Вместо одного итогового балла система оценивает, какие скрытые способности модели связаны с каждым пунктом теста, насколько пункт сложен и хорошо ли он различает более сильные и слабые модели. Код и три набора данных уже опубликованы.

Что показал анализ 34 тысяч заданий

Авторы обучили BenchMIRT на результатах 100 языковых моделей в 16 бенчмарках, включавших более 34 тысяч вопросов. Шесть тестов были ориентированы на общие рассуждения, в том числе MMLU-Pro, GPQA, MATH и BBH, ещё десять взяли из набора оценок безопасности Olmo 3. Названия измеряемых способностей методу заранее не сообщали, но он устойчиво выделил две главные размерности: безопасность и общие рассуждения.

Для ряда тестов результат совпал с их заявленной целью, но обнаружились и смешанные сигналы. Например, BBQ, который обычно используют для оценки социальных предубеждений, оказался сильнее связан с общими рассуждениями. WMDP, проверяющий опасные знания в биологии, химии и кибербезопасности, тоже больше отражал рассуждения, чем безопасное поведение. В HarmBench вопросы об опасных действиях были связаны с безопасностью, а задания об авторском праве — преимущественно с общими способностями.

Это означает, что низкий или высокий итоговый балл не всегда можно объяснить только тем качеством, которое указано в описании бенчмарка. BenchMIRT не объявляет такие тесты ошибочными, а показывает, какие группы вопросов формируют результат и где один показатель объединяет несколько разных способностей.

Можно ли сделать оценки короче

По данным Ai2, отбор 10% наиболее информативных заданий обычно сохранял почти ту же картину относительной силы моделей по безопасности или рассуждениям, что и полный тест. При сохранении 50% заданий совпадение с полной оценкой часто становилось ещё ближе.

Метод также предсказывал правильность ответа модели на скрытый вопрос в 79% случаев. Простая базовая оценка, предполагающая одинаковую вероятность успеха для всех вопросов одного теста, достигла 70%. При этом авторы отдельно отмечают: если задача состоит только в ранжировании моделей по случайно отложенным вопросам, обычный средний балл немного превосходит BenchMIRT. Преимущество нового подхода — не одно место в таблице, а объяснение поведения отдельных заданий.

Ограничения метода

Все модели в исходном анализе были выпущены не позднее марта 2025 года, поэтому результаты ещё не показывают, как метод ведёт себя на более новых поколениях LLM. Найденные размерности зависят от состава тестов: другой набор заданий может выделить иные способности вместо безопасности и рассуждений.

Есть и риск обратного применения. Оценки информативности позволяют улучшать тесты, но ими же можно воспользоваться, чтобы удалить самые сильные вопросы безопасности и упростить прохождение проверки. Кроме того, публичный репозиторий пока содержит лишь краткое описание, исходный код и зависимости, без подробного руководства по воспроизведению всех экспериментов.

Где попробовать

Исходный код доступен в официальном репозитории Ai2 на GitHub. В коллекции BenchMIRT на Hugging Face опубликованы данные оценок для 34,3 тысячи заданий, статистика 100 моделей и статистика отдельных вопросов. Технический отчёт и подробный разбор результатов собраны в официальной публикации Ai2 и Hugging Face.

Как изучить BenchMIRT

01

Откройте наборы данных

Перейдите в официальную коллекцию BenchMIRT на Hugging Face и изучите данные оценок, статистику моделей и статистику заданий.
02

Скачайте исходный код

Клонируйте публичный репозиторий allenai/BenchMIRT с GitHub или скачайте его архив.
03

Подготовьте окружение

Используйте Python версии 3.12 или новее и установите зависимости, перечисленные в pyproject.toml.
04

Начните с готовой статистики

Сопоставьте показатели отдельных заданий с итоговыми баллами выбранного бенчмарка перед запуском собственных экспериментов.

Главное о BenchMIRT

BenchMIRT — это новый LLM-бенчмарк?

Нет. Это метод аудита существующих бенчмарков, который оценивает вклад и свойства отдельных вопросов или заданий.

На каких данных проверяли метод?

На результатах 100 моделей в 16 бенчмарках и более чем 34 тысячах заданий; все модели были выпущены не позднее марта 2025 года.

Код и данные доступны публично?

Да. Код открыт в репозитории Ai2 на GitHub, а три набора данных опубликованы в коллекции BenchMIRT на Hugging Face.

BenchMIRT заменяет обычный средний балл?

Нет. Метод даёт более подробную картину отдельных заданий, но для простого ранжирования на случайно отложенных вопросах средний балл в исследовании был немного лучше.

Хочешь узнавать первым о таких новостях?

Переходи в наш телеграм канал где мы ежедневно публикуем самые свежие и интересные новости

Перейти в Телеграм

Хочешь узнавать первым о таких новостях?

Переходи в наш телеграм канал где мы ежедневно публикуем самые свежие и интересные новости

Чиби Новости