Содержание
Как BenchMIRT разбирает оценки LLM по отдельным заданиям
Allen Institute for AI (Ai2) представил BenchMIRT — открытый метод аудита LLM-бенчмарков на уровне отдельных вопросов и заданий. Вместо одного итогового балла система оценивает, какие скрытые способности модели связаны с каждым пунктом теста, насколько пункт сложен и хорошо ли он различает более сильные и слабые модели. Код и три набора данных уже опубликованы.
Что показал анализ 34 тысяч заданий
Авторы обучили BenchMIRT на результатах 100 языковых моделей в 16 бенчмарках, включавших более 34 тысяч вопросов. Шесть тестов были ориентированы на общие рассуждения, в том числе MMLU-Pro, GPQA, MATH и BBH, ещё десять взяли из набора оценок безопасности Olmo 3. Названия измеряемых способностей методу заранее не сообщали, но он устойчиво выделил две главные размерности: безопасность и общие рассуждения.
Для ряда тестов результат совпал с их заявленной целью, но обнаружились и смешанные сигналы. Например, BBQ, который обычно используют для оценки социальных предубеждений, оказался сильнее связан с общими рассуждениями. WMDP, проверяющий опасные знания в биологии, химии и кибербезопасности, тоже больше отражал рассуждения, чем безопасное поведение. В HarmBench вопросы об опасных действиях были связаны с безопасностью, а задания об авторском праве — преимущественно с общими способностями.
Это означает, что низкий или высокий итоговый балл не всегда можно объяснить только тем качеством, которое указано в описании бенчмарка. BenchMIRT не объявляет такие тесты ошибочными, а показывает, какие группы вопросов формируют результат и где один показатель объединяет несколько разных способностей.
Можно ли сделать оценки короче
По данным Ai2, отбор 10% наиболее информативных заданий обычно сохранял почти ту же картину относительной силы моделей по безопасности или рассуждениям, что и полный тест. При сохранении 50% заданий совпадение с полной оценкой часто становилось ещё ближе.
Метод также предсказывал правильность ответа модели на скрытый вопрос в 79% случаев. Простая базовая оценка, предполагающая одинаковую вероятность успеха для всех вопросов одного теста, достигла 70%. При этом авторы отдельно отмечают: если задача состоит только в ранжировании моделей по случайно отложенным вопросам, обычный средний балл немного превосходит BenchMIRT. Преимущество нового подхода — не одно место в таблице, а объяснение поведения отдельных заданий.
Ограничения метода
Все модели в исходном анализе были выпущены не позднее марта 2025 года, поэтому результаты ещё не показывают, как метод ведёт себя на более новых поколениях LLM. Найденные размерности зависят от состава тестов: другой набор заданий может выделить иные способности вместо безопасности и рассуждений.
Есть и риск обратного применения. Оценки информативности позволяют улучшать тесты, но ими же можно воспользоваться, чтобы удалить самые сильные вопросы безопасности и упростить прохождение проверки. Кроме того, публичный репозиторий пока содержит лишь краткое описание, исходный код и зависимости, без подробного руководства по воспроизведению всех экспериментов.
Где попробовать
Исходный код доступен в официальном репозитории Ai2 на GitHub. В коллекции BenchMIRT на Hugging Face опубликованы данные оценок для 34,3 тысячи заданий, статистика 100 моделей и статистика отдельных вопросов. Технический отчёт и подробный разбор результатов собраны в официальной публикации Ai2 и Hugging Face.
Как изучить BenchMIRT
Откройте наборы данных
Перейдите в официальную коллекцию BenchMIRT на Hugging Face и изучите данные оценок, статистику моделей и статистику заданий.Скачайте исходный код
Клонируйте публичный репозиторий allenai/BenchMIRT с GitHub или скачайте его архив.Подготовьте окружение
Используйте Python версии 3.12 или новее и установите зависимости, перечисленные в pyproject.toml.Начните с готовой статистики
Сопоставьте показатели отдельных заданий с итоговыми баллами выбранного бенчмарка перед запуском собственных экспериментов.Главное о BenchMIRT
BenchMIRT — это новый LLM-бенчмарк?
Нет. Это метод аудита существующих бенчмарков, который оценивает вклад и свойства отдельных вопросов или заданий.
На каких данных проверяли метод?
На результатах 100 моделей в 16 бенчмарках и более чем 34 тысячах заданий; все модели были выпущены не позднее марта 2025 года.
Код и данные доступны публично?
Да. Код открыт в репозитории Ai2 на GitHub, а три набора данных опубликованы в коллекции BenchMIRT на Hugging Face.
BenchMIRT заменяет обычный средний балл?
Нет. Метод даёт более подробную картину отдельных заданий, но для простого ранжирования на случайно отложенных вопросах средний балл в исследовании был немного лучше.