BenchMIRT от Ai2: один балл бенчмарка часто смешивает разные умения

Один средний балл на лидерборде часто смешивает разные умения внутри одного теста — безопасность, рассуждение и то, чего в названии бенчмарка даже нет. Allen AI представила BenchMIRT: метод смотрит на каждый промпт отдельно и показывает, какое умение реально двигает балл.
Как метод находит сигналы
BenchMIRT опирается на многомерную теорию ответов на тесты — психометрический приём IRT, развёрнутый до MIRT. Для каждой модели считается сила по скрытым измерениям, для каждого вопроса — сложность и насколько он отделяет сильные модели от слабых.
Обучали на 100 моделях, 16 бенчмарках и более 34 тысячах вопросов: шесть reasoning-тестов, включая MMLU-Pro, GPQA, MATH и BBH, плюс десять из safety-сьюта Olmo 3 — HarmBench, StrongReject, WildJailbreak, BBQ, WMDP и XSTest. Исследователям не говорили, какой бенчмарк что меряет — стабильно всплывали два измерения: безопасность и общее рассуждение.
Что всплыло в известных тестах
- BBQ — тест социальных стереотипов, обычно кидают в safety; BenchMIRT показал более сильную связь с рассуждением. Низкий балл может означать сложность вопроса, а не слабую безопасность.
- WMDP — опасные dual-use знания; балл сильнее коррелировал с reasoning, и более сильное рассуждение давало ниже WMDP: правильный ответ там — отказ.
- HarmBench — вредные промпты тянут safety, а вопросы про авторские права, например текст песни, ближе к рассуждению.
- WildJailbreak — вредные jailbreak-промпты и безобидные запросы на отказ сидят в одном среднем балле, хотя меряют разное.
Меньше вопросов — та же картина
BenchMIRT ранжирует вопросы по информативности: 10% самых полезных промптов почти сохраняют картину рейтинга моделей по safety или reasoning. При 50% совпадение с полным бенчмарком часто становится точнее.
На незнакомых вопросах метод угадывает ответ модели в 79% случаев против 70% у baseline, который просто экстраполирует средний балл. Ограничения тоже названы: обучение шло на моделях, выпущенных до марта 2025 года, а найденные измерения зависят от набора бенчмарков.
Источник: BenchMIRT: What are LLM benchmarks actually measuring?.