Перейти к содержимому
Экосистема AI Vibe

Новости

BenchMIRT от Ai2: один балл бенчмарка часто смешивает разные умения

Редакция 2 сентября 2026 г.

График BenchMIRT раскладывает баллы LLM-бенчмарков на измерения безопасности и общего рассуждения по отдельным вопросам.

Один средний балл на лидерборде часто смешивает разные умения внутри одного теста — безопасность, рассуждение и то, чего в названии бенчмарка даже нет. Allen AI представила BenchMIRT: метод смотрит на каждый промпт отдельно и показывает, какое умение реально двигает балл.

Как метод находит сигналы

BenchMIRT опирается на многомерную теорию ответов на тесты — психометрический приём IRT, развёрнутый до MIRT. Для каждой модели считается сила по скрытым измерениям, для каждого вопроса — сложность и насколько он отделяет сильные модели от слабых.

Обучали на 100 моделях, 16 бенчмарках и более 34 тысячах вопросов: шесть reasoning-тестов, включая MMLU-Pro, GPQA, MATH и BBH, плюс десять из safety-сьюта Olmo 3 — HarmBench, StrongReject, WildJailbreak, BBQ, WMDP и XSTest. Исследователям не говорили, какой бенчмарк что меряет — стабильно всплывали два измерения: безопасность и общее рассуждение.

Что всплыло в известных тестах

  • BBQ — тест социальных стереотипов, обычно кидают в safety; BenchMIRT показал более сильную связь с рассуждением. Низкий балл может означать сложность вопроса, а не слабую безопасность.
  • WMDP — опасные dual-use знания; балл сильнее коррелировал с reasoning, и более сильное рассуждение давало ниже WMDP: правильный ответ там — отказ.
  • HarmBench — вредные промпты тянут safety, а вопросы про авторские права, например текст песни, ближе к рассуждению.
  • WildJailbreak — вредные jailbreak-промпты и безобидные запросы на отказ сидят в одном среднем балле, хотя меряют разное.

Меньше вопросов — та же картина

BenchMIRT ранжирует вопросы по информативности: 10% самых полезных промптов почти сохраняют картину рейтинга моделей по safety или reasoning. При 50% совпадение с полным бенчмарком часто становится точнее.

На незнакомых вопросах метод угадывает ответ модели в 79% случаев против 70% у baseline, который просто экстраполирует средний балл. Ограничения тоже названы: обучение шло на моделях, выпущенных до марта 2025 года, а найденные измерения зависят от набора бенчмарков.

Источник: BenchMIRT: What are LLM benchmarks actually measuring?.