New-ZZZ
RU / EN
Бенчмарки 1 сентября 2026

BenchMIRT показывает, что на самом деле измеряют тесты LLM

Р
Редакция New-ZZZ
Hugging Face Blog · 1 день назад

BenchMIRT — это новый метод аудита бенчмарков больших языковых моделей на уровне отдельных промптов, а не подход, при котором каждая оценка рассматривается как единый однородный тест. Бенчмарки обычно представляют как инструменты измерения определённой способности — например, безопасности, рассуждения или следования инструкциям. Однако на практике для правильного ответа даже на один вопрос может потребоваться сразу несколько способностей. Промпт, предназначенный для выявления социальных предубеждений, может также требовать отслеживания упомянутых в сценарии людей, интерпретации доказательств и умения не делать необоснованных предположений. В результате итоговая оценка может отражать не только ту способность, которая заявлена в описании бенчмарка.

Проблема возникает и тогда, когда бенчмарк содержит существенно различающиеся группы заданий. WildJailbreak объединяет вредоносные попытки обхода ограничений с безобидными запросами, проверяющими, не отказывается ли модель без необходимости отвечать на безопасные вопросы. Результаты на вредоносных промптах тесно связаны с поведением в области безопасности, тогда как ответы на безобидные промпты могут в большей степени зависеть от общих способностей к рассуждению. Объединение обеих групп в одно среднее значение может скрыть эти различия и затруднить понимание того, почему одна модель превосходит другую. BenchMIRT предназначен для разделения этих перекрывающихся сигналов и определения того, какие базовые способности в наибольшей степени связаны с успешным выполнением каждого промпта.

Метод основан на теории ответов на задания, или IRT, — разработанной в психометрике концепции для оценки способностей по структуре ответов на тестовые вопросы. IRT предполагает, что вопросы различаются не только по сложности, но и по тому, насколько эффективно они позволяют отличать более сильных участников тестирования от более слабых. В более ранних исследованиях, включая проект Fluid Benchmarking, к оценке языковых моделей применялась одномерная IRT. BenchMIRT развивает эту идею с помощью многомерной теории ответов на задания, позволяя нескольким способностям одновременно влиять на вероятность того, что модель правильно ответит на конкретный вопрос.

BenchMIRT проводит анализ как на уровне моделей, так и на уровне отдельных заданий. Для каждой модели он оценивает сильные стороны по измерениям способностей, представленным в выбранных оценочных наборах. Для каждого отдельного вопроса он оценивает сложность и определяет, насколько хорошо задание различает модели с более высокими и более низкими способностями по этим измерениям. Это даёт более подробную картину, чем сводная оценка в таблице лидеров, поскольку исследователи могут увидеть, какие именно вопросы создают видимое преимущество или выявляют слабость модели.

Исследователи обучили BenchMIRT на результатах 100 больших языковых моделей, оценённых по 16 бенчмаркам, включавшим более 34 000 вопросов. Шесть оценочных наборов были посвящены общим способностям к рассуждению, включая MMLU-Pro, GPQA, MATH и BBH. Остальные десять были взяты из набора тестов безопасности Olmo 3 и включали HarmBench, StrongReject, WildJailbreak, BBQ, WMDP и XSTest. Важно отметить, что системе не предоставляли метки, указывающие, какую именно способность должен оценивать каждый бенчмарк.

Несмотря на отсутствие заранее заданного соответствия между бенчмарками и способностями, BenchMIRT самостоятельно выявил два доминирующих измерения: безопасность и общие способности к рассуждению. При каждом повторном запуске анализа с самого начала обнаруживались те же два измерения, что указывает на устойчивость структуры, а не на случайный результат отдельного запуска. Для многих оценочных наборов выводы совпали с их заявленным назначением: результаты традиционных тестов на рассуждение были связаны со способностью рассуждать, а результаты оценок вредоносного контента и попыток обхода ограничений — с безопасностью.

Другие бенчмарки дали менее однозначные результаты. BBQ предназначен для оценки того, опирается ли модель на социальные стереотипы, и обычно классифицируется как бенчмарк безопасности. BenchMIRT обнаружил, что его вопросы гораздо сильнее связаны с общими способностями к рассуждению. Один из примеров, в котором внук и дедушка пытаются заказать Uber, проверяет наличие предположений, связанных с возрастом, но одновременно требует от модели правильно отслеживать личности участников сценария и основывать вывод на предоставленных данных. Поэтому слабый результат в BBQ может указывать на трудности с пониманием вопроса и рассуждением при его решении, а не только на небезопасное или предвзятое поведение.

WMDP продемонстрировал ещё одну необычную взаимосвязь. Этот бенчмарк проверяет опасные знания двойного назначения в биологии, химии и кибербезопасности, включая информацию, которая может способствовать неправомерному применению биологического агента или эксплуатации компьютерной системы. Его результаты оказались сильнее связаны с общими способностями к рассуждению, чем с измерением безопасности. При этом направление взаимосвязи было обратным: более сильные способности к рассуждению соответствовали более низким результатам WMDP, поскольку бенчмарк считает желательным исходом отказ или неспособность предоставить опасную информацию. Это показывает, как правила оценивания бенчмарка могут представить базовую способность полезной или вредной в зависимости от того, какое поведение поощряет оценка.

HarmBench показал, что отдельные разделы одного бенчмарка могут измерять разные сочетания способностей. Его стандартные промпты напрямую запрашивают помощь во вредоносных действиях — например, требуют составить фишинговое письмо для кражи банковских данных. Контекстные промпты предоставляют исходную информацию, а затем просят модель действовать на её основе — например, написать сообщение, убеждающее человека перейти по ссылке с вредоносным ПО. В анализе BenchMIRT обе группы были связаны преимущественно с безопасностью. Однако промпты HarmBench, посвящённые авторскому праву, повели себя иначе: запросы на воспроизведение защищённых материалов, таких как текст известной песни, оказались теснее связаны с общими способностями к рассуждению.

Главный вывод заключается в том, что заявленное назначение бенчмарка не гарантирует, что каждый включённый в него промпт измеряет одну и ту же способность. BenchMIRT позволяет исследователям проводить аудит оценочных наборов до того, как полагаться на их сводные результаты, выявлять смешанные сигналы внутри бенчмарка и отделять поведение модели от требований к рассуждению или правил оценивания, заложенных в конкретных вопросах. Представленные результаты не делают рассмотренные бенчмарки автоматически недействительными; они лишь показывают, почему результаты тестирования необходимо интерпретировать на уровне отдельных заданий, когда на их основе делаются выводы о безопасности или интеллекте модели.

Почему это важно

  • Совокупные результаты бенчмарков могут скрывать, чем обусловлена эффективность модели: безопасностью поведения, способностью рассуждать или сочетанием обоих факторов.
  • Анализ на уровне отдельных заданий помогает исследователям избежать ошибочных выводов о модели, основанных лишь на заявленном назначении бенчмарка.
  • Результаты показывают, что структура оценки и правила подсчёта могут влиять на то, как базовая способность модели отражается в итоговых показателях.

Ключевые факты

  • BenchMIRT обучили на результатах 100 LLM в 16 бенчмарках, включающих более 34 000 вопросов.
  • Не получая меток способностей, метод неоднократно выявлял два доминирующих измерения: безопасность и общую способность рассуждать.
  • В проведённом анализе BBQ и WMDP сильнее коррелировали с общей способностью рассуждать, чем с безопасностью.
  • Разные подмножества HarmBench давали разные сигналы: вредоносные промпты отражали безопасность, а промпты об авторском праве — способность рассуждать.
  • BenchMIRT оценивает способности моделей, а также сложность каждого вопроса и его способность отличать более сильные модели от более слабых.
Читать первоисточник

Полный текст — в первоисточнике. Здесь — краткое изложение и ключевые факты.

/ похожие материалы