RESEARCH / 04
BenchMIRT: LLMベンチマークは本当に何を測っているのか — Allen Instituteが100モデル・3.4万問で監査
Allen Institute for AI(Ai2)がHugging FaceでBenchMIRTを公開。多次元項目反応理論でLLMベンチマーク16種・3.4万問を分析し、各設問が安全性と推論のどちらを測るかを分離。BBQの推論寄り、WMDPの負の相関、HarmBench内の異質性などを一次情報に基づき整理。
TAG / TOPIC
「LLM評価」に関するAIニュースと解説記事の一覧です。
01 STORIES
LATEST STORIES