Hugging Face Blog·· 2026-09-02
Hugging Face 推出 BenchMIRT:审计 LLM 基准测试究竟在测什么
BenchMIRT: What are LLM benchmarks actually measuring?
SI 导读
Hugging Face 发布 BenchMIRT,一种在单条提示词层面审计 LLM 基准测试的多维 IRT 方法,基于 100 个 LLM、16 个基准、超 34K 道题的评测结果训练,在未被告知基准对应能力的情况下自动识别出安全与通用推理两个主导维度。分析显示 BBQ 和 WMDP 的得分与通用推理关联更强,HarmBench 的版权类问题同样如此,说明单一基准分数会混合多种信号。
SI 评分32
来源:Hugging Face Blog · huggingface.co