跳到正文
原文
Hugging Face·· 29 天前精选AI 评分64

AllenAI 推出 BenchMIRT:基于多维项目反应理论审计 LLM 基准测试

BenchMIRT: What are LLM benchmarks actually measuring?

AI 导读

AllenAI 推出 BenchMIRT 评估方法,利用多维项目反应理论在单题层级审计 LLM 基准测试实际衡量的潜在能力,并开源了代码、数据与技术报告。该方法分析了 100 个大模型在 16 个基准中超过 34K 道题目的表现,独立分离出安全性和通用推理两大主维度,发现 BBQ 与 WMDP 等传统安全基准的得分受通用推理能力影响更显著。

推荐理由

该方法引入多维项目反应理论拆解评测题目实际测量的能力维度,有助于研究者诊断基准中的混杂信号并精简测试集。

来源:Hugging Face · huggingface.co