Hugging Face Blog·· 28 天前AI 评分55
BenchMIRT:大语言模型评测基准到底在衡量什么
BenchMIRT: What are LLM benchmarks actually measuring?
AI 导读
AllenAI 推出大语言模型评测审计方法 BenchMIRT,利用多维项目反应理论在题目层面上拆解评测基准实际衡量的底层能力。该研究对 100 个模型在 16 个基准上的表现进行分析,发现 BBQ 和 WMDP 等通常归类为安全的基准实际上受通用推理能力驱动更深。实验还表明,仅筛选保留 10% 高区分度的题目,即可基本复现全量基准区分模型安全与推理能力的效果。
来源:Hugging Face Blog · huggingface.co