跳到正文
原文
Hugging Face Blog·· 8 天前AI 评分57

英国 AISI 与 EvalEval 如何实现基准评测结果的可复现

How UK AISI and EvalEval Are Making Benchmark Results Reproducible

AI 导读

英国人工智能安全研究所与 EvalEval 联盟合作,通过 Evaluation Cards 平台与统一规范公开发布评测运行记录与配置细节。公开数据覆盖 Claude Opus 4/4.5/4.6 及 GPT-5/5.2/5.4 等 6 款前沿模型,涉及 FrontierMath、Humanity's Last Exam 等 5 项基准。

来源:Hugging Face Blog · huggingface.co