Google DeepMind·· 2026-08-27精选AI 评分61
Google DeepMind 试点双盲 AI 评测以应对基准测试污染
Piloting the world's first double-blind AI evaluations
AI 导读
Google DeepMind 宣布试点双盲 AI 评测方案,利用密码学安全环境防止前沿专有模型在测试前获取题目,以解决基准测试污染问题。团队联合新加坡 AI 安全研究所、OpenMined、AVERI 与 MLCommons,在隐私保护环境中对 Gemini Flash Lite 模型进行机密基准测试。该机制通过技术与密码学保障替代单纯的合同与日志约束,提升模型能力评测的完整性与可信度。
推荐理由
文章介绍了通过密码学安全环境防止基准测试数据污染的试点方案,为解决模型预先窥题和评估失真提供了工程化参考。
来源:Google DeepMind · deepmind.google