跳到正文
原文
Google DeepMind·· 2026-08-27精选AI 评分61

Google DeepMind 试点双盲 AI 评测以应对基准测试污染

Piloting the world's first double-blind AI evaluations

AI 导读

Google DeepMind 宣布试点双盲 AI 评测方案,利用密码学安全环境防止前沿专有模型在测试前获取题目,以解决基准测试污染问题。团队联合新加坡 AI 安全研究所、OpenMined、AVERI 与 MLCommons,在隐私保护环境中对 Gemini Flash Lite 模型进行机密基准测试。该机制通过技术与密码学保障替代单纯的合同与日志约束,提升模型能力评测的完整性与可信度。

推荐理由

文章介绍了通过密码学安全环境防止基准测试数据污染的试点方案,为解决模型预先窥题和评估失真提供了工程化参考。

来源:Google DeepMind · deepmind.google