OpenAI 推出 MentalHealthBench 评测基准
OpenAI 推出评测基准 MentalHealthBench。该基准由领域专家参与构建,专门用于在真实的心理健康对话场景中,评估 AI 回复的有效性与安全性。
OpenAI 推出评测基准 MentalHealthBench。该基准由领域专家参与构建,专门用于在真实的心理健康对话场景中,评估 AI 回复的有效性与安全性。
英国人工智能安全研究所与 EvalEval 联盟合作,通过 Evaluation Cards 平台与统一规范公开发布评测运行记录与配置细节。公开数据覆盖 Claude Opus 4/4.5/4.6 及 GPT-5/5.2/5.4 等 6 款前沿模型,涉及 FrontierMath、Humanity's Last Exam 等 5 项基准。
IBM Research 在 Hugging Face 博客介绍 ALTK-Evolve 新增的 consistency guidelines 与 Consistency Analyzer,用于衡量并改善智能体在重复运行下的不稳定问题。
推荐理由:原文提出 Pass^k 与一致性差距的度量,并给出把差距减半的检测与修复方法,可用于判断智能体上线后的可靠性。
Hugging Face 联合 Voice Arena 在 Open ASR Leaderboard 中上线 Monsoon 印地语与印度英语语音评测集。该数据集包含 4,888 位说话人及 12 项人口统计学元数据,涵盖公有与私有切分,支持按地区、年龄和设备等多维度排查识别错误。
Google DeepMind 宣布试点双盲 AI 评测方案,利用密码学安全环境防止前沿专有模型在测试前获取题目,以解决基准测试污染问题。团队联合新加坡 AI 安全研究所、OpenMined、AVERI 与 MLCommons,在隐私保护环境中对 Gemini Flash Lite 模型进行机密基准测试。该机制通过技术与密码学保障替代单纯的合同与日志约束,提升模型能力评测的完整性与可信度。
推荐理由:文章介绍了通过密码学安全环境防止基准测试数据污染的试点方案,为解决模型预先窥题和评估失真提供了工程化参考。
Hugging Face 针对语音识别模型刷榜和基准过拟合现象提出三种量化测试,并评估了 11 个主流开源 ASR 模型。实测显示部分基准高分模型会直接复现参考文本里的历史标注错误,在音频数字被静音时仍有 30% 至 40% 的概率猜出被抹去的数字,甚至依赖背景声学线索切换不同数据集的拼写习惯。
推荐理由:该研究量化了语音模型利用声学线索迎合测试集的过拟合行为,为评估模型真实泛化能力提供了实用检测方法。
研究团队推出含 70 款纯文本游戏的 DiG-bench 基准,评估 AI 自主探索隐藏规则的能力,Opus 5 与 Fable 5 表现最佳但在最高难度 Tier 7 成功率仅 20%。
Hugging Face 与 alphaXiv 联合举办 ICML 2026 开放复现挑战赛,1,221 名社区成员利用编码智能体复现了 2,226 篇论文。审计结果显示 51% 的论文至少有一项声明得到独立验证,23% 存在被推翻或具争议的声明,多篇论文的证明缺陷或代码偏差已获原作者确认并提交 arXiv 更正。
推荐理由:原文展示了社区利用编码智能体大规模复现顶会论文的实测数据,呈现了智能体在学术审计中的潜力与人机协作边界。
新评测基准 MindTopo 评估了多模态模型在连通性、包围、顺序、分离及打结等维度的拓扑推理与规划能力。评测显示,现有开源与闭源模型在静态图像识别上的表现普遍明显优于交互式规划任务,但整体均远低于人类水平。模型在多步规划中往往会丢失结构关系或违反物理动态约束,难以随场景动态变化持续维持拓扑理解。
Epoch 与 METR 发布长周期编程基准 MirrorCode,Opus 4.7 仅耗时 14 小时和 $251 推理成本便完成需人类 2-17 周的程序重写任务。
语音 AI 基准 Real World VoiceEQ 正式发布,基于超过 100 万项人类真实评分,全面评测 40 多款主流专有及开源语音模型的实际交互质量。
IBM Research 推出企业级 Java 框架迁移评测基准 ScarfBench,用于评估 AI 智能体在 Spring、Jakarta EE 与 Quarkus 之间的跨框架重构能力。
Google Research 推出人机对话数据集 ConvApparel,用于量化并弥合 LLM 用户模拟器与真实人类间的真实度差距。数据集涵盖服装购物场景超 4,000 场对话(近 15,000 轮),通过将用户分流至“优质”与故意制造障碍的“劣质”双智能体,记录逐轮的满意度与挫败感。团队还提出了结合统计对齐、拟人度评分和反事实验证的三维框架来评测模拟器。
Google Research 推出一套基于情境判断测试(SJT)的新评估框架,用于衡量大语言模型在真实日常与职场场景中的行为倾向是否与人类对齐。团队对 25 个模型进行的评测显示,参数量小于 25B 的小模型在人类高度共识场景下的方向对齐接近随机水平,而大于 120B 的前沿模型在共识低于 90% 时对齐率也仅停留在 80% 左右。
Google 与康奈尔大学测试了 GPT-4o、Claude 3.5、Gemini Advanced Pro 1.5 和 NotebookLM 等 6 款大语言模型解答高温超导前沿问题的表现。