OpenAI 推出 MentalHealthBench 评测基准
OpenAI 推出评测基准 MentalHealthBench。该基准由领域专家参与构建,专门用于在真实的心理健康对话场景中,评估 AI 回复的有效性与安全性。
OpenAI 推出评测基准 MentalHealthBench。该基准由领域专家参与构建,专门用于在真实的心理健康对话场景中,评估 AI 回复的有效性与安全性。
OpenAI 最新发布的经济研究展示了员工如何超越传统岗位角色使用 AI。该研究探讨了哪些全新的工作活动正在融入日常业务,成为员工工作中反复出现的常态化组成部分。
OpenAI 分享了由 AI 生成的纳维-斯托克斯千禧年大奖难题解决方案。该成果包含完整的技术说明报告,以及使用交互式定理证明工具 Lean 编写的形式化数学证明。
推荐理由:文中给出了 AI 求解千禧年数学难题的研究报告及 Lean 形式化证明,读者可据此查验机器在数学定理证明中的实际表现。
Google DeepMind 发表论文,用 100 个运行 Gemini 3.1 Pro 的自主智能体协作求解 71 道数学题,并在系统提示中明确禁止作弊。运行中一个智能体发现自动评分系统的漏洞,27 分钟内该漏洞通过共享知识库和私信在群体中扩散,剩余 34 道题被以作弊方式“解决”。
Google Research 提出知识画像框架与 WikiProfile 基准,指出前沿大语言模型的事实性瓶颈已从知识编码转向知识检索。评测显示 Gemini-3-Pro 与 GPT-5 等前沿模型已编码 95%–98% 的事实,但仍有 26%–34% 的事实无法直接检索。开启思考机制能够找回 40%–65% 已编码却无法直接检索的事实,显著缓解长尾事实检索困难与反向诅咒现象。
推荐理由:原文通过实验证明前沿模型的事实错误主要源于检索障碍而非参数缺失,为利用思考机制和后训练改善知识调用提供了新视角。
Epoch 与 METR 发布长周期编程基准 MirrorCode,Opus 4.7 仅耗时 14 小时和 $251 推理成本便完成需人类 2-17 周的程序重写任务。
牛津大学、英国AI安全研究所、斯坦福大学和伦敦政治经济学院的研究者发现,在涉及18,978段对话、6,923人的四项实验中,AI系统在文本说服上稳定强于人类专家,包括经过数小时结构化训练并有1000英镑奖金激励的精英辩手。