跳到正文

#推理

今日 1 条
今天9月29日周二
  1. Microsoft Research58

    微软研究院发布生物学 AI 研究系统 Quine

    微软研究院推出面向复杂生物学研究的 AI 系统 Quine,由生物多模态世界模型与交互式实验调度框架组成。在与 Broad 研究所合作的胰腺癌研究中,系统在一个周末内预测并筛选出能诱导肿瘤细胞状态转换的候选化合物,并在湿实验中完成验证。微软同步启动了 Quine Fellows 访问计划,并计划未来通过 Microsoft Discovery 等产品逐步扩大访问权限。

9月22日周二
9月16日周三
9月8日周二
  1. OpenAI News76

    OpenAI 提出纳维-斯托克斯千禧年大奖难题的 AI 解答与 Lean 形式化证明

    OpenAI 分享了由 AI 生成的纳维-斯托克斯千禧年大奖难题解决方案。该成果包含完整的技术说明报告,以及使用交互式定理证明工具 Lean 编写的形式化数学证明。

    推荐理由:文中给出了 AI 求解千禧年数学难题的研究报告及 Lean 形式化证明,读者可据此查验机器在数学定理证明中的实际表现。

9月2日周三
  1. Hugging Face Blog55

    BenchMIRT:大语言模型评测基准到底在衡量什么

    AllenAI 推出大语言模型评测审计方法 BenchMIRT,利用多维项目反应理论在题目层面上拆解评测基准实际衡量的底层能力。该研究对 100 个模型在 16 个基准上的表现进行分析,发现 BBQ 和 WMDP 等通常归类为安全的基准实际上受通用推理能力驱动更深。实验还表明,仅筛选保留 10% 高区分度的题目,即可基本复现全量基准区分模型安全与推理能力的效果。

8月17日周一
8月13日周四
  1. Microsoft Research47

    MindTopo 揭示 VLM 的空间推理能力

    新评测基准 MindTopo 评估了多模态模型在连通性、包围、顺序、分离及打结等维度的拓扑推理与规划能力。评测显示,现有开源与闭源模型在静态图像识别上的表现普遍明显优于交互式规划任务,但整体均远低于人类水平。模型在多步规划中往往会丢失结构关系或违反物理动态约束,难以随场景动态变化持续维持拓扑理解。

8月12日周三
  1. Google Research66

    Google Research 提出知识画像框架:大模型事实性瓶颈在于检索而非编码

    Google Research 提出知识画像框架与 WikiProfile 基准,指出前沿大语言模型的事实性瓶颈已从知识编码转向知识检索。评测显示 Gemini-3-Pro 与 GPT-5 等前沿模型已编码 95%–98% 的事实,但仍有 26%–34% 的事实无法直接检索。开启思考机制能够找回 40%–65% 已编码却无法直接检索的事实,显著缓解长尾事实检索困难与反向诅咒现象。

    推荐理由:原文通过实验证明前沿模型的事实错误主要源于检索障碍而非参数缺失,为利用思考机制和后训练改善知识调用提供了新视角。

7月31日周五
  1. Microsoft Research57

    微软研究院提出 EvoLib 框架将经验转化为可演进知识

    微软研究院发布 EvoLib 框架,使大语言模型在测试期无需真实标签或更新权重即可将经验自监督地转化为可复用技能与反思见解。该框架通过知识整合与动态重加权机制持续演进知识库,在数学推理、受限编码及长程交互任务中以更低 token 消耗超越传统检索式记忆方法。目前相关代码与实验结果已在 GitHub 开源。

6月27日周六
6月25日周四
  1. Google Research66

    Google 研究揭示推理过程如何解锁大模型的参数化知识

    Google Research 团队在 COLM 2026 入选论文中揭示,让大模型生成推理轨迹能显著解锁单跳事实问答中原本难以直接读取的参数化知识。该提升主要由提供额外前向计算的计算缓冲效应,以及自发生成相关背景事实的事实预热机制共同驱动。研究同时发现中间推理若夹杂单条幻觉事实会导致最终正确率骤降,建议通过测试期轨迹验证或过程奖励强化真实性。

    推荐理由:研究揭示了思维链除任务拆解外还能辅助参数化记忆检索的双重机制,为理解思考型模型的知识召回与幻觉抑制提供了控制实验依据。

5月20日周三
  1. Google Research73

    Google 推出科研代码生成系统 ERA 与 Computational Discovery 工具

    Google 在《Nature》发表论文介绍科研编程系统 ERA(Empirical Research Assistance),并宣布通过 Gemini for Science 逐步开放基于 ERA 和 AlphaEvolve 构建的实验工具 Computational Discovery。

    推荐理由:该研究展示了将大模型与树搜索结合优化科研代码的具体路径,为自动化计算实验与科学发现提供了可参考的工程框架。

4月22日周三
  1. Google Research60

    Google 提出 ReasoningBank:让智能体从成败经验中提炼推理记忆并自演进

    Google Research 推出智能体记忆框架 ReasoningBank,能够从成功与失败经历中提炼结构化的高阶推理模式,支持测试阶段的持续自演进。该方案通过闭环工作流提取防范性策略,并结合记忆感知测试时扩展(MaTTS)在并行或序列推理中强化策略质量。

    推荐理由:该研究系统性地从失败经验中提炼高层推理模式,为构建具备持续反思与测试时自演进能力的智能体提供了具体记忆架构参考。

4月20日周一
  1. Berkeley AI Research47

    面向更长时域世界模型的基于梯度规划方法 GRASP

    研究人员提出用于世界模型的新型基于梯度规划器 GRASP,旨在解决长时域规划中优化病态与局部极小值陷阱等问题。GRASP 将轨迹提升为虚拟状态以实现跨时间并行优化,并在状态迭代中直接加入随机性以促进探索;同时通过重塑梯度提供清晰动作信号,避免高维视觉模型中脆弱的状态输入梯度。

4月16日周四
  1. Google Research52

    Google 提出合成数据生成框架 Simula:基于第一性原理与机制设计

    Google 推出合成数据生成与评估框架 Simula,通过基于推理的第一性原理将全流程解耦为全局多样性、局部多样性、复杂化与双批评质量检查四个独立可控维度。实验使用 Gemini 2.5 Flash 作为教师模型向 Gemma-3 4B 进行蒸馏,在网络安全、法律推理、数学等领域最高生成 512K 规模数据并显著超越基线。