跳到正文

#推理

今日 4 条
今天9月29日周二
  1. Microsoft Research58

    微软研究院发布生物学 AI 研究系统 Quine

    微软研究院推出面向复杂生物学研究的 AI 系统 Quine,由生物多模态世界模型与交互式实验调度框架组成。在与 Broad 研究所合作的胰腺癌研究中,系统在一个周末内预测并筛选出能诱导肿瘤细胞状态转换的候选化合物,并在湿实验中完成验证。微软同步启动了 Quine Fellows 访问计划,并计划未来通过 Microsoft Discovery 等产品逐步扩大访问权限。

  2. AWS Machine Learning Blog63

    xAI Grok 4.7 正式上线 Amazon Bedrock

    xAI 的 Grok 4.7 模型已正式登陆 Amazon Bedrock,提供 500K token 上下文窗口并支持 low 至 xhigh 四档推理强度调节。该模型主打长任务自我验证与代码及专业知识工作,在 Bedrock 上通过跨区域推理配置文件提供服务。调用端兼容 OpenAI SDK 与 AWS Converse API,同时支持隐式提示词缓存和 Bedrock Guardrails。

    推荐理由:该集成提供了跨区域推理与四档推理强度控制,开发者可直接在云端现有合规框架内调用长上下文模型。

  3. Simon Willison84

    Claude Sonnet 5.5 发布并开放至免费层

    Anthropic 发布 Claude Sonnet 5.5 模型,速度提升 30% 以上且多数任务成本降低最多 30%,并已作为 claude.ai 免费层默认模型。该模型在各项基准测试中超越 Sonnet 5,部分编程表现接近 Opus 5.5,但在极高思考力度配置下仍可能出现耗尽 128,000 tokens 的问题;此外官方确认 Haiku 5.5 将在未来几周上线。

    推荐理由:作者通过生成测试指出了高强度思考下的耗尽问题,并结合免费层下放评估了实用价值。

9月27日周日
  1. 量子位39

    量子AI初创公司费米宇宙估值达10亿元,推出量子增强大模型FermiQLLM 1.0

    国内Q4AI初创公司费米宇宙完成1亿元种子轮融资、估值约10亿元,并推出全链路量子增强大模型FermiQLLM 1.0。该模型基于Qwen基座改造,无需量子硬件即可在现有GPU上训练部署,内测推理性能提升超15%,强化学习训练成本下降超25%。在MATH-500、GPQA-Diamond及BBH等基准上,其综合性能提升10%~20%。

9月24日周四
9月23日周三
  1. Simon Willison88

    Claude Opus 5.5 与 GPT-6 Sol、Luna 实测体验及价格战分析

    Anthropic 与 OpenAI 分别发布 Claude Opus 5.5 和 GPT-6 Sol、Luna,以大幅降价引发新一轮前沿模型价格战。GPT-6 Luna 将输入价格降至每百万 token 0.10 美元,Opus 5.5 输入降价 20% 且缓存读取价格降低 60%。

    推荐理由:文章梳理了多款新模型的价格落点与降幅,并记录了深度思考模式在生成任务中耗尽上下文的实测表现。

9月22日周二
9月16日周三
  1. Latent Space50

    TypeSafe 推出决策模型 Jev:专注分类与路由,速度比前沿小模型快超 100 倍、成本低超 200 倍

    TypeSafe 推出专用于决策、分类与路由的“系统一模型” Jev,放弃自由文本生成,比前沿小模型快 20–200 倍且成本降低 40–400 倍。该模型基于 RLCD 训练,具备并行采样与无模型幻觉特性,输出 token 免费。其定位为受约束的高效推理引擎,可在生产环境中替代传统 LLM 执行结构化分类、评分与策略路由。

  2. NVIDIA Blog52

    黄仁勋在 Dreamforce 演讲称 AI 让人类能知晓一切并做任何事,Salesforce 推出推理模型 Koa

    黄仁勋在 Salesforce Dreamforce 大会发表演讲,Salesforce 同期宣布基于 NVIDIA Nemotron 3 Super 构建其首个 CRM 推理模型 Koa。黄仁勋指出 AI 安全本质上是工程问题,企业未来都将转向智能体架构。Koa 完全由 Salesforce 在自有基础设施上采用合成数据训练,计划于 10 月展开客户试点并在 2026 年冬季正式上线。

  3. Latent Space58

    AI 在游戏中习得的技能能否迁移至现实工作?Good Start Labs 的探索与实验

    初创团队 Good Start Labs 通过将策略游戏构建为强化学习训练环境,验证了 AI 模型在游戏中习得的推理与目标执行能力可以迁移至实际工作任务。其实验显示,在铁路策略游戏《1830》中训练的终端智能体能显著提升 Finance-Agent 金融研究基准表现,而微调《外交》游戏的模型在客户支持基准上也有所改进。

9月10日周四
9月9日周三
  1. OpenAI News76

    OpenAI 发布企业级模型 GPT-6 Astra

    OpenAI 推出面向企业场景的模型 GPT-6 Astra,定位于其能力最强的工作智能模型。该模型具备更高级的推理能力与计算机操作功能,同时提升了写作和设计判断表现。

    推荐理由:原文列出面向企业场景的核心能力演进,读者可据此了解其在计算机操作与推理层面的定位。

9月8日周二
  1. OpenAI News76

    OpenAI 提出纳维-斯托克斯千禧年大奖难题的 AI 解答与 Lean 形式化证明

    OpenAI 分享了由 AI 生成的纳维-斯托克斯千禧年大奖难题解决方案。该成果包含完整的技术说明报告,以及使用交互式定理证明工具 Lean 编写的形式化数学证明。

    推荐理由:文中给出了 AI 求解千禧年数学难题的研究报告及 Lean 形式化证明,读者可据此查验机器在数学定理证明中的实际表现。

9月3日周四
  1. Google DeepMind79

    Google DeepMind 发布 Gemini 3.8 Flash 与 3.8 Flash Cyber

    Google DeepMind 正式推出 Gemini 3.8 Flash 及专注于网络安全防御的 Gemini 3.8 Flash Cyber,在保持与 3.7 Flash 相同速度和低成本的同时强化了推理与编码能力。

    推荐理由:新模型在保持原有推理成本和低延迟的基础上,显著强化了长程编码智能体能力并推出了防御型安全版本。

9月2日周三
  1. Hugging Face Blog55

    BenchMIRT:大语言模型评测基准到底在衡量什么

    AllenAI 推出大语言模型评测审计方法 BenchMIRT,利用多维项目反应理论在题目层面上拆解评测基准实际衡量的底层能力。该研究对 100 个模型在 16 个基准上的表现进行分析,发现 BBQ 和 WMDP 等通常归类为安全的基准实际上受通用推理能力驱动更深。实验还表明,仅筛选保留 10% 高区分度的题目,即可基本复现全量基准区分模型安全与推理能力的效果。

8月25日周二
  1. Hugging Face Blog73

    IBM Granite 4.2 推理大模型如何构建

    IBM Granite 团队开源了首个 Dense 架构推理大模型家族 Granite 4.2,涵盖 3B、8B 和 30B 三种尺寸并采用 Apache 2.0 协议。

    推荐理由:文章详细拆解了从五阶段预训练到多阶段异步 GRPO 强化学习的完整流程,为开源智能体与推理模型的端到端训练提供了具体工程参考。

8月21日周五
8月17日周一
8月14日周五
  1. Google DeepMind83

    Google DeepMind 发布 Gemini 3.7 Flash

    Google DeepMind 正式推出面向编程与 AI 智能体的工作流模型 Gemini 3.7 Flash,在软件工程、知识处理和 Web 开发上均有提升。

    推荐理由:原文给出了编程和复杂工作流的实测基准数据与首发半价方案,读者可以据此评估在生产环境中替换现有轻量模型的性价比。

8月13日周四
  1. Microsoft Research47

    MindTopo 揭示 VLM 的空间推理能力

    新评测基准 MindTopo 评估了多模态模型在连通性、包围、顺序、分离及打结等维度的拓扑推理与规划能力。评测显示,现有开源与闭源模型在静态图像识别上的表现普遍明显优于交互式规划任务,但整体均远低于人类水平。模型在多步规划中往往会丢失结构关系或违反物理动态约束,难以随场景动态变化持续维持拓扑理解。

8月12日周三
  1. Google Research66

    Google Research 提出知识画像框架:大模型事实性瓶颈在于检索而非编码

    Google Research 提出知识画像框架与 WikiProfile 基准,指出前沿大语言模型的事实性瓶颈已从知识编码转向知识检索。评测显示 Gemini-3-Pro 与 GPT-5 等前沿模型已编码 95%–98% 的事实,但仍有 26%–34% 的事实无法直接检索。开启思考机制能够找回 40%–65% 已编码却无法直接检索的事实,显著缓解长尾事实检索困难与反向诅咒现象。

    推荐理由:原文通过实验证明前沿模型的事实错误主要源于检索障碍而非参数缺失,为利用思考机制和后训练改善知识调用提供了新视角。

7月31日周五
  1. Microsoft Research57

    微软研究院提出 EvoLib 框架将经验转化为可演进知识

    微软研究院发布 EvoLib 框架,使大语言模型在测试期无需真实标签或更新权重即可将经验自监督地转化为可复用技能与反思见解。该框架通过知识整合与动态重加权机制持续演进知识库,在数学推理、受限编码及长程交互任务中以更低 token 消耗超越传统检索式记忆方法。目前相关代码与实验结果已在 GitHub 开源。

7月29日周三
7月16日周四
7月8日周三
  1. Hugging Face Blog62

    Hugging Face transformers 后端在 vLLM 中达到原生速度

    Hugging Face 宣布 vLLM 的 transformers 建模后端在许多 LLM 架构上已达到甚至超过 vLLM 手写原生实现的吞吐。在 Qwen3-4B 单卡、Qwen3-32B 张量并行、Qwen3-235B-A22B-FP8 MoE 三种配置的对比中,该后端均追平或超过原生实现。

    推荐理由:Hugging Face 给出 transformers 后端在 vLLM 中追平原生实现的实测与改动方式,便于判断模型作者是否还需自写 vLLM 实现。

7月2日周四
  1. Mistral AI65

    Mistral AI 发布形式化证明模型 Leanstral 1.5

    Mistral AI 正式发布开源形式化验证模型 Leanstral 1.5,采用 Apache-2.0 协议,拥有 119B 总参数与 6B 激活参数。模型在 miniF2F 评测中达到 100% 满分, PutnamBench 成功解出 587/672 题且单题成本约 4 美元,同时在 FATE-H 与 FATE-X 上刷新纪录。

    推荐理由:模型在极低推理成本下展现出长链形式化验证能力,适合关注自动定理证明与代码严格验证的工程团队参考。

7月1日周三
  1. Berkeley AI Research35

    BAIR 2026 届毕业生展示

    伯克利人工智能研究实验室(BAIR)公布 2026 届博士毕业生名录,集中展示其在前沿 AI 领域的研究成果与职业去向。该届研究涵盖大语言模型与推理、机器人与具身智能、计算机视觉及生成模型等方向。毕业生去向包括前往高校任教、开展博士后研究,或加入 OpenAI、Mistral AI、Physical Intelligence 等机构与自主创业。

  2. Hugging Face Blog70

    Hugging Face 联合 Cerebras 将 Gemma 4 引入实时语音 AI 流水线

    Hugging Face 联合 Cerebras 推出基于 Gemma 4 31B 的实时语音到语音开源流水线,大幅降低语言模型推理与多轮交互延迟。该级联系统采用完全模块化设计,整合 Nvidia Parakeet 语音识别、Cerebras 加速的 Gemma 4 推理以及阿里 Qwen3TTS 文本转语音,重点优化高分位延迟瓶颈。

    推荐理由:原文展示了通过专用推理芯片与模块化开源模型串联消除长尾延迟的方案,为具身智能与实时语音助手的架构设计提供了落地参考。

6月27日周六
6月25日周四
  1. Google Research66

    Google 研究揭示推理过程如何解锁大模型的参数化知识

    Google Research 团队在 COLM 2026 入选论文中揭示,让大模型生成推理轨迹能显著解锁单跳事实问答中原本难以直接读取的参数化知识。该提升主要由提供额外前向计算的计算缓冲效应,以及自发生成相关背景事实的事实预热机制共同驱动。研究同时发现中间推理若夹杂单条幻觉事实会导致最终正确率骤降,建议通过测试期轨迹验证或过程奖励强化真实性。

    推荐理由:研究揭示了思维链除任务拆解外还能辅助参数化记忆检索的双重机制,为理解思考型模型的知识召回与幻觉抑制提供了控制实验依据。

5月29日周五