跳到正文

推理能力

模型推理能力的进展:思维链、推理模型、数学与逻辑基准的突破与争议。

最新精选

第 1–20 条 · 共 25 条
今天9月29日周二
  1. AWS Machine Learning Blog63

    xAI Grok 4.7 正式上线 Amazon Bedrock

    xAI 的 Grok 4.7 模型已正式登陆 Amazon Bedrock,提供 500K token 上下文窗口并支持 low 至 xhigh 四档推理强度调节。该模型主打长任务自我验证与代码及专业知识工作,在 Bedrock 上通过跨区域推理配置文件提供服务。调用端兼容 OpenAI SDK 与 AWS Converse API,同时支持隐式提示词缓存和 Bedrock Guardrails。

    推荐理由:该集成提供了跨区域推理与四档推理强度控制,开发者可直接在云端现有合规框架内调用长上下文模型。

  2. Simon Willison84

    Claude Sonnet 5.5 发布并开放至免费层

    Anthropic 发布 Claude Sonnet 5.5 模型,速度提升 30% 以上且多数任务成本降低最多 30%,并已作为 claude.ai 免费层默认模型。该模型在各项基准测试中超越 Sonnet 5,部分编程表现接近 Opus 5.5,但在极高思考力度配置下仍可能出现耗尽 128,000 tokens 的问题;此外官方确认 Haiku 5.5 将在未来几周上线。

    推荐理由:作者通过生成测试指出了高强度思考下的耗尽问题,并结合免费层下放评估了实用价值。

9月23日周三
  1. Simon Willison88

    Claude Opus 5.5 与 GPT-6 Sol、Luna 实测体验及价格战分析

    Anthropic 与 OpenAI 分别发布 Claude Opus 5.5 和 GPT-6 Sol、Luna,以大幅降价引发新一轮前沿模型价格战。GPT-6 Luna 将输入价格降至每百万 token 0.10 美元,Opus 5.5 输入降价 20% 且缓存读取价格降低 60%。

    推荐理由:文章梳理了多款新模型的价格落点与降幅,并记录了深度思考模式在生成任务中耗尽上下文的实测表现。

9月16日周三
9月10日周四
9月9日周三
  1. OpenAI News76

    OpenAI 发布企业级模型 GPT-6 Astra

    OpenAI 推出面向企业场景的模型 GPT-6 Astra,定位于其能力最强的工作智能模型。该模型具备更高级的推理能力与计算机操作功能,同时提升了写作和设计判断表现。

    推荐理由:原文列出面向企业场景的核心能力演进,读者可据此了解其在计算机操作与推理层面的定位。

9月8日周二
  1. OpenAI News76

    OpenAI 提出纳维-斯托克斯千禧年大奖难题的 AI 解答与 Lean 形式化证明

    OpenAI 分享了由 AI 生成的纳维-斯托克斯千禧年大奖难题解决方案。该成果包含完整的技术说明报告,以及使用交互式定理证明工具 Lean 编写的形式化数学证明。

    推荐理由:文中给出了 AI 求解千禧年数学难题的研究报告及 Lean 形式化证明,读者可据此查验机器在数学定理证明中的实际表现。

9月3日周四
  1. Google DeepMind79

    Google DeepMind 发布 Gemini 3.8 Flash 与 3.8 Flash Cyber

    Google DeepMind 正式推出 Gemini 3.8 Flash 及专注于网络安全防御的 Gemini 3.8 Flash Cyber,在保持与 3.7 Flash 相同速度和低成本的同时强化了推理与编码能力。

    推荐理由:新模型在保持原有推理成本和低延迟的基础上,显著强化了长程编码智能体能力并推出了防御型安全版本。

8月25日周二
  1. Hugging Face Blog73

    IBM Granite 4.2 推理大模型如何构建

    IBM Granite 团队开源了首个 Dense 架构推理大模型家族 Granite 4.2,涵盖 3B、8B 和 30B 三种尺寸并采用 Apache 2.0 协议。

    推荐理由:文章详细拆解了从五阶段预训练到多阶段异步 GRPO 强化学习的完整流程,为开源智能体与推理模型的端到端训练提供了具体工程参考。

8月14日周五
  1. Google DeepMind83

    Google DeepMind 发布 Gemini 3.7 Flash

    Google DeepMind 正式推出面向编程与 AI 智能体的工作流模型 Gemini 3.7 Flash,在软件工程、知识处理和 Web 开发上均有提升。

    推荐理由:原文给出了编程和复杂工作流的实测基准数据与首发半价方案,读者可以据此评估在生产环境中替换现有轻量模型的性价比。

8月12日周三
  1. Google Research66

    Google Research 提出知识画像框架:大模型事实性瓶颈在于检索而非编码

    Google Research 提出知识画像框架与 WikiProfile 基准,指出前沿大语言模型的事实性瓶颈已从知识编码转向知识检索。评测显示 Gemini-3-Pro 与 GPT-5 等前沿模型已编码 95%–98% 的事实,但仍有 26%–34% 的事实无法直接检索。开启思考机制能够找回 40%–65% 已编码却无法直接检索的事实,显著缓解长尾事实检索困难与反向诅咒现象。

    推荐理由:原文通过实验证明前沿模型的事实错误主要源于检索障碍而非参数缺失,为利用思考机制和后训练改善知识调用提供了新视角。

7月8日周三
  1. Hugging Face Blog62

    Hugging Face transformers 后端在 vLLM 中达到原生速度

    Hugging Face 宣布 vLLM 的 transformers 建模后端在许多 LLM 架构上已达到甚至超过 vLLM 手写原生实现的吞吐。在 Qwen3-4B 单卡、Qwen3-32B 张量并行、Qwen3-235B-A22B-FP8 MoE 三种配置的对比中,该后端均追平或超过原生实现。

    推荐理由:Hugging Face 给出 transformers 后端在 vLLM 中追平原生实现的实测与改动方式,便于判断模型作者是否还需自写 vLLM 实现。

7月2日周四
  1. Mistral AI65

    Mistral AI 发布形式化证明模型 Leanstral 1.5

    Mistral AI 正式发布开源形式化验证模型 Leanstral 1.5,采用 Apache-2.0 协议,拥有 119B 总参数与 6B 激活参数。模型在 miniF2F 评测中达到 100% 满分, PutnamBench 成功解出 587/672 题且单题成本约 4 美元,同时在 FATE-H 与 FATE-X 上刷新纪录。

    推荐理由:模型在极低推理成本下展现出长链形式化验证能力,适合关注自动定理证明与代码严格验证的工程团队参考。

7月1日周三
  1. Hugging Face Blog70

    Hugging Face 联合 Cerebras 将 Gemma 4 引入实时语音 AI 流水线

    Hugging Face 联合 Cerebras 推出基于 Gemma 4 31B 的实时语音到语音开源流水线,大幅降低语言模型推理与多轮交互延迟。该级联系统采用完全模块化设计,整合 Nvidia Parakeet 语音识别、Cerebras 加速的 Gemma 4 推理以及阿里 Qwen3TTS 文本转语音,重点优化高分位延迟瓶颈。

    推荐理由:原文展示了通过专用推理芯片与模块化开源模型串联消除长尾延迟的方案,为具身智能与实时语音助手的架构设计提供了落地参考。

6月25日周四
  1. Google Research66

    Google 研究揭示推理过程如何解锁大模型的参数化知识

    Google Research 团队在 COLM 2026 入选论文中揭示,让大模型生成推理轨迹能显著解锁单跳事实问答中原本难以直接读取的参数化知识。该提升主要由提供额外前向计算的计算缓冲效应,以及自发生成相关背景事实的事实预热机制共同驱动。研究同时发现中间推理若夹杂单条幻觉事实会导致最终正确率骤降,建议通过测试期轨迹验证或过程奖励强化真实性。

    推荐理由:研究揭示了思维链除任务拆解外还能辅助参数化记忆检索的双重机制,为理解思考型模型的知识召回与幻觉抑制提供了控制实验依据。

5月20日周三
  1. Google Research73

    Google 推出科研代码生成系统 ERA 与 Computational Discovery 工具

    Google 在《Nature》发表论文介绍科研编程系统 ERA(Empirical Research Assistance),并宣布通过 Gemini for Science 逐步开放基于 ERA 和 AlphaEvolve 构建的实验工具 Computational Discovery。

    推荐理由:该研究展示了将大模型与树搜索结合优化科研代码的具体路径,为自动化计算实验与科学发现提供了可参考的工程框架。

4月22日周三
  1. Google Research60

    Google 提出 ReasoningBank:让智能体从成败经验中提炼推理记忆并自演进

    Google Research 推出智能体记忆框架 ReasoningBank,能够从成功与失败经历中提炼结构化的高阶推理模式,支持测试阶段的持续自演进。该方案通过闭环工作流提取防范性策略,并结合记忆感知测试时扩展(MaTTS)在并行或序列推理中强化策略质量。

    推荐理由:该研究系统性地从失败经验中提炼高层推理模式,为构建具备持续反思与测试时自演进能力的智能体提供了具体记忆架构参考。

4月13日周一