Google DeepMind 推出多智能体科研系统 Co-Scientist
Google DeepMind 在《Nature》发表研究并推出基于 Gemini 的多智能体 AI 系统 Co-Scientist,旨在协助科研人员在生命科学等领域生成、论证与迭代科学假说。
推荐理由:原文给出了多智能体通过辩论锦标赛演进科学假说的架构细节,对探索 AI 辅助基础科研的工作流设计提供了参考。
让模型自主规划、调用工具、完成多步任务的技术方向——从 Claude Code、Manus 到各家 Agent 框架与评测基准的全部动态。
Google DeepMind 在《Nature》发表研究并推出基于 Gemini 的多智能体 AI 系统 Co-Scientist,旨在协助科研人员在生命科学等领域生成、论证与迭代科学假说。
推荐理由:原文给出了多智能体通过辩论锦标赛演进科学假说的架构细节,对探索 AI 辅助基础科研的工作流设计提供了参考。
Google DeepMind 汇总了 Gemini 驱动的编码智能体 AlphaEvolve 发布一年来的落地成果。它帮助 DeepConsensus 将变异检测错误降低 30%,把电网 AC Optimal Power Flow 的可行解比例从 14% 提升到 88%以上,并在量子模拟中给出误差低 10 倍的量子线路。
推荐理由:一年来 AlphaEvolve 在基因测序、电网、TPU 与量子模拟等场景的落地数据,展示了编码智能体从演示走向基础设施的路径。
Google DeepMind 宣布 AI co-clinician 研究计划,探索 AI 智能体在医生监督下协助患者诊疗。在 98 个真实初级保健问题的盲测中,该系统在其中 97 个案例未出现关键错误,医生对其回答的偏好也高于主流证据合成工具。
推荐理由:Google DeepMind 披露 AI co-clinician 的评测设计与多模态问诊模拟结果,可了解医疗 AI 从文本走向实时音视频的路径。
Mistral AI 发布 Workflows 公测版,定位为企业 AI 编排层,提供持久化执行、可观测性和容错能力,用于把 AI 流程从概念验证推进到生产环境。
推荐理由:Mistral 把企业 AI 编排层的落地路径讲清楚了,包括持久化执行、人审断点和数据面隔离的具体做法。
Google Research 推出智能体记忆框架 ReasoningBank,能够从成功与失败经历中提炼结构化的高阶推理模式,支持测试阶段的持续自演进。该方案通过闭环工作流提取防范性策略,并结合记忆感知测试时扩展(MaTTS)在并行或序列推理中强化策略质量。
推荐理由:该研究系统性地从失败经验中提炼高层推理模式,为构建具备持续反思与测试时自演进能力的智能体提供了具体记忆架构参考。
Google DeepMind 正式推出开源模型 Gemma 4 系列,包含 E2B、E4B、26B MoE 和 31B Dense 四种尺寸,专为高级推理与智能体工作流设计。
推荐理由:Gemma 4 转向 Apache 2.0 商业许可并覆盖端侧至 31B 规模,展示了小尺寸开源模型在多模态与智能体工作流上的落地路径。
Mistral AI 总结了内部平台工具 Spaces CLI 的开发经验,提出了一套同时适配人类开发者与编码智能体的命令行设计原则。团队提出交互式输入均需提供对应的命令行参数与非交互模式默认值,通过 context.json 和 AGENTS.md 自动导出结构化上下文与执行规则,并消除工作目录等隐式状态依赖,使智能体能自主完成从脚手架创建到部署的全流程。
推荐理由:文章总结了让命令行工具兼顾人类交互与智能体调用的五条工程规范,为开发者构建面向智能体的开发工具提供了可迁移的落地参考。
Google Research 在 The Check Up 活动上公布了一系列医疗健康 AI 突破,涵盖个人健康助手、临床辅助决策系统及开源开发者工具。团队展示了具备多模态推理能力的多智能体系统 AMIE 在临床问诊中的实测进展,并推广支持 3D 影像的开源医疗模型 MedGemma;同时公布了乳腺癌早筛研究以及用于识别癌症基因突变的研究工具 DeepSomatic。
推荐理由:文章系统梳理了前沿医疗多模态模型与多智能体系统从实验室算法走向临床筛查、开发者生态和基因组学研究的落地链路。
Mistral AI 分享了基于开源编程助手 Vibe 构建 Rails 自动化测试智能体的实践,能在 CI/CD 中无需人工干预自主编写、校验与改进 RSpec 测试用例。
推荐理由:文章详细展示了结合上下文规范与执行工具闭环让智能体自测自改的方法,为大型代码库落地自动化测试提供了可复用范式。
Mistral AI 发布终端原生编码智能体 Mistral Vibe 2.0,由 Devstral 2 模型家族驱动,新增自定义子智能体、多选意图澄清、斜杠命令技能以及统一智能体模式。该版本已上线 Le Chat Pro 和 Team 计划并支持自带 API key 或超额按量付费,Devstral 2 同步开放付费 API 访问。
推荐理由:新版将子智能体编排与交互澄清引入终端开发流,为开发者提供了更具可控性的终端编程自动化实践。
Mistral AI 推出新一代代码模型家族 Devstral 2 及配套终端开源智能体工具 Mistral Vibe CLI。该系列包含 123B 的 Devstral 2 与 24B 的 Devstral Small 2,均支持 256K 上下文窗口,在 SWE-bench Verified 上分别取得 72.2% 与 68.0% 的成绩。
推荐理由:Mistral 发布了针对代码智能体的开源模型家族并配套终端 CLI,适合关注低成本本地化代码自动化部署的开发者。
Mistral AI 宣布为旗下 AI 助手 Le Chat 推出自定义 MCP 连接器目录与跨对话记忆(Memories)两项功能(测试版),全部向免费用户开放。
推荐理由:原文详细列出了首批接入的企业工具类别和自定义 MCP 扩展方式,读者可以据此了解企业级智能体打通工作流的具体落地形态。
Mistral AI 发布 Codestral 25.08 及完整企业编码栈,新版本接受的补全量增加 30%,建议后保留代码增加 10%,失控生成减少 50%。
推荐理由:原文给出 Codestral 25.08 的完成率变化和企业私有化部署路径,读者可据此判断自托管编码助手的可行性。
Mistral AI 宣布为助手 Le Chat 推出一系列重大更新,包括提供结构化研究报告的 Deep Research 预览版,以及由新模型 Voxtral 驱动的低延迟语音模式。新版本还集成了推理模型 Magistral 以支持原生多语言深度思考,并增加用于归类管理对话与文件的 Projects 功能,同时携手 Black Forest Labs 支持直接通过提示词进行图像连续编辑。
推荐理由:原文集中展示了深度研究、语音和推理模型等多项能力更新,读者可以了解该助手在工作流组织与多模态交互上的最新进展。
Mistral AI 联合 All Hands AI 发布编程模型 Devstral Medium 并升级推出 Devstral Small 1.1,专注提升 Agent 编程能力。
推荐理由:开源的 24B 版本采用宽松协议,商用版在基准测试中取得 61.6% 的成绩,为软件开发智能体提供了兼顾本地部署与性价比的新选择。
Mistral AI 正式推出面向企业研发团队的 AI 编码助手 Mistral Code,已在 JetBrains 和 VSCode 开放内测。该产品基于开源项目 Continue 构建,由 Codestral、Codestral Embed、Devstral 和 Mistral Medium 四款模型驱动,支持云端或本地隔离环境部署。
推荐理由:产品采用单一厂商全栈交付模式并支持本地私有化部署,为受合规监管的企业提供了可自主微调的端到端编码方案。
Mistral AI 正式发布 Agents API,为企业级 AI 智能体开发提供包含持久记忆与多智能体编排能力的专用框架。该接口内置 Python 代码沙盒执行、FLUX1.1 [pro] Ultra 图像生成、文档库 RAG 和联网搜索连接器,并全面支持模型上下文协议(MCP)集成外部工具。系统还提供支持对话分支的有状态会话管理,以及跨智能体任务交接(handoffs)协作机制。
推荐理由:原文展示了模型厂商将状态管理、代码沙盒与 MCP 协议封装为 API 的工程方案,读者可据此评估多智能体编排选型。
Mistral AI 联合 All Hands AI 发布专为软件工程设计的智能体模型 Devstral,采用 Apache 2.0 协议开源。该模型在 SWE-Bench Verified 基准上取得 46.8% 的成绩,可在单张 RTX 4090 或 32GB 内存的 Mac 上本地部署,同时已开放 API 接入,价格为每百万输入 tokens $0.1、输出 tokens $0.3。
推荐理由:该模型以可单卡本地运行的轻量体积在代码评测中超过部分大参数开源基座,为本地智能体开发提供了开箱即用的开源选项。
Mistral 发布 Le Chat Enterprise,一款由全新 Mistral Medium 3 模型驱动的企业 AI 助手,包含企业搜索、Agent 构建器、数据与工具连接器、文档库、自定义模型和混合部署等功能,全部功能将在未来两周内逐步上线。
推荐理由:Mistral 把企业搜索、Agent 构建与混合部署打包进同一订阅,可观察欧洲厂商做企业 AI 的路线选择。