Google DeepMind 发布 AI 控制路线图以防范失准智能体风险
Google DeepMind 发布 AI 控制路线图(AI Control Roadmap)与配套技术报告,提出在传统模型对齐之外引入系统级纵深防御,将未完全对齐的 AI 智能体视为潜在内部威胁进行动态管控。
Google DeepMind 发布 AI 控制路线图(AI Control Roadmap)与配套技术报告,提出在传统模型对齐之外引入系统级纵深防御,将未完全对齐的 AI 智能体视为潜在内部威胁进行动态管控。
Google DeepMind 联合 Schmidt Sciences、Cooperative AI Foundation、ARIA 及 Google.org 设立最高 $10M 的技术研究资助计划,面向全球征集多智能体 AI 安全研究提案。
Google 宣布在 Gemini Enterprise Agent Platform 上线跨知识库 Agentic RAG 公测版本,解决多跳多源复杂检索中单步 RAG 易漏查的问题。
Google Research 在 I/O 2026 推出科研工具套件 Gemini for Science,包含 Computational Discovery 与 Hypothesis Generation 等工具。
Mistral AI 在 AI Now Summit 2026 上推出面向工业工程的 AI 技术栈,并宣布与 Airbus、BMW 和 ASML 展开深度合作。其长程生产力智能体 Vibe 支持日常日程管理、深度研究以及从需求到合并 PR 的全流程编程任务。此外,位于法国 Les Ulis 的 10 MW 推理专用数据中心预计于 2026 年 Q3 启用,以提升算力自主掌控力与数据安全性。
Mistral 把 Le Chat 升级为统一 AI 智能体 Vibe,同时覆盖工作与编码场景,原 Le Chat 的订阅、历史和设置已迁移至其中的 Chat mode。
推荐理由:Mistral 把 Le Chat 升级为统一智能体 Vibe,同时给出 Work 与 Code 两种模式和 VS Code 扩展,可对照理解其与现有编码智能体的差异。
Mistral AI 推出开源框架 Search Toolkit 公共预览版,用于为 AI 应用构建涵盖数据摄取、检索与评估的生产级搜索流水线。该框架支持 BM25、稠密向量及混合检索,内置 NDCG 与 MRR 等评估指标,可独立评测检索器性能。它还支持通过 MCP 连接外部系统,为 AI 智能体同时提供索引检索与实时数据拉取能力。
推荐理由:该框架统一了数据摄取、检索与评估流程并支持 MCP 连接,可减少企业在 RAG 和智能体搜索链路中的集成成本。
Mistral AI 宣布达成确定性协议收购奥地利物理 AI 公司 Emmi AI,以加速工程制造领域的 AI 转型并拓展科学研究路线。Emmi 联合创始人及 30 余名研究员与工程师将加入 Mistral 的科学与应用 AI 团队,双方计划结合物理建模与大模型能力,打造面向航空航天、汽车和半导体等工业场景的工程智能体与实时仿真平台。
推荐理由:原文披露了基础模型厂商收购物理模拟团队的具体方向,展现了大模型切入工业工程与实时仿真领域的落地路径。
Mistral AI 发布 128B 稠密模型 Mistral Medium 3.5,并在 Mistral Vibe 与 Le Chat 中上线支持异步并行运行的云端远程智能体。
推荐理由:该模型将推理与编码能力合并为单组权重,让团队既能基于少量显卡自托管部署,也能借助云端环境异步执行长周期智能体任务。
Mistral AI 宣布在 Studio 中推出 Connectors 公共预览版,支持开发者通过 API 和 SDK 接入内置连接器及基于 MCP 协议的自定义连接器,供所有模型与智能体调用。新功能引入了集中注册管理、免鉴权障碍的直接工具调用机制,以及支持人工在环审批的安全确认流程,避免在业务代码中重复实现集成与 OAuth 认证逻辑。
推荐理由:原文给出了基于 MCP 封装集成、工具权限排除与人工审批机制的具体代码,可直接用于规范企业级智能体的工具调用体系。
Google DeepMind 为实验原型 Project Genie 推出 Street View 实景锚定能力,用户可在美国境内选点并结合风格与角色描述生成世界,起始位置锚定真实街景影像;该能力基于 Maps Imagery Grounding。
Google DeepMind 推出科研工具集 Gemini for Science,在 Google Labs 开放假说生成、计算发现与文献洞察三款实验性原型,并在 Google Antigravity 中提供整合 30 多个生命科学数据库的 Science Skills。
推荐理由:原文展示了多智能体辩论与并行代码生成如何介入科学假说与验证,读者可以据此了解通用智能体融入科研全流程的具体形态。
Calico Life Sciences 的 Matt Onsum 与 Katherine Labbé 正使用 Google DeepMind 的 Co-Scientist 梳理衰老生物学中零散的发现并生成可验证的假设。
Google DeepMind 展示了爱丁堡大学团队利用 Co-Scientist 加速代谢功能障碍相关脂肪性肝炎(MASH)机制研究的成果。面对多靶点组合疗法搜索空间过大的问题,Co-Scientist 梳理肝脏生物学与药理学文献并生成假说,指出 NLRP3 炎症小体是连接炎症与代谢的关键分子桥梁。
斯坦福大学医学院与 Google DeepMind 合作,利用 Co-Scientist 智能体从现有药物文献中筛选治疗肝纤维化的老药新用候选物,相关研究发表于《Advanced Science》。
推荐理由:研究展示了科学智能体在海量文献中挖掘老药新用候选物的实验命中表现,为生物医药研发提供了具体验证案例。
Google DeepMind 正式推出 Gemini 3.5 模型系列并上线首发版本 Gemini 3.5 Flash,主打长流程编码与复杂智能体任务执行。该模型在 MCP Atlas 达 83.6%、Terminal-Bench 2.1 达 76.2%,输出 token 速率达到其他前沿模型的 4 倍,系列旗舰 3.5 Pro 计划于下月推出。
推荐理由:模型在兼顾生成速率的同时强化了编码与多步智能体执行能力,可作为评估长流程任务端到端自动化成本的重要参考。
Google DeepMind 在《Nature》发表研究并推出基于 Gemini 的多智能体 AI 系统 Co-Scientist,旨在协助科研人员在生命科学等领域生成、论证与迭代科学假说。
推荐理由:原文给出了多智能体通过辩论锦标赛演进科学假说的架构细节,对探索 AI 辅助基础科研的工作流设计提供了参考。
Google DeepMind 汇总了 Gemini 驱动的编码智能体 AlphaEvolve 发布一年来的落地成果。它帮助 DeepConsensus 将变异检测错误降低 30%,把电网 AC Optimal Power Flow 的可行解比例从 14% 提升到 88%以上,并在量子模拟中给出误差低 10 倍的量子线路。
推荐理由:一年来 AlphaEvolve 在基因测序、电网、TPU 与量子模拟等场景的落地数据,展示了编码智能体从演示走向基础设施的路径。
Google DeepMind 宣布 AI co-clinician 研究计划,探索 AI 智能体在医生监督下协助患者诊疗。在 98 个真实初级保健问题的盲测中,该系统在其中 97 个案例未出现关键错误,医生对其回答的偏好也高于主流证据合成工具。
推荐理由:Google DeepMind 披露 AI co-clinician 的评测设计与多模态问诊模拟结果,可了解医疗 AI 从文本走向实时音视频的路径。
Google Research 公布科学家使用 Empirical Research Assistance(ERA)的四类实际科研场景:用 ERA 每周为美国各州提交流感、COVID-19 和 RSV 住院预测,在流感与 COVID-19 公开排行榜上表现处于或接近榜首。
Mistral AI 发布 Workflows 公测版,定位为企业 AI 编排层,提供持久化执行、可观测性和容错能力,用于把 AI 流程从概念验证推进到生产环境。
推荐理由:Mistral 把企业 AI 编排层的落地路径讲清楚了,包括持久化执行、人审断点和数据面隔离的具体做法。
Google Research 推出智能体记忆框架 ReasoningBank,能够从成功与失败经历中提炼结构化的高阶推理模式,支持测试阶段的持续自演进。该方案通过闭环工作流提取防范性策略,并结合记忆感知测试时扩展(MaTTS)在并行或序列推理中强化策略质量。
推荐理由:该研究系统性地从失败经验中提炼高层推理模式,为构建具备持续反思与测试时自演进能力的智能体提供了具体记忆架构参考。
Google DeepMind 宣布与 Accenture、Bain & Company、BCG、Deloitte 和 McKinsey 达成合作,加速推动全球企业的智能体转型与前沿 AI 规模化落地。合作伙伴将获得 Gemini 等前沿模型的早期访问权,并与 DeepMind 技术团队合作开发金融、制造等行业解决方案。该合作旨在弥合目前仅 25% 组织实现 AI 规模化投产的应用鸿沟。
Google 与纽约大学合作推出 Vantage 研究实验,利用生成式 AI 构建多方协作模拟环境,用于评估学生的批判性思维与协作等持久技能。系统由主管大模型(Executive LLM)在对话中动态施加冲突与挑战以激发技能展现,再由 AI 评估器对照评分量规生成可视化技能图谱与定性反馈。
Google Research 推出人机对话数据集 ConvApparel,用于量化并弥合 LLM 用户模拟器与真实人类间的真实度差距。数据集涵盖服装购物场景超 4,000 场对话(近 15,000 轮),通过将用户分流至“优质”与故意制造障碍的“劣质”双智能体,记录逐轮的满意度与挫败感。团队还提出了结合统计对齐、拟人度评分和反事实验证的三维框架来评测模拟器。
Google Research 推出两款学术 AI 智能体 PaperVizAgent 与 ScholarPeer,分别用于自动生成学术插图与论文同行评审。PaperVizAgent 由 5 个专用智能体协同运作,在插图评测中取得 60.2 分,显著超越 50.0 的人类基准线及 GPT-Image-1.5。
Google DeepMind 正式推出开源模型 Gemma 4 系列,包含 E2B、E4B、26B MoE 和 31B Dense 四种尺寸,专为高级推理与智能体工作流设计。
推荐理由:Gemma 4 转向 Apache 2.0 商业许可并覆盖端侧至 31B 规模,展示了小尺寸开源模型在多模态与智能体工作流上的落地路径。
Mistral AI 总结了内部平台工具 Spaces CLI 的开发经验,提出了一套同时适配人类开发者与编码智能体的命令行设计原则。团队提出交互式输入均需提供对应的命令行参数与非交互模式默认值,通过 context.json 和 AGENTS.md 自动导出结构化上下文与执行规则,并消除工作目录等隐式状态依赖,使智能体能自主完成从脚手架创建到部署的全流程。
推荐理由:文章总结了让命令行工具兼顾人类交互与智能体调用的五条工程规范,为开发者构建面向智能体的开发工具提供了可迁移的落地参考。
Google Research 在 The Check Up 活动上公布了一系列医疗健康 AI 突破,涵盖个人健康助手、临床辅助决策系统及开源开发者工具。团队展示了具备多模态推理能力的多智能体系统 AMIE 在临床问诊中的实测进展,并推广支持 3D 影像的开源医疗模型 MedGemma;同时公布了乳腺癌早筛研究以及用于识别癌症基因突变的研究工具 DeepSomatic。
推荐理由:文章系统梳理了前沿医疗多模态模型与多智能体系统从实验室算法走向临床筛查、开发者生态和基因组学研究的落地链路。
Mistral AI 发布企业模型构建系统 Forge,支持企业利用内部代码库、文档和运营记录等专有数据定制模型与智能体。该系统覆盖预训练、后训练和强化学习全流程,兼容稠密与 MoE 架构及多模态输入,并具备 Agent-first 设计支持智能体自动调优。目前 ASML、爱立信和欧洲空间局等机构已接入该系统在自身基础设施中构建领域专用模型。
Mistral 发布 Leanstral,一个面向 Lean 4 的开源代码代理,激活参数 6B,权重以 Apache 2.0 许可开放,同时提供 Mistral Vibe 中的 agent 模式和免费 API 端点。
Mistral AI 分享了基于开源编程助手 Vibe 构建 Rails 自动化测试智能体的实践,能在 CI/CD 中无需人工干预自主编写、校验与改进 RSpec 测试用例。
推荐理由:文章详细展示了结合上下文规范与执行工具闭环让智能体自测自改的方法,为大型代码库落地自动化测试提供了可复用范式。
Mistral AI 发布终端原生编码智能体 Mistral Vibe 2.0,由 Devstral 2 模型家族驱动,新增自定义子智能体、多选意图澄清、斜杠命令技能以及统一智能体模式。该版本已上线 Le Chat Pro 和 Team 计划并支持自带 API key 或超额按量付费,Devstral 2 同步开放付费 API 访问。
推荐理由:新版将子智能体编排与交互澄清引入终端开发流,为开发者提供了更具可控性的终端编程自动化实践。
Mistral AI 推出新一代代码模型家族 Devstral 2 及配套终端开源智能体工具 Mistral Vibe CLI。该系列包含 123B 的 Devstral 2 与 24B 的 Devstral Small 2,均支持 256K 上下文窗口,在 SWE-bench Verified 上分别取得 72.2% 与 68.0% 的成绩。
推荐理由:Mistral 发布了针对代码智能体的开源模型家族并配套终端 CLI,适合关注低成本本地化代码自动化部署的开发者。
Mistral AI 推出企业级生产平台 Mistral AI Studio,旨在帮助企业打通从提示词开发到稳定生产的全流程闭环,目前已开放 Private Beta 申请。该平台包含可观测性与评测系统、基于 Temporal 构建的高容错 Agent Runtime 以及管理资产与权限的 AI Registry 三大模块,并支持混合云与私有化部署。
Mistral 旗下 Le Chat 上线 Memories(beta),采用自动保存、智能且可见召回并附来源链接的混合式记忆方案。用户可随时关闭记忆、使用不使用记忆的隐身对话、编辑或删除单条记忆,并支持导出与导入以实现可移植和互操作。同时推出 Memory Insights,基于用户自有数据提供可编辑的提示。
Mistral AI 宣布为旗下 AI 助手 Le Chat 推出自定义 MCP 连接器目录与跨对话记忆(Memories)两项功能(测试版),全部向免费用户开放。
推荐理由:原文详细列出了首批接入的企业工具类别和自定义 MCP 扩展方式,读者可以据此了解企业级智能体打通工作流的具体落地形态。
Mistral AI 发布 Codestral 25.08 及完整企业编码栈,新版本接受的补全量增加 30%,建议后保留代码增加 10%,失控生成减少 50%。
推荐理由:原文给出 Codestral 25.08 的完成率变化和企业私有化部署路径,读者可据此判断自托管编码助手的可行性。
Mistral AI 宣布为助手 Le Chat 推出一系列重大更新,包括提供结构化研究报告的 Deep Research 预览版,以及由新模型 Voxtral 驱动的低延迟语音模式。新版本还集成了推理模型 Magistral 以支持原生多语言深度思考,并增加用于归类管理对话与文件的 Projects 功能,同时携手 Black Forest Labs 支持直接通过提示词进行图像连续编辑。
推荐理由:原文集中展示了深度研究、语音和推理模型等多项能力更新,读者可以了解该助手在工作流组织与多模态交互上的最新进展。
Mistral AI 联合 All Hands AI 发布编程模型 Devstral Medium 并升级推出 Devstral Small 1.1,专注提升 Agent 编程能力。
推荐理由:开源的 24B 版本采用宽松协议,商用版在基准测试中取得 61.6% 的成绩,为软件开发智能体提供了兼顾本地部署与性价比的新选择。