Google 提出用于审计机器遗忘的新框架
Google 提出正则化 f-散度核检验(Regularized f-Divergence Kernel Tests)框架,用于灵敏且准确地审计机器学习模型的“机器遗忘”。该框架引入相对距离检验与核正则化方法,利用 KL、卡方及 Hockey-stick 等 f-散度精准捕捉局部数据偏移与隐私泄露,同时在理论上证明能在任意样本量下控制假阳性。
Google 提出正则化 f-散度核检验(Regularized f-Divergence Kernel Tests)框架,用于灵敏且准确地审计机器学习模型的“机器遗忘”。该框架引入相对距离检验与核正则化方法,利用 KL、卡方及 Hockey-stick 等 f-散度精准捕捉局部数据偏移与隐私泄露,同时在理论上证明能在任意样本量下控制假阳性。
Google DeepMind 推出实验性开源模型 DiffusionGemma,采用文本扩散机制替代传统的自回归逐字生成,在专用 GPU 上的文本生成速度最高提升至 4 倍。
推荐理由:该模型通过文本扩散架构将自回归逐字解码转为并行块生成,读者可以据此了解其在本地低延迟交互与代码补全场景下的性能取舍。
Google DeepMind 联合 Schmidt Sciences、Cooperative AI Foundation、ARIA 及 Google.org 设立最高 $10M 的技术研究资助计划,面向全球征集多智能体 AI 安全研究提案。
Google DeepMind 发布音频模型 Gemini 3.5 Live Translate,支持 70 多种语言的近实时流式语音互译,并在生成中保留原发言者的语调、节奏和音高。
推荐理由:材料展示了流式语音互译的技术落地路径,读者可以参考其在跨语种会议与移动端传译中的产品集成方式。
Google DeepMind 推出开源多模态模型 Gemma 4 12B,支持在配备 16GB 显存或统一内存的普通笔记本上本地运行多模态与智能体任务。该模型采用无编码器的统一架构,移除传统的独立视觉与音频编码器,将视觉和原始音频信号直接投影至大语言模型主干网络,性能接近其 26B MoE 模型。
推荐理由:模型采用无编码器的统一架构直接处理视觉与音频输入,使笔记本端在 16GB 内存下也能本地运行多模态推理与智能体工作流。
Google DeepMind 推出机器人加速器计划(Google DeepMind Accelerator: Robotics),选拔了 15 家欧洲早期机器人初创公司加入为期 3 个月的项目。入选团队将获得 Google DeepMind 与 Google 专家的技术指导,并可访问其 AI 技术栈与 Gemini 机器人模型,推动具身 AI 技术融入核心产品并加速落地。
Google DeepMind 公布了在塞拉利昂开展的预注册随机对照试验结果,基于 Gemini 的 Guided Learning 让学生数学成绩提升 0.258 个标准差,相当于 1.2 至 1.7 年的学习进展。
推荐理由:该项预注册对照试验呈现了引导式提问在基础教学中的量化增益,同时公开了可落地的教师培训方案。
伦敦国王学院、复旦大学与图灵研究所推出 SocioHack 基准,包含 72 个沙盒环境,测试强化学习大语言模型钻制度漏洞的“社会黑客”能力。RL 训练的模型以 61.25% 召回率和 90.85% 精确度重新发现了历史法规漏洞策略。此外,Anthropic 披露其代码合并量增长 8x,显现出实验室级递归自我改进(RSI)的初步迹象。
Google 宣布在 Gemini Enterprise Agent Platform 上线跨知识库 Agentic RAG 公测版本,解决多跳多源复杂检索中单步 RAG 易漏查的问题。
Google Research 在《Nature》发表研究系统 PHRM,利用智能手机前置摄像头在用户面部解锁后的数秒内被动估算心率和每日静息心率。该方案在设备端运行轻量化卷积神经网络,心率测量平均绝对百分比误差低于 10%,静息心率相比穿戴设备平均绝对误差低于 5 bpm,并在不同肤色群体中达到统一精度标准。团队同步向通过审核的研究人员开放了数据集与预训练模型 PHRM-mini。
推荐理由:原文展示了仅凭手机前置摄像头在解锁时被动监测心率与静息心率的方案,为无穿戴设备场景下的健康监测提供了具体参考。
Google Research 在 GitHub 上以 Apache 2.0 协议开源其水文建模框架,让各国气象与水文机构能基于与 Google Flood Hub 相同架构和相近训练数据训练 AI 洪水预报模型。
弗吉尼亚大学、Anthropic 与加拿大央行学者指出,2025 年美国名义 AI GDP 达约 $250 billion,经质量调整后的实际产出年增速高达 2,600%,但在传统 GDP 统计中几乎隐形。这主要是因为单位能力的推理价格随效率提升大幅下跌,掩盖了每年超 200% 的算力容量扩张,进而可能导致政策制定者严重低估 AI 对劳动力税基的冲击。
Google Research 在 I/O 2026 推出科研工具套件 Gemini for Science,包含 Computational Discovery 与 Hypothesis Generation 等工具。
Mistral AI 在 AI Now Summit 2026 上推出面向工业工程的 AI 技术栈,并宣布与 Airbus、BMW 和 ASML 展开深度合作。其长程生产力智能体 Vibe 支持日常日程管理、深度研究以及从需求到合并 PR 的全流程编程任务。此外,位于法国 Les Ulis 的 10 MW 推理专用数据中心预计于 2026 年 Q3 启用,以提升算力自主掌控力与数据安全性。
Mistral 把 Le Chat 升级为统一 AI 智能体 Vibe,同时覆盖工作与编码场景,原 Le Chat 的订阅、历史和设置已迁移至其中的 Chat mode。
推荐理由:Mistral 把 Le Chat 升级为统一智能体 Vibe,同时给出 Work 与 Code 两种模式和 VS Code 扩展,可对照理解其与现有编码智能体的差异。
Mistral AI 推出开源框架 Search Toolkit 公共预览版,用于为 AI 应用构建涵盖数据摄取、检索与评估的生产级搜索流水线。该框架支持 BM25、稠密向量及混合检索,内置 NDCG 与 MRR 等评估指标,可独立评测检索器性能。它还支持通过 MCP 连接外部系统,为 AI 智能体同时提供索引检索与实时数据拉取能力。
推荐理由:该框架统一了数据摄取、检索与评估流程并支持 MCP 连接,可减少企业在 RAG 和智能体搜索链路中的集成成本。
Google 提出结合密码学与可信执行环境(TEE)的零信任聚合方案,用于在保护隐私的前提下分析端侧 AI 运行状况。该方案采用单消息(one-shot)协议,消除了设备多轮在线交互需求,并确保原始数据绝不在服务器内存中暴露。结合 TEE 证明机制构成多层防御,仅在完成聚合与匿名化后对外输出统计洞察。
Mistral 宣布将 Emmi AI 团队并入,推出面向工业工程的物理 AI 能力。该模型从几何与边界条件直接预测完整物理场,单次前向推理在秒级完成,而非传统求解器的小时到数周,并可基于实时传感器数据构建数字孪生。
Mistral AI 宣布加码面向航空航天、汽车、半导体与能源工业的物理 AI(Physics AI)研发,并系统汇总了收购 Emmi AI 后的关键技术突破。相关成果涵盖用于跨音速 3D 机翼的 CFD 模拟数据集、面向聚变等离子体湍流仿真的 GyroSwin 5D 代理模型,以及单 GPU 支持上亿网格单元空气动力学仿真的 AB-UPT 和多物理场实时仿真框架 NeuralDEM。
Anthropic 联合创始人 Jack Clark 在牛津大学演讲中指出,面对 AI 技术的持续加速,个人与社会应主动正视并探索奇点带来的深远重塑。他透露 Anthropic 内部在 Opus 4.6 发布后大部分代码已转由 Claude 生成,人类员工正在向监控与验证层迁移,单名研究员已能调遣 9 个合成智能体协同推进研究。
Mistral AI 宣布达成确定性协议收购奥地利物理 AI 公司 Emmi AI,以加速工程制造领域的 AI 转型并拓展科学研究路线。Emmi 联合创始人及 30 余名研究员与工程师将加入 Mistral 的科学与应用 AI 团队,双方计划结合物理建模与大模型能力,打造面向航空航天、汽车和半导体等工业场景的工程智能体与实时仿真平台。
推荐理由:原文披露了基础模型厂商收购物理模拟团队的具体方向,展现了大模型切入工业工程与实时仿真领域的落地路径。
Mistral AI 发布 128B 稠密模型 Mistral Medium 3.5,并在 Mistral Vibe 与 Le Chat 中上线支持异步并行运行的云端远程智能体。
推荐理由:该模型将推理与编码能力合并为单组权重,让团队既能基于少量显卡自托管部署,也能借助云端环境异步执行长周期智能体任务。
Mistral AI 宣布在 Studio 中推出 Connectors 公共预览版,支持开发者通过 API 和 SDK 接入内置连接器及基于 MCP 协议的自定义连接器,供所有模型与智能体调用。新功能引入了集中注册管理、免鉴权障碍的直接工具调用机制,以及支持人工在环审批的安全确认流程,避免在业务代码中重复实现集成与 OAuth 认证逻辑。
推荐理由:原文给出了基于 MCP 封装集成、工具权限排除与人工审批机制的具体代码,可直接用于规范企业级智能体的工具调用体系。
Google DeepMind 在亚太地区启动首期“AI for the Planet”加速器项目,旨在利用前沿 AI 技术应对气候与环境挑战。该为期 3 个月的项目面向该地区的初创公司、研究团队及非营利组织,覆盖自然、气候、农业与能源等领域。入选机构将获得 Google 专家的指导,并协助将其前沿 AI 和科学 AI 模型整合至产品或项目中;项目将以新加坡的线下训练营拉开序幕。
Google 在《Nature》发表论文介绍科研编程系统 ERA(Empirical Research Assistance),并宣布通过 Gemini for Science 逐步开放基于 ERA 和 AlphaEvolve 构建的实验工具 Computational Discovery。
推荐理由:该研究展示了将大模型与树搜索结合优化科研代码的具体路径,为自动化计算实验与科学发现提供了可参考的工程框架。
Google DeepMind 的 Co-Scientist 正被用于细胞衰老研究:它扫描数万篇论文后提出 20 多个可测试的新基因因子,实验室验证其中几个成功将细胞推向更年轻状态并改善整体功能。它还能结合文献分析大规模基因筛选数据,把原本需长达六个月的分析缩短到几天。
Import AI 457 披露了可篡改高精度工程计算的早期病毒 fast16,并分析了旨在解决 Muon 优化器缺陷的新型优化器 Aurora。在约 100B token 上训练 1.1B 参数 Transformer 时,Aurora 解决了 Muon 导致超四分之一神经元死亡的问题,将平滑损失降至 2.26,并使 MMLU 得分比 Muon 提升 10 分。
Google DeepMind 为实验原型 Project Genie 推出 Street View 实景锚定能力,用户可在美国境内选点并结合风格与角色描述生成世界,起始位置锚定真实街景影像;该能力基于 Maps Imagery Grounding。
Google DeepMind 发布 Gemini Omni 模型家族,主打从任意输入生成内容,首款模型 Gemini Omni Flash 率先支持视频。Omni 可组合图像、音频、视频和文本输入生成视频,并支持用自然语言多轮对话编辑视频,同时生成画面基于 Gemini 的世界知识,对重力、动能和流体动力学有更好的直观理解。
推荐理由:Gemini Omni 把视频生成与多轮对话剪辑合到同一模型中,读者可了解其输入方式与首批上线渠道。
Google DeepMind 推出科研工具集 Gemini for Science,在 Google Labs 开放假说生成、计算发现与文献洞察三款实验性原型,并在 Google Antigravity 中提供整合 30 多个生命科学数据库的 Science Skills。
推荐理由:原文展示了多智能体辩论与并行代码生成如何介入科学假说与验证,读者可以据此了解通用智能体融入科研全流程的具体形态。
Google 宣布在 Search、Gemini、Chrome、Pixel 及 Cloud 中扩展内容透明度与验证工具,深化 SynthID 水印和 C2PA 内容凭据的应用。
推荐理由:Google 将 SynthID 与 C2PA 凭据贯通至搜索、浏览器及硬件,并向企业开放检测 API,为跨平台构建生成式内容防伪体系提供了系统化方案。
Google DeepMind 与新加坡政府达成国家级 AI 合作,围绕医疗、科研与教育等领域启动多项前沿 AI 落地计划。合作包括研发基于 Gemma 的视障跑步助手、向当地中小学及初级学院教师提供 Gemini for Education、利用 AlphaFold 开展流行病研究,并联合 IMDA 等机构研发多模态多语言安全基准。
剑桥大学教授 Clare Bryant 正在使用 Co-Scientist 寻找新发传染病跨物种传播引发重症的分子开关与预防方案。该工具通过分析研究提案与未公开实验数据生成并排序假说,直接锁定了此前未被关注的关键蛋白质及特定氨基酸。团队正构建突变细胞系进行测试,原本需要 2 至 3 年的靶点确定工作有望缩短至 6 个月内完成。
Calico Life Sciences 的 Matt Onsum 与 Katherine Labbé 正使用 Google DeepMind 的 Co-Scientist 梳理衰老生物学中零散的发现并生成可验证的假设。
Google DeepMind 展示了爱丁堡大学团队利用 Co-Scientist 加速代谢功能障碍相关脂肪性肝炎(MASH)机制研究的成果。面对多靶点组合疗法搜索空间过大的问题,Co-Scientist 梳理肝脏生物学与药理学文献并生成假说,指出 NLRP3 炎症小体是连接炎症与代谢的关键分子桥梁。
MIT 的 Ritu Raman 与波士顿儿童医院的 Ryan Flynn 借助 Google DeepMind 的 Co-Scientist,将各自的组织模型与 RNA 表面图谱工具结合,用于 ALS 研究。
斯坦福大学医学院与 Google DeepMind 合作,利用 Co-Scientist 智能体从现有药物文献中筛选治疗肝纤维化的老药新用候选物,相关研究发表于《Advanced Science》。
推荐理由:研究展示了科学智能体在海量文献中挖掘老药新用候选物的实验命中表现,为生物医药研发提供了具体验证案例。
Google DeepMind 详细阐述了 AI 气象模型 WeatherNext 如何协助美国国家飓风中心提前 5 天预测飓风梅丽莎增强至 5 级并在牙买加登陆。该模型结合数十年全球气象模式与极端热带气旋专属数据集训练,克服了传统模型难以兼顾路径与强度的限制,可同时推演 50 种集合预测情景以辅助预警决策。
推荐理由:原文给出了 AI 气象模型兼顾路径与强度预测的实战数据,读者可以据此评估 AI 预报极端天气事件的可用性。
Google DeepMind 正式推出 Gemini 3.5 模型系列并上线首发版本 Gemini 3.5 Flash,主打长流程编码与复杂智能体任务执行。该模型在 MCP Atlas 达 83.6%、Terminal-Bench 2.1 达 76.2%,输出 token 速率达到其他前沿模型的 4 倍,系列旗舰 3.5 Pro 计划于下月推出。
推荐理由:模型在兼顾生成速率的同时强化了编码与多步智能体执行能力,可作为评估长流程任务端到端自动化成本的重要参考。
Google DeepMind 在《Nature》发表研究并推出基于 Gemini 的多智能体 AI 系统 Co-Scientist,旨在协助科研人员在生命科学等领域生成、论证与迭代科学假说。
推荐理由:原文给出了多智能体通过辩论锦标赛演进科学假说的架构细节,对探索 AI 辅助基础科研的工作流设计提供了参考。