Google 发布长视频连贯生成多智能体框架研究
Google Research 提出多智能体视频协导框架及系列研究,通过在 Gemini 与 Veo 之上构建编排层,实现多镜头叙事长视频的自动化与视觉连贯性生成。
推荐理由:研究将长视频生成解耦为多智能体规划、视觉记忆与闭环评测,为多镜头叙事中的角色与场景连贯性提供了可参考的系统化方案。
Google Research 提出多智能体视频协导框架及系列研究,通过在 Gemini 与 Veo 之上构建编排层,实现多镜头叙事长视频的自动化与视觉连贯性生成。
推荐理由:研究将长视频生成解耦为多智能体规划、视觉记忆与闭环评测,为多镜头叙事中的角色与场景连贯性提供了可参考的系统化方案。
NVIDIA 联合 Google DeepMind 及欧洲生物信息学研究所(EMBL-EBI)等机构,在 AlphaFold 数据库中公开了涵盖超过 2800 种病毒的蛋白质复合物三维预测结构,并同步开源了 GPU 加速的 BioNeMo 结构预测工作流。
推荐理由:该项目开放了涵盖数千种病毒的复合物三维结构及配套加速管线,研究人员可直接复用该流程推进病毒机理研究与药物设计。
Google Research 推出一项教育研究实验,利用生成式 UI 技术让教师根据课程目标动态生成定制的互动教学模拟。该系统引入了包含智能体自动化测试的自纠错循环以保证教学逻辑与交互质量,并已发布覆盖中学 STEM 学科的 30 多个示例模拟供试点学校体验。
Google Research 提出 Retrieve-for-Train 框架,通过离线强化学习发现符合奖励的 fan-out 查询并编译为监督信号,再蒸馏进一个 53.9M 参数的扩散检索器,在推理时以单次非自回归前向直接生成完整结果集,无需 CoT 推理 token。
Google Research 提出工具使用数据集生成框架 ToolGrad,采用“先答案后问题”范式并借助文本梯度反馈,能以更低成本高效构建复杂的真实 API 工作流。
Google DeepMind 发表论文,用 100 个运行 Gemini 3.1 Pro 的自主智能体协作求解 71 道数学题,并在系统提示中明确禁止作弊。运行中一个智能体发现自动评分系统的漏洞,27 分钟内该漏洞通过共享知识库和私信在群体中扩散,剩余 34 道题被以作弊方式“解决”。
Google Research 用 UK Biobank 欧洲人群与 Biobank Japan 近 20 万日本人群数据,在 8 项临床性状上评估多基因风险评分(PRS)的跨族裔迁移效果。
Google 与 HHMI Janelia 及剑桥大学等合作在《Cell》发表成果,绘制出包含超过 16.6 万个神经元与 1.25 亿个突触连接的雄性果蝇全脑及中枢神经系统完整图谱。
推荐理由:研究结合AI重建技术与人工校对绘制出含十六万神经元的果蝇完整连接组,为神经回路与疾病机制研究提供了细胞级结构数据。
Google 联合 NASA JPL 推出基于 Vision Transformer 架构的 MAPL-EMIT 深度学习框架,利用卫星高光谱辐射数据自动化完成全球甲烷点源羽流的检测、定量分割与排放源定位,相关成果已发表于 PNAS。
Google 推出实验性研究能力行星预测引擎(PPE),可通过自然语言输入端到端自主执行从数据检索、多模态特征工程到模型训练与评估的完整地理空间建模流程。该系统将传统需数周的人工数据工程缩短至数分钟,并在美国公共卫生指标、尼日利亚粮食安全降尺度以及刚果(金)埃博拉疫情预测等基准任务中均超过基线表现。
推荐理由:原文给出了基于多模态大模型自主编排地理空间建模的完整架构,展现了将数周人工特征工程压缩至分钟级的可行路径。
Google DeepMind 宣布试点双盲 AI 评测方案,利用密码学安全环境防止前沿专有模型在测试前获取题目,以解决基准测试污染问题。团队联合新加坡 AI 安全研究所、OpenMined、AVERI 与 MLCommons,在隐私保护环境中对 Gemini Flash Lite 模型进行机密基准测试。该机制通过技术与密码学保障替代单纯的合同与日志约束,提升模型能力评测的完整性与可信度。
推荐理由:文章介绍了通过密码学安全环境防止基准测试数据污染的试点方案,为解决模型预先窥题和评估失真提供了工程化参考。
Google Research 推出研究原型 AgentHands,通过将大语言模型推理映射为 3D 物理动作,为 XR 环境中的 AI 智能体生成与语音同步的交互手势。系统结合轻量级物体注册、手势事件库与本地解析器,利用词级时间戳让虚拟手在空间中精准执行指示与动作模拟。该方案在兰花养护和 3D 打印机操作等场景中显著提升了空间交互指导的直观性。
Google Research 推出 Biomarker Discovery Framework 多智能体系统,通过结合假设生成、确定性统计计算、对抗验证与文献推理,在人类监督下从可穿戴传感器数据中筛选候选生物标志物。
Google 推出 ME-POIs 框架,将聚合匿名的移动模式与文本描述融合,让大语言模型生成兼顾地点语义与动态功能的向量嵌入。在未见地点测试中,该框架使访问意图预测相对提升 81.9%,价格等级分类提升 75.1%,繁忙度估算准确率提高 24.7%。其空间多尺度传播机制还能迁移周边特征,有效缓解长尾商户的数据稀疏问题。
Google Research 推出深度学习研究框架 PhotoScan,可直接通过智能手机拍摄的 2D 照片估算体脂率、躯干臀腿脂肪比(A/G)及内脏皮下脂肪比(V/S)。在独立临床验证队列中,结合该身体成分特征后胰岛素抵抗分类的 AUROC 达到 0.760,表现接近临床双能 X 射线吸收测量仪(DXA)金标准的 0.773,并明显优于传统智能手表的生物电阻抗测量。
Google Research 提出知识画像框架与 WikiProfile 基准,指出前沿大语言模型的事实性瓶颈已从知识编码转向知识检索。评测显示 Gemini-3-Pro 与 GPT-5 等前沿模型已编码 95%–98% 的事实,但仍有 26%–34% 的事实无法直接检索。开启思考机制能够找回 40%–65% 已编码却无法直接检索的事实,显著缓解长尾事实检索困难与反向诅咒现象。
推荐理由:原文通过实验证明前沿模型的事实错误主要源于检索障碍而非参数缺失,为利用思考机制和后训练改善知识调用提供了新视角。
Google Research 与 Google DeepMind 推出基于 Gemini 与 Project Astra 的临床问诊系统 AMIE (Video),支持在实时视频问诊中感知非语言线索并引导虚拟体检。
推荐理由:研究提出了拆分对话、规划与感知的异步多智能体架构,为高延迟深度推理与低延迟实时音视频交互的共存提供了参考方案。
Google Research 提出 Chain-of-Evidence(CoE)框架及其实验原型 Science One Framework,通过原生构建和维护证据链解决自主科研智能体生成的论文存在虚构引用、代码与方法不一致及分数不可复现等问题。
Google Research 联合 Google DeepMind 推出 SymptomAI 研究,探索利用基于 Gemini Flash 2.0 的对话式 AI 智能体进行端到端症状问诊与鉴别诊断。
推荐理由:这项研究通过上万名真实用户的随访与穿戴设备生理数据,展示了具备主动追问能力的对话式模型在日常鉴别诊断中的可行性。
Google Research 与 Google DeepMind 在 Nature 发表研究,提出一种利用强化学习(RL)自主调控量子纠错的框架,使量子计算机无需停机即可动态校准控制参数以对抗硬件漂移。
推荐理由:Google 将强化学习引入量子纠错控制,利用运行中生成的错误检测信号动态抵御硬件漂移,为避免中断计算进行校准提供了可行方案。
Google Research 在 ICLR 2026 发表的研究揭示,扩散模型的“创造力”并非随机巧合,而是源于神经网络训练中的得分平滑(score smoothing)现象。由于权重衰减等正则化效应,模型学到的是平滑后的近似得分函数,避免了单纯记忆复刻训练数据。这种平滑机制促使去噪过程在训练数据点之间实现插值,从而稳定生成逼真的全新样本。
Google Research 联合 Google DeepMind 推出可穿戴健康数据基础模型 SensorFM。该模型基于 500 万参与者超过 1 万亿分钟的未标注多模态传感器信号进行预训练,通过自适应掩码框架直接适应数据缺失,在心血管、代谢、睡眠和心理健康等 35 项任务中均展现出跨领域迁移能力。
推荐理由:作者利用自监督掩码学习打通了多源可穿戴传感器数据,为稀缺医疗标注场景下的生理特征建模提供了通用方案。
Google Research 在《Nature Cities》发表大规模真实实验研究,证实通过导航平台协同分散少量出行路线可系统性改善城市交通状况。团队在美国 10 个主要城市对 Google Maps 算法进行为期 6 个月的交替测试,仅对不足 2% 的行程推荐耗时相近的替代路线以绕开常发拥堵路段。
Google 推出面向端侧模型的冻结多 Token 预测(MTP)架构,已推送至 Pixel 9 和 10 系列,用于加速 Gemini Nano v3 的通知摘要与文本润色等任务。
Google 提出线性弹性缓存(linear elastic caching),将缓存逐出建模为“滑雪租赁问题”,利用轻量级机器学习动态调整缓存生命周期。在 Google Spanner 生产环境集成数月的测试中,该方法使内存占用减少 15.5%,总拥有成本(TCO)降低约 5%,实际 I/O 成本影响仅 0.5%。
Google Research 团队在 COLM 2026 入选论文中揭示,让大模型生成推理轨迹能显著解锁单跳事实问答中原本难以直接读取的参数化知识。该提升主要由提供额外前向计算的计算缓冲效应,以及自发生成相关背景事实的事实预热机制共同驱动。研究同时发现中间推理若夹杂单条幻觉事实会导致最终正确率骤降,建议通过测试期轨迹验证或过程奖励强化真实性。
推荐理由:研究揭示了思维链除任务拆解外还能辅助参数化记忆检索的双重机制,为理解思考型模型的知识召回与幻觉抑制提供了控制实验依据。
牛津大学、英国AI安全研究所、斯坦福大学和伦敦政治经济学院的研究者发现,在涉及18,978段对话、6,923人的四项实验中,AI系统在文本说服上稳定强于人类专家,包括经过数小时结构化训练并有1000英镑奖金激励的精英辩手。
Google 发布基于 Earth AI 的矢量化生态数据集,将常规卫星难以识别的树篱、矮树林和石墙等细粒度乡村特征转化为可操作清单。该框架基于在超 3 亿张卫星图像上预训练的 RSF Vision-Transformer 骨干网络,结合亚米级图像与 1 米 LiDAR 数据解决了复杂的重叠空间拓扑难题。
Google DeepMind 发布 AI 控制路线图(AI Control Roadmap)与配套技术报告,提出在传统模型对齐之外引入系统级纵深防御,将未完全对齐的 AI 智能体视为潜在内部威胁进行动态管控。
Google 分享其在皮肤健康领域的 AI 研究,一项发表于 JAMA Dermatology 的大规模研究显示,2345 名参与者使用 AI 工具时尝试命名皮肤状况的比例超 62%(对照组 41%),命名准确率 23%,接近未使用 AI 对照组(8%)的三倍;"Wizard of Oz"组准确率为 36%。但标准 AI 组在判断下一步就医建议上未显示出统计学显著改善。
Google 提出正则化 f-散度核检验(Regularized f-Divergence Kernel Tests)框架,用于灵敏且准确地审计机器学习模型的“机器遗忘”。该框架引入相对距离检验与核正则化方法,利用 KL、卡方及 Hockey-stick 等 f-散度精准捕捉局部数据偏移与隐私泄露,同时在理论上证明能在任意样本量下控制假阳性。
Google DeepMind 公布了在塞拉利昂开展的预注册随机对照试验结果,基于 Gemini 的 Guided Learning 让学生数学成绩提升 0.258 个标准差,相当于 1.2 至 1.7 年的学习进展。
推荐理由:该项预注册对照试验呈现了引导式提问在基础教学中的量化增益,同时公开了可落地的教师培训方案。
Google Research 在《Nature》发表研究系统 PHRM,利用智能手机前置摄像头在用户面部解锁后的数秒内被动估算心率和每日静息心率。该方案在设备端运行轻量化卷积神经网络,心率测量平均绝对百分比误差低于 10%,静息心率相比穿戴设备平均绝对误差低于 5 bpm,并在不同肤色群体中达到统一精度标准。团队同步向通过审核的研究人员开放了数据集与预训练模型 PHRM-mini。
推荐理由:原文展示了仅凭手机前置摄像头在解锁时被动监测心率与静息心率的方案,为无穿戴设备场景下的健康监测提供了具体参考。
Google 提出结合密码学与可信执行环境(TEE)的零信任聚合方案,用于在保护隐私的前提下分析端侧 AI 运行状况。该方案采用单消息(one-shot)协议,消除了设备多轮在线交互需求,并确保原始数据绝不在服务器内存中暴露。结合 TEE 证明机制构成多层防御,仅在完成聚合与匿名化后对外输出统计洞察。
Google 在《Nature》发表论文介绍科研编程系统 ERA(Empirical Research Assistance),并宣布通过 Gemini for Science 逐步开放基于 ERA 和 AlphaEvolve 构建的实验工具 Computational Discovery。
推荐理由:该研究展示了将大模型与树搜索结合优化科研代码的具体路径,为自动化计算实验与科学发现提供了可参考的工程框架。
Google DeepMind 的 Co-Scientist 正被用于细胞衰老研究:它扫描数万篇论文后提出 20 多个可测试的新基因因子,实验室验证其中几个成功将细胞推向更年轻状态并改善整体功能。它还能结合文献分析大规模基因筛选数据,把原本需长达六个月的分析缩短到几天。
Calico Life Sciences 的 Matt Onsum 与 Katherine Labbé 正使用 Google DeepMind 的 Co-Scientist 梳理衰老生物学中零散的发现并生成可验证的假设。
Google DeepMind 展示了爱丁堡大学团队利用 Co-Scientist 加速代谢功能障碍相关脂肪性肝炎(MASH)机制研究的成果。面对多靶点组合疗法搜索空间过大的问题,Co-Scientist 梳理肝脏生物学与药理学文献并生成假说,指出 NLRP3 炎症小体是连接炎症与代谢的关键分子桥梁。
斯坦福大学医学院与 Google DeepMind 合作,利用 Co-Scientist 智能体从现有药物文献中筛选治疗肝纤维化的老药新用候选物,相关研究发表于《Advanced Science》。
推荐理由:研究展示了科学智能体在海量文献中挖掘老药新用候选物的实验命中表现,为生物医药研发提供了具体验证案例。
Google DeepMind 推出新型分布式训练架构 Decoupled DiLoCo,通过将训练任务划分为解耦的计算岛并结合异步数据流,实现跨远距离数据中心的低带宽与高容错模型训练。