Google 推出 AMIE (Video) 实时视频临床问诊系统
Google Research 与 Google DeepMind 推出基于 Gemini 与 Project Astra 的临床问诊系统 AMIE (Video),支持在实时视频问诊中感知非语言线索并引导虚拟体检。
推荐理由:研究提出了拆分对话、规划与感知的异步多智能体架构,为高延迟深度推理与低延迟实时音视频交互的共存提供了参考方案。
Google 与 DeepMind 的 AI 动态:Gemini 系列、Veo 视频模型、研究成果与产品生态的持续追踪。
Google Research 与 Google DeepMind 推出基于 Gemini 与 Project Astra 的临床问诊系统 AMIE (Video),支持在实时视频问诊中感知非语言线索并引导虚拟体检。
推荐理由:研究提出了拆分对话、规划与感知的异步多智能体架构,为高延迟深度推理与低延迟实时音视频交互的共存提供了参考方案。
Google DeepMind 联合多家气象机构在《Nature》发表研究并开源 WeatherNext 系列模型,在热带气旋路径、强度及风场结构预测上平均获得额外 24 小时的精度提前量。
推荐理由:该成果证明大尺度低分辨率输入结合生成网络同样能精准预测极端气旋,为极端气象预警提供了开源且低计算门槛的方案。
Google DeepMind 正式推出具身推理模型 Gemini Robotics ER 2,作为机器人的高层大脑提供连续视频理解、多步任务编排与多机协作能力。
推荐理由:该模型将高层推理规划与底层动作执行解耦,并通过连续视频流追踪任务进度,展示了具身智能分层编排与落地的具体路径。
Google DeepMind 宣布在 Google Flow Music 中上线最新音乐生成模型 Lyria 3.5,全面升级音乐性、歌词、人声表现和创作控制。新模型支持更复杂的旋律结构与发音更准、情感更自然的人声,同时增强了歌词生成的提示词遵循度,并允许用户直接调整输出的节奏与时长。
推荐理由:模型在旋律、歌词、人声以及节奏和时长控制上的升级,为创作者在音乐生成工具中微调成品提供了更细致的调节空间。
Google DeepMind 发布机器人模型系列 Gemini Robotics 2,首次实现对人形机器人的全身运动控制、高灵巧度末端操作及多机器人协作。该系列包含负责视觉语言动作控制的 VLA 模型、负责长流程规划的具身推理模型 ER 2,以及适配新本体仅需数小时数据的端侧模型 On-Device 2。
推荐理由:该系列将控制范围扩展至人形机器人全身协调与灵巧操作,为具身智能从桌面任务迈向多机长周期协作提供了落地方案。
Google Research 联合 Google DeepMind 推出 SymptomAI 研究,探索利用基于 Gemini Flash 2.0 的对话式 AI 智能体进行端到端症状问诊与鉴别诊断。
推荐理由:这项研究通过上万名真实用户的随访与穿戴设备生理数据,展示了具备主动追问能力的对话式模型在日常鉴别诊断中的可行性。
Google Research 与 Google DeepMind 在 Nature 发表研究,提出一种利用强化学习(RL)自主调控量子纠错的框架,使量子计算机无需停机即可动态校准控制参数以对抗硬件漂移。
推荐理由:Google 将强化学习引入量子纠错控制,利用运行中生成的错误检测信号动态抵御硬件漂移,为避免中断计算进行校准提供了可行方案。
Google DeepMind 正式推出 Gemini 3.6 Flash、3.5 Flash-Lite 以及专用于网络安全的 3.5 Flash Cyber 模型,重点提升智能体工作流的 token 效率与执行速度。
推荐理由:模型通过减少输出 token 消耗和推理步骤降低智能体运行成本,为开发者部署高吞吐工作流提供了兼顾速度与精度的选型参考。
Google DeepMind 发布 Gemini 3.5 Flash Cyber,这是基于 3.5 Flash 微调的轻量网络安全模型,用于快速发现、验证和修补漏洞,将由 CodeMender 通过限定访问试点向政府和可信合作伙伴提供。
推荐理由:官方给出轻量安全模型在多个漏洞基准上的对比与限政府合作伙伴的试点安排,可了解攻防两侧能力变化。
Google Research 联合 Google DeepMind 推出可穿戴健康数据基础模型 SensorFM。该模型基于 500 万参与者超过 1 万亿分钟的未标注多模态传感器信号进行预训练,通过自适应掩码框架直接适应数据缺失,在心血管、代谢、睡眠和心理健康等 35 项任务中均展现出跨领域迁移能力。
推荐理由:作者利用自监督掩码学习打通了多源可穿戴传感器数据,为稀缺医疗标注场景下的生理特征建模提供了通用方案。
Google DeepMind 推出图像生成模型 Nano Banana 2 Lite 与视频生成编辑模型 Gemini Omni Flash,现已上线 Google AI Studio 与 Gemini API。
推荐理由:官方给出了高吞吐图像模型与多模态视频模型的延迟和定价,为构建轻量端到端多媒体流水线提供了参考。
Google Research 推出面向表格数据分类与回归的零样本基础模型 TabFM,无需手动训练、特征工程或超参数调优即可在单次前向传播中完成预测。模型融合行列交替注意力与行压缩机制,完全基于结构因果模型生成的数亿个合成数据集预训练。目前该模型已在 GitHub 与 Hugging Face 开源,并原生接入 Google Cloud BigQuery 支持直接通过 SQL 调用。
推荐理由:该模型将上下文学习范式引入表格数据分析,读者可以了解如何省去传统树模型繁琐的特征工程与调优流程。
Google Research 团队在 COLM 2026 入选论文中揭示,让大模型生成推理轨迹能显著解锁单跳事实问答中原本难以直接读取的参数化知识。该提升主要由提供额外前向计算的计算缓冲效应,以及自发生成相关背景事实的事实预热机制共同驱动。研究同时发现中间推理若夹杂单条幻觉事实会导致最终正确率骤降,建议通过测试期轨迹验证或过程奖励强化真实性。
推荐理由:研究揭示了思维链除任务拆解外还能辅助参数化记忆检索的双重机制,为理解思考型模型的知识召回与幻觉抑制提供了控制实验依据。
Google DeepMind 宣布 computer use 成为 Gemini 3.5 Flash 的内置工具,开发者可通过 Gemini API 和 Gemini Enterprise Agent Platform 构建能在浏览器、移动端和桌面环境中感知、推理并执行操作的智能体。
推荐理由:Original text explains the capability and API access methods for integrating computer use into the main Gemini Flash model, allowing readers to assess how to build cross-platform automation agents.
Google DeepMind 推出实验性开源模型 DiffusionGemma,采用文本扩散机制替代传统的自回归逐字生成,在专用 GPU 上的文本生成速度最高提升至 4 倍。
推荐理由:该模型通过文本扩散架构将自回归逐字解码转为并行块生成,读者可以据此了解其在本地低延迟交互与代码补全场景下的性能取舍。
Google DeepMind 发布音频模型 Gemini 3.5 Live Translate,支持 70 多种语言的近实时流式语音互译,并在生成中保留原发言者的语调、节奏和音高。
推荐理由:材料展示了流式语音互译的技术落地路径,读者可以参考其在跨语种会议与移动端传译中的产品集成方式。
Google DeepMind 推出开源多模态模型 Gemma 4 12B,支持在配备 16GB 显存或统一内存的普通笔记本上本地运行多模态与智能体任务。该模型采用无编码器的统一架构,移除传统的独立视觉与音频编码器,将视觉和原始音频信号直接投影至大语言模型主干网络,性能接近其 26B MoE 模型。
推荐理由:模型采用无编码器的统一架构直接处理视觉与音频输入,使笔记本端在 16GB 内存下也能本地运行多模态推理与智能体工作流。
Google DeepMind 公布了在塞拉利昂开展的预注册随机对照试验结果,基于 Gemini 的 Guided Learning 让学生数学成绩提升 0.258 个标准差,相当于 1.2 至 1.7 年的学习进展。
推荐理由:该项预注册对照试验呈现了引导式提问在基础教学中的量化增益,同时公开了可落地的教师培训方案。
Google Research 在《Nature》发表研究系统 PHRM,利用智能手机前置摄像头在用户面部解锁后的数秒内被动估算心率和每日静息心率。该方案在设备端运行轻量化卷积神经网络,心率测量平均绝对百分比误差低于 10%,静息心率相比穿戴设备平均绝对误差低于 5 bpm,并在不同肤色群体中达到统一精度标准。团队同步向通过审核的研究人员开放了数据集与预训练模型 PHRM-mini。
推荐理由:原文展示了仅凭手机前置摄像头在解锁时被动监测心率与静息心率的方案,为无穿戴设备场景下的健康监测提供了具体参考。
Google 在《Nature》发表论文介绍科研编程系统 ERA(Empirical Research Assistance),并宣布通过 Gemini for Science 逐步开放基于 ERA 和 AlphaEvolve 构建的实验工具 Computational Discovery。
推荐理由:该研究展示了将大模型与树搜索结合优化科研代码的具体路径,为自动化计算实验与科学发现提供了可参考的工程框架。