跳到正文

#Google

今日 0 条
9月28日周一
9月25日周五
  1. Google Research64

    Google 发布长视频连贯生成多智能体框架研究

    Google Research 提出多智能体视频协导框架及系列研究,通过在 Gemini 与 Veo 之上构建编排层,实现多镜头叙事长视频的自动化与视觉连贯性生成。

    推荐理由:研究将长视频生成解耦为多智能体规划、视觉记忆与闭环评测,为多镜头叙事中的角色与场景连贯性提供了可参考的系统化方案。

  2. Google DeepMind74

    Google DeepMind 推出 Gemini 3.8 Live 实时数字人功能 Live Avatar

    Google DeepMind 推出 Gemini 3.8 Live 的 Live Avatar 功能,为原生实时对话模型提供低延迟的流式视频虚拟形象。该功能支持自然表情和精准唇形同步,可在 97 种语言间无缝切换,并支持在保持对话流畅的同时于后台异步调用工具执行复杂任务。输出内容均默认嵌入 SynthID 水印防伪,即日起在 Gemini Enterprise 开放可用。

    推荐理由:原文展示了流式视频形象与后台异步工具调用的结合,读者可以据此评估实时数字人在企业端交互场景中的落地可行性。

9月24日周四
  1. NVIDIA Blog67

    开放科学如何协助科研人员应对下一场大流行病:NVIDIA 与 DeepMind 等公开病毒蛋白质复合物数据集

    NVIDIA 联合 Google DeepMind 及欧洲生物信息学研究所(EMBL-EBI)等机构,在 AlphaFold 数据库中公开了涵盖超过 2800 种病毒的蛋白质复合物三维预测结构,并同步开源了 GPU 加速的 BioNeMo 结构预测工作流。

    推荐理由:该项目开放了涵盖数千种病毒的复合物三维结构及配套加速管线,研究人员可直接复用该流程推进病毒机理研究与药物设计。

  2. Google DeepMind61

    Google 推出 Private AI Compute 安全服务端内存架构,实现跨设备持久 AI 记忆

    Google 宣布为 Private AI Compute 平台引入服务端安全持久内存架构,在保持端侧隐私标准的同时支持跨设备保留长期 AI 上下文。该架构结合硬件安全飞地、端到端加密通道和仅由设备端持有的解密密钥,云端仅在隔离内存中临时解密处理并即时重新加密,确保数据对包括 Google 在内的第三方不可见。

    推荐理由:原文解决了传统云端隐私计算无状态导致无法跨设备保留上下文的问题,展示了云端大模型在严格硬件加密下维持长期记忆的可行路径。

9月23日周三
9月18日周五
9月16日周三
  1. NVIDIA Blog48

    Emerald AI、Google 与 NVIDIA 联合成立联盟推进灵活 AI 数据中心

    Emerald AI、Google 与 NVIDIA 宣布联合成立 AI 能源管理联盟(AEMA),旨在推进可根据电网状况动态调节用电的灵活 AI 数据中心。该联盟通过转移计算负载、储能放电及配套发电等方式使数据中心转变为可控资源,从而更高效地利用电网容量并缩短并网周期。AEMA 坚持技术中立原则,重点制定性能指标、应急响应规则与数据共享标准。

9月11日周五
9月8日周二
  1. Google DeepMind71

    Google DeepMind 推出 AlphaGenome Atlas 人类基因组突变预测图谱平台

    Google DeepMind 正式推出 AlphaGenome Atlas 平台,预计算并收录了人类基因组中全部 90 亿个单核苷酸变异的分子生物学影响。该 1PB 规模的数据集配套推出了综合致病性评估的 AVI 评分,可同时覆盖蛋白质编码区与占 98% 的非编码调控区。目前该图谱已通过免费网站门户和 API 开放学术研究使用,后续将登陆 Google Cloud。

    推荐理由:平台预先计算了人类基因组 90 亿个突变的分子影响,科研人员无需自行推理即可直接排查致病位点。

9月4日周五
  1. Google Research72

    Google 联合多机构绘制完成雄性果蝇全脑及中枢神经系统连接图谱

    Google 与 HHMI Janelia 及剑桥大学等合作在《Cell》发表成果,绘制出包含超过 16.6 万个神经元与 1.25 亿个突触连接的雄性果蝇全脑及中枢神经系统完整图谱。

    推荐理由:研究结合AI重建技术与人工校对绘制出含十六万神经元的果蝇完整连接组,为神经回路与疾病机制研究提供了细胞级结构数据。

9月3日周四
  1. Google DeepMind72

    Google DeepMind 发布全球气象 AI 模型 WeatherNext 3

    Google DeepMind 联合 Google Research 正式发布全球气象 AI 模型 WeatherNext 3,直接利用实时地球同步卫星拼接数据与地面气象站观测,实现每小时刷新并提供最高 5 公里空间分辨率的预报。

    推荐理由:该模型通过引入实时卫星数据实现每小时刷新与5公里空间分辨率,展示了AI气象预报在降水与清洁能源场景下的工程落地路径。

  2. Google DeepMind57

    Google DeepMind 推出 Fairwind 计划,提供 Gemini 3.8 Flash Cyber 与自主漏洞修复能力

    Google DeepMind 宣布启动面向政府与受信任合作伙伴的 Fairwind 计划,提供自主发现和修复网络安全漏洞的高级防御能力。该计划结合专用模型 Gemini 3.8 Flash Cyber 与 CodeMender 框架,可在几分钟内为组织生成并验证可直接部署的安全补丁。目前全球已有超 650 家伙伴参与,覆盖公共部门、关键基础设施运营商与核心技术平台。

  3. Google DeepMind79

    Google DeepMind 发布 Gemini 3.8 Flash 与 3.8 Flash Cyber

    Google DeepMind 正式推出 Gemini 3.8 Flash 及专注于网络安全防御的 Gemini 3.8 Flash Cyber,在保持与 3.7 Flash 相同速度和低成本的同时强化了推理与编码能力。

    推荐理由:新模型在保持原有推理成本和低延迟的基础上,显著强化了长程编码智能体能力并推出了防御型安全版本。

9月2日周三
9月1日周二
  1. Google Research65

    Google Research 推出 TimesFM-3:支持多元零样本预测的时序基础模型

    Google Research 推出 330M 参数的时序基础模型 TimesFM-3,原生支持零样本多元时序预测。该模型采用因果时间注意力与跨序列注意力交替架构,通过连续 Patch 掩码在单次前向传播中同时预测多个目标,并能结合历史与未来已知协变量输出 9 个分位数预测。目前 TimesFM-3 已在 GitHub 和 Hugging Face 开源上线,后续还将接入 BigQuery。

    推荐理由:该模型通过交替注意力与非自回归单次前向推理扩展至多元预测,为结合未来已知协变量的时序任务提供了开源基础模型参考。

8月28日周五
  1. Google Research60

    Google 推出行星预测引擎 PPE:实现地理空间预测模型端到端自动化构建

    Google 推出实验性研究能力行星预测引擎(PPE),可通过自然语言输入端到端自主执行从数据检索、多模态特征工程到模型训练与评估的完整地理空间建模流程。该系统将传统需数周的人工数据工程缩短至数分钟,并在美国公共卫生指标、尼日利亚粮食安全降尺度以及刚果(金)埃博拉疫情预测等基准任务中均超过基线表现。

    推荐理由:原文给出了基于多模态大模型自主编排地理空间建模的完整架构,展现了将数周人工特征工程压缩至分钟级的可行路径。

8月27日周四
  1. Google DeepMind61

    Google DeepMind 试点双盲 AI 评测以应对基准测试污染

    Google DeepMind 宣布试点双盲 AI 评测方案,利用密码学安全环境防止前沿专有模型在测试前获取题目,以解决基准测试污染问题。团队联合新加坡 AI 安全研究所、OpenMined、AVERI 与 MLCommons,在隐私保护环境中对 Gemini Flash Lite 模型进行机密基准测试。该机制通过技术与密码学保障替代单纯的合同与日志约束,提升模型能力评测的完整性与可信度。

    推荐理由:文章介绍了通过密码学安全环境防止基准测试数据污染的试点方案,为解决模型预先窥题和评估失真提供了工程化参考。

  2. Google Research42

    GlucoFM:面向连续血糖监测的基础模型

    Google 提出面向连续血糖监测(CGM)的自监督基础模型 GlucoFM,采用分离慢速血糖趋势与短期波动的双流架构。该模型基于 109,066 小时无标签数据预训练,在 14 项临床预测评估中平均 PR-AUC 达 58.8,较同数据基准提升 4.1 点,并在两小时餐后血糖反应(PPGR)预测中取得最低平均绝对误差。

8月26日周三
  1. Google Research47

    AgentHands:在 XR 中为空间定位智能体对话生成交互式手势

    Google Research 推出研究原型 AgentHands,通过将大语言模型推理映射为 3D 物理动作,为 XR 环境中的 AI 智能体生成与语音同步的交互手势。系统结合轻量级物体注册、手势事件库与本地解析器,利用词级时间戳让虚拟手在空间中精准执行指示与动作模拟。该方案在兰花养护和 3D 打印机操作等场景中显著提升了空间交互指导的直观性。

8月22日周六
8月21日周五
  1. Google Research45

    Google:移动数据如何让大语言模型更深入理解地点

    Google 推出 ME-POIs 框架,将聚合匿名的移动模式与文本描述融合,让大语言模型生成兼顾地点语义与动态功能的向量嵌入。在未见地点测试中,该框架使访问意图预测相对提升 81.9%,价格等级分类提升 75.1%,繁忙度估算准确率提高 24.7%。其空间多尺度传播机制还能迁移周边特征,有效缓解长尾商户的数据稀疏问题。

8月17日周一
  1. Google Research59

    Google Research 推出 PhotoScan 框架,利用手机照片估算身体成分与心脏代谢风险

    Google Research 推出深度学习研究框架 PhotoScan,可直接通过智能手机拍摄的 2D 照片估算体脂率、躯干臀腿脂肪比(A/G)及内脏皮下脂肪比(V/S)。在独立临床验证队列中,结合该身体成分特征后胰岛素抵抗分类的 AUROC 达到 0.760,表现接近临床双能 X 射线吸收测量仪(DXA)金标准的 0.773,并明显优于传统智能手表的生物电阻抗测量。

8月14日周五
  1. Google DeepMind83

    Google DeepMind 发布 Gemini 3.7 Flash

    Google DeepMind 正式推出面向编程与 AI 智能体的工作流模型 Gemini 3.7 Flash,在软件工程、知识处理和 Web 开发上均有提升。

    推荐理由:原文给出了编程和复杂工作流的实测基准数据与首发半价方案,读者可以据此评估在生产环境中替换现有轻量模型的性价比。

8月12日周三
  1. Google DeepMind70

    Google DeepMind 推出手语转文本模型 SL2T

    Google DeepMind 推出多语言手语转文本模型 SL2T,并在 Pixel 11 的 Gboard 与 Live Transcribe 中率先支持美式手语转英语输入。该模型使用覆盖 50 多种手语的超 100,000 小时数据联合训练,借助端侧 MediaPipe Holistic 提取身体姿态关键点坐标直接翻译为文本,在 FLEURS-ASL 基准测试中达到 70 BLEURT 分数。

    推荐理由:该模型将端侧姿态坐标提取与云端序列翻译结合并绕过中间标注,为视觉多模态语言落地提供了具体方案。

  2. Google Research66

    Google Research 提出知识画像框架:大模型事实性瓶颈在于检索而非编码

    Google Research 提出知识画像框架与 WikiProfile 基准,指出前沿大语言模型的事实性瓶颈已从知识编码转向知识检索。评测显示 Gemini-3-Pro 与 GPT-5 等前沿模型已编码 95%–98% 的事实,但仍有 26%–34% 的事实无法直接检索。开启思考机制能够找回 40%–65% 已编码却无法直接检索的事实,显著缓解长尾事实检索困难与反向诅咒现象。

    推荐理由:原文通过实验证明前沿模型的事实错误主要源于检索障碍而非参数缺失,为利用思考机制和后训练改善知识调用提供了新视角。

  3. Google Research74

    Google 推出 AMIE (Video) 实时视频临床问诊系统

    Google Research 与 Google DeepMind 推出基于 Gemini 与 Project Astra 的临床问诊系统 AMIE (Video),支持在实时视频问诊中感知非语言线索并引导虚拟体检。

    推荐理由:研究提出了拆分对话、规划与感知的异步多智能体架构,为高延迟深度推理与低延迟实时音视频交互的共存提供了参考方案。

8月6日周四
  1. Google DeepMind78

    Google DeepMind 开源气旋预测模型 WeatherNext

    Google DeepMind 联合多家气象机构在《Nature》发表研究并开源 WeatherNext 系列模型,在热带气旋路径、强度及风场结构预测上平均获得额外 24 小时的精度提前量。

    推荐理由:该成果证明大尺度低分辨率输入结合生成网络同样能精准预测极端气旋,为极端气象预警提供了开源且低计算门槛的方案。

7月31日周五
7月30日周四
  1. Google DeepMind65

    Google DeepMind 在 Flow Music 中推出音乐生成模型 Lyria 3.5

    Google DeepMind 宣布在 Google Flow Music 中上线最新音乐生成模型 Lyria 3.5,全面升级音乐性、歌词、人声表现和创作控制。新模型支持更复杂的旋律结构与发音更准、情感更自然的人声,同时增强了歌词生成的提示词遵循度,并允许用户直接调整输出的节奏与时长。

    推荐理由:模型在旋律、歌词、人声以及节奏和时长控制上的升级,为创作者在音乐生成工具中微调成品提供了更细致的调节空间。

7月28日周二
  1. Google DeepMind76

    Google DeepMind 发布 Gemini Robotics 2 机器人模型系列

    Google DeepMind 发布机器人模型系列 Gemini Robotics 2,首次实现对人形机器人的全身运动控制、高灵巧度末端操作及多机器人协作。该系列包含负责视觉语言动作控制的 VLA 模型、负责长流程规划的具身推理模型 ER 2,以及适配新本体仅需数小时数据的端侧模型 On-Device 2。

    推荐理由:该系列将控制范围扩展至人形机器人全身协调与灵巧操作,为具身智能从桌面任务迈向多机长周期协作提供了落地方案。