跳到正文

Google / Gemini

Google 与 DeepMind 的 AI 动态:Gemini 系列、Veo 视频模型、研究成果与产品生态的持续追踪。

最新精选

第 41–60 条 · 共 60 条
5月18日周一
  1. Google DeepMind82

    Google DeepMind 发布 Gemini Omni,首款模型 Gemini Omni Flash 上线

    Google DeepMind 发布 Gemini Omni 模型家族,主打从任意输入生成内容,首款模型 Gemini Omni Flash 率先支持视频。Omni 可组合图像、音频、视频和文本输入生成视频,并支持用自然语言多轮对话编辑视频,同时生成画面基于 Gemini 的世界知识,对重力、动能和流体动力学有更好的直观理解。

    推荐理由:Gemini Omni 把视频生成与多轮对话剪辑合到同一模型中,读者可了解其输入方式与首批上线渠道。

5月17日周日
  1. Google DeepMind64

    Google DeepMind 推出 Gemini for Science 系列科研实验工具

    Google DeepMind 推出科研工具集 Gemini for Science,在 Google Labs 开放假说生成、计算发现与文献洞察三款实验性原型,并在 Google Antigravity 中提供整合 30 多个生命科学数据库的 Science Skills。

    推荐理由:原文展示了多智能体辩论与并行代码生成如何介入科学假说与验证,读者可以据此了解通用智能体融入科研全流程的具体形态。

  2. Google DeepMind67

    Google 扩展 SynthID 与 C2PA 验证工具,上线 AI 内容检测 API 并深化跨生态溯源

    Google 宣布在 Search、Gemini、Chrome、Pixel 及 Cloud 中扩展内容透明度与验证工具,深化 SynthID 水印和 C2PA 内容凭据的应用。

    推荐理由:Google 将 SynthID 与 C2PA 凭据贯通至搜索、浏览器及硬件,并向企业开放检测 API,为跨平台构建生成式内容防伪体系提供了系统化方案。

5月16日周六
  1. Google DeepMind64

    Google DeepMind 借助 Co-Scientist 发现抗肝纤维化的老药新用候选物

    斯坦福大学医学院与 Google DeepMind 合作,利用 Co-Scientist 智能体从现有药物文献中筛选治疗肝纤维化的老药新用候选物,相关研究发表于《Advanced Science》。

    推荐理由:研究展示了科学智能体在海量文献中挖掘老药新用候选物的实验命中表现,为生物医药研发提供了具体验证案例。

  2. Google DeepMind67

    WeatherNext 如何协助美国国家飓风中心预测飓风梅丽莎在牙买加的历史性登陆

    Google DeepMind 详细阐述了 AI 气象模型 WeatherNext 如何协助美国国家飓风中心提前 5 天预测飓风梅丽莎增强至 5 级并在牙买加登陆。该模型结合数十年全球气象模式与极端热带气旋专属数据集训练,克服了传统模型难以兼顾路径与强度的限制,可同时推演 50 种集合预测情景以辅助预警决策。

    推荐理由:原文给出了 AI 气象模型兼顾路径与强度预测的实战数据,读者可以据此评估 AI 预报极端天气事件的可用性。

  3. Google DeepMind88

    Google DeepMind 发布 Gemini 3.5 系列并上线 3.5 Flash

    Google DeepMind 正式推出 Gemini 3.5 模型系列并上线首发版本 Gemini 3.5 Flash,主打长流程编码与复杂智能体任务执行。该模型在 MCP Atlas 达 83.6%、Terminal-Bench 2.1 达 76.2%,输出 token 速率达到其他前沿模型的 4 倍,系列旗舰 3.5 Pro 计划于下月推出。

    推荐理由:模型在兼顾生成速率的同时强化了编码与多步智能体执行能力,可作为评估长流程任务端到端自动化成本的重要参考。

5月12日周二
  1. Google DeepMind75

    Google DeepMind 推出多智能体科研系统 Co-Scientist

    Google DeepMind 在《Nature》发表研究并推出基于 Gemini 的多智能体 AI 系统 Co-Scientist,旨在协助科研人员在生命科学等领域生成、论证与迭代科学假说。

    推荐理由:原文给出了多智能体通过辩论锦标赛演进科学假说的架构细节,对探索 AI 辅助基础科研的工作流设计提供了参考。

5月6日周三
  1. Google DeepMind64

    Google DeepMind 展示 AlphaEvolve 一年成果:从 DNA 测序到 TPU 设计

    Google DeepMind 汇总了 Gemini 驱动的编码智能体 AlphaEvolve 发布一年来的落地成果。它帮助 DeepConsensus 将变异检测错误降低 30%,把电网 AC Optimal Power Flow 的可行解比例从 14% 提升到 88%以上,并在量子模拟中给出误差低 10 倍的量子线路。

    推荐理由:一年来 AlphaEvolve 在基因测序、电网、TPU 与量子模拟等场景的落地数据,展示了编码智能体从演示走向基础设施的路径。

4月30日周四
  1. Google DeepMind65

    Google DeepMind 发布 AI co-clinician 医疗协作研究计划

    Google DeepMind 宣布 AI co-clinician 研究计划,探索 AI 智能体在医生监督下协助患者诊疗。在 98 个真实初级保健问题的盲测中,该系统在其中 97 个案例未出现关键错误,医生对其回答的偏好也高于主流证据合成工具。

    推荐理由:Google DeepMind 披露 AI co-clinician 的评测设计与多模态问诊模拟结果,可了解医疗 AI 从文本走向实时音视频的路径。

4月23日周四
  1. Google Research72

    Google 推出 3D 感知图像重构技术,已在 Google Photos 自动构图中上线

    Google 推出一种结合三维场景理解与生成式 AI 的照片重构技术,并已在 Google Photos 的 Auto frame 功能中正式上线。该方案将图像处理解耦为 3D 场景与相机参数估计、潜在扩散模型修补两个阶段,能够在拍照后自动调整虚拟相机机位与焦距,并修复人像广角畸变。用户在编辑包含人物的照片时,可直接在构图候选项中选择重构视角的一键优化效果。

    推荐理由:该方案将单张照片解耦为三维场景估计与扩散模型修补两阶段,展示了借助空间感知调整成像视角并消除畸变的新思路。

4月22日周三
  1. Google Research60

    Google 提出 ReasoningBank:让智能体从成败经验中提炼推理记忆并自演进

    Google Research 推出智能体记忆框架 ReasoningBank,能够从成功与失败经历中提炼结构化的高阶推理模式,支持测试阶段的持续自演进。该方案通过闭环工作流提取防范性策略,并结合记忆感知测试时扩展(MaTTS)在并行或序列推理中强化策略质量。

    推荐理由:该研究系统性地从失败经验中提炼高层推理模式,为构建具备持续反思与测试时自演进能力的智能体提供了具体记忆架构参考。

4月16日周四
  1. Google DeepMind72

    Google DeepMind 推出 Gemini 3.1 Flash TTS 语音模型

    Google DeepMind 正式推出文本转语音模型 Gemini 3.1 Flash TTS,支持通过自然语言音频标签精确控制语音风格、节奏和表达,并原生支持多说话人对话与 70 多种语言。

    推荐理由:该模型通过自然语言行内标签实现对语调和语速的精细调度,为构建多角色对话系统提供了更具成本效益的语音方案。

4月13日周一
4月3日周五
  1. Google DeepMind88

    Google DeepMind 发布开源模型 Gemma 4

    Google DeepMind 正式推出开源模型 Gemma 4 系列,包含 E2B、E4B、26B MoE 和 31B Dense 四种尺寸,专为高级推理与智能体工作流设计。

    推荐理由:Gemma 4 转向 Apache 2.0 商业许可并覆盖端侧至 31B 规模,展示了小尺寸开源模型在多模态与智能体工作流上的落地路径。

3月29日周日
  1. Google DeepMind65

    Google DeepMind 重新构想 AI 时代的鼠标指针交互

    Google DeepMind 推出基于 Gemini 的 AI 鼠标指针原型,让指针能结合屏幕视觉与语义上下文直接理解用户意图。团队提出了保持工作流连贯、减少冗长提示词、支持指代交互以及将像素转化为可操作实体四项原则。目前该功能已在 Google AI Studio 开放实验体验,并逐步整合至 Chrome 浏览器与 Googlebook 笔记本。

    推荐理由:原文提出了结合视觉语义与光标位置的交互原则,为大模型如何摆脱独立对话框并融入日常系统界面提供了具体设计参考。

3月25日周三
  1. Google Research67

    Google 推出 Vibe Coding XR:结合 Gemini 与 XR Blocks 加速 Android XR 原型开发

    Google 发布 Vibe Coding XR 原型工作流,结合 Gemini 的推理能力与开源 XR Blocks 框架,支持通过自然语言在 60 秒内生成具备物理感知与手势交互的 Android XR 应用。

    推荐理由:原文展示了大语言模型结合 WebXR 框架快速构建空间交互原型的技术链路,开发者可参考其上下文工程设计与桌面端仿真方案。

3月18日周三
  1. Google Research61

    Google Research 汇总 The Check Up 医疗 AI 进展:涵盖 MedGemma 与临床智能体 AMIE

    Google Research 在 The Check Up 活动上公布了一系列医疗健康 AI 突破,涵盖个人健康助手、临床辅助决策系统及开源开发者工具。团队展示了具备多模态推理能力的多智能体系统 AMIE 在临床问诊中的实测进展,并推广支持 3D 影像的开源医疗模型 MedGemma;同时公布了乳腺癌早筛研究以及用于识别癌症基因突变的研究工具 DeepSomatic。

    推荐理由:文章系统梳理了前沿医疗多模态模型与多智能体系统从实验室算法走向临床筛查、开发者生态和基因组学研究的落地链路。

  2. Google Research71

    Google Research 联合 NHS 发布研究:利用机器学习优化乳腺癌筛查工作流

    Google Research 与英国国家医疗服务体系(NHS)合作在《Nature Cancer》发表两项关于乳腺癌筛查 AI 系统的研究。评估显示独立 AI 系统的癌症检出率从千分之 7.54 提升至 9.33 并检出了 25% 的间歇期癌症,在前瞻性部署中中位处理时间为 17.7 分钟。

    推荐理由:原文展示了将模型作为第二阅片员融入临床双读流程的试验设计,为医疗场景评估人机协同与工作量削减提供了参考依据。

3月12日周四
  1. Google Research67

    Google 开展对话式诊断 AI 真实临床研究,验证 AMIE 门诊预诊可行性

    Google 与 BIDMC 合作完成前瞻性临床研究,验证对话式医疗 AI 系统 AMIE 在门诊初级保健就诊前采集病史的安全性与可行性。在对 100 名患者的测试中,医生实时监督下未触发任何安全终止事件,盲审评估显示 AMIE 的鉴别诊断质量与全科医生相当,90% 病例的前 7 项鉴别诊断命中 8 周后的最终确诊结果。

    推荐理由:该研究将对话式医疗 AI 从模拟环境推进到真实门诊预诊流程,在人工监督下验证了病史采集的安全性和鉴别诊断表现。

5月7日周三
  1. Mistral AI63

    Mistral 推出 Le Chat Enterprise,由 Mistral Medium 3 驱动

    Mistral 发布 Le Chat Enterprise,一款由全新 Mistral Medium 3 模型驱动的企业 AI 助手,包含企业搜索、Agent 构建器、数据与工具连接器、文档库、自定义模型和混合部署等功能,全部功能将在未来两周内逐步上线。

    推荐理由:Mistral 把企业搜索、Agent 构建与混合部署打包进同一订阅,可观察欧洲厂商做企业 AI 的路线选择。