Google DeepMind 为 Project Genie 加入 Street View 实景锚定能力
Google DeepMind 为实验原型 Project Genie 推出 Street View 实景锚定能力,用户可在美国境内选点并结合风格与角色描述生成世界,起始位置锚定真实街景影像;该能力基于 Maps Imagery Grounding。
Google DeepMind 为实验原型 Project Genie 推出 Street View 实景锚定能力,用户可在美国境内选点并结合风格与角色描述生成世界,起始位置锚定真实街景影像;该能力基于 Maps Imagery Grounding。
Google DeepMind 发布 Gemini Omni 模型家族,主打从任意输入生成内容,首款模型 Gemini Omni Flash 率先支持视频。Omni 可组合图像、音频、视频和文本输入生成视频,并支持用自然语言多轮对话编辑视频,同时生成画面基于 Gemini 的世界知识,对重力、动能和流体动力学有更好的直观理解。
推荐理由:Gemini Omni 把视频生成与多轮对话剪辑合到同一模型中,读者可了解其输入方式与首批上线渠道。
Google DeepMind 推出科研工具集 Gemini for Science,在 Google Labs 开放假说生成、计算发现与文献洞察三款实验性原型,并在 Google Antigravity 中提供整合 30 多个生命科学数据库的 Science Skills。
推荐理由:原文展示了多智能体辩论与并行代码生成如何介入科学假说与验证,读者可以据此了解通用智能体融入科研全流程的具体形态。
Google 宣布在 Search、Gemini、Chrome、Pixel 及 Cloud 中扩展内容透明度与验证工具,深化 SynthID 水印和 C2PA 内容凭据的应用。
推荐理由:Google 将 SynthID 与 C2PA 凭据贯通至搜索、浏览器及硬件,并向企业开放检测 API,为跨平台构建生成式内容防伪体系提供了系统化方案。
Google DeepMind 与新加坡政府达成国家级 AI 合作,围绕医疗、科研与教育等领域启动多项前沿 AI 落地计划。合作包括研发基于 Gemma 的视障跑步助手、向当地中小学及初级学院教师提供 Gemini for Education、利用 AlphaFold 开展流行病研究,并联合 IMDA 等机构研发多模态多语言安全基准。
剑桥大学教授 Clare Bryant 正在使用 Co-Scientist 寻找新发传染病跨物种传播引发重症的分子开关与预防方案。该工具通过分析研究提案与未公开实验数据生成并排序假说,直接锁定了此前未被关注的关键蛋白质及特定氨基酸。团队正构建突变细胞系进行测试,原本需要 2 至 3 年的靶点确定工作有望缩短至 6 个月内完成。
Calico Life Sciences 的 Matt Onsum 与 Katherine Labbé 正使用 Google DeepMind 的 Co-Scientist 梳理衰老生物学中零散的发现并生成可验证的假设。
Google DeepMind 展示了爱丁堡大学团队利用 Co-Scientist 加速代谢功能障碍相关脂肪性肝炎(MASH)机制研究的成果。面对多靶点组合疗法搜索空间过大的问题,Co-Scientist 梳理肝脏生物学与药理学文献并生成假说,指出 NLRP3 炎症小体是连接炎症与代谢的关键分子桥梁。
MIT 的 Ritu Raman 与波士顿儿童医院的 Ryan Flynn 借助 Google DeepMind 的 Co-Scientist,将各自的组织模型与 RNA 表面图谱工具结合,用于 ALS 研究。
斯坦福大学医学院与 Google DeepMind 合作,利用 Co-Scientist 智能体从现有药物文献中筛选治疗肝纤维化的老药新用候选物,相关研究发表于《Advanced Science》。
推荐理由:研究展示了科学智能体在海量文献中挖掘老药新用候选物的实验命中表现,为生物医药研发提供了具体验证案例。
Google DeepMind 详细阐述了 AI 气象模型 WeatherNext 如何协助美国国家飓风中心提前 5 天预测飓风梅丽莎增强至 5 级并在牙买加登陆。该模型结合数十年全球气象模式与极端热带气旋专属数据集训练,克服了传统模型难以兼顾路径与强度的限制,可同时推演 50 种集合预测情景以辅助预警决策。
推荐理由:原文给出了 AI 气象模型兼顾路径与强度预测的实战数据,读者可以据此评估 AI 预报极端天气事件的可用性。
Google DeepMind 正式推出 Gemini 3.5 模型系列并上线首发版本 Gemini 3.5 Flash,主打长流程编码与复杂智能体任务执行。该模型在 MCP Atlas 达 83.6%、Terminal-Bench 2.1 达 76.2%,输出 token 速率达到其他前沿模型的 4 倍,系列旗舰 3.5 Pro 计划于下月推出。
推荐理由:模型在兼顾生成速率的同时强化了编码与多步智能体执行能力,可作为评估长流程任务端到端自动化成本的重要参考。
Google DeepMind 在《Nature》发表研究并推出基于 Gemini 的多智能体 AI 系统 Co-Scientist,旨在协助科研人员在生命科学等领域生成、论证与迭代科学假说。
推荐理由:原文给出了多智能体通过辩论锦标赛演进科学假说的架构细节,对探索 AI 辅助基础科研的工作流设计提供了参考。
自适应并行推理旨在让推理模型自行决定何时分解并并行化独立子任务、开启多少并发线程以及如何协调,而非由外部框架强加并行结构。现有方法如 Self-consistency、Best-of-N、Tree/Graph of Thoughts、MCTS、ParaThinker、GroupThink 与 Hogwild!
Google DeepMind 汇总了 Gemini 驱动的编码智能体 AlphaEvolve 发布一年来的落地成果。它帮助 DeepConsensus 将变异检测错误降低 30%,把电网 AC Optimal Power Flow 的可行解比例从 14% 提升到 88%以上,并在量子模拟中给出误差低 10 倍的量子线路。
推荐理由:一年来 AlphaEvolve 在基因测序、电网、TPU 与量子模拟等场景的落地数据,展示了编码智能体从演示走向基础设施的路径。
Google Research 公布其开放科学进展,过去十年推出的开源技术与公开数据集已支持全球超 25 万名科研人员与开发者。其成果涵盖基因组分析套件(助力处理 250 万人基因组)、混合大气模型 NeuralGCM 等。在医疗领域,开源权重模型 MedGemma 下载量已超 480 万次,Open Health Stack 工具套件已惠及超 6500 万人。
Google DeepMind 宣布 AI co-clinician 研究计划,探索 AI 智能体在医生监督下协助患者诊疗。在 98 个真实初级保健问题的盲测中,该系统在其中 97 个案例未出现关键错误,医生对其回答的偏好也高于主流证据合成工具。
推荐理由:Google DeepMind 披露 AI co-clinician 的评测设计与多模态问诊模拟结果,可了解医疗 AI 从文本走向实时音视频的路径。
Google Research 公布科学家使用 Empirical Research Assistance(ERA)的四类实际科研场景:用 ERA 每周为美国各州提交流感、COVID-19 和 RSV 住院预测,在流感与 COVID-19 公开排行榜上表现处于或接近榜首。
Mistral AI 发布 Workflows 公测版,定位为企业 AI 编排层,提供持久化执行、可观测性和容错能力,用于把 AI 流程从概念验证推进到生产环境。
推荐理由:Mistral 把企业 AI 编排层的落地路径讲清楚了,包括持久化执行、人审断点和数据面隔离的具体做法。
Google DeepMind 与韩国科学技术信息通信部(MSIT)建立合作,将在首尔办公室设立 AI Campus,与首尔大学、KAIST 及三个 AI Bio 创新中心探索科研合作。
Google 推出一种结合三维场景理解与生成式 AI 的照片重构技术,并已在 Google Photos 的 Auto frame 功能中正式上线。该方案将图像处理解耦为 3D 场景与相机参数估计、潜在扩散模型修补两个阶段,能够在拍照后自动调整虚拟相机机位与焦距,并修复人像广角畸变。用户在编辑包含人物的照片时,可直接在构图候选项中选择重构视角的一键优化效果。
推荐理由:该方案将单张照片解耦为三维场景估计与扩散模型修补两阶段,展示了借助空间感知调整成像视角并消除畸变的新思路。
Google DeepMind 推出新型分布式训练架构 Decoupled DiLoCo,通过将训练任务划分为解耦的计算岛并结合异步数据流,实现跨远距离数据中心的低带宽与高容错模型训练。
Google Research 推出智能体记忆框架 ReasoningBank,能够从成功与失败经历中提炼结构化的高阶推理模式,支持测试阶段的持续自演进。该方案通过闭环工作流提取防范性策略,并结合记忆感知测试时扩展(MaTTS)在并行或序列推理中强化策略质量。
推荐理由:该研究系统性地从失败经验中提炼高层推理模式,为构建具备持续反思与测试时自演进能力的智能体提供了具体记忆架构参考。
Google DeepMind 宣布与 Accenture、Bain & Company、BCG、Deloitte 和 McKinsey 达成合作,加速推动全球企业的智能体转型与前沿 AI 规模化落地。合作伙伴将获得 Gemini 等前沿模型的早期访问权,并与 DeepMind 技术团队合作开发金融、制造等行业解决方案。该合作旨在弥合目前仅 25% 组织实现 AI 规模化投产的应用鸿沟。
研究人员提出用于世界模型的新型基于梯度规划器 GRASP,旨在解决长时域规划中优化病态与局部极小值陷阱等问题。GRASP 将轨迹提升为虚拟状态以实现跨时间并行优化,并在状态迭代中直接加入随机性以促进探索;同时通过重塑梯度提供清晰动作信号,避免高维视觉模型中脆弱的状态输入梯度。
Google 推出合成数据生成与评估框架 Simula,通过基于推理的第一性原理将全流程解耦为全局多样性、局部多样性、复杂化与双批评质量检查四个独立可控维度。实验使用 Gemini 2.5 Flash 作为教师模型向 Gemma-3 4B 进行蒸馏,在网络安全、法律推理、数学等领域最高生成 512K 规模数据并显著超越基线。
Google Research 推出神经形态生成模型 MoGen,通过点云流匹配技术生成逼真的 3D 神经元形态,以合成数据加速大脑神经连接图谱重建。实验显示,在 PATHFINDER 重建模型的训练中加入 MoGen 数据后,小鼠轴突重建错误率降低了 4.4%,在完整小鼠大脑规模下相当于节省 157 人年的人工校对成本。
Google DeepMind 正式推出文本转语音模型 Gemini 3.1 Flash TTS,支持通过自然语言音频标签精确控制语音风格、节奏和表达,并原生支持多说话人对话与 70 多种语言。
推荐理由:该模型通过自然语言行内标签实现对语调和语速的精细调度,为构建多角色对话系统提供了更具成本效益的语音方案。
Google 与纽约大学合作推出 Vantage 研究实验,利用生成式 AI 构建多方协作模拟环境,用于评估学生的批判性思维与协作等持久技能。系统由主管大模型(Executive LLM)在对话中动态施加冲突与挑战以激发技能展现,再由 AI 评估器对照评分量规生成可视化技能图谱与定性反馈。
Google DeepMind 推出专为机器人设计的具身推理模型 Gemini Robotics-ER 1.6,大幅增强了空间推理、多视角理解以及任务完成判定能力。
推荐理由:该模型增强了空间指向、多视角任务完成判定与工业仪表读取能力,有助于开发者为实体机器人构建高阶环境理解与决策系统。
Google Research 推出人机对话数据集 ConvApparel,用于量化并弥合 LLM 用户模拟器与真实人类间的真实度差距。数据集涵盖服装购物场景超 4,000 场对话(近 15,000 轮),通过将用户分流至“优质”与故意制造障碍的“劣质”双智能体,记录逐轮的满意度与挫败感。团队还提出了结合统计对齐、拟人度评分和反事实验证的三维框架来评测模拟器。
Google Research 推出两款学术 AI 智能体 PaperVizAgent 与 ScholarPeer,分别用于自动生成学术插图与论文同行评审。PaperVizAgent 由 5 个专用智能体协同运作,在插图评测中取得 60.2 分,显著超越 50.0 的人类基准线及 GPT-Image-1.5。
Google Research 推出一套基于情境判断测试(SJT)的新评估框架,用于衡量大语言模型在真实日常与职场场景中的行为倾向是否与人类对齐。团队对 25 个模型进行的评测显示,参数量小于 25B 的小模型在人类高度共识场景下的方向对齐接近随机水平,而大于 120B 的前沿模型在共识低于 90% 时对齐率也仅停留在 80% 左右。
Google DeepMind 正式推出开源模型 Gemma 4 系列,包含 E2B、E4B、26B MoE 和 31B Dense 四种尺寸,专为高级推理与智能体工作流设计。
推荐理由:Gemma 4 转向 Apache 2.0 商业许可并覆盖端侧至 31B 规模,展示了小尺寸开源模型在多模态与智能体工作流上的落地路径。
Google Research 研究发现,AI 评测中每个样本配备 1 至 5 名标注人员的通用做法不足以捕捉人类真实分歧。若要捕捉观点差异等细节,单样本通常需超过 10 名标注人员;若只评估多数票准确率,增加样本量则比增加标注人员更有效。团队指出依据指标优化配比仅需约 1,000 次总标注即可实现高可复现性,相关模拟器已在 GitHub 开源。
Mistral AI 总结了内部平台工具 Spaces CLI 的开发经验,提出了一套同时适配人类开发者与编码智能体的命令行设计原则。团队提出交互式输入均需提供对应的命令行参数与非交互模式默认值,通过 context.json 和 AGENTS.md 自动导出结构化上下文与执行规则,并消除工作目录等隐式状态依赖,使智能体能自主完成从脚手架创建到部署的全流程。
推荐理由:文章总结了让命令行工具兼顾人类交互与智能体调用的五条工程规范,为开发者构建面向智能体的开发工具提供了可迁移的落地参考。
Google DeepMind 推出基于 Gemini 的 AI 鼠标指针原型,让指针能结合屏幕视觉与语义上下文直接理解用户意图。团队提出了保持工作流连贯、减少冗长提示词、支持指代交互以及将像素转化为可操作实体四项原则。目前该功能已在 Google AI Studio 开放实验体验,并逐步整合至 Chrome 浏览器与 Googlebook 笔记本。
推荐理由:原文提出了结合视觉语义与光标位置的交互原则,为大模型如何摆脱独立对话框并融入日常系统界面提供了具体设计参考。
Google 发布 Vibe Coding XR 原型工作流,结合 Gemini 的推理能力与开源 XR Blocks 框架,支持通过自然语言在 60 秒内生成具备物理感知与手势交互的 Android XR 应用。
推荐理由:原文展示了大语言模型结合 WebXR 框架快速构建空间交互原型的技术链路,开发者可参考其上下文工程设计与桌面端仿真方案。
Google Research 推出向量压缩算法 TurboQuant,结合 PolarQuant 极坐标量化与 1-bit QJL 残差纠错技术,在零精度损失的前提下大幅降低 KV cache 内存开销。该算法在 Gemma 和 Mistral 等开源大语言模型上通过了 LongBench、RULER 等长上下文基准评测,在显著压缩 KV 内存占用的同时优化了向量检索效率。
Google Research 推出自监督框架 S2Vec,通过将地理要素光栅化并结合掩码自编码(MAE)学习人造环境的通用嵌入向量。该方法利用 S2 Geometry 多分辨率网格表征建筑与道路等空间分布,无需人工标注即可捕捉区域特征。在全美人口密度与中位数收入等零样本跨区域预测基准中,S2Vec 表现优于 SATCLIP 等对比模型。