Google 发布神经形态生成模型 MoGen,利用合成神经元加速大脑连接组重建
Google Research 推出神经形态生成模型 MoGen,通过点云流匹配技术生成逼真的 3D 神经元形态,以合成数据加速大脑神经连接图谱重建。实验显示,在 PATHFINDER 重建模型的训练中加入 MoGen 数据后,小鼠轴突重建错误率降低了 4.4%,在完整小鼠大脑规模下相当于节省 157 人年的人工校对成本。
Google Research 推出神经形态生成模型 MoGen,通过点云流匹配技术生成逼真的 3D 神经元形态,以合成数据加速大脑神经连接图谱重建。实验显示,在 PATHFINDER 重建模型的训练中加入 MoGen 数据后,小鼠轴突重建错误率降低了 4.4%,在完整小鼠大脑规模下相当于节省 157 人年的人工校对成本。
Google DeepMind 正式推出文本转语音模型 Gemini 3.1 Flash TTS,支持通过自然语言音频标签精确控制语音风格、节奏和表达,并原生支持多说话人对话与 70 多种语言。
推荐理由:该模型通过自然语言行内标签实现对语调和语速的精细调度,为构建多角色对话系统提供了更具成本效益的语音方案。
Google 与纽约大学合作推出 Vantage 研究实验,利用生成式 AI 构建多方协作模拟环境,用于评估学生的批判性思维与协作等持久技能。系统由主管大模型(Executive LLM)在对话中动态施加冲突与挑战以激发技能展现,再由 AI 评估器对照评分量规生成可视化技能图谱与定性反馈。
Google DeepMind 推出专为机器人设计的具身推理模型 Gemini Robotics-ER 1.6,大幅增强了空间推理、多视角理解以及任务完成判定能力。
推荐理由:该模型增强了空间指向、多视角任务完成判定与工业仪表读取能力,有助于开发者为实体机器人构建高阶环境理解与决策系统。
Google Research 推出人机对话数据集 ConvApparel,用于量化并弥合 LLM 用户模拟器与真实人类间的真实度差距。数据集涵盖服装购物场景超 4,000 场对话(近 15,000 轮),通过将用户分流至“优质”与故意制造障碍的“劣质”双智能体,记录逐轮的满意度与挫败感。团队还提出了结合统计对齐、拟人度评分和反事实验证的三维框架来评测模拟器。
Google Research 推出两款学术 AI 智能体 PaperVizAgent 与 ScholarPeer,分别用于自动生成学术插图与论文同行评审。PaperVizAgent 由 5 个专用智能体协同运作,在插图评测中取得 60.2 分,显著超越 50.0 的人类基准线及 GPT-Image-1.5。
Google Research 推出一套基于情境判断测试(SJT)的新评估框架,用于衡量大语言模型在真实日常与职场场景中的行为倾向是否与人类对齐。团队对 25 个模型进行的评测显示,参数量小于 25B 的小模型在人类高度共识场景下的方向对齐接近随机水平,而大于 120B 的前沿模型在共识低于 90% 时对齐率也仅停留在 80% 左右。
Google DeepMind 正式推出开源模型 Gemma 4 系列,包含 E2B、E4B、26B MoE 和 31B Dense 四种尺寸,专为高级推理与智能体工作流设计。
推荐理由:Gemma 4 转向 Apache 2.0 商业许可并覆盖端侧至 31B 规模,展示了小尺寸开源模型在多模态与智能体工作流上的落地路径。
Google Research 研究发现,AI 评测中每个样本配备 1 至 5 名标注人员的通用做法不足以捕捉人类真实分歧。若要捕捉观点差异等细节,单样本通常需超过 10 名标注人员;若只评估多数票准确率,增加样本量则比增加标注人员更有效。团队指出依据指标优化配比仅需约 1,000 次总标注即可实现高可复现性,相关模拟器已在 GitHub 开源。
Google DeepMind 推出基于 Gemini 的 AI 鼠标指针原型,让指针能结合屏幕视觉与语义上下文直接理解用户意图。团队提出了保持工作流连贯、减少冗长提示词、支持指代交互以及将像素转化为可操作实体四项原则。目前该功能已在 Google AI Studio 开放实验体验,并逐步整合至 Chrome 浏览器与 Googlebook 笔记本。
推荐理由:原文提出了结合视觉语义与光标位置的交互原则,为大模型如何摆脱独立对话框并融入日常系统界面提供了具体设计参考。
Google 发布 Vibe Coding XR 原型工作流,结合 Gemini 的推理能力与开源 XR Blocks 框架,支持通过自然语言在 60 秒内生成具备物理感知与手势交互的 Android XR 应用。
推荐理由:原文展示了大语言模型结合 WebXR 框架快速构建空间交互原型的技术链路,开发者可参考其上下文工程设计与桌面端仿真方案。
Google Research 推出向量压缩算法 TurboQuant,结合 PolarQuant 极坐标量化与 1-bit QJL 残差纠错技术,在零精度损失的前提下大幅降低 KV cache 内存开销。该算法在 Gemma 和 Mistral 等开源大语言模型上通过了 LongBench、RULER 等长上下文基准评测,在显著压缩 KV 内存占用的同时优化了向量检索效率。
Google Research 推出自监督框架 S2Vec,通过将地理要素光栅化并结合掩码自编码(MAE)学习人造环境的通用嵌入向量。该方法利用 S2 Geometry 多分辨率网格表征建筑与道路等空间分布,无需人工标注即可捕捉区域特征。在全美人口密度与中位数收入等零样本跨区域预测基准中,S2Vec 表现优于 SATCLIP 等对比模型。
Google Research 在 The Check Up 活动上公布了一系列医疗健康 AI 突破,涵盖个人健康助手、临床辅助决策系统及开源开发者工具。团队展示了具备多模态推理能力的多智能体系统 AMIE 在临床问诊中的实测进展,并推广支持 3D 影像的开源医疗模型 MedGemma;同时公布了乳腺癌早筛研究以及用于识别癌症基因突变的研究工具 DeepSomatic。
推荐理由:文章系统梳理了前沿医疗多模态模型与多智能体系统从实验室算法走向临床筛查、开发者生态和基因组学研究的落地链路。
Google Research 与英国国家医疗服务体系(NHS)合作在《Nature Cancer》发表两项关于乳腺癌筛查 AI 系统的研究。评估显示独立 AI 系统的癌症检出率从千分之 7.54 提升至 9.33 并检出了 25% 的间歇期癌症,在前瞻性部署中中位处理时间为 17.7 分钟。
推荐理由:原文展示了将模型作为第二阅片员融入临床双读流程的试验设计,为医疗场景评估人机协同与工作量削减提供了参考依据。
Google 与康奈尔大学测试了 GPT-4o、Claude 3.5、Gemini Advanced Pro 1.5 和 NotebookLM 等 6 款大语言模型解答高温超导前沿问题的表现。
Google 宣布在 Flood Hub 中推出城市山洪预报功能,利用 AI 方法可提前最长 24 小时预测城市突发性洪水风险。为解决山洪缺乏传统水文传感器监测数据的难题,团队利用 Gemini 从公开新闻中抽取洪水发生地与时间构建 Groundsource 数据集,并结合 LSTM 网络与全球公开气象模型进行训练。
Google Research 推出 Groundsource 框架,利用 Gemini 将全球非结构化新闻转化为结构化历史灾害数据,并开源包含 150 多个国家和地区、260 万条记录的城市突发洪水数据集。
Google 与 BIDMC 合作完成前瞻性临床研究,验证对话式医疗 AI 系统 AMIE 在门诊初级保健就诊前采集病史的安全性与可行性。在对 100 名患者的测试中,医生实时监督下未触发任何安全终止事件,盲审评估显示 AMIE 的鉴别诊断质量与全科医生相当,90% 病例的前 7 项鉴别诊断命中 8 周后的最终确诊结果。
推荐理由:该研究将对话式医疗 AI 从模拟环境推进到真实门诊预诊流程,在人工监督下验证了病史采集的安全性和鉴别诊断表现。
Google Research 联合非洲机构推出开源语音数据集 WAXAL,覆盖 26 个以上国家超 1 亿人使用的 27 种子撒哈拉非洲语言。该资源采用 CC-BY-4.0 许可开源,包含约 1,846 小时用于 ASR 的自然无脚本转录语音数据,以及超 565 小时用于 TTS 的高保真录音数据,旨在支持开发全双工对话系统并促进低资源语音技术研发。
Mistral 发布 Le Chat Enterprise,一款由全新 Mistral Medium 3 模型驱动的企业 AI 助手,包含企业搜索、Agent 构建器、数据与工具连接器、文档库、自定义模型和混合部署等功能,全部功能将在未来两周内逐步上线。
推荐理由:Mistral 把企业搜索、Agent 构建与混合部署打包进同一订阅,可观察欧洲厂商做企业 AI 的路线选择。