跳到正文

#论文/研究

今日 2 条
7月9日周四
  1. Google Research70

    Google 提出 SensorFM:面向可穿戴健康数据的传感器基础模型

    Google Research 联合 Google DeepMind 推出可穿戴健康数据基础模型 SensorFM。该模型基于 500 万参与者超过 1 万亿分钟的未标注多模态传感器信号进行预训练,通过自适应掩码框架直接适应数据缺失,在心血管、代谢、睡眠和心理健康等 35 项任务中均展现出跨领域迁移能力。

    推荐理由:作者利用自监督掩码学习打通了多源可穿戴传感器数据,为稀缺医疗标注场景下的生理特征建模提供了通用方案。

7月8日周三
6月30日周二
  1. Hugging Face Blog35

    为什么专业化不可避免:优化理论、生物学、市场与机器学习给出同一答案

    围绕 Goldfeder、Wyder、LeCun 与 Shwartz-Ziv 的 2026 年论文《AI Must Embrace Specialization via Superhuman Adaptable Intelligence》,Dharma AI 撰文指出,优化理论、演化生物学、竞争市场与机器学习共同预测:在有限资源下,专注于特定领域的系统会胜过追求通用性的系统。

  2. Hugging Face Blog36

    DiScoFormer:跨分布联合估计密度与分值的 Transformer 模型

    研究者推出 DiScoFormer,可通过单个 Transformer 在单次前向传播中同时估计数据分布的密度与分值(score),无需针对新分布重复训练。该模型采用共享主干与双输出头设计,在 100 维场景下相比最佳调优的 KDE 将分值误差降低约 6.5 倍、密度误差降低超 37 倍。模型还支持在推理时无监督自适应分布外数据,适用于扩散生成模型与贝叶斯推断。

6月29日周一
  1. Import AI38

    Import AI 463:自我改进机器人、中国万卡 GPU 集群与人类时代的挽歌

    NVIDIA 研究人员推出机器人代码智能体框架 ENPIRE,通过自动重置、自动评估与策略迭代,使实体机器人在真实世界中实现闭环自主改进。在搭载 NVIDIA RTX 5090 的双臂工作站测试中,前沿代码智能体在 PushT、整理插针与剪断扎带等复杂灵巧操作任务上实现了 99% 的成功率。

6月27日周六
6月25日周四
  1. Google Research38

    Google 通过线性弹性缓存优化云经济性

    Google 提出线性弹性缓存(linear elastic caching),将缓存逐出建模为“滑雪租赁问题”,利用轻量级机器学习动态调整缓存生命周期。在 Google Spanner 生产环境集成数月的测试中,该方法使内存占用减少 15.5%,总拥有成本(TCO)降低约 5%,实际 I/O 成本影响仅 0.5%。

  2. Google Research66

    Google 研究揭示推理过程如何解锁大模型的参数化知识

    Google Research 团队在 COLM 2026 入选论文中揭示,让大模型生成推理轨迹能显著解锁单跳事实问答中原本难以直接读取的参数化知识。该提升主要由提供额外前向计算的计算缓冲效应,以及自发生成相关背景事实的事实预热机制共同驱动。研究同时发现中间推理若夹杂单条幻觉事实会导致最终正确率骤降,建议通过测试期轨迹验证或过程奖励强化真实性。

    推荐理由:研究揭示了思维链除任务拆解外还能辅助参数化记忆检索的双重机制,为理解思考型模型的知识召回与幻觉抑制提供了控制实验依据。

6月22日周一
6月17日周三
  1. Google Research41

    Google Earth AI 助力自然恢复:从像素到规划

    Google 发布基于 Earth AI 的矢量化生态数据集,将常规卫星难以识别的树篱、矮树林和石墙等细粒度乡村特征转化为可操作清单。该框架基于在超 3 亿张卫星图像上预训练的 RSF Vision-Transformer 骨干网络,结合亚米级图像与 1 米 LiDAR 数据解决了复杂的重叠空间拓扑难题。

6月16日周二
6月13日周六
  1. Google Research26

    Google 研究:AI 如何帮助用户理解皮肤状况

    Google 分享其在皮肤健康领域的 AI 研究,一项发表于 JAMA Dermatology 的大规模研究显示,2345 名参与者使用 AI 工具时尝试命名皮肤状况的比例超 62%(对照组 41%),命名准确率 23%,接近未使用 AI 对照组(8%)的三倍;"Wizard of Oz"组准确率为 36%。但标准 AI 组在判断下一步就医建议上未显示出统计学显著改善。

6月11日周四
  1. Google Research45

    Google 提出用于审计机器遗忘的新框架

    Google 提出正则化 f-散度核检验(Regularized f-Divergence Kernel Tests)框架,用于灵敏且准确地审计机器学习模型的“机器遗忘”。该框架引入相对距离检验与核正则化方法,利用 KL、卡方及 Hockey-stick 等 f-散度精准捕捉局部数据偏移与隐私泄露,同时在理论上证明能在任意样本量下控制假阳性。

6月8日周一
6月5日周五
  1. Google Research68

    Google 推出基于手机摄像头的被动心率监测系统 PHRM

    Google Research 在《Nature》发表研究系统 PHRM,利用智能手机前置摄像头在用户面部解锁后的数秒内被动估算心率和每日静息心率。该方案在设备端运行轻量化卷积神经网络,心率测量平均绝对百分比误差低于 10%,静息心率相比穿戴设备平均绝对误差低于 5 bpm,并在不同肤色群体中达到统一精度标准。团队同步向通过审核的研究人员开放了数据集与预训练模型 PHRM-mini。

    推荐理由:原文展示了仅凭手机前置摄像头在解锁时被动监测心率与静息心率的方案,为无穿戴设备场景下的健康监测提供了具体参考。

6月1日周一
  1. Import AI35

    Import AI 459:AI 监督难点、蛋白质折叠模型缩放定律与 AI 灭绝风险定价

    弗吉尼亚大学、Anthropic 与加拿大央行学者指出,2025 年美国名义 AI GDP 达约 $250 billion,经质量调整后的实际产出年增速高达 2,600%,但在传统 GDP 统计中几乎隐形。这主要是因为单位能力的推理价格随效率提升大幅下跌,掩盖了每年超 200% 的算力容量扩张,进而可能导致政策制定者严重低估 AI 对劳动力税基的冲击。

5月28日周四
  1. Google Research41

    Google 基于零信任聚合的隐私分析方案

    Google 提出结合密码学与可信执行环境(TEE)的零信任聚合方案,用于在保护隐私的前提下分析端侧 AI 运行状况。该方案采用单消息(one-shot)协议,消除了设备多轮在线交互需求,并确保原始数据绝不在服务器内存中暴露。结合 TEE 证明机制构成多层防御,仅在完成聚合与匿名化后对外输出统计洞察。

5月27日周三
  1. Mistral AI52

    Mistral AI 盘点推动工业工程发展的物理 AI 系列研究成果

    Mistral AI 宣布加码面向航空航天、汽车、半导体与能源工业的物理 AI(Physics AI)研发,并系统汇总了收购 Emmi AI 后的关键技术突破。相关成果涵盖用于跨音速 3D 机翼的 CFD 模拟数据集、面向聚变等离子体湍流仿真的 GyroSwin 5D 代理模型,以及单 GPU 支持上亿网格单元空气动力学仿真的 AB-UPT 和多物理场实时仿真框架 NeuralDEM。

5月19日周二
5月16日周六
  1. Google DeepMind44

    借助 Co-Scientist 探寻新发传染病背后的分子开关

    剑桥大学教授 Clare Bryant 正在使用 Co-Scientist 寻找新发传染病跨物种传播引发重症的分子开关与预防方案。该工具通过分析研究提案与未公开实验数据生成并排序假说,直接锁定了此前未被关注的关键蛋白质及特定氨基酸。团队正构建突变细胞系进行测试,原本需要 2 至 3 年的靶点确定工作有望缩短至 6 个月内完成。

  2. Google DeepMind64

    Google DeepMind 借助 Co-Scientist 发现抗肝纤维化的老药新用候选物

    斯坦福大学医学院与 Google DeepMind 合作,利用 Co-Scientist 智能体从现有药物文献中筛选治疗肝纤维化的老药新用候选物,相关研究发表于《Advanced Science》。

    推荐理由:研究展示了科学智能体在海量文献中挖掘老药新用候选物的实验命中表现,为生物医药研发提供了具体验证案例。

5月8日周五
4月30日周四
  1. Google DeepMind65

    Google DeepMind 发布 AI co-clinician 医疗协作研究计划

    Google DeepMind 宣布 AI co-clinician 研究计划,探索 AI 智能体在医生监督下协助患者诊疗。在 98 个真实初级保健问题的盲测中,该系统在其中 97 个案例未出现关键错误,医生对其回答的偏好也高于主流证据合成工具。

    推荐理由:Google DeepMind 披露 AI co-clinician 的评测设计与多模态问诊模拟结果,可了解医疗 AI 从文本走向实时音视频的路径。

4月22日周三
  1. Google Research60

    Google 提出 ReasoningBank:让智能体从成败经验中提炼推理记忆并自演进

    Google Research 推出智能体记忆框架 ReasoningBank,能够从成功与失败经历中提炼结构化的高阶推理模式,支持测试阶段的持续自演进。该方案通过闭环工作流提取防范性策略,并结合记忆感知测试时扩展(MaTTS)在并行或序列推理中强化策略质量。

    推荐理由:该研究系统性地从失败经验中提炼高层推理模式,为构建具备持续反思与测试时自演进能力的智能体提供了具体记忆架构参考。

4月20日周一
  1. Berkeley AI Research47

    面向更长时域世界模型的基于梯度规划方法 GRASP

    研究人员提出用于世界模型的新型基于梯度规划器 GRASP,旨在解决长时域规划中优化病态与局部极小值陷阱等问题。GRASP 将轨迹提升为虚拟状态以实现跨时间并行优化,并在状态迭代中直接加入随机性以促进探索;同时通过重塑梯度提供清晰动作信号,避免高维视觉模型中脆弱的状态输入梯度。

4月16日周四
  1. Google Research52

    Google 提出合成数据生成框架 Simula:基于第一性原理与机制设计

    Google 推出合成数据生成与评估框架 Simula,通过基于推理的第一性原理将全流程解耦为全局多样性、局部多样性、复杂化与双批评质量检查四个独立可控维度。实验使用 Gemini 2.5 Flash 作为教师模型向 Gemma-3 4B 进行蒸馏,在网络安全、法律推理、数学等领域最高生成 512K 规模数据并显著超越基线。

  2. Google Research50

    Google 发布神经形态生成模型 MoGen,利用合成神经元加速大脑连接组重建

    Google Research 推出神经形态生成模型 MoGen,通过点云流匹配技术生成逼真的 3D 神经元形态,以合成数据加速大脑神经连接图谱重建。实验显示,在 PATHFINDER 重建模型的训练中加入 MoGen 数据后,小鼠轴突重建错误率降低了 4.4%,在完整小鼠大脑规模下相当于节省 157 人年的人工校对成本。

4月9日周四
  1. Google Research43

    ConvApparel:衡量与弥合用户模拟器的真实度差距

    Google Research 推出人机对话数据集 ConvApparel,用于量化并弥合 LLM 用户模拟器与真实人类间的真实度差距。数据集涵盖服装购物场景超 4,000 场对话(近 15,000 轮),通过将用户分流至“优质”与故意制造障碍的“劣质”双智能体,记录逐轮的满意度与挫败感。团队还提出了结合统计对齐、拟人度评分和反事实验证的三维框架来评测模拟器。

4月3日周五
  1. Google Research53

    Google Research 提出评估大语言模型行为倾向与人类对齐的测试框架

    Google Research 推出一套基于情境判断测试(SJT)的新评估框架,用于衡量大语言模型在真实日常与职场场景中的行为倾向是否与人类对齐。团队对 25 个模型进行的评测显示,参数量小于 25B 的小模型在人类高度共识场景下的方向对齐接近随机水平,而大于 120B 的前沿模型在共识低于 90% 时对齐率也仅停留在 80% 左右。

4月1日周三
  1. Google Research48

    Google Research:构建更好的 AI 评测基准需要多少标注人员?

    Google Research 研究发现,AI 评测中每个样本配备 1 至 5 名标注人员的通用做法不足以捕捉人类真实分歧。若要捕捉观点差异等细节,单样本通常需超过 10 名标注人员;若只评估多数票准确率,增加样本量则比增加标注人员更有效。团队指出依据指标优化配比仅需约 1,000 次总标注即可实现高可复现性,相关模拟器已在 GitHub 开源。

3月25日周三
  1. Google Research45

    TurboQuant:通过极致压缩重新定义 AI 效率

    Google Research 推出向量压缩算法 TurboQuant,结合 PolarQuant 极坐标量化与 1-bit QJL 残差纠错技术,在零精度损失的前提下大幅降低 KV cache 内存开销。该算法在 Gemma 和 Mistral 等开源大语言模型上通过了 LongBench、RULER 等长上下文基准评测,在显著压缩 KV 内存占用的同时优化了向量检索效率。

  2. Google Research42

    S2Vec 如何学习现代城市的地理语言

    Google Research 推出自监督框架 S2Vec,通过将地理要素光栅化并结合掩码自编码(MAE)学习人造环境的通用嵌入向量。该方法利用 S2 Geometry 多分辨率网格表征建筑与道路等空间分布,无需人工标注即可捕捉区域特征。在全美人口密度与中位数收入等零样本跨区域预测基准中,S2Vec 表现优于 SATCLIP 等对比模型。

3月18日周三
  1. Google Research71

    Google Research 联合 NHS 发布研究:利用机器学习优化乳腺癌筛查工作流

    Google Research 与英国国家医疗服务体系(NHS)合作在《Nature Cancer》发表两项关于乳腺癌筛查 AI 系统的研究。评估显示独立 AI 系统的癌症检出率从千分之 7.54 提升至 9.33 并检出了 25% 的间歇期癌症,在前瞻性部署中中位处理时间为 17.7 分钟。

    推荐理由:原文展示了将模型作为第二阅片员融入临床双读流程的试验设计,为医疗场景评估人机协同与工作量削减提供了参考依据。

3月17日周二
3月13日周五
  1. Berkeley AI Research43

    大规模识别大语言模型中的特征交互

    为解决大语言模型解释性分析中的组合爆炸难题,研究团队提出 SPEX 与 ProxySPEX 算法,实现大规模关键特征交互的高效识别。SPEX 借助信号处理与编码理论将搜索转化为稀疏恢复问题,在上下文扩展至数千特征时仍保持高忠实度。ProxySPEX 进一步利用交互的层级特性,以少约 10 倍的消融成本达到了与 SPEX 相同的性能。

3月12日周四