跳到正文

全部动态

今日 109 条
5月11日周一
  1. Import AI38

    Import AI 第 456 期:RSI 与经济增长、AI 监管的根本选择权及神经计算机

    Institute for Law & AI 提出“根本选择权”治理框架,主张政府在短期避免过度监管,同时提前储备应对强 AI 危机所需的制度与信息工具。该方案建议建立透明度与报告机制、保护前沿实验室吹哨人,并加大对美英两国 AI 安全研究所(CAISI 与 AISI)的技术投入。此外,Meta 与 KAIST 联合探讨了统合计算、内存与 I/O 的“神经计算机”。

5月8日周五
5月6日周三
  1. Google DeepMind64

    Google DeepMind 展示 AlphaEvolve 一年成果:从 DNA 测序到 TPU 设计

    Google DeepMind 汇总了 Gemini 驱动的编码智能体 AlphaEvolve 发布一年来的落地成果。它帮助 DeepConsensus 将变异检测错误降低 30%,把电网 AC Optimal Power Flow 的可行解比例从 14% 提升到 88%以上,并在量子模拟中给出误差低 10 倍的量子线路。

    推荐理由:一年来 AlphaEvolve 在基因测序、电网、TPU 与量子模拟等场景的落地数据,展示了编码智能体从演示走向基础设施的路径。

5月4日周一
5月2日周六
  1. Google Research38

    Google Research:通过全球合作与开放资源推动科学影响

    Google Research 公布其开放科学进展,过去十年推出的开源技术与公开数据集已支持全球超 25 万名科研人员与开发者。其成果涵盖基因组分析套件(助力处理 250 万人基因组)、混合大气模型 NeuralGCM 等。在医疗领域,开源权重模型 MedGemma 下载量已超 480 万次,Open Health Stack 工具套件已惠及超 6500 万人。

4月30日周四
  1. Google DeepMind65

    Google DeepMind 发布 AI co-clinician 医疗协作研究计划

    Google DeepMind 宣布 AI co-clinician 研究计划,探索 AI 智能体在医生监督下协助患者诊疗。在 98 个真实初级保健问题的盲测中,该系统在其中 97 个案例未出现关键错误,医生对其回答的偏好也高于主流证据合成工具。

    推荐理由:Google DeepMind 披露 AI co-clinician 的评测设计与多模态问诊模拟结果,可了解医疗 AI 从文本走向实时音视频的路径。

4月27日周一
4月23日周四
  1. Google Research72

    Google 推出 3D 感知图像重构技术,已在 Google Photos 自动构图中上线

    Google 推出一种结合三维场景理解与生成式 AI 的照片重构技术,并已在 Google Photos 的 Auto frame 功能中正式上线。该方案将图像处理解耦为 3D 场景与相机参数估计、潜在扩散模型修补两个阶段,能够在拍照后自动调整虚拟相机机位与焦距,并修复人像广角畸变。用户在编辑包含人物的照片时,可直接在构图候选项中选择重构视角的一键优化效果。

    推荐理由:该方案将单张照片解耦为三维场景估计与扩散模型修补两阶段,展示了借助空间感知调整成像视角并消除畸变的新思路。

4月22日周三
  1. Google Research60

    Google 提出 ReasoningBank:让智能体从成败经验中提炼推理记忆并自演进

    Google Research 推出智能体记忆框架 ReasoningBank,能够从成功与失败经历中提炼结构化的高阶推理模式,支持测试阶段的持续自演进。该方案通过闭环工作流提取防范性策略,并结合记忆感知测试时扩展(MaTTS)在并行或序列推理中强化策略质量。

    推荐理由:该研究系统性地从失败经验中提炼高层推理模式,为构建具备持续反思与测试时自演进能力的智能体提供了具体记忆架构参考。

4月21日周二
  1. Google DeepMind39

    Google DeepMind 携手行业领袖加速 AI 转型

    Google DeepMind 宣布与 Accenture、Bain & Company、BCG、Deloitte 和 McKinsey 达成合作,加速推动全球企业的智能体转型与前沿 AI 规模化落地。合作伙伴将获得 Gemini 等前沿模型的早期访问权,并与 DeepMind 技术团队合作开发金融、制造等行业解决方案。该合作旨在弥合目前仅 25% 组织实现 AI 规模化投产的应用鸿沟。

4月20日周一
  1. Berkeley AI Research47

    面向更长时域世界模型的基于梯度规划方法 GRASP

    研究人员提出用于世界模型的新型基于梯度规划器 GRASP,旨在解决长时域规划中优化病态与局部极小值陷阱等问题。GRASP 将轨迹提升为虚拟状态以实现跨时间并行优化,并在状态迭代中直接加入随机性以促进探索;同时通过重塑梯度提供清晰动作信号,避免高维视觉模型中脆弱的状态输入梯度。

4月16日周四
  1. Google Research52

    Google 提出合成数据生成框架 Simula:基于第一性原理与机制设计

    Google 推出合成数据生成与评估框架 Simula,通过基于推理的第一性原理将全流程解耦为全局多样性、局部多样性、复杂化与双批评质量检查四个独立可控维度。实验使用 Gemini 2.5 Flash 作为教师模型向 Gemma-3 4B 进行蒸馏,在网络安全、法律推理、数学等领域最高生成 512K 规模数据并显著超越基线。

  2. Google Research50

    Google 发布神经形态生成模型 MoGen,利用合成神经元加速大脑连接组重建

    Google Research 推出神经形态生成模型 MoGen,通过点云流匹配技术生成逼真的 3D 神经元形态,以合成数据加速大脑神经连接图谱重建。实验显示,在 PATHFINDER 重建模型的训练中加入 MoGen 数据后,小鼠轴突重建错误率降低了 4.4%,在完整小鼠大脑规模下相当于节省 157 人年的人工校对成本。

  3. Google DeepMind72

    Google DeepMind 推出 Gemini 3.1 Flash TTS 语音模型

    Google DeepMind 正式推出文本转语音模型 Gemini 3.1 Flash TTS,支持通过自然语言音频标签精确控制语音风格、节奏和表达,并原生支持多说话人对话与 70 多种语言。

    推荐理由:该模型通过自然语言行内标签实现对语调和语速的精细调度,为构建多角色对话系统提供了更具成本效益的语音方案。

4月14日周二
  1. Google Research51

    Google 推出 Vantage 研究实验:利用生成式 AI 模拟协作并评估学生软技能

    Google 与纽约大学合作推出 Vantage 研究实验,利用生成式 AI 构建多方协作模拟环境,用于评估学生的批判性思维与协作等持久技能。系统由主管大模型(Executive LLM)在对话中动态施加冲突与挑战以激发技能展现,再由 AI 评估器对照评分量规生成可视化技能图谱与定性反馈。

4月13日周一
4月9日周四
  1. Google Research43

    ConvApparel:衡量与弥合用户模拟器的真实度差距

    Google Research 推出人机对话数据集 ConvApparel,用于量化并弥合 LLM 用户模拟器与真实人类间的真实度差距。数据集涵盖服装购物场景超 4,000 场对话(近 15,000 轮),通过将用户分流至“优质”与故意制造障碍的“劣质”双智能体,记录逐轮的满意度与挫败感。团队还提出了结合统计对齐、拟人度评分和反事实验证的三维框架来评测模拟器。

4月3日周五
  1. Google Research53

    Google Research 提出评估大语言模型行为倾向与人类对齐的测试框架

    Google Research 推出一套基于情境判断测试(SJT)的新评估框架,用于衡量大语言模型在真实日常与职场场景中的行为倾向是否与人类对齐。团队对 25 个模型进行的评测显示,参数量小于 25B 的小模型在人类高度共识场景下的方向对齐接近随机水平,而大于 120B 的前沿模型在共识低于 90% 时对齐率也仅停留在 80% 左右。

  2. Google DeepMind88

    Google DeepMind 发布开源模型 Gemma 4

    Google DeepMind 正式推出开源模型 Gemma 4 系列,包含 E2B、E4B、26B MoE 和 31B Dense 四种尺寸,专为高级推理与智能体工作流设计。

    推荐理由:Gemma 4 转向 Apache 2.0 商业许可并覆盖端侧至 31B 规模,展示了小尺寸开源模型在多模态与智能体工作流上的落地路径。

4月1日周三
  1. Google Research48

    Google Research:构建更好的 AI 评测基准需要多少标注人员?

    Google Research 研究发现,AI 评测中每个样本配备 1 至 5 名标注人员的通用做法不足以捕捉人类真实分歧。若要捕捉观点差异等细节,单样本通常需超过 10 名标注人员;若只评估多数票准确率,增加样本量则比增加标注人员更有效。团队指出依据指标优化配比仅需约 1,000 次总标注即可实现高可复现性,相关模拟器已在 GitHub 开源。

3月31日周二
  1. Mistral AI65

    Mistral AI 分享 Spaces CLI 设计实践:如何让命令行工具兼顾人类与智能体

    Mistral AI 总结了内部平台工具 Spaces CLI 的开发经验,提出了一套同时适配人类开发者与编码智能体的命令行设计原则。团队提出交互式输入均需提供对应的命令行参数与非交互模式默认值,通过 context.json 和 AGENTS.md 自动导出结构化上下文与执行规则,并消除工作目录等隐式状态依赖,使智能体能自主完成从脚手架创建到部署的全流程。

    推荐理由:文章总结了让命令行工具兼顾人类交互与智能体调用的五条工程规范,为开发者构建面向智能体的开发工具提供了可迁移的落地参考。

3月29日周日
  1. Google DeepMind65

    Google DeepMind 重新构想 AI 时代的鼠标指针交互

    Google DeepMind 推出基于 Gemini 的 AI 鼠标指针原型,让指针能结合屏幕视觉与语义上下文直接理解用户意图。团队提出了保持工作流连贯、减少冗长提示词、支持指代交互以及将像素转化为可操作实体四项原则。目前该功能已在 Google AI Studio 开放实验体验,并逐步整合至 Chrome 浏览器与 Googlebook 笔记本。

    推荐理由:原文提出了结合视觉语义与光标位置的交互原则,为大模型如何摆脱独立对话框并融入日常系统界面提供了具体设计参考。

3月25日周三
  1. Google Research67

    Google 推出 Vibe Coding XR:结合 Gemini 与 XR Blocks 加速 Android XR 原型开发

    Google 发布 Vibe Coding XR 原型工作流,结合 Gemini 的推理能力与开源 XR Blocks 框架,支持通过自然语言在 60 秒内生成具备物理感知与手势交互的 Android XR 应用。

    推荐理由:原文展示了大语言模型结合 WebXR 框架快速构建空间交互原型的技术链路,开发者可参考其上下文工程设计与桌面端仿真方案。

  2. Google Research45

    TurboQuant:通过极致压缩重新定义 AI 效率

    Google Research 推出向量压缩算法 TurboQuant,结合 PolarQuant 极坐标量化与 1-bit QJL 残差纠错技术,在零精度损失的前提下大幅降低 KV cache 内存开销。该算法在 Gemma 和 Mistral 等开源大语言模型上通过了 LongBench、RULER 等长上下文基准评测,在显著压缩 KV 内存占用的同时优化了向量检索效率。

  3. Google Research42

    S2Vec 如何学习现代城市的地理语言

    Google Research 推出自监督框架 S2Vec,通过将地理要素光栅化并结合掩码自编码(MAE)学习人造环境的通用嵌入向量。该方法利用 S2 Geometry 多分辨率网格表征建筑与道路等空间分布,无需人工标注即可捕捉区域特征。在全美人口密度与中位数收入等零样本跨区域预测基准中,S2Vec 表现优于 SATCLIP 等对比模型。

3月24日周二
  1. Mistral AI81

    Mistral AI 发布 4B 多语言语音合成模型 Voxtral TTS

    Mistral AI 正式发布多语言文本转语音模型 Voxtral TTS,采用基于 Ministral 3B 的流匹配架构,总参数量为 4B,支持英语、法语、阿拉伯语等 9 种语言的情感化语音生成。

    推荐理由:原文披露了基于自研编解码器与流匹配的架构细节及延迟数据,读者可据此评估端到端语音智能体的落地成本。

3月18日周三
  1. Google Research61

    Google Research 汇总 The Check Up 医疗 AI 进展:涵盖 MedGemma 与临床智能体 AMIE

    Google Research 在 The Check Up 活动上公布了一系列医疗健康 AI 突破,涵盖个人健康助手、临床辅助决策系统及开源开发者工具。团队展示了具备多模态推理能力的多智能体系统 AMIE 在临床问诊中的实测进展,并推广支持 3D 影像的开源医疗模型 MedGemma;同时公布了乳腺癌早筛研究以及用于识别癌症基因突变的研究工具 DeepSomatic。

    推荐理由:文章系统梳理了前沿医疗多模态模型与多智能体系统从实验室算法走向临床筛查、开发者生态和基因组学研究的落地链路。

  2. Google Research71

    Google Research 联合 NHS 发布研究:利用机器学习优化乳腺癌筛查工作流

    Google Research 与英国国家医疗服务体系(NHS)合作在《Nature Cancer》发表两项关于乳腺癌筛查 AI 系统的研究。评估显示独立 AI 系统的癌症检出率从千分之 7.54 提升至 9.33 并检出了 25% 的间歇期癌症,在前瞻性部署中中位处理时间为 17.7 分钟。

    推荐理由:原文展示了将模型作为第二阅片员融入临床双读流程的试验设计,为医疗场景评估人机协同与工作量削减提供了参考依据。

  3. Mistral AI51

    Mistral AI 发布企业模型定制系统 Forge

    Mistral AI 发布企业模型构建系统 Forge,支持企业利用内部代码库、文档和运营记录等专有数据定制模型与智能体。该系统覆盖预训练、后训练和强化学习全流程,兼容稠密与 MoE 架构及多模态输入,并具备 Agent-first 设计支持智能体自动调优。目前 ASML、爱立信和欧洲空间局等机构已接入该系统在自身基础设施中构建领域专用模型。

3月17日周二
  1. Mistral AI73

    Mistral AI 与 NVIDIA 达成战略合作并加入 Nemotron 联盟

    Mistral AI 宣布作为创始成员加入 NVIDIA Nemotron 联盟,双方将联合研发前沿开源 AI 模型。Mistral AI 贡献专有模型架构、多模态能力和微调工具,结合 NVIDIA 的算力与合成数据流水线,共同构建基于 NVIDIA DGX Cloud 训练的开源基础模型,为后续 NVIDIA Nemotron 4 系列提供支撑。

    推荐理由:原文披露了两家机构联合开发前沿开源模型的技术分工与路径,读者可借此评估算力与模型架构结合对开源生态的影响。

3月13日周五
  1. Berkeley AI Research43

    大规模识别大语言模型中的特征交互

    为解决大语言模型解释性分析中的组合爆炸难题,研究团队提出 SPEX 与 ProxySPEX 算法,实现大规模关键特征交互的高效识别。SPEX 借助信号处理与编码理论将搜索转化为稀疏恢复问题,在上下文扩展至数千特征时仍保持高忠实度。ProxySPEX 进一步利用交互的层级特性,以少约 10 倍的消融成本达到了与 SPEX 相同的性能。

3月12日周四
  1. Google Research59

    Google Flood Hub 上线城市山洪预报功能,可提前 24 小时预测风险

    Google 宣布在 Flood Hub 中推出城市山洪预报功能,利用 AI 方法可提前最长 24 小时预测城市突发性洪水风险。为解决山洪缺乏传统水文传感器监测数据的难题,团队利用 Gemini 从公开新闻中抽取洪水发生地与时间构建 Groundsource 数据集,并结合 LSTM 网络与全球公开气象模型进行训练。