跳到正文

#Agent

今日 1 条
今天9月29日周二
  1. Hugging Face Blog50

    ProvenanceGuard:面向 MCP 智能体的溯源感知核查

    ProvenanceGuard 是针对 MCP 智能体推出的生成后事实核查层,专门解决事实正确但归因来源错误的“跨来源混淆”问题。该方案在无需重新训练模型的情况下,通过读取包含工具输出与来源 ID 的 MCP 轨迹,逐项核对声明与其归属来源是否匹配。在 361 项专家测试声明中,它成功拦截了 139 项违规声明中的 138 项,来源识别准确率达 86%。

9月25日周五
  1. Google Research64

    Google 发布长视频连贯生成多智能体框架研究

    Google Research 提出多智能体视频协导框架及系列研究,通过在 Gemini 与 Veo 之上构建编排层,实现多镜头叙事长视频的自动化与视觉连贯性生成。

    推荐理由:研究将长视频生成解耦为多智能体规划、视觉记忆与闭环评测,为多镜头叙事中的角色与场景连贯性提供了可参考的系统化方案。

9月18日周五
9月16日周三
  1. Hugging Face Blog66

    IBM Research 提出 Consistency Analyzer:把智能体的一致性差距从 24.4 点减半到 12.0 点

    IBM Research 在 Hugging Face 博客介绍 ALTK-Evolve 新增的 consistency guidelines 与 Consistency Analyzer,用于衡量并改善智能体在重复运行下的不稳定问题。

    推荐理由:原文提出 Pass^k 与一致性差距的度量,并给出把差距减半的检测与修复方法,可用于判断智能体上线后的可靠性。

9月11日周五
9月7日周一
8月28日周五
  1. Google Research60

    Google 推出行星预测引擎 PPE:实现地理空间预测模型端到端自动化构建

    Google 推出实验性研究能力行星预测引擎(PPE),可通过自然语言输入端到端自主执行从数据检索、多模态特征工程到模型训练与评估的完整地理空间建模流程。该系统将传统需数周的人工数据工程缩短至数分钟,并在美国公共卫生指标、尼日利亚粮食安全降尺度以及刚果(金)埃博拉疫情预测等基准任务中均超过基线表现。

    推荐理由:原文给出了基于多模态大模型自主编排地理空间建模的完整架构,展现了将数周人工特征工程压缩至分钟级的可行路径。

8月26日周三
  1. Google Research47

    AgentHands:在 XR 中为空间定位智能体对话生成交互式手势

    Google Research 推出研究原型 AgentHands,通过将大语言模型推理映射为 3D 物理动作,为 XR 环境中的 AI 智能体生成与语音同步的交互手势。系统结合轻量级物体注册、手势事件库与本地解析器,利用词级时间戳让虚拟手在空间中精准执行指示与动作模拟。该方案在兰花养护和 3D 打印机操作等场景中显著提升了空间交互指导的直观性。

8月24日周一
8月22日周六
8月17日周一
8月13日周四
  1. Hugging Face Blog76

    Hugging Face 总结复现 ICML 2,200 篇论文的经验与发现

    Hugging Face 与 alphaXiv 联合举办 ICML 2026 开放复现挑战赛,1,221 名社区成员利用编码智能体复现了 2,226 篇论文。审计结果显示 51% 的论文至少有一项声明得到独立验证,23% 存在被推翻或具争议的声明,多篇论文的证明缺陷或代码偏差已获原作者确认并提交 arXiv 更正。

    推荐理由:原文展示了社区利用编码智能体大规模复现顶会论文的实测数据,呈现了智能体在学术审计中的潜力与人机协作边界。

8月12日周三
  1. Google Research74

    Google 推出 AMIE (Video) 实时视频临床问诊系统

    Google Research 与 Google DeepMind 推出基于 Gemini 与 Project Astra 的临床问诊系统 AMIE (Video),支持在实时视频问诊中感知非语言线索并引导虚拟体检。

    推荐理由:研究提出了拆分对话、规划与感知的异步多智能体架构,为高延迟深度推理与低延迟实时音视频交互的共存提供了参考方案。

8月3日周一
  1. Import AI41

    Import AI 467:自我维持的 AI 病毒、AI 进展节奏与创造力之争

    多伦多大学、Vector Institute、剑桥大学与 ServiceNow 的研究者构建出一款可自我复制、自我维持的 AI 蠕虫,利用被感染机器的 GPU 运行开源权重 LLM 进行推理,漏洞识别成功率约 80%、利用成功率约 53%、自我复制成功率 88%,完整攻击成功率约 37%。研究者称这证明"自我维持的 AI 驱动网络威胁已不再是理论"。

7月31日周五
  1. Microsoft Research70

    微软发布 Echoverse:面向计算机操作智能体的深度演进环境

    微软研究院提出 Echoverse,为计算机操作智能体构建十二个训练世界,包括十个深度领域环境和两个能力环境,分别针对日期选择器与嵌套筛选等单一控件。在全部十二个世界上训练的 9B 模型得分从 36.5% 提升到 67.1%,接近 GPT-5.4 的 80.7%。

    推荐理由:微软公布 Echoverse 十二个计算机操作智能体训练世界与数据库锚定评分机制,并开源其中四个世界及代码与任务。

  2. Microsoft Research57

    微软研究院提出 EvoLib 框架将经验转化为可演进知识

    微软研究院发布 EvoLib 框架,使大语言模型在测试期无需真实标签或更新权重即可将经验自监督地转化为可复用技能与反思见解。该框架通过知识整合与动态重加权机制持续演进知识库,在数学推理、受限编码及长程交互任务中以更低 token 消耗超越传统检索式记忆方法。目前相关代码与实验结果已在 GitHub 开源。

7月26日周日
  1. Berkeley AI Research43

    教 LLM 更新信念以实现高效长周期交互

    针对大语言模型在长周期交互中自我摘要导致的性能损耗,研究团队提出 ABBEL 框架,用受监督的自然语言“信念状态”替代完整交互历史。该框架将自编码重构等信念评分作为辅助强化学习奖励,以监督状态内容。在 CollabBench 评测中,ABBEL-rec-BG 仅用 50 步训练便追回与全上下文模型约 50% 的差距,训练步数减少 50% 且显著降低峰值 token 占用。

7月23日周四
  1. Google Research74

    Google 提出 SymptomAI:用于日常症状评估的对话式 AI 智能体研究

    Google Research 联合 Google DeepMind 推出 SymptomAI 研究,探索利用基于 Gemini Flash 2.0 的对话式 AI 智能体进行端到端症状问诊与鉴别诊断。

    推荐理由:这项研究通过上万名真实用户的随访与穿戴设备生理数据,展示了具备主动追问能力的对话式模型在日常鉴别诊断中的可行性。

  2. Google Research67

    Google 提出基于强化学习的量子纠错控制框架:在量子计算运行中实现自主校准

    Google Research 与 Google DeepMind 在 Nature 发表研究,提出一种利用强化学习(RL)自主调控量子纠错的框架,使量子计算机无需停机即可动态校准控制参数以对抗硬件漂移。

    推荐理由:Google 将强化学习引入量子纠错控制,利用运行中生成的错误检测信号动态抵御硬件漂移,为避免中断计算进行校准提供了可行方案。

7月9日周四
  1. Google Research70

    Google 提出 SensorFM:面向可穿戴健康数据的传感器基础模型

    Google Research 联合 Google DeepMind 推出可穿戴健康数据基础模型 SensorFM。该模型基于 500 万参与者超过 1 万亿分钟的未标注多模态传感器信号进行预训练,通过自适应掩码框架直接适应数据缺失,在心血管、代谢、睡眠和心理健康等 35 项任务中均展现出跨领域迁移能力。

    推荐理由:作者利用自监督掩码学习打通了多源可穿戴传感器数据,为稀缺医疗标注场景下的生理特征建模提供了通用方案。

7月1日周三
6月29日周一
  1. Import AI38

    Import AI 463:自我改进机器人、中国万卡 GPU 集群与人类时代的挽歌

    NVIDIA 研究人员推出机器人代码智能体框架 ENPIRE,通过自动重置、自动评估与策略迭代,使实体机器人在真实世界中实现闭环自主改进。在搭载 NVIDIA RTX 5090 的双臂工作站测试中,前沿代码智能体在 PushT、整理插针与剪断扎带等复杂灵巧操作任务上实现了 99% 的成功率。

6月16日周二
5月16日周六
  1. Google DeepMind64

    Google DeepMind 借助 Co-Scientist 发现抗肝纤维化的老药新用候选物

    斯坦福大学医学院与 Google DeepMind 合作,利用 Co-Scientist 智能体从现有药物文献中筛选治疗肝纤维化的老药新用候选物,相关研究发表于《Advanced Science》。

    推荐理由:研究展示了科学智能体在海量文献中挖掘老药新用候选物的实验命中表现,为生物医药研发提供了具体验证案例。

4月22日周三
  1. Google Research60

    Google 提出 ReasoningBank:让智能体从成败经验中提炼推理记忆并自演进

    Google Research 推出智能体记忆框架 ReasoningBank,能够从成功与失败经历中提炼结构化的高阶推理模式,支持测试阶段的持续自演进。该方案通过闭环工作流提取防范性策略,并结合记忆感知测试时扩展(MaTTS)在并行或序列推理中强化策略质量。

    推荐理由:该研究系统性地从失败经验中提炼高层推理模式,为构建具备持续反思与测试时自演进能力的智能体提供了具体记忆架构参考。

4月9日周四
  1. Google Research43

    ConvApparel:衡量与弥合用户模拟器的真实度差距

    Google Research 推出人机对话数据集 ConvApparel,用于量化并弥合 LLM 用户模拟器与真实人类间的真实度差距。数据集涵盖服装购物场景超 4,000 场对话(近 15,000 轮),通过将用户分流至“优质”与故意制造障碍的“劣质”双智能体,记录逐轮的满意度与挫败感。团队还提出了结合统计对齐、拟人度评分和反事实验证的三维框架来评测模拟器。