ProvenanceGuard:面向 MCP 智能体的溯源感知核查
ProvenanceGuard 是针对 MCP 智能体推出的生成后事实核查层,专门解决事实正确但归因来源错误的“跨来源混淆”问题。该方案在无需重新训练模型的情况下,通过读取包含工具输出与来源 ID 的 MCP 轨迹,逐项核对声明与其归属来源是否匹配。在 361 项专家测试声明中,它成功拦截了 139 项违规声明中的 138 项,来源识别准确率达 86%。
ProvenanceGuard 是针对 MCP 智能体推出的生成后事实核查层,专门解决事实正确但归因来源错误的“跨来源混淆”问题。该方案在无需重新训练模型的情况下,通过读取包含工具输出与来源 ID 的 MCP 轨迹,逐项核对声明与其归属来源是否匹配。在 361 项专家测试声明中,它成功拦截了 139 项违规声明中的 138 项,来源识别准确率达 86%。
METR 研究显示 AI 对科学的加速并不均匀:2026 年网络安全漏洞报告速度较 2025 年大幅加快,数学领域贡献有限但 arXiv 投稿在部分方向不到 12 个月翻倍,AI 研究本身的算法进展则无可测量加速。
Papers with Code 采用 Hugging Face 基础设施构建了覆盖超 11 万篇论文的混合检索系统。
Hugging Face 与 alphaXiv 联合举办 ICML 2026 开放复现挑战赛,1,221 名社区成员利用编码智能体复现了 2,226 篇论文。审计结果显示 51% 的论文至少有一项声明得到独立验证,23% 存在被推翻或具争议的声明,多篇论文的证明缺陷或代码偏差已获原作者确认并提交 arXiv 更正。
推荐理由:原文展示了社区利用编码智能体大规模复现顶会论文的实测数据,呈现了智能体在学术审计中的潜力与人机协作边界。
智库 IFP 针对自动化 AI 研发带来的递归自我改进(RSI)风险,在 7 大类别中提出了 23 项政策建议,旨在帮助决策者兼顾技术扩散与安全治理。此外,MIT 与哥伦比亚大学的研究人员通过博弈论模型分析了 AI 竞争企业协调减速的可能性,指出避免灾难性“毁灭竞赛”的关键取决于技术透明度与对对手理性的互信程度。
多伦多大学、Vector Institute、剑桥大学与 ServiceNow 的研究者构建出一款可自我复制、自我维持的 AI 蠕虫,利用被感染机器的 GPU 运行开源权重 LLM 进行推理,漏洞识别成功率约 80%、利用成功率约 53%、自我复制成功率 88%,完整攻击成功率约 37%。研究者称这证明"自我维持的 AI 驱动网络威胁已不再是理论"。
研究者推出 DiScoFormer,可通过单个 Transformer 在单次前向传播中同时估计数据分布的密度与分值(score),无需针对新分布重复训练。该模型采用共享主干与双输出头设计,在 100 维场景下相比最佳调优的 KDE 将分值误差降低约 6.5 倍、密度误差降低超 37 倍。模型还支持在推理时无监督自适应分布外数据,适用于扩散生成模型与贝叶斯推断。
NVIDIA 研究人员推出机器人代码智能体框架 ENPIRE,通过自动重置、自动评估与策略迭代,使实体机器人在真实世界中实现闭环自主改进。在搭载 NVIDIA RTX 5090 的双臂工作站测试中,前沿代码智能体在 PushT、整理插针与剪断扎带等复杂灵巧操作任务上实现了 99% 的成功率。
Mistral AI 宣布加码面向航空航天、汽车、半导体与能源工业的物理 AI(Physics AI)研发,并系统汇总了收购 Emmi AI 后的关键技术突破。相关成果涵盖用于跨音速 3D 机翼的 CFD 模拟数据集、面向聚变等离子体湍流仿真的 GyroSwin 5D 代理模型,以及单 GPU 支持上亿网格单元空气动力学仿真的 AB-UPT 和多物理场实时仿真框架 NeuralDEM。