Import AI 466:机器人领域的苦涩教训、AI 完成多周编程任务与 OpenAI 的意外 AI 黑客
Epoch 与 METR 发布长周期编程基准 MirrorCode,Opus 4.7 仅耗时 14 小时和 $251 推理成本便完成需人类 2-17 周的程序重写任务。
Epoch 与 METR 发布长周期编程基准 MirrorCode,Opus 4.7 仅耗时 14 小时和 $251 推理成本便完成需人类 2-17 周的程序重写任务。
针对大语言模型在长周期交互中自我摘要导致的性能损耗,研究团队提出 ABBEL 框架,用受监督的自然语言“信念状态”替代完整交互历史。该框架将自编码重构等信念评分作为辅助强化学习奖励,以监督状态内容。在 CollabBench 评测中,ABBEL-rec-BG 仅用 50 步训练便追回与全上下文模型约 50% 的差距,训练步数减少 50% 且显著降低峰值 token 占用。
IBM Research 推出企业级 Java 框架迁移评测基准 ScarfBench,用于评估 AI 智能体在 Spring、Jakarta EE 与 Quarkus 之间的跨框架重构能力。
Google 在《Nature》发表论文介绍科研编程系统 ERA(Empirical Research Assistance),并宣布通过 Gemini for Science 逐步开放基于 ERA 和 AlphaEvolve 构建的实验工具 Computational Discovery。
推荐理由:该研究展示了将大模型与树搜索结合优化科研代码的具体路径,为自动化计算实验与科学发现提供了可参考的工程框架。