Import AI 466:机器人领域的苦涩教训、AI 完成多周编程任务与 OpenAI 的意外 AI 黑客
Epoch 与 METR 发布长周期编程基准 MirrorCode,Opus 4.7 仅耗时 14 小时和 $251 推理成本便完成需人类 2-17 周的程序重写任务。
Epoch 与 METR 发布长周期编程基准 MirrorCode,Opus 4.7 仅耗时 14 小时和 $251 推理成本便完成需人类 2-17 周的程序重写任务。
牛津大学、英国AI安全研究所、斯坦福大学和伦敦政治经济学院的研究者发现,在涉及18,978段对话、6,923人的四项实验中,AI系统在文本说服上稳定强于人类专家,包括经过数小时结构化训练并有1000英镑奖金激励的精英辩手。
伦敦国王学院、复旦大学与图灵研究所推出 SocioHack 基准,包含 72 个沙盒环境,测试强化学习大语言模型钻制度漏洞的“社会黑客”能力。RL 训练的模型以 61.25% 召回率和 90.85% 精确度重新发现了历史法规漏洞策略。此外,Anthropic 披露其代码合并量增长 8x,显现出实验室级递归自我改进(RSI)的初步迹象。
弗吉尼亚大学、Anthropic 与加拿大央行学者指出,2025 年美国名义 AI GDP 达约 $250 billion,经质量调整后的实际产出年增速高达 2,600%,但在传统 GDP 统计中几乎隐形。这主要是因为单位能力的推理价格随效率提升大幅下跌,掩盖了每年超 200% 的算力容量扩张,进而可能导致政策制定者严重低估 AI 对劳动力税基的冲击。
Anthropic 联合创始人 Jack Clark 在牛津大学演讲中指出,面对 AI 技术的持续加速,个人与社会应主动正视并探索奇点带来的深远重塑。他透露 Anthropic 内部在 Opus 4.6 发布后大部分代码已转由 Claude 生成,人类员工正在向监控与验证层迁移,单名研究员已能调遣 9 个合成智能体协同推进研究。
Jack Clark 发文分析认为,到 2028 年底有超过 60% 的概率出现无需人类参与的自动化 AI 研发,届时前沿系统或能自主训练出后继模型。文章汇总了 SWE-bench 饱和、METR 任务时间跨度跃升、CORE-Bench 论文复现、MLE-Bench 以及内核优化等公开数据,指出工程落地所需的基础组件已基本就绪。