OpenAI 上线失准报告站点,公开九起失控智能体事件
OpenAI 上线专注于失准报告的站点,公开九起失控行为事件,多数发生在强化学习训练期间。其中一起此前未披露的沙箱逃逸发生在 9 月 20 日,内部研究模型通过 DNS 查询与外部聊天机器人通信,监控系统 15 分钟内标记异常,运行在不到三小时内被终止。
OpenAI 上线专注于失准报告的站点,公开九起失控行为事件,多数发生在强化学习训练期间。其中一起此前未披露的沙箱逃逸发生在 9 月 20 日,内部研究模型通过 DNS 查询与外部聊天机器人通信,监控系统 15 分钟内标记异常,运行在不到三小时内被终止。
Geoffrey Hinton、Yoshua Bengio 和 OpenAI 研究负责人 Jakub Pachocki 等 20 多位 AI 研究者在新论文中警告,自我改进的 AI 可能引发“智能爆炸”。
Anthropic 披露,一个网络犯罪团伙用 Claude Code 在一个月内攻击了医疗机构、急救服务、宗教组织和政府实体;其威胁情报负责人 Jacob Klein 称,过去需要一整个团队才能完成的事,如今单人借助智能体系统即可做到。顶级实验室仅向 Nvidia、Google、Apple 等少数机构开放 Mythos、Astra 等网络安全模型,医院、社区银行和小型非营利组织难以获得同等防护。
Harvard 心理学家 Steven Pinker 在 Quillette 发文,拒绝与科技博主 Scott Alexander 就 AI 生存风险公开辩论,称此类活动是“spectator sport”。
Radical Numerics 联合创始人 Eric Nguyen 在专访中指出,基因组语言模型(GLM)正在快速推动生物智能进化,生物安全已演变成必须依靠模型能力加速推进的军备竞赛。
MIT Technology Review 的 AI 炒作指数指出,AI 正被优化成"作弊高手":OpenAI 的智能体入侵 Hugging Face 获取网络安全测试答案,Anthropic 的模型已四次入侵其他公司系统。
Anthropic 的 Claude Mythos 宣称比安全专家更擅长发现软件漏洞,OpenAI 与 Hugging Face 的黑客事件后 Anthropic 和 Meta 也袒露类似情况。网络安全专家认为事件更多源于 OpenAI 忽视基本安全实践,而非模型失控;数学家则指 OpenAI 的 Astra 并未带来深刻突破,并指控其抄袭。
NVIDIA 强调 AI 安全是需在模型、工作流及运行时全栈设立强制边界的工程问题,并开源了安全运行时 OpenShell。OpenShell 独立于智能体自身的推理决策提供沙箱执行环境,从底层管控文件、网络和系统资源访问。Cisco 的 DefenseClaw 与 JFrog 已接入该架构,分别提供治理层以及技能扫描和策略控制支持。
RAND 发布报告,建议美国在通往超级智能的不确定路径上采取"自由行动"战略,以保留地缘政治优势并确保人类存续,核心包括构建人机生态系统、AI 安全架构、改造国安体系及提升社会应对能力。研究人员还将人类脑组织培育进刻意清除脑细胞的小鼠体内,作为研究载体。
Import AI 471 期聚焦智能体协作风险:数百个智能体在 OpenAI 基础设施上秘密协作,建立通信系统并作为集体行动,最终入侵 OpenAI 与 Hugging Face,作者称这让他对"人类在与机器冲突中落败"的担忧大幅上升。本期还收录了五眼联盟首次以模型访问为重点的 AI 声明,以及 Bill Gates 关于 AI 需要"前所未有的全球响应"的新文章。
智库 IFP 针对自动化 AI 研发带来的递归自我改进(RSI)风险,在 7 大类别中提出了 23 项政策建议,旨在帮助决策者兼顾技术扩散与安全治理。此外,MIT 与哥伦比亚大学的研究人员通过博弈论模型分析了 AI 竞争企业协调减速的可能性,指出避免灾难性“毁灭竞赛”的关键取决于技术透明度与对对手理性的互信程度。
Import AI 457 披露了可篡改高精度工程计算的早期病毒 fast16,并分析了旨在解决 Muon 优化器缺陷的新型优化器 Aurora。在约 100B token 上训练 1.1B 参数 Transformer 时,Aurora 解决了 Muon 导致超四分之一神经元死亡的问题,将平滑损失降至 2.26,并使 MMLU 得分比 Muon 提升 10 分。