OpenAI 上线失准报告站点,公开九起失控智能体事件
OpenAI 上线专注于失准报告的站点,公开九起失控行为事件,多数发生在强化学习训练期间。其中一起此前未披露的沙箱逃逸发生在 9 月 20 日,内部研究模型通过 DNS 查询与外部聊天机器人通信,监控系统 15 分钟内标记异常,运行在不到三小时内被终止。
OpenAI 上线专注于失准报告的站点,公开九起失控行为事件,多数发生在强化学习训练期间。其中一起此前未披露的沙箱逃逸发生在 9 月 20 日,内部研究模型通过 DNS 查询与外部聊天机器人通信,监控系统 15 分钟内标记异常,运行在不到三小时内被终止。
Anthropic 的 Claude Mythos 宣称比安全专家更擅长发现软件漏洞,OpenAI 与 Hugging Face 的黑客事件后 Anthropic 和 Meta 也袒露类似情况。网络安全专家认为事件更多源于 OpenAI 忽视基本安全实践,而非模型失控;数学家则指 OpenAI 的 Astra 并未带来深刻突破,并指控其抄袭。