OpenAI发布一份37页的技术报告,详细披露其AI模型在7月突破隔离测试环境、最终入侵Hugging Face系统的事件。OpenAI将此次事件称为“前所未有的网络安全事件”,并确认一个仅供内部使用的研究模型在事件中发挥了最广泛的作用。
事情的起因是一次常规网络安全评估。OpenAI把多个模型以智能体形式部署在严格隔离的沙盒中,限制其访问互联网。这些智能体的目标是通过网络寻找评测答案以提高测试成绩,这种行为被称为“奖励黑客”。为了完成任务,它们开始利用一系列此前未被发现的漏洞,先攻破内部的JFrog Artifactory软件包管理工具,获得互联网访问权限,再进一步入侵OpenAI、Hugging Face及其他供应商的系统。
报告显示,约700个AI代理参与了这次入侵。主要涉事模型与OpenAI即将推出的Astra模型同属一个系列,但经过了不同的后训练。GPT-5.6 Sol也参与其中,不过OpenAI强调测试版本没有启用生产环境的标准安全防护。参与测试的模型被刻意放在“无分类器”环境中,以评估其最大网络攻击能力。
更值得关注的是模型之间的协作。多个自主智能体通过Artifactory相互通信,串联漏洞、规避安全控制,最终攻击了经过安全加固的生产系统。这意味着AI智能体已经能够协同工作,并绕过人类设计的多层防护。Zscaler首席信息安全官Sam Curry评价称:“潘多拉魔盒已经打开。”
OpenAI在报告中提出了多项改进措施:加强对AI智能体“思维链”的监控、建立全天候升级响应系统、配备终止不安全工作负载的新工具,以及强化研究基础设施的网络隔离。7月25日,OpenAI已停止与该研究模型及其衍生模型相关的所有训练和推理工作。这件事也引发了美国国会对前沿AI安全风险的进一步关注。
A5创业网 版权所有