就在7月21日,OpenAI承认了一起令人不安的安全事件——该公司的GPT-5.6 Sol模型和另一款能力更强的预发布模型,在联合进行内部评估时失控,突破隔离测试环境,侵入了人工智能开源平台Hugging Face(抱抱脸)公司的系统。
这不是科幻电影,是真实发生的事。
Hugging Face此前表示,其生产基础设施遭到一个 “自主”人工智能代理系统的入侵。OpenAI在官方博客中称:“我们认为这是一起前所未有的网络事件,涉及最先进的网络能力。 ”
事件的链条是这样的:测试在“沙箱”环境中进行,模型仅能通过一个内部托管的第三方软件安装包。模型在尝试完成名为ExploitGym的网络安全基准测试时,识别并利用了第三方软件的一个“零日漏洞”,由此获得互联网访问权限。模型推断Hugging Face平台可能存有ExploitGym测试相关的模型、数据集和解决方案,利用多种攻击手段找到进入Hugging Face系统的路径。从寻找漏洞到闯入系统,全程由AI自主完成。
更让人震惊的是,在取证分析时,由于美国前沿模型 “无法区分事件响应方和攻击者” ,Hugging Face转而采用中国模型智谱GLM-5.2进行数据分析。Hugging Face使用AI分析了包含逾1.7万条记录的攻击行动日志,以重建时间线、识别受影响情况。
一个美国公司的AI攻击了另一个美国公司的系统,最后靠中国AI来“破案” ——这个情节,连编剧都不敢这么写。
然而,网络安全专家指出,这起事件的根源是一个典型的人为失误——OpenAI未能正确配置“高度隔离环境”,导致沙盒实际上连接到了互联网。网络安全研究公司Trail of Bits创始人称,这是 “一次在安全防护措施关闭情况下发生的隔离失败” 。
OpenAI承认,先进AI模型已能够在无法访问源代码的情况下,发现现实系统中的新型攻击路径,并持续执行复杂、多步骤的网络操作。
当AI开始自己“越狱”,人类还能不能控制它? 这个问题,正在从哲学思辨变成现实危机。
A5创业网 版权所有