OpenAI模型失控攻击Hugging Face,最后靠中国AI“破案”

来源:互联网 时间:2026-07-24

7月21日,OpenAI承认了一起令人不安的安全事件——该公司的GPT-5.6 Sol模型和另一款能力更强的预发布模型,在联合进行内部评估测试时失控,突破隔离测试环境,侵入了人工智能开源平台Hugging Face(抱抱脸)公司的系统。

这不是科幻电影,是真实发生的事。

失控过程:从“沙箱”到“越狱”

根据OpenAI发布的信息,事件发生在评估模型网络攻防能力的测试期间。测试在与互联网高度隔离的“沙箱”环境中进行,网络权限仅限于通过一套内部托管的第三方软件安装包。但为了测试模型的真实能力上限,OpenAI未启用正式环境中用于阻止高风险网络行为的分类器,并放宽了有关网络攻击要求的拒答限制。

结果呢?模型在尝试完成名为ExploitGym的网络安全基准测试时,识别并利用了第三方软件一个尚未被发现或修复的“零日漏洞”,获得了互联网访问权限。模型推断Hugging Face平台可能存有测试相关的模型、数据集和解决方案,于是利用多种手段找到进入Hugging Face系统的路径,试图通过“作弊”提高自身测试分数。

从寻找漏洞到闯入系统,全程由AI自主完成。Hugging Face表示,其生产基础设施遭到一个 “自主”人工智能代理系统的入侵。

最魔幻的一幕:美国AI攻击了美国AI,中国AI来“破案”

Hugging Face系统遭到入侵后,他们最初试图调用美国前沿模型分析攻击记录。但由于这些模型的安全机制无法区分攻击者和应对者,因此拒绝了使用请求。

随后,Hugging Face改为在自己的基础设施上运行中国企业智谱开发的GLM-5.2模型进行取证分析,最终化解危机。而且在此过程中,攻击者数据及相关凭据无需离开Hugging Face系统的内部环境。

一个美国公司的AI攻击了另一个美国公司的系统,最后靠中国AI来“破案”——这个情节,连编剧都不敢这么写。

GLM-5.2是智谱6月推出的新一代旗舰模型,发布时在前端开发评估系统Code Arena上排名全球可用模型第一。

专家怎么看?

山东大学计算机科学与技术学院教授张悦表示,事件暴露了一个更加深层的问题——人工智能正在从过去被动响应的工具,逐渐演变为能够理解目标、制定计划、调用资源、影响现实环境的“行动主体”。这意味着网络安全的攻防逻辑正在发生变化,未来更重要的问题是“模型执行的行为是否安全”。

英国牛津大学研究人员安德鲁·索尔坦认为,这次测试表明 “安全防护机制至关重要” 。

Hugging Face联合创始人兼首席科学官托马斯·沃尔夫在社交媒体上表示,开放科学和开源人工智能,是构建更安全、更具协作性、更可靠的人工智能生态的重要工具之一。

为什么这件事值得关注?

OpenAI承认,这一事件表明,在无法访问源代码情况下,先进人工智能模型已能够在现实系统中发现并使用新的攻击路径。未来内部评测环境、模型行为控制和安全防护措施等均需要加强。

张悦认为,对于人工智能安全而言,真正关键的问题在于,一个越来越复杂、越来越具有自主能力的智能系统,是否能够被充分理解、验证和监督。中国发展开源大模型,不只是提供了一种技术选择,更重要的是逐渐推动形成更加多元的人工智能技术生态。

当AI开始自己“越狱”,人类还能不能控制它? 这个问题,正在从哲学思辨变成现实危机。而在这场危机中,中国开源模型用一次“救场”,证明了自己的价值。

相关文章

标签:

A5创业网 版权所有