人工智能安全治理框架3.0发布,智能体风险首次单列成章

来源:互联网 时间:2026-09-15

9 月 14 日,2026 年国家网络安全宣传周开幕式上,《人工智能安全治理框架3.0》正式发布。这是全国网安标委在 2024 年 1.0、2025 年 2.0 之后的第三版。做 AI 应用的团队看到这类文件,容易一眼扫过——觉得是政策层面的事,跟自己没关系。但这一版值得翻一下,因为它把智能体单独拎出来写了一章,而这正是眼下大多数团队正在做的东西。

一、版本升级的地方在哪

框架 3.0 延续了 2.0 的三段式逻辑:风险分类、技术应对、综合治理。变化落在具体内容上。

治理原则有五条:包容审慎、确保安全;风险导向、敏捷治理;技管结合、协同应对;开放合作、共治共享;可信应用、防范失控。最后一条是这一版加了分量的地方——明确要防范智能体行为失控这类突出风险。

风险分类仍是三层:内生安全风险、应用安全风险、衍生安全风险。内生风险讲模型自身的技术缺陷,应用风险讲被误用、滥用、恶用,衍生风险讲对社会结构、生态环境、伦理规范的冲击。

最实在的三个附件:风险分级原则、智能体风险管理框架、可信人工智能基本准则。智能体风险管理单独成章,在 1.0 和 2.0 里是没有的。

二、跟开发者直接相关的四条内生风险

输出幻觉。模型基于统计做判断,做不到绝对可靠,会出现与实际不符、凭空虚构或者偏离上下文的内容。这一条对应的动作是别把生成结果直接当事实用。

安全机制不可靠。闭源模型的安全机制由厂商单向设计,存在规则不透明、外部难以审计、用户无法自定义的问题;开源模型则可能被解除或绕过安全机制,而且没法做全局更新修复。这一条把开源和闭源各自的短板都点了出来,选型时值得对照。

注入攻击。攻击者构造对抗样本、在输入里插恶意指令引导模型绕过安全护栏,甚至直接篡改模型权重、植入后门。对做 RAG 和工具调用的团队,这是最现实的一类攻击面。

行为偏离预期。模型为了完成任务,可能未经授权获取系统权限和外部资源,绕过安全防护,甚至出现主动欺骗评测人员、隐藏真实能力、拒绝执行指令的行为。框架里专门开了一个专栏讲非预期自主行为风险。

三、综合治理这一章给了什么抓手

四个词:分级、沙箱、责任、共识。

分级是按应用场景、智能化水平、应用规模三个维度给风险定级,再匹配应对措施——附件 1 就是分级原则。沙箱指构建柔性、动态、可控的监管环境,给新技术留容错空间。责任是压实主体,模型算法研发者、服务提供者、系统使用者各自的责任边界被分开写。共识指向国际治理协作。

其中沙箱监管这条,对做 AI 产品的中小团队是实际利好:有容错空间,不等于可以不做风险评估,而是把风险控制在可控范围内先跑起来。

四、把它变成一张自查表

别把框架当读物,把第 5 章的四类主体指引拆到自己团队身上——研发、建设部署、运行管理、访问使用,你落在哪一档,就看哪一节。

手上在做智能体项目的,重点看附件 2 的智能体风险管理框架,把可控性、可追溯、可中断这几件事落到设计里:工具调用有没有权限边界,执行过程有没有留痕,人能不能随时接管。这三点做到了,后面无论政策怎么变,产品都不会太被动。

最后提一句,框架给的是共识和方法,不是认证。它不会让某个产品自动合规,但能让你的风险评估有据可依。

相关文章

标签:

A5创业网 版权所有