很多企业最初接触AI安全,是从"内容审核"入手的:过滤输入中的敏感词、审查输出是否包含不当内容。这一步确实必要,但当AI从"对话工具"升级为"具备行动能力的Agent"后,内容过滤只覆盖了安全问题的一小部分。

传统内容安全的边界

内容过滤解决的是"这段文字是否合适"的问题,关注的是输入和输出两端。它对纯文本生成场景(比如智能客服的回复内容)是有效的第一道防线,但一旦AI系统开始调用工具、访问数据、执行操作,内容过滤就无法覆盖"这个操作该不该被执行"这类问题——因为触发问题的可能不是某一段"不合适的文字",而是一连串本身看起来完全正常的操作组合。

六层安全模型

金宝博AI安全栏目建议企业在评估AI应用安全时,至少覆盖以下六层:

1. IDENTITY 身份:Agent是谁?

每一次AI操作都应该能明确追溯到具体的身份——是用户直接授权的一次性任务,还是某个自动化流程在后台运行。身份不清,后续的权限判断就无从谈起。

2. AUTHORIZATION 授权:它能做什么?

身份确认后,需要明确这个身份在当前任务下被授予了哪些具体权限,而不是默认拥有系统内的全部能力。

3. DATA 数据:可以访问什么?

即使权限设计合理,仍需要限定这次任务能接触的数据范围,避免"因为权限已开,索性给全部数据"的设计惯性。

4. TOOLS 工具:可以调用什么?

Agent能调用的工具集合应该与当前任务强相关,高风险工具(发送、删除、支付)应该与常规读取类工具分开管理。

5. ACTION 动作:允许执行什么?

最终触发的真实操作需要有明确的许可边界,不可逆或影响范围大的动作应设置额外的确认环节。

6. AUDIT 审计:发生了什么?

完整记录每一次身份、权限、数据访问和动作执行的日志,是发现问题、追溯责任、持续改进安全策略的基础。

内容过滤在六层模型中的位置

内容过滤更多作用于"数据"和"动作"环节的输入端(判断即将处理或生成的内容是否合适),它是六层模型中的一个环节,而不是可以替代其余五层的全部工作。把内容过滤当作AI安全的全部投入,相当于只在信任链的一个节点设防,其余环节仍然暴露。

建立六层安全模型之后,企业可以更清晰地定位自己当前的安全投入覆盖了哪些环节、还有哪些空白,这也是金宝博AI安全和Agent安全两个栏目共同建议的评估起点。