越来越多的AI安全讨论开始强调一个前提:不要假设模型永远不会被骗。这不是对模型能力的否定,而是一种更稳健的系统设计思路——把"模型可能出错"当作默认前提,而不是小概率的例外情况。

为什么不能只依赖模型本身的判断

模型的输出本质上是基于概率的推理结果,即使经过大量安全训练,也无法保证在所有输入组合下都做出预期中的正确判断,尤其是面对精心构造的间接提示注入内容时。如果整个系统的安全性完全建立在"模型这一层不会出错"的假设上,那么一旦这个假设被打破,后续所有操作都会失去保护。

六层纵深防御结构

更稳健的做法是建立多层独立的防护,即使某一层失效,其余层仍然可以发挥作用:

MODEL 模型安全

第一层,通过训练和提示词工程尽量提升模型判断的可靠性,这是基础但不是全部。

SANDBOX 沙箱

把Agent的执行环境限制在隔离的沙箱中,即使某次操作出现问题,影响范围也被限制在沙箱边界内,不会直接波及生产系统。

IDENTITY 身份

明确每一次操作的身份来源,为后续的权限判断和审计提供基础。

PERMISSION 权限

按最小权限原则限定Agent能够访问的资源和能够执行的操作范围。

MONITOR 监控

持续监控Agent的行为模式,及时发现异常操作或偏离预期的行为序列。

CONTROL 高风险操作控制

对不可逆或影响范围大的操作设置人工确认,作为最后一道防线。

纵深防御的核心逻辑

这六层防护并不要求每一层都做到完美,而是让"某一层失效"不等于"整个系统失效"。即使模型判断出现失误,沙箱可以限制影响范围,权限设计可以阻止越权操作,监控可以及时发现异常,高风险操作确认可以在最后关头拦截严重后果。这种"多道关卡、层层过滤"的思路,与日常生活中"安全带、刹车和交通规则共同降低事故风险"是类似的逻辑——单独一项都不能保证绝对安全,但组合起来能显著降低严重后果发生的概率。

纵深防御思路也呼应了当前安全研究中被称为"AI Control"的方向:与其追求模型本身绝对可靠,不如设计一套系统,使得即使模型行为出现偏差,整体系统仍然保持在可控范围内。这一理念贯穿在Agent安全和金宝博安全实验室栏目的多篇内容中,建议结合Agent权限边界设计一并阅读。