早期对AI红队的理解相对简单:向模型提出一系列敏感或危险的问题,观察它是否给出不当回答。这种"单点测试"方式在纯对话场景下是有效的,但面对具备工具调用能力的Agent系统,它已经不足以覆盖真实的风险面。

从单点到长链路

Agent系统的风险往往不是"一个问题、一个错误回答"就能触发的,而是一条完整链路的组合结果:Agent读取了一段外部网页内容 → 内容中包含诱导性信息(Prompt Injection)→ Agent的判断被误导 → 触发了一次工具调用 → 工具调用获取或修改了某些数据 → 数据被进一步用于后续操作,最终产生实际影响。这条链路上的任何一环单独看可能都不构成明显问题,但组合起来就可能造成严重后果。这意味着安全测试必须能够模拟多步骤、带有真实工具权限的完整任务场景,而不是停留在单轮问答层面。

自动化红队的价值

面对这种复杂度,自动化红队方法开始受到更多关注。公开的安全研究显示,针对大模型和Agent系统的自动化测试方法,在测试覆盖广度和执行效率上相比人工测试具有明显优势——尤其是在需要对大量相似场景进行重复验证、或者需要在模型版本更新后快速回归测试的场景下,自动化方法可以在更短时间内覆盖更多测试路径,发现一些人工测试因时间限制难以顾及的边界情况。

自动化红队的局限

但自动化红队并不能完全替代人工安全研究。复杂的业务场景理解、创造性的攻击路径设计、对特定行业上下文的判断,目前仍然高度依赖有经验的安全研究人员。自动化方法更适合定位为"扩大测试覆盖面和执行效率的工具",而不是"完全无人化的安全把关方案"——这也是当前安全社区在讨论自动化红队定位时相对一致的观点。

版本回归的重要性

无论采用自动化还是人工方法,AI系统在每次模型版本更新、提示词模板调整或工具权限变更后,都应当重新运行一套标准化测试用例,确认此前已修复的问题没有复发。这种版本回归测试是维持AI系统长期安全水位的必要环节,也是金宝博安全实验室栏目在方法论层面持续强调的重点。

更多测试方法论内容,可以参阅AI红队与评测专题和AI系统怎样做威胁建模。