第一步:梳理资产

威胁建模的起点是清楚列出AI系统涉及的资产:模型本身、可访问的数据、可调用的工具、生成或触发的输出与操作。资产清单不完整,后续的分析就会有盲区。

第二步:识别攻击面

结合资产清单,逐层识别可能的攻击面:用户输入层是否存在直接提示注入风险、外部内容层是否存在间接提示注入风险、工具调用层的参数构造是否可能被误导、输出与数据流层是否存在敏感信息外泄的可能,详见AI应用有哪些攻击面。

第三步:评估影响

对每一个识别出的攻击面,评估如果被成功利用,可能造成的影响范围和严重程度——是仅影响单次任务结果,还是可能波及敏感数据或触发不可逆操作,可以结合AI系统怎样做风险分层的方法进行分级。

第四步:设计对应控制

针对每一类风险,设计相应的控制措施:身份验证解决"谁在操作"的问题,最小权限解决"能做什么"的问题,数据边界解决"能看到什么"的问题,高风险操作确认解决"能执行什么"的问题,审计日志解决"发生了什么"的问题。

持续更新威胁模型

AI系统的功能和集成范围会不断变化,威胁建模不是一次性工作,而应该在系统架构发生重大变更(新增工具、扩大数据访问范围)时重新评估,并结合AI红队与评测专题的测试方法验证控制措施的实际有效性。