基本定义
AI安全是指围绕AI系统在输入处理、模型判断、内容生成和(在Agent场景下)真实行动这几个环节,识别和防范风险的技术领域。它既包括防止AI被诱导生成不当内容,也包括防止AI的判断被利用来执行未经授权的操作。
覆盖的具体问题
AI安全通常涉及以下几类问题:模型是否会输出违反预设规则的内容、模型是否会被提示注入误导、训练和使用过程中的数据是否得到妥善保护、以及当AI具备行动能力后,这些行动是否被合理的权限边界约束。
和信息安全的关系
AI安全不是信息安全的替代品,而是信息安全在AI应用场景下的延伸。传统信息安全关注网络、终端、身份和数据的攻防,AI安全在此基础上额外关注模型判断的可靠性和AI行动带来的新风险,两者需要结合使用,详见大模型安全和网络安全有什么区别。
为什么现在更受关注
随着AI从单纯的内容生成工具发展为可以调用工具、访问数据、执行任务的Agent,AI判断失误的后果从"一段不准确的文字"扩展到"一次真实的系统操作",这直接提高了AI安全问题的现实紧迫性,相关内容见Agent安全栏目。