什么是RAG

检索增强生成(RAG)指AI在生成回答前,先从企业知识库中检索相关内容,再结合检索结果生成回答,是企业AI应用中常见的架构模式,可以让AI回答更贴合企业内部信息。

边界一:检索范围

知识库通常包含不同敏感度的内容,如果检索环节没有按用户身份或角色限定范围,可能导致低权限用户的提问间接检索到高敏感度内容,通过AI生成的回答泄漏出去。

边界二:权限继承

理想情况下,RAG系统的检索权限应当继承原始文档的访问权限——如果某份文档在企业系统中只对特定角色可见,AI在为其他角色生成回答时就不应该检索到这份文档的内容。这一点在实际实现中容易被忽略,因为知识库的索引过程有时会脱离原始权限体系。

边界三:敏感内容过滤

即使检索权限设置正确,仍建议对生成的回答做二次检查,避免知识库中意外包含的敏感信息(如误上传的内部文件)被直接呈现给用户。

实践建议

企业在搭建RAG系统时,建议从知识库入库阶段就明确标注内容的敏感度和可访问角色,并在检索环节严格执行权限过滤,而不是依赖后期补救,详见AI连接企业数据库应怎样控制权限。