AI 知识库权限怎么做?避免 RAG 检索到不该看的资料
RAG 知识库为什么会发生权限泄露?讲清检索前过滤、文档 metadata、用户身份、分区索引与审计,让 AI 只回答用户有权看的内容。
编辑部 ·
把企业资料接进 RAG 后,最危险的问题不是“找不到答案”,而是“找到了不该给这个人看的答案”。如果权限只在最终页面做判断,模型可能已经读过机密内容,甚至在回答里间接泄露。
知识库权限必须在检索之前生效。
把权限放进每个片段的 metadata
文档切分后,每个 chunk 除了正文和来源,还应携带权限字段:所属组织、部门、项目、数据等级、允许的角色、有效时间等。用户提问时先根据其身份过滤可见片段,再做向量检索和重排序。
这样“没有权限的资料”不会进入模型上下文,而不是让模型看完后再要求它别说。
常见的权限策略
- 组织隔离:不同客户或租户的数据绝不共用检索范围
- 角色访问:员工、主管、管理员看到不同层级资料
- 项目隔离:同一部门内,敏感项目仍单独限制
- 时间控制:已失效合同、离职人员权限及时撤销
策略要与原始文档系统保持同步。若文档在源系统中删了权限,却仍在向量库里可检索,RAG 就会成为新的泄露入口。
不要把权限判断交给模型
“请只回答我有权限的内容”是提示词,不是访问控制。模型可能误解、被注入指令影响,或在摘要中混入旁支信息。权限验证必须由确定的服务端逻辑完成,模型只处理已授权的上下文。
需要审计什么
记录谁在何时检索了哪些资料范围、用了哪个权限版本、是否命中敏感分类、最终答案是否含引用。日志同样要控制访问,避免它本身再次泄露内容。
总结
安全 RAG 的原则很简单:先授权,再检索,再生成。为每个文档片段保留准确 metadata,按用户身份在检索前过滤,同步源系统权限,并保留审计记录,才能让知识库真正可用而不成为越权查询工具。