很多 RAG 项目失败,并不是模型能力不够,而是知识库数据链路没有治理好。企业文档格式复杂,来源包括 PDF、Word、网页、表格、工单和内部知识库,每一种数据都需要不同的解析和清洗策略。
数据接入
第一步是建立可追踪的数据接入流程。文档需要记录来源、版本、更新时间、权限范围和责任人。解析后不能直接入库,还要处理页眉页脚、目录、重复段落、表格语义和无效文本,否则检索出来的上下文会干扰模型回答。
切分与向量化
切分策略决定检索质量。过短会丢上下文,过长会浪费 token 并降低召回精度。常见做法是按标题层级、段落语义和固定长度混合切分,再使用 Embedding 模型生成向量。向量数据库需要维护集合、索引、元数据过滤和版本更新策略。
检索评测
上线前要准备问题集,分别评测召回率、答案相关性、幻觉率和引用准确性。Rerank 可以提高结果排序质量,但也会增加延迟。运维人员要持续观察检索命中、无答案比例、接口耗时和用户反馈,把 RAG 当成长期迭代系统,而不是一次性导入文档。

