RAG 的 Demo 几乎人人能跑通:切文档、进向量库、检索、拼 Prompt。但演示效果和生产可用之间隔着一整条工程链路。以下七项,是我们每个知识库项目上线前必过的检查。
1. 切分策略对过真实文档吗?
按固定字数切分对制度文件、表格、FAQ 的效果天差地别。上线前用你自己的文档类型逐一验证,而不是用示例 PDF。
2. 检索质量有量化指标吗?
准备一份评测集(真实问题 + 标准出处),对检索命中率做基线测量。没有这个数字,后续所有"优化"都是感觉。
3. 答案带出处吗?
企业场景里,一条不带引用的回答约等于不可信。出处要能点回原文位置,这是用户判断"能不能信"的唯一抓手。
4. 拒答机制做了吗?
检索不到相关内容时,模型必须明确说"知识库中没有相关信息",而不是发挥。这一条直接决定系统会不会在老板面前编造制度。
5. 权限过滤在哪一层?
不同部门能看的文档不同。权限过滤必须发生在检索层(带权限条件查询),而不是等模型生成完再兜底。
6. 文档更新链路是自动的吗?
制度改了、知识库还是旧的,比没有知识库更糟。入库要挂在文档源头的更新事件上,而不是靠人记得手动同步。
7. 上线后有反馈闭环吗?
在界面上放"有用 / 没用"按钮,把差评样本回流到评测集。RAG 系统的质量是运营出来的,不是一次性调出来的。
这七项没有一项涉及"换个更强的模型"——生产可用性的大头在工程,不在模型。如果你的知识库项目卡在演示阶段,联系我们,可以帮你做一次落地评估。