拆解检索与回答工作流
如何区分知识未入索引、召回失败、重排丢证据和生成未遵循证据?
- 01AI 适用性与不可自动化边界卡
- 02客服知识机会评估表
- 03RAG 诊断与方案选择表
- 04坐席权限、升级与恢复图
- 05RAG 评测、成本与上线护栏表
- 06完整客服知识产品评审档案
如何区分知识未入索引、召回失败、重排丢证据和生成未遵循证据?
这是一个教学案例。某数字产品客服团队维护帮助中心、产品政策、故障处置手册和内部操作说明,希望为坐席提供可回到当前有效原文的回答草稿。
- 事实E3
RAG 评测研究分别观察上下文相关性、答案忠实度和答案相关性,而不是只给最终回答一个总分。
外部来源支持 - 事实E3
长上下文模型对相关信息位置的使用可能不稳定,因此候选重排和位置切片需要单独测试。
外部来源支持
- 未知项E0
真实语料适合的切分、关键词与语义检索组合、候选数量、重排和上下文长度尚未比较。
尚无外部证据
Artifact delta
本关如何改变项目材料
RAG 诊断与方案选择表
固定知识发布、检索、重排、充分性、生成、引用和拒答步骤及各自输入输出与终止条件。
- 新知识未及时入索引
- 信号
- 已发布有效内容持续无法召回或下架内容仍然返回
- 影响
- 回答遗漏最新政策或继续使用已经失效的知识
- 恢复
- 检查发布队列和缓存失效,标记知识不可用并回退人工流程
- 责任
- 知识负责人和工程
- 关键证据召回失败
- 信号
- 有效来源存在但未进入候选集合
- 影响
- 系统可能错误拒答或在缺少关键条件时生成答案
- 恢复
- 保持无答案状态并升级,修复查询、切分或检索后回放固定样本
- 责任
- 检索和评测负责人
- 重排截断关键证据
- 信号
- 相关来源已召回却未进入最终上下文
- 影响
- 答案遗漏关键限制、例外或适用条件
- 恢复
- 调整候选与重排策略,运行证据位置和风险切片回归
- 责任
- 检索和评测负责人
- 模型或重排服务超时
- 信号
- 草稿延迟、失败率或重试量突然升高
- 影响
- 坐席等待增加且重复调用推高成本
- 恢复
- 达到上限后停止重试,降级到搜索与人工起草并记录失败
- 责任
- 工程
- quality · increase风险切片检索召回
在高风险、无答案、冲突和常见主题切片中,必要证据进入候选集合的比例。
阈值:待真实基线 - quality · increase检索精确率
返回候选中与当前问题、客户条件和有效知识范围相关的证据所占比例。
阈值:待真实基线 - quality · increase引用支持率
回答关键主张中,其引用真实存在、版本有效且原文确实支持该主张的比例。
阈值:待真实基线 - operation · decreaseP95 草稿延迟
从提交已授权问题到返回可供坐席复核草稿的第九十五百分位端到端时间。
阈值:待真实基线
- 权威文献ARES RAG Evaluation Framework
支持分别评估上下文相关性、答案忠实度和答案相关性并使用人工标注校准。
- 权威文献Lost in the Middle
支持长上下文对证据位置使用不稳定以及需要位置敏感评测的结论。
- 核心概念上下文检索
解释查询、候选召回和上下文选择过程。
- 核心概念检索精确率
用于定位检索噪声和无关候选问题。
- 核心概念检索召回率
用于定位关键证据没有进入候选集合的问题。
- 核心概念忠实度
检查回答是否由给定证据支持而没有添加无依据主张。
- 核心概念文档切片
决定知识库切片窗口大小以保持上下文语义完整度。
- 核心概念嵌入
将切片文档与用户提问转化为稠密向量以计算语义相似度。
- 核心概念重排
对初筛召回的 Top-K 知识片段进行高精度重排序以剔除干扰。
- 核心概念向量数据库
存储文档嵌入向量并提供毫秒级高并发最近邻检索支持。
Project directory
六个 Gate,共同形成一份项目档案
这是固定顺序的项目阶段目录,不代表个人进度,也不会保存选择。
- 01是否使用 AI判断 AI 边界已核验
这个场景需要生成式回答,还是搜索与固定话术已经足够?
- 02业务价值与数据条件建立价值与数据条件已核验
怎样证明解决的是找到并使用正确知识,而不是只让回答更像人?
- 03任务拆解与方案选择拆解检索与回答工作流已核验
如何区分知识未入索引、召回失败、重排丢证据和生成未遵循证据?
- 04人机协作与失败恢复设计坐席控制与失败恢复已核验
坐席怎样看见证据、识别不确定性、纠正回答并完成升级?
- 05评测、成本与上线治理定义评测、成本与上线护栏已核验
怎样同时评测检索、回答、引用、拒答、延迟和人工负担?
- 06完整项目与持续迭代治理发布与持续更新已核验
什么时候能扩大自动化,知识更新或质量回退时如何停止?