Gate 03 / 06
  1. G01
  2. G02
  3. G03
  4. G04
  5. G05
  6. G06
任务拆解与方案选择
返回项目档案
任务拆解与方案选择Gate 03 of 06 · 决策推演

拆解检索与回答工作流

PM 核心决策题

如何区分知识未入索引、召回失败、重排丢证据和生成未遵循证据?

项目材料逐步形成各关决策沉淀为 PRD 章节
  1. 01AI 适用性与不可自动化边界卡
  2. 02客服知识机会评估表
  3. 03RAG 诊断与方案选择表
  4. 04坐席权限、升级与恢复图
  5. 05RAG 评测、成本与上线护栏表
  6. 06完整客服知识产品评审档案
Decision BriefGate 03 决策工作台

如何区分知识未入索引、召回失败、重排丢证据和生成未遵循证据?

业务场景背景与约束:

这是一个教学案例。某数字产品客服团队维护帮助中心、产品政策、故障处置手册和内部操作说明,希望为坐席提供可回到当前有效原文的回答草稿。

📋

当前已知事实与数据

  • 事实E3

    RAG 评测研究分别观察上下文相关性、答案忠实度和答案相关性,而不是只给最终回答一个总分。

    外部来源支持
  • 事实E3

    长上下文模型对相关信息位置的使用可能不稳定,因此候选重排和位置切片需要单独测试。

    外部来源支持
⚠️

不能假装已知 (盲区与待核验假设)

  • 未知项E0

    真实语料适合的切分、关键词与语义检索组合、候选数量、重排和上下文长度尚未比较。

    尚无外部证据

Compare Paths

比较三条决策路径

展开任一路径查看立项依据、成立条件、主要风险与决策影响天平;可作为 PM 采纳方案并留存印记。

推荐路径有条件成立高风险方案
A可观察的分步 RAG 流程
推荐路径展开取舍 ↓收起取舍 ↑
推荐路径
PM 方案立项理由

分步契约能定位知识发布、检索、重排、生成和引用中的具体失败,并支持局部回退。

⚖️

成立条件

⚠️

主要风险

  • 编排、日志和评测成本增加
🔄

后续影响

  • 可以针对失败步骤改进而不是反复调 Prompt
  • 可以替换单个组件而不重建全部流程
⚡ 决策影响天平 (Impact Meter)工程复杂度与业务代价联动预估
开发周期可控迭代 (2-3周)
推理成本可控常规
确定准确度96% (防幻觉严格基准)
人工兜底率35% (抽样或异常接管)
代价警示

平衡点:可以针对失败步骤改进而不是反复调 Prompt

本关材料变化

在 RAG 诊断表中固定知识发布、检索、重排、生成、引用和拒答的输入输出。

B简化检索后生成草稿
有条件成立展开取舍 ↓收起取舍 ↑
有条件成立
PM 方案立项理由

在小型、单一来源、低风险知识集中可作为对照基线,但仍需权限和引用校验。

⚖️

成立条件

⚠️

主要风险

  • 无法充分诊断重排和充分性问题
🔄

后续影响

  • 原型路径较短但扩展能力有限
⚡ 决策影响天平 (Impact Meter)工程复杂度与业务代价联动预估
开发周期中等 (3-4周)
推理成本可控常规
确定准确度88% (常规业务可用)
人工兜底率35% (抽样或异常接管)
代价警示

权衡前提:依赖于前置成立条件(知识来源单一且版本冲突很少),适用阶段性过渡。

本关材料变化

在 RAG 诊断表中标记简化流程的适用范围和必须保留的控制。

C只看最终回答调试
风险较高展开取舍 ↓收起取舍 ↑
风险较高
PM 方案立项理由

最终错误可能来自文档、索引、查询、召回、重排或生成,只看成文无法可靠归因。

⚖️

成立条件

⚠️

主要风险

  • 团队反复调整模型却忽略检索失败
  • 局部质量回退无法被发现
🔄

后续影响

  • 当前方案不进入生产评测设计
⚡ 决策影响天平 (Impact Meter)工程复杂度与业务代价联动预估
开发周期中等 (3-4周)
推理成本波动隐患较大
确定准确度76% (长尾显著失真风险)
人工兜底率55% (故障易引发投诉挤兑)
代价警示

高代价警告:团队反复调整模型却忽略检索失败

本关材料变化

在 RAG 诊断表中记录各步骤必须暴露的观测信号和固定反例。

默认展开推荐路径

Artifact delta

本关如何改变项目材料

新增材料

RAG 诊断与方案选择表

固定知识发布、检索、重排、充分性、生成、引用和拒答步骤及各自输入输出与终止条件。

失败与恢复

  • 新知识未及时入索引
    信号
    已发布有效内容持续无法召回或下架内容仍然返回
    影响
    回答遗漏最新政策或继续使用已经失效的知识
    恢复
    检查发布队列和缓存失效,标记知识不可用并回退人工流程
    责任
    知识负责人和工程
  • 关键证据召回失败
    信号
    有效来源存在但未进入候选集合
    影响
    系统可能错误拒答或在缺少关键条件时生成答案
    恢复
    保持无答案状态并升级,修复查询、切分或检索后回放固定样本
    责任
    检索和评测负责人
  • 重排截断关键证据
    信号
    相关来源已召回却未进入最终上下文
    影响
    答案遗漏关键限制、例外或适用条件
    恢复
    调整候选与重排策略,运行证据位置和风险切片回归
    责任
    检索和评测负责人
  • 模型或重排服务超时
    信号
    草稿延迟、失败率或重试量突然升高
    影响
    坐席等待增加且重复调用推高成本
    恢复
    达到上限后停止重试,降级到搜索与人工起草并记录失败
    责任
    工程

指标与真实基线

  • quality · increase风险切片检索召回

    在高风险、无答案、冲突和常见主题切片中,必要证据进入候选集合的比例。

    阈值:待真实基线
  • quality · increase检索精确率

    返回候选中与当前问题、客户条件和有效知识范围相关的证据所占比例。

    阈值:待真实基线
  • quality · increase引用支持率

    回答关键主张中,其引用真实存在、版本有效且原文确实支持该主张的比例。

    阈值:待真实基线
  • operation · decreaseP95 草稿延迟

    从提交已授权问题到返回可供坐席复核草稿的第九十五百分位端到端时间。

    阈值:待真实基线

按需知识支持

PRD 随阶段生成中:当前处于 Gate 03。你可以随时预览或导出当前已沉淀的立项 PRD(未做选择的关卡自动按推荐基准填充)。

Project directory

六个 Gate,共同形成一份项目档案

这是固定顺序的项目阶段目录,不代表个人进度,也不会保存选择。

  1. 01
    是否使用 AI判断 AI 边界

    这个场景需要生成式回答,还是搜索与固定话术已经足够?

    已核验
  2. 02
    业务价值与数据条件建立价值与数据条件

    怎样证明解决的是找到并使用正确知识,而不是只让回答更像人?

    已核验
  3. 03
    任务拆解与方案选择拆解检索与回答工作流

    如何区分知识未入索引、召回失败、重排丢证据和生成未遵循证据?

    已核验
  4. 04
    人机协作与失败恢复设计坐席控制与失败恢复

    坐席怎样看见证据、识别不确定性、纠正回答并完成升级?

    已核验
  5. 05
    评测、成本与上线治理定义评测、成本与上线护栏

    怎样同时评测检索、回答、引用、拒答、延迟和人工负担?

    已核验
  6. 06
    完整项目与持续迭代治理发布与持续更新

    什么时候能扩大自动化,知识更新或质量回退时如何停止?

    已核验
Level 2/3 Capstone · 交付成果沉淀

《客服知识库与回答辅助》AI 产品立项 PRD

官方推荐基准

包含立项背景、六阶段决策推演、成立条件核验、指标基线与故障应急 Runbook。

MARKDOWN PREVIEW6 关推演 · 12 项指标 · 12 个故障应急
# 【AI 产品立项 PRD / 方案评审材料】客服知识库与回答辅助

> **生成时间**:2026-09-30  
> **项目级别**:核心聚焦案例 · **业务领域**:RAG 与客服产品  
> **方案状态**:团队推荐基准方案(未微调,可在关卡中二次定制)  
> **面向对象**:零基础或初级 AI 产品经理、需要评审客服知识助手的产品与业务人员  

---

## 一、 项目背景与立项核心目标 (Context & Objective)

### 1.1 业务背景
这是一个教学案例。某数字产品客服团队维护帮助中心、产品政策、故障处置手册和内部操作说明,希望为坐席提供可回到当前有效原文的回答草稿。

### 1.2 核心目标
在知识版本、访问权限和原文证据可核验的前提下,提高坐席形成可发送回答的效率,并在证据不足或风险较高时可靠拒答和升级。

### 1.3 现有业务流程与痛点
1. 接收客户问题并识别客户、产品与问题类型
2. 搜索帮助中心、政策和内部处置手册
3. 检查文档版本、生效时间和适用条件
4. 起草回答并补充相关原文
5. 将高风险、无答案或冲突问题升级
6. 由坐席确认发送并记录处理结果

### 1.4 客观事实与基线假设
- **[ASSUMPTION · E1]** 当前搜索、核对、起草和升级流程只用于建立教学起点,不代表真实客服团队采用同样工具或存在效率问题。
- **[UNKNOWN · E0]** 实际问题分布、无答案比例、查找时间、错误成本、人工容量、延迟和单位成本均需要真实组织数据验证。

### 1.5 刚性边界约束
- **[FACT · E2]** AI-Native 不为教学完整性虚构检索、回答、引用、成本、延迟或上线阈值。
- **[RECOMMENDATION · E1]** 首版只辅助内部坐席,不自动对客回复,也不执行退款、改价、封禁、删除或其他外部动作。
- **[RECOMMENDATION · E3]** 权限必须由检索和业务系统执行,检索内容作为不可信数据处理,不能取得系统指令或工具权限。

---

## 二、 六阶段方案选型与决策推演 (Architecture & Gate Decisions)

本章节记录从「边界判断」到「上线交付」全链路 6 大关键关卡的方案抉择、成立条件与风险应对:

### Gate 01:判断 AI 边界
**核心问题**:这个场景需要生成式回答,还是搜索与固定话术已经足够?

- **采纳路径**:**治理优先的检索辅助** (推荐最佳实践) `默认基准`
- **选型依据 (Rationale)**:先固定知识、权限和证据边界,再把生成限制为可核验草稿,能够分开控制风险和价值。

**前置成立条件清单 (Conditions Checklist)**:
  - [ ] 文档具有所有者、版本、生效时间和权限字段
  - [ ] 回答关键主张可以定位到有效原文

**主要风险与防范 (Risks)**:
  - ⚠️ 知识治理会增加前期投入
  - ⚠️ 受限生成可能覆盖不了全部问题

**落地后续影响 (Consequences)**:
  - 📌 可逐步判断哪些步骤真正需要模型
  - 📌 无证据问题可以安全转交人工

- **本关交付材料沉淀 (Artifact Delta)**:在 AI 适用性卡中固定知识治理、搜索、生成和人工确认的责任边界。

### Gate 02:建立价值与数据条件
**核心问题**:怎样证明解决的是找到并使用正确知识,而不是只让回答更像人?

- **采纳路径**:**先建立有证据任务基线** (推荐最佳实践) `默认基准`
- **选型依据 (Rationale)**:只有同时记录当前任务结果、证据和错误,才能判断新系统是否改善了值得解决的问题。

**前置成立条件清单 (Conditions Checklist)**:
  - [ ] 明确坐席、知识负责人和升级责任人
  - [ ] 获取脱敏问题样本和有效知识版本

**主要风险与防范 (Risks)**:
  - ⚠️ 前期盘点会推迟演示

**落地后续影响 (Consequences)**:
  - 📌 后续指标可以映射到真实客服任务
  - 📌 无答案和高风险切片会在开发前暴露

- **本关交付材料沉淀 (Artifact Delta)**:在机会评估表中加入任务结果、知识条件、权限、错误成本和升级链路。

### Gate 03:拆解检索与回答工作流
**核心问题**:如何区分知识未入索引、召回失败、重排丢证据和生成未遵循证据?

- **采纳路径**:**可观察的分步 RAG 流程** (推荐最佳实践) `默认基准`
- **选型依据 (Rationale)**:分步契约能定位知识发布、检索、重排、生成和引用中的具体失败,并支持局部回退。

**前置成立条件清单 (Conditions Checklist)**:
  - [ ] 每一步记录输入、输出、版本、状态和失败原因
  - [ ] 无证据和冲突状态可以在生成前停止

**主要风险与防范 (Risks)**:
  - ⚠️ 编排、日志和评测成本增加

**落地后续影响 (Consequences)**:
  - 📌 可以针对失败步骤改进而不是反复调 Prompt
  - 📌 可以替换单个组件而不重建全部流程

- **本关交付材料沉淀 (Artifact Delta)**:在 RAG 诊断表中固定知识发布、检索、重排、生成、引用和拒答的输入输出。

### Gate 04:设计坐席控制与失败恢复
**核心问题**:坐席怎样看见证据、识别不确定性、纠正回答并完成升级?

- **采纳路径**:**证据优先的坐席控制** (推荐最佳实践) `默认基准`
- **选型依据 (Rationale)**:坐席同时看到回答、原文、版本、风险原因和可执行动作,才可能有效判断是否发送或升级。

**前置成立条件清单 (Conditions Checklist)**:
  - [ ] 关键主张和对应证据可以逐项核对
  - [ ] 坐席拥有修改、驳回、转交和停止权限

**主要风险与防范 (Risks)**:
  - ⚠️ 信息过多可能增加复核负担
  - ⚠️ 坐席仍可能因自动化偏差而盲信

**落地后续影响 (Consequences)**:
  - 📌 错误可以在外发前被发现和纠正
  - 📌 纠正原因可进入评测与知识维护

- **本关交付材料沉淀 (Artifact Delta)**:在责任恢复图中加入证据检查、拒答原因、升级上下文、超时和撤销路径。

### Gate 05:定义评测、成本与上线护栏
**核心问题**:怎样同时评测检索、回答、引用、拒答、延迟和人工负担?

- **采纳路径**:**分层评测与完整成本** (推荐最佳实践) `默认基准`
- **选型依据 (Rationale)**:分层指标能定位失败来源,单位已确认回答成本则把模型、运行、失败和人工成本放回真实任务。

**前置成立条件清单 (Conditions Checklist)**:
  - [ ] 查询集包含常见、无答案、冲突、高风险和权限切片
  - [ ] 每个候选版本在同一固定集和真实人工样本上比较

**主要风险与防范 (Risks)**:
  - ⚠️ 数据标注和持续维护成本较高

**落地后续影响 (Consequences)**:
  - 📌 上线与回滚可以基于可复核证据
  - 📌 降本不会通过减少覆盖或过度拒答伪造

- **本关交付材料沉淀 (Artifact Delta)**:在评测护栏表中加入分步指标、风险切片、单位成功成本和回滚触发项。

### Gate 06:治理发布与持续更新
**核心问题**:什么时候能扩大自动化,知识更新或质量回退时如何停止?

- **采纳路径**:**证据门禁的分级发布** (推荐最佳实践) `默认基准`
- **选型依据 (Rationale)**:每一级只增加有限权限,并保留上一稳定流程,能够在获得真实证据前限制错误影响范围。

**前置成立条件清单 (Conditions Checklist)**:
  - [ ] 每级明确范围、责任人、通过条件和回滚动作
  - [ ] 知识更新和固定查询集在发布前通过回归

**主要风险与防范 (Risks)**:
  - ⚠️ 发布节奏慢且需要持续运营投入

**落地后续影响 (Consequences)**:
  - 📌 质量回退或知识异常可以局部停止
  - 📌 自动化范围与证据强度保持一致

- **本关交付材料沉淀 (Artifact Delta)**:在完整评审档案中加入四级权限、晋级证据、持续监控、事件响应和回滚表。

---

## 三、 项目材料交付清单 (Deliverable Artifacts)

项目随六关推演逐步形成的 6 份核心产品标准件:

### 3.1 AI 适用性与不可自动化边界卡 (`ai-applicability`)
区分知识治理、权限搜索、生成草稿与坐席最终发送,记录不使用生成和禁止自动化的范围。

### 3.2 客服知识机会评估表 (`opportunity-assessment`)
记录目标角色、当前任务、知识条件、权限、真实基线、错误成本、无答案和升级链路。

### 3.3 RAG 诊断与方案选择表 (`workflow-selection`)
固定知识发布、检索、重排、充分性、生成、引用和拒答步骤及各自输入输出与终止条件。

### 3.4 坐席权限、升级与恢复图 (`responsibility-recovery`)
标明证据检查、修改、驳回、转交、超时、事件响应和最终发送的人员与系统权限。

### 3.5 RAG 评测、成本与上线护栏表 (`evaluation-guardrails`)
组合固定查询集、风险切片、分步质量、人工负担、单位成功成本、延迟和回滚条件。

### 3.6 完整客服知识产品评审档案 (`complete-review`)
汇总六关决策、四级发布权限、知识更新、持续监控、事件响应、晋级和回滚证据。

---

## 四、 核心评估指标与真实基线 (Metrics & Guardrails)

任何 AI 产品上线必须定义明确的评估指标与基线阈值:

| 类别 | 指标名称 | 期望方向 | 阈值状态 / 目标值 | 详细口径与定义 |
| :--- | :--- | :--- | :--- | :--- |
| business | **有证据回答任务完成率** | increase | 待真实基线 | 有充分有效证据且经授权坐席确认完成的回答任务,占进入目标范围问题的比例。 |
| business | **有效证据查找时间** | decrease | 待真实基线 | 从坐席开始查找,到定位当前有效且适用于该问题的原文证据所需时间。 |
| quality | **风险切片检索召回** | increase | 待真实基线 | 在高风险、无答案、冲突和常见主题切片中,必要证据进入候选集合的比例。 |
| quality | **检索精确率** | increase | 待真实基线 | 返回候选中与当前问题、客户条件和有效知识范围相关的证据所占比例。 |
| quality | **引用支持率** | increase | 待真实基线 | 回答关键主张中,其引用真实存在、版本有效且原文确实支持该主张的比例。 |
| quality | **合理拒答率** | range | 待真实基线 | 在无证据、知识冲突、权限不足或高风险问题上正确拒答或升级,同时不过度拒绝可回答问题的表现。 |
| operation | **知识新鲜度延迟** | decrease | 待真实基线 | 有效知识发布或下架后,到检索系统正确反映该版本状态之间的端到端时间。 |
| operation | **P95 草稿延迟** | decrease | 待真实基线 | 从提交已授权问题到返回可供坐席复核草稿的第九十五百分位端到端时间。 |
| human | **坐席复核时间** | decrease | 待真实基线 | 坐席核对证据、修改、驳回或确认一条回答草稿所投入的人工时间。 |
| human | **升级队列时长** | decrease | 待真实基线 | 无答案、高风险或冲突问题从进入人工升级队列到由责任人接手的等待时间。 |
| cost | **单位已确认回答成本** | decrease | 待真实基线 | 知识治理、索引、检索、生成、失败运行和人工复核总成本除以有充分证据且经坐席确认的回答数。 |
| operation | **权限违规输出数** | guardrail | 任何权限违规均阻止晋级并触发事件响应 | 检索或回答向当前坐席、客户或租户暴露无权访问知识的事件数量。 |

---

## 五、 故障模式与应急恢复手册 (Failure Modes & Recovery Runbook)

AI 具备概率性与不确定性,必须在立项时即明确降级兜底方案:

| 故障模式 | 异常监控信号 (Signal) | 业务负面影响 (Impact) | 恢复方案与降级动作 (Recovery) | 主责人 |
| :--- | :--- | :--- | :--- | :--- |
| **过期文档仍可检索** | 回答引用旧版本、已下架政策或错误生效日期 | 坐席可能依据无效规则对客户作出错误说明或承诺 | 停止相关来源、重建索引、回放受影响查询并退回人工搜索 | 知识负责人和工程 |
| **新知识未及时入索引** | 已发布有效内容持续无法召回或下架内容仍然返回 | 回答遗漏最新政策或继续使用已经失效的知识 | 检查发布队列和缓存失效,标记知识不可用并回退人工流程 | 知识负责人和工程 |
| **权限过滤失败** | 返回其他租户、客户或未授权内部资料 | 造成敏感信息暴露、合规风险和客户信任损害 | 阻断输出、停用相关索引、保全日志并启动安全事件响应 | 安全和工程 |
| **关键证据召回失败** | 有效来源存在但未进入候选集合 | 系统可能错误拒答或在缺少关键条件时生成答案 | 保持无答案状态并升级,修复查询、切分或检索后回放固定样本 | 检索和评测负责人 |
| **重排截断关键证据** | 相关来源已召回却未进入最终上下文 | 答案遗漏关键限制、例外或适用条件 | 调整候选与重排策略,运行证据位置和风险切片回归 | 检索和评测负责人 |
| **引用不支持回答主张** | 引用可打开但原文与回答结论不一致 | 坐席可能因看见引用而错误信任无依据回答 | 阻止发送,删除或重写不受支持主张,并把失败加入固定集 | 坐席和评测负责人 |
| **有效知识来源冲突** | 多份当前有效文档对同一条件给出不同规则 | 系统可能任意选边并形成错误对客承诺 | 不自动裁决,展示冲突并转交知识负责人确认唯一有效规则 | 知识负责人 |
| **无答案时仍然作答** | 检索为空或证据不足时仍给出确定回答 | 模型编造可能直接影响客户处理和业务责任 | 强制拒答并进入人工队列,检查充分性和生成护栏 | 产品和客服主管 |
| **间接提示注入** | 检索文档试图改变指令、请求敏感数据或调用工具 | 模型行为可能被外部内容操纵并导致越权或错误输出 | 将文档按不可信数据隔离,阻止动作并启动安全审查和攻击回放 | 安全和工程 |
| **人工升级队列过载** | 队龄、积压、超时和未处理高风险问题持续上升 | 形式上的人在回路无法在业务时限内提供真实保护 | 收紧自动化范围、按风险排序并调整责任人与容量 | 客服主管 |
| **模型或重排服务超时** | 草稿延迟、失败率或重试量突然升高 | 坐席等待增加且重复调用推高成本 | 达到上限后停止重试,降级到搜索与人工起草并记录失败 | 工程 |
| **版本升级质量回退** | 固定集、风险切片或线上纠正指标相对稳定版本下降 | 质量可能在没有明显系统错误时静默恶化 | 冻结候选版本并回滚模型、提示、索引或重排到上一稳定组合 | 产品、工程和评测负责人 |

---

## 六、 规范参考与支持资料 (References)

- **[ROUTE] RAG 从零到理解与应用**:提供从知识库、切分、检索、重排到评测的顺序阅读支持。
- **[TERM] 检索增强生成**:解释检索与生成的基本结构、适用条件和评测边界。
- **[TERM] 知识库**:解释知识集合、维护、版本和访问边界。
- **[TERM] 上下文检索**:解释查询、候选召回和上下文选择过程。
- **[TERM] 引用生成**:区分引用存在、位置正确和引用真正支持主张。
- **[TERM] 检索精确率**:用于定位检索噪声和无关候选问题。
- **[TERM] 检索召回率**:用于定位关键证据没有进入候选集合的问题。
- **[TERM] 忠实度**:检查回答是否由给定证据支持而没有添加无依据主张。
- **[TERM] 离线评测**:建立版本化固定查询集、保留集和错误切片。
- **[TERM] 评测**:解释质量标准、数据集、指标和发布决策的关系。
- **[TERM] 人工升级**:明确拒答、升级、责任、必要上下文和接管权限。
- **[TERM] 提示注入**:解释外部内容改变模型行为和越权的安全风险。
- **[TERM] 人机协作**:解释人工判断和系统自动化如何按风险分工。
- **[TERM] 问题方案匹配**:防止用流畅输出替代真实问题、任务和价值证据。
- **[TERM] AI 产品**:把模型能力放回用户任务、控制、失败和运营系统中评审。
- **[TERM] 延迟**:解释端到端等待、分位数和用户任务时限。
- **[TERM] 金丝雀发布**:解释限制影响范围并逐步扩大版本或流量的发布方法。
- **[TERM] 回滚**:解释质量回退或事件发生时恢复上一稳定版本。
- **[TERM] 可观测性**:解释通过日志、指标和追踪定位运行与质量问题。
- **[TERM] 文档切片**:决定知识库切片窗口大小以保持上下文语义完整度。
- **[TERM] 嵌入**:将切片文档与用户提问转化为稠密向量以计算语义相似度。
- **[TERM] 重排**:对初筛召回的 Top-K 知识片段进行高精度重排序以剔除干扰。
- **[TERM] 向量数据库**:存储文档嵌入向量并提供毫秒级高并发最近邻检索支持。
- **[TERM] AI 护栏**:在对客生成回答前后设立输入脱敏与违规内容拦截护栏。
- **[TERM] 依据一致性**:严格检验回答中的主张是否完全由召回片段支撑,无额外虚构。
- **[TERM] 幻觉**:识别并拦截客服场景下编造不存在政策或优惠的严重事故。
- **[TERM] 服务等级目标**:为内部客服坐席辅助系统制定可用性与响应时延指标契约。
- **[SOURCE] NIST AI 600-1 Generative AI Profile**:支持生成内容可能错误、引用可能虚假以及风险需按使用情境和生命周期治理。
- **[SOURCE] Retrieval-Augmented Generation for Knowledge-Intensive NLP Tasks**:支持使用显式非参数知识解决知识更新和来源追踪问题的研究动机。
- **[SOURCE] Lost in the Middle**:支持长上下文对证据位置使用不稳定以及需要位置敏感评测的结论。
- **[SOURCE] ARES RAG Evaluation Framework**:支持分别评估上下文相关性、答案忠实度和答案相关性并使用人工标注校准。
- **[SOURCE] OWASP LLM01 2025 Prompt Injection**:支持 RAG 不能完全缓解提示注入和检索文档可能成为间接注入来源。

---
*文档生成自 AI-Native 实战判断系统 · 面向生产上线的可复核产品方案*