Level 2 continuous case · Level 3 capstone

每日用户反馈分析与产品改进

在来源可追溯、错误可发现、人工可接管和成本可计算的前提下,缩短从反馈产生到可复核问题证据出现的时间。

Business context

这是一个可复核的教学案例

这是一个教学案例。某数字产品团队从客服工单、应用商店评论和站内反馈接收中文用户反馈,产品团队希望形成可复核的问题证据和行动候选。

案例中的事实、假设、建议和未知项分别标注;生产页面如实展示 YAML 生命周期。

当前流程假设

  1. 从多个来源导出反馈
  2. 人工合并表格并处理重复项
  3. 人工打标签和统计高频问题
  4. 阅读代表反馈并编写简报
  5. 产品经理复核并安排后续动作

Project directory

六个 Gate,共同形成一份项目档案

这是固定顺序的项目阶段目录,不代表个人进度,也不会保存选择。

  1. 01
    是否使用 AI判断 AI 边界

    哪些步骤真的需要概率语义能力?

    已核验
  2. 02
    业务价值与数据条件建立价值与数据条件

    怎样证明这不是一个更漂亮的摘要 Demo?

    已核验
  3. 03
    任务拆解与方案选择拆解并选择工作流

    如何让每一步可评估、可替换、可停止?

    已核验
  4. 04
    人机协作与失败恢复设计控制与恢复

    失败出现时谁能看见、纠正、接管和恢复?

    已核验
  5. 05
    评测、成本与上线治理定义评测、成本与护栏

    怎样证明质量、时效和成本同时可接受?

    已核验
  6. 06
    完整项目与持续迭代治理上线与持续迭代

    什么时候扩大范围,什么时候停止或回滚?

    已核验

Level 3 · review archive

完整项目档案概览

档案展示标准推荐路径,不宣称它是唯一行业做法。所有阈值仍需由真实组织基线、错误成本与运行证据确定。

  1. 01

    判断 AI 边界

    规则负责确定性任务,只在语义分类、近似重复和主题发现步骤引入受限模型。

    哪些步骤真的需要概率语义能力?

    进入本关查看证据与取舍

    形成材料

    AI 适用性判断卡

    说明哪些任务使用规则、模型或人工,以及为什么当前不默认使用自主 Agent。

  2. 02

    建立价值与数据条件

    先记录现有处理、覆盖、返工、问题发现和行动链路,再定义可观察目标和数据许可。

    怎样证明这不是一个更漂亮的摘要 Demo?

    进入本关查看证据与取舍

    形成材料

    场景机会评估表

    记录使用者、当前流程、业务结果、数据条件、基线和仍待验证的关键问题。

  3. 03

    拆解并选择工作流

    采用固定工作流和结构化中间结果,分别处理接入、校验、去重、分类、聚类、摘要与人工复核。

    如何让每一步可评估、可替换、可停止?

    进入本关查看证据与取舍

    形成材料

    任务流程与方案选择表

    展示每个步骤的输入、输出、状态、机制、权限、异常和终止条件。

  4. 04

    设计控制与恢复

    低确定性、高影响、冲突和无证据结果进入人工队列,原文与每一步结果始终保留。

    失败出现时谁能看见、纠正、接管和恢复?

    进入本关查看证据与取舍

    形成材料

    人机责任与失败恢复图

    明确错误信号、恢复动作、人工队列、升级上下文、责任人和撤销路径。

  5. 05

    定义评测、成本与护栏

    建立任务级黄金集、错误切片、线上运行指标和单位成功任务成本,具体阈值等待真实基线。

    怎样证明质量、时效和成本同时可接受?

    进入本关查看证据与取舍

    形成材料

    评测、成本与上线护栏表

    汇总任务级评测、错误切片、单位成功任务成本、运行指标和待验证阈值。

  6. 06

    治理上线与持续迭代

    按影子运行、辅助草稿、有限使用和扩大范围四级推进,每一级独立评审并保留回滚路径。

    什么时候扩大范围,什么时候停止或回滚?

    进入本关查看证据与取舍

    形成材料

    完整 AI 产品评审档案

    串联机会、方案、体验、质量、成本、上线分级、监控、回滚和下一轮验证。

完整成果沉淀:将本案例中 6 个阶段的推演决策、成立条件核验与指标基线一键导出为标准的《AI 产品立项 PRD》。

Level 2/3 Capstone · 交付成果沉淀

《每日用户反馈分析与产品改进》AI 产品立项 PRD

官方推荐基准

包含立项背景、六阶段决策推演、成立条件核验、指标基线与故障应急 Runbook。

MARKDOWN PREVIEW6 关推演 · 11 项指标 · 12 个故障应急
# 【AI 产品立项 PRD / 方案评审材料】每日用户反馈分析与产品改进

> **生成时间**:2026-09-30  
> **项目级别**:顶石综合案例 · **业务领域**:AI 产品运营与用户洞察  
> **方案状态**:团队推荐基准方案(未微调,可在关卡中二次定制)  
> **面向对象**:零基础或初级 AI 产品经理、需要评审 AI 方案的产品与业务人员  

---

## 一、 项目背景与立项核心目标 (Context & Objective)

### 1.1 业务背景
这是一个教学案例。某数字产品团队从客服工单、应用商店评论和站内反馈接收中文用户反馈,产品团队希望形成可复核的问题证据和行动候选。

### 1.2 核心目标
在来源可追溯、错误可发现、人工可接管和成本可计算的前提下,缩短从反馈产生到可复核问题证据出现的时间。

### 1.3 现有业务流程与痛点
1. 从多个来源导出反馈
2. 人工合并表格并处理重复项
3. 人工打标签和统计高频问题
4. 阅读代表反馈并编写简报
5. 产品经理复核并安排后续动作

### 1.4 客观事实与基线假设
- **[ASSUMPTION · E1]** 当前人工流程用于建立教学起点,不代表真实组织一定使用表格或存在效率问题。
- **[UNKNOWN · E0]** 实际反馈量、处理时间、覆盖、返工、成本和行动结果均需要真实组织数据验证。

### 1.5 刚性边界约束
- **[FACT · E2]** AI-Native 不为教学完整性虚构业务量、准确率、成本、收益或上线阈值。
- **[RECOMMENDATION · E1]** 模型不得拥有最终发布、产品优先级、外发回复或问题关闭权限。
- **[RECOMMENDATION · E3]** 重要主题、疑似问题和行动草稿必须能够回到原始反馈证据和处理步骤。

---

## 二、 六阶段方案选型与决策推演 (Architecture & Gate Decisions)

本章节记录从「边界判断」到「上线交付」全链路 6 大关键关卡的方案抉择、成立条件与风险应对:

### Gate 01:判断 AI 边界
**核心问题**:哪些步骤真的需要概率语义能力?

- **采纳路径**:**规则优先的受限工作流** (推荐最佳实践) `默认基准`
- **选型依据 (Rationale)**:把确定性步骤和概率步骤分开,才能分别控制质量、成本、权限与恢复。

**前置成立条件清单 (Conditions Checklist)**:
  - [ ] 每一步都有固定输入输出和终止条件
  - [ ] 语义步骤可以单独评测并回退

**主要风险与防范 (Risks)**:
  - ⚠️ 规则和标签体系需要持续维护

**落地后续影响 (Consequences)**:
  - 📌 可以定位具体失败步骤
  - 📌 不必要的模型调用被删除

- **本关交付材料沉淀 (Artifact Delta)**:在 AI 适用性判断卡中标出规则、模型和人工的初步边界。

### Gate 02:建立价值与数据条件
**核心问题**:怎样证明这不是一个更漂亮的摘要 Demo?

- **采纳路径**:**先建立基线和使用链路** (推荐最佳实践) `默认基准`
- **选型依据 (Rationale)**:没有当前流程和后续行动证据,就无法判断自动化是否解决了值得解决的问题。

**前置成立条件清单 (Conditions Checklist)**:
  - [ ] 明确输出使用者和责任人
  - [ ] 获取合规的历史样本与当前流程记录

**主要风险与防范 (Risks)**:
  - ⚠️ 前期研究会推迟原型展示

**落地后续影响 (Consequences)**:
  - 📌 后续指标可以映射到真实任务
  - 📌 数据限制会在开发前暴露

- **本关交付材料沉淀 (Artifact Delta)**:在机会评估表中加入角色、当前流程、基线、数据权限和业务结果字段。

### Gate 03:拆解并选择工作流
**核心问题**:如何让每一步可评估、可替换、可停止?

- **采纳路径**:**可观察的固定工作流** (推荐最佳实践) `默认基准`
- **选型依据 (Rationale)**:固定步骤允许对失败、版本、成本和恢复进行独立治理,并保留必要语义能力。

**前置成立条件清单 (Conditions Checklist)**:
  - [ ] 中间结果使用结构化契约
  - [ ] 每一步记录版本、状态和失败原因

**主要风险与防范 (Risks)**:
  - ⚠️ 步骤增多会增加编排和维护成本

**落地后续影响 (Consequences)**:
  - 📌 可以局部替换模型或退回人工流程

- **本关交付材料沉淀 (Artifact Delta)**:在流程选择表中固定步骤、机制、输入、输出、状态、权限和终止条件。

### Gate 04:设计控制与恢复
**核心问题**:失败出现时谁能看见、纠正、接管和恢复?

- **采纳路径**:**基于风险的人工复核** (推荐最佳实践) `默认基准`
- **选型依据 (Rationale)**:把有限人工能力用于高影响、冲突、低确定性和无证据结果,同时保留低风险自动处理。

**前置成立条件清单 (Conditions Checklist)**:
  - [ ] 每个升级携带原文、原因和建议动作
  - [ ] 责任人拥有修改、驳回和停止权限

**主要风险与防范 (Risks)**:
  - ⚠️ 风险规则不当会造成队列过载或漏报

**落地后续影响 (Consequences)**:
  - 📌 自动化范围可以随证据逐步扩大

- **本关交付材料沉淀 (Artifact Delta)**:在责任恢复图中加入人工队列、升级上下文、超时和撤销路径。

### Gate 05:定义评测、成本与护栏
**核心问题**:怎样证明质量、时效和成本同时可接受?

- **采纳路径**:**分步任务评测与单位成本** (推荐最佳实践) `默认基准`
- **选型依据 (Rationale)**:分别评测输入、去重、分类、主题、问题发现和摘要,才能知道优化是否改善真实任务。

**前置成立条件清单 (Conditions Checklist)**:
  - [ ] 黄金集包含常见、边界和高影响少数类
  - [ ] 自动评分与人工判断持续校准

**主要风险与防范 (Risks)**:
  - ⚠️ 建立和维护评测集需要业务人员投入

**落地后续影响 (Consequences)**:
  - 📌 版本比较和上线决定有可复核证据

- **本关交付材料沉淀 (Artifact Delta)**:在评测护栏表中加入分步指标、错误切片、成本公式和待验证阈值。

### Gate 06:治理上线与持续迭代
**核心问题**:什么时候扩大范围,什么时候停止或回滚?

- **采纳路径**:**四级渐进上线** (推荐最佳实践) `默认基准`
- **选型依据 (Rationale)**:先在不影响现行业务的影子模式发现错误,再按证据逐级增加可见性和范围。

**前置成立条件清单 (Conditions Checklist)**:
  - [ ] 每一级有责任人、通过条件和回滚动作
  - [ ] 版本变化重新运行固定评测集

**主要风险与防范 (Risks)**:
  - ⚠️ 推进速度慢于直接上线

**落地后续影响 (Consequences)**:
  - 📌 风险影响被限制在明确范围
  - 📌 可以按来源、类别或版本局部回退

- **本关交付材料沉淀 (Artifact Delta)**:在完整评审档案中串联六份材料、四级上线、监控、停止和复盘责任。

---

## 三、 项目材料交付清单 (Deliverable Artifacts)

项目随六关推演逐步形成的 6 份核心产品标准件:

### 3.1 AI 适用性判断卡 (`ai-applicability`)
说明哪些任务使用规则、模型或人工,以及为什么当前不默认使用自主 Agent。

### 3.2 场景机会评估表 (`opportunity-assessment`)
记录使用者、当前流程、业务结果、数据条件、基线和仍待验证的关键问题。

### 3.3 任务流程与方案选择表 (`workflow-selection`)
展示每个步骤的输入、输出、状态、机制、权限、异常和终止条件。

### 3.4 人机责任与失败恢复图 (`responsibility-recovery`)
明确错误信号、恢复动作、人工队列、升级上下文、责任人和撤销路径。

### 3.5 评测、成本与上线护栏表 (`evaluation-guardrails`)
汇总任务级评测、错误切片、单位成功任务成本、运行指标和待验证阈值。

### 3.6 完整 AI 产品评审档案 (`complete-review`)
串联机会、方案、体验、质量、成本、上线分级、监控、回滚和下一轮验证。

---

## 四、 核心评估指标与真实基线 (Metrics & Guardrails)

任何 AI 产品上线必须定义明确的评估指标与基线阈值:

| 类别 | 指标名称 | 期望方向 | 阈值状态 / 目标值 | 详细口径与定义 |
| :--- | :--- | :--- | :--- | :--- |
| business | **复核反馈覆盖** | increase | 待真实基线 | 被纳入人工可复核分析的授权反馈占全部目标反馈的比例。 |
| business | **确认问题发现周期** | decrease | 待真实基线 | 从反馈产生到问题被授权人员确认并进入行动链路的端到端时间。 |
| quality | **分类 Macro F1** | increase | 待真实基线 | 对每个标签分别计算 F1 后取平均,避免高频类别掩盖少数类别表现。 |
| quality | **高影响问题召回** | increase | 待真实基线 | 黄金集中实际高影响问题被系统候选发现的比例,重点观察假阴性。 |
| quality | **主题证据覆盖** | increase | 待真实基线 | 已发布主题中能够回到充分原始反馈证据的主题比例。 |
| quality | **无依据主张率** | decrease | 待真实基线 | 摘要或行动草稿中无法由关联原始反馈支持的主张比例。 |
| operation | **工作流成功率** | increase | 待真实基线 | 目标批次在证据完整且无需异常补偿的情况下进入人工复核的比例。 |
| operation | **P95 处理延迟** | decrease | 待真实基线 | 从授权记录进入系统到形成可复核候选的第九十五百分位端到端时间。 |
| human | **人工复核时间** | decrease | 待真实基线 | 授权人员检查、修改、驳回和确认系统候选所需的实际处理时间。 |
| human | **复核队列时长** | decrease | 待真实基线 | 等待人工处理的项目从进入队列到获得决定的时间分布。 |
| cost | **单位已批准简报成本** | decrease | 待真实基线 | 接入、模型、失败重试、运行和人工复核总成本除以证据完整的已批准简报数。 |

---

## 五、 故障模式与应急恢复手册 (Failure Modes & Recovery Runbook)

AI 具备概率性与不确定性,必须在立项时即明确降级兜底方案:

| 故障模式 | 异常监控信号 (Signal) | 业务负面影响 (Impact) | 恢复方案与降级动作 (Recovery) | 主责人 |
| :--- | :--- | :--- | :--- | :--- |
| **不必要的模型调用** | 确定性任务仍产生模型请求和可变结果 | 增加延迟、成本和不必要的不确定性 | 改为规则步骤并使用固定样本回归验证 | 产品与工程 |
| **来源接入失败** | 来源批次缺口、错误码或队列持续积压 | 简报覆盖不完整并可能形成错误趋势判断 | 重试或延迟批次,明确标记缺失来源并由工程确认补采 | 工程 |
| **必要字段缺失** | Schema 校验失败或来源字段映射发生变化 | 记录被错配、丢失或错误进入后续分析 | 隔离记录并修复字段映射,不把无效输入发送给模型 | 数据责任人 |
| **敏感数据暴露** | 脱敏检测、权限审查或人工复核发现不应处理的数据 | 形成隐私、权限和组织风险 | 停止处理并隔离相关批次,按数据事件流程处置 | 数据与安全责任人 |
| **重复合并错误** | 人工驳回重复候选或频次出现异常变化 | 原始证据被错误合并并造成主题频次失真 | 保留原文并撤销候选关系,重新校准相似度规则 | 产品运营 |
| **标签体系漂移** | 标签分布异常、定义变化或固定回归集下降 | 跨批次趋势不可比较并造成错误路由 | 回退标签版本并进入重标队列,由标签责任人批准新版 | 标签责任人 |
| **高影响问题漏报** | 后续人工、客服或线上事件发现系统遗漏的重要问题 | 重大问题发现和处理被延迟 | 增加规则信号和高影响切片样本,复盘后重新评测 | 产品与工程 |
| **无依据摘要或建议** | 结论无法回到原始反馈或与证据冲突 | 错误信息进入产品决策和行动链路 | 阻止发布并重新生成或由人工编写,保留失败样本 | 产品经理 |
| **模型超时或不可用** | 超时、错误率或重试量超过已批准运行边界 | 批次延迟并增加失败与重试成本 | 跳过非必要步骤或回到人工流程,工程决定恢复条件 | 工程 |
| **版本质量回归** | 提示、模型或配置变化后固定评测集下降 | 质量无声漂移且历史结果不可比较 | 冻结或回退版本,阻止晋级并补充失败样本 | 产品与工程 |
| **人工复核过载** | 队列时长和未处理项目持续增长 | 人在回路失去实际响应能力并形成业务死路 | 收紧自动化范围并按风险排序,由业务责任人调整容量 | 业务责任人 |
| **纠正反馈被错误解释** | 自动指标改善但人工复盘和真实任务结果变差 | 错误反馈进入评测集并放大系统偏差 | 区分修改、驳回、偏好和真实错误后重新校准标签 | 评测责任人 |

---

## 六、 规范参考与支持资料 (References)

- **[TERM] AI 能力边界**:用于判断确定性系统与概率模型的适用范围。
- **[TERM] 工作流自动化**:用于理解固定步骤、状态、异常和恢复的编排方式。
- **[TERM] 问题方案匹配**:用于区分技术演示效果与值得解决的业务问题。
- **[TERM] 任务拆解**:用于拆分目标、步骤、输入输出和终止条件。
- **[TERM] 结构化输出**:用于约束工作流中间结果并支持自动校验。
- **[TERM] 人在回路**:用于定义高影响节点的人工决定和权限。
- **[TERM] 人工升级处理**:用于设计异常发生后的上下文交接和责任路径。
- **[TERM] 错误恢复**:用于设计重试、撤销、降级和继续任务的路径。
- **[TERM] 黄金数据集**:用于管理经过业务定义和版本化的评测样本。
- **[TERM] 离线评估**:用于在版本发布前比较固定任务和错误切片。
- **[TERM] 在线评估**:用于观察真实使用分布、影响和持续变化。
- **[TERM] 成本优化**:用于定义单位成功任务成本和调用优化顺序。
- **[TERM] 可观测性**:用于关联输入、步骤、版本、失败和最终结果。
- **[TERM] 回滚**:用于定义版本、来源或类别级别的恢复动作。
- **[TERM] AI 风险管理**:用于持续识别、测量、响应和复核部署风险。
- **[TERM] 分类任务**:将海量反馈自动归入功能缺陷、体验抱怨或新需求等离散类别。
- **[TERM] 用户研究**:从原始用户言论中提炼用户真实使用心智与未满足痛点。
- **[TERM] 产品数据分析**:将定性反馈聚合统计转化为定量问题分布与频次趋势。
- **[TERM] 提示词模板**:固化主题提取、情感倾向与高价值证据抽取的提示词结构。
- **[TERM] 提示链**:先提取原子问题点,再聚合归类生成问题集群的多步调用链。
- **[TERM] 少样本提示**:提供模糊与口语化中文表达的标准标注示例以提高分类稳定性。
- **[TERM] 用户信任**:避免输出失真导致的内部决策失误,维持团队对分析工具的信任。
- **[TERM] 可审计性**:保证生成的每一份简报都能逐句下钻溯源到真实的原始反馈工单。
- **[TERM] 评测集**:覆盖多意图混杂、网络缩写与长篇负面情绪反馈的基准验证集。
- **[TERM] 大模型裁判**:使用能力更强的大模型对候选摘要的主题提炼准确度进行自动打分。
- **[TERM] 金丝雀发布**:限制影响范围并逐步扩大版本或内部体验群的发布策略。
- **[TERM] 反馈闭环**:收集产品经理对自动生成 Issue 的采纳与驳回记录以优化模型。
- **[TERM] 调用追踪**:记录单批次反馈聚类全过程的执行时间、中间结构与 Token 消耗。
- **[ROUTE] AI 产品与场景判断**:支持业务价值、场景条件和方案边界的前置学习。
- **[ROUTE] 高效人机协作**:支持责任、控制、纠正、恢复和人工接管的前置学习。
- **[SOURCE] NIST AI RMF Core**:支持预期用途、角色责任、人类监督、风险处理和部署决定。
- **[SOURCE] Google PAIR Errors and Graceful Failure**:支持按任务定义错误、提供继续路径、反馈和人工接管。
- **[SOURCE] Google PAIR Feedback and Control**:支持明确反馈用途、平衡自动化与控制并保留手动路径。
- **[SOURCE] OpenAI Evaluation Best Practices**:支持任务化评测、真实分布、持续评估和人工校准。
- **[SOURCE] Google Classification Metrics**:支持按错误成本选择 precision、recall 和其他分类指标。
- **[SOURCE] OpenAI Latency Optimization**:支持减少不必要调用、请求和 Token,并避免默认使用 LLM。

---
*文档生成自 AI-Native 实战判断系统 · 面向生产上线的可复核产品方案*