实战案例每日用户反馈分析与产品改进
评测、成本与上线治理Gate 05 of 06 · 决策推演
定义评测、成本与护栏
PM 核心决策题
怎样证明质量、时效和成本同时可接受?
项目材料逐步形成各关决策沉淀为 PRD 章节
- 01AI 适用性判断卡
- 02场景机会评估表
- 03任务流程与方案选择表
- 04人机责任与失败恢复图
- 05评测、成本与上线护栏表
- 06完整 AI 产品评审档案
Decision BriefGate 05 决策工作台
怎样证明质量、时效和成本同时可接受?
业务场景背景与约束:
这是一个教学案例。某数字产品团队从客服工单、应用商店评论和站内反馈接收中文用户反馈,产品团队希望形成可复核的问题证据和行动候选。
团队推荐基准建立任务级黄金集、错误切片、线上运行指标和单位成功任务成本,具体阈值等待真实基线。默认基线路径,可根据实际约束探索并采纳其他方案
- 事实E3
类别不平衡或错误成本不同时,总体准确率不能替代 precision、recall 和错误类型分析。
外部来源支持 - 事实E2
单位成功任务成本必须包含接入、模型、失败重试、运行和人工复核,而不只是调用价格。
产品方法基线
- 未知项E0
各类错误成本、预算、时效、上线门槛和回滚阈值尚未通过真实基线确定。
尚无外部证据
Artifact delta
本关如何改变项目材料
新增材料
评测、成本与上线护栏表
汇总任务级评测、错误切片、单位成功任务成本、运行指标和待验证阈值。
- 高影响问题漏报
- 信号
- 后续人工、客服或线上事件发现系统遗漏的重要问题
- 影响
- 重大问题发现和处理被延迟
- 恢复
- 增加规则信号和高影响切片样本,复盘后重新评测
- 责任
- 产品与工程
- 无依据摘要或建议
- 信号
- 结论无法回到原始反馈或与证据冲突
- 影响
- 错误信息进入产品决策和行动链路
- 恢复
- 阻止发布并重新生成或由人工编写,保留失败样本
- 责任
- 产品经理
- 版本质量回归
- 信号
- 提示、模型或配置变化后固定评测集下降
- 影响
- 质量无声漂移且历史结果不可比较
- 恢复
- 冻结或回退版本,阻止晋级并补充失败样本
- 责任
- 产品与工程
- quality · increase分类 Macro F1
对每个标签分别计算 F1 后取平均,避免高频类别掩盖少数类别表现。
阈值:待真实基线 - quality · increase高影响问题召回
黄金集中实际高影响问题被系统候选发现的比例,重点观察假阴性。
阈值:待真实基线 - quality · increase主题证据覆盖
已发布主题中能够回到充分原始反馈证据的主题比例。
阈值:待真实基线 - quality · decrease无依据主张率
摘要或行动草稿中无法由关联原始反馈支持的主张比例。
阈值:待真实基线 - operation · increase工作流成功率
目标批次在证据完整且无需异常补偿的情况下进入人工复核的比例。
阈值:待真实基线 - operation · decreaseP95 处理延迟
从授权记录进入系统到形成可复核候选的第九十五百分位端到端时间。
阈值:待真实基线 - cost · decrease单位已批准简报成本
接入、模型、失败重试、运行和人工复核总成本除以证据完整的已批准简报数。
阈值:待真实基线
- 核心概念黄金数据集
用于管理经过业务定义和版本化的评测样本。
- 核心概念离线评估
用于在版本发布前比较固定任务和错误切片。
- 核心概念在线评估
用于观察真实使用分布、影响和持续变化。
- 核心概念成本优化
用于定义单位成功任务成本和调用优化顺序。
- 核心概念评测集
覆盖多意图混杂、网络缩写与长篇负面情绪反馈的基准验证集。
- 核心概念大模型裁判
使用能力更强的大模型对候选摘要的主题提炼准确度进行自动打分。
- 权威文献OpenAI Evaluation Best Practices
支持任务化评测、真实分布、持续评估和人工校准。
- 权威文献Google Classification Metrics
支持按错误成本选择 precision、recall 和其他分类指标。
Project directory
六个 Gate,共同形成一份项目档案
这是固定顺序的项目阶段目录,不代表个人进度,也不会保存选择。