T1 · 第 7 / 30 题 · 阶段 02 第 2 / 5 题

判断数据是否够用,应该先看什么?

情境

团队想做客服意图识别,手上有一批历史会话记录,但从未清理过标注。

  1. 01历史会话数量看起来很多
  2. 02记录中夹杂测试与重复数据
  3. 03意图标签需要人工统一

你会选择哪一种决策?

先做选择,再展开每条路径的判断。键盘按 1–3 作答。

  1. 查看这条路径的判断

    推荐路径

    数量多不等于可用,先抽样看重复、测试数据与标签口径,才能判断数据是否支撑训练。

    🎯 评审反诘 · 项目立项评审委员会

    「该推荐路径在保证业务确定性的同时,把大模型用在了最具杠杆价值的核心环节。如何量化并向管理层证明 ROI?」

    PM 论据:以最小的工程研发复杂度锁定 90%+ 的核心诉求,风险完全隔绝在可控沙箱内,交付确定性最高。

  2. 查看这条路径的判断

    高风险路径

    条数掩盖了重复、缺失与标签不一致的问题,按数量决策会在训练后才发现数据不可用。

    ⚡ 评审反诘 · 技术架构师 / 风控评审人

    「该方案明显引入了不可控的不确定性、调用延迟与接口成本。一旦长尾样本发生幻觉或服务超时,由谁对业务资损与客诉担责?」

    PM 审视:切忌盲目“为 AI 而 AI”,确定性问题坚持规则优先,高风险链路必须设置安全熔断阀。

  3. 查看这条路径的判断

    高风险路径

    未清洗的数据会把噪声一起教给模型,效果难以解释,后续排查也找不到原因。

    ⚡ 评审反诘 · 技术架构师 / 风控评审人

    「该方案明显引入了不可控的不确定性、调用延迟与接口成本。一旦长尾样本发生幻觉或服务超时,由谁对业务资损与客诉担责?」

    PM 审视:切忌盲目“为 AI 而 AI”,确定性问题坚持规则优先,高风险链路必须设置安全熔断阀。

不只记答案,记住判断方法

核心原则答完后展开
判断数据是否够用,先看质量与标注口径,再看数量。

下次遇到类似问题,检查

  1. 01数据是否重复或缺失
  2. 02标签口径是否统一
  3. 03样本是否覆盖真实问题

PM 落地

如果你是产品经理,下一步做什么

做一次数据抽样检查,交付质量、重复与标签一致性的结论,再决定是否训练。

工业实战落地Gate 02 · 场景与机会判断

想在真实业务场景中看本题的落地推演?

在《智能客服知识库与回答辅助》案例中,完整推演该阶段的事实依据、盲区核验、方案三选一与决策影响天平。

进入实战案例 Gate 02 →