AI 基础与模型边界
先理解 AI 能做什么、不能保证什么,再讨论产品功能。
三层递进,每层把六个阶段完整走一遍:先认得出概念,再判断得了边界,最后做得了取舍。共90 道判断题,按层折叠,一次只看一层。
本机进度:已答0 / 90继续下一题 →错题攻坚(0 题待消灭)→
遇到现实业务死穴?按常见产品痛点快速过滤靶向试题:
已筛选:(0 题)将 90 道情境判断题与 6 大业务案例映射为 6 项核心 PM 能力。本地答题与方案决策会自动沉淀为你的战力雷达与薄弱项诊断。
正在建立对大模型基础概念与工作机理的第一手认知,准备开始实操判断。
补强薄弱项「AI 基础与模型边界」,该维度当前掌握度 0%
学习闭环闭环提醒:完成判断题建立概念边界后,前往对应业务案例在真实 Gate 中检验工程与商业取舍。
先把概念认准:这个场景属于哪一类问题,该用哪一类方案。
练成:能在单点场景里认出正确方案,并说清另外两个为什么不行。
“发票金额校验,需要引入大模型吗?”
场景财务希望自动检查发票总额是否等于各明细项之和,字段结构固定,计算规则明确。
“工单打标签,应该让模型自由生成还是做分类?”
场景客服团队要把用户工单归入固定的八个类别,用于后续分流与统计报表。
“哪种任务不该交给大模型处理?”
场景内容团队整理一批历史合同,需要逐条核对金额并保证与原件完全一致。
“订单信息抽取,输出该用结构化还是自由文本?”
场景运营要把邮件里的订单信息录入系统,字段固定为商品、数量与收货地址。
“上下文装不下全部资料时,第一步应该做什么?”
场景客服助手要回答产品问题,知识库有上千篇文档,无法一次性全部放进上下文。
“演示效果很好,就说明这是个值得做的机会吗?”
场景销售团队看到模型能自动生成话术,演示当场很惊艳,但没人说清谁会用、用在哪一步。
“判断数据是否够用,应该先看什么?”
场景团队想做客服意图识别,手上有一批历史会话记录,但从未清理过标注。
“什么情况下这个错误成本不能接受?”
场景财务团队想用模型自动审批付款申请,审批通过会直接触发银行转账。
“这条流程里,哪个环节最适合先自动化?”
场景销售团队每周整理客户反馈,需要收集来源、去重、归类,最后人工写跟进建议。
“怎么判断这个用户价值是真的?”
场景团队打算做会议纪要助手,理由是会议很多,但没人统计过纪要现在的处理方式。
“约束回答风格与接入最新资料,分别该用什么?”
场景内容团队希望助手统一用简洁语气回答,同时能引用本周更新的产品资料。
“用户要定位原文依据,该用检索还是生成?”
场景法务同事想快速找到合同里的责任条款,需要看到原文位置而不是改写后的说法。
“步骤固定但有一处需要判断,该用哪种方案?”
场景报销流程固定为四步,其中只有票据合规性判断需要模型,其余步骤完全确定。
“什么情况下才应该考虑微调?”
场景团队想让模型稳定输出公司特有的字段格式,提示词与检索方案都试过但不稳定。
“知识每周都在变,方案该选哪一种?”
场景价格与政策每周调整,助手要按最新版本回答,并说明依据来自哪一版。
“模型改写了用户文案,用户不满意时应该怎么办?”
场景写作助手会自动润色用户的初稿,用户希望保留原意,只调整不满意的句子。
“模型没有把握时,界面应该怎么表达?”
场景财务助手根据邮件判断费用归属科目,部分邮件信息缺失,无法确定科目。
“助手应该在什么时候把问题转给人工?”
场景客服助手能回答常见问题,遇到退款纠纷时会给出与政策不符的说法。
“模型批量改错了数据,应该怎么恢复?”
场景助手按指令批量更新了两百条客户标签,事后发现有三十条改错了。
“用户第一次打开助手,最该先给什么?”
场景新用户打开数据分析助手,界面上只有一个空白输入框,不知道能问什么。
“要衡量回答质量,评测集应该怎么建?”
场景团队要上线客服助手,需要一套可以反复运行、结果可比较的质量检查。
“上线后应该重点看哪些线上指标?”
场景客服助手上线一个月,团队只统计了调用次数与用户满意度评分,没有看回答是否正确。
“设计这个功能时,应该先确定什么?”
场景销售在客户现场用助手查资料,希望回答在两秒内出现,超时就会直接放弃使用。
“估算这个功能的成本,应该按什么口径?”
场景客服助手预计每天一万次对话,每次对话可能触发多轮模型调用与检索。
“上线前,这套系统最需要什么护栏?”
场景助手可以自动给客户发送邮件,语气和内容都由模型生成,发送后无法撤回。
“这个方案最明显的缺陷是什么?”
场景客服助手被要求回答任何问题,包括它完全不了解的内部政策,答不出来也照样给答案。
“这个方案最该补上什么?”
场景助手根据内部制度回答问题,但只给结论,不说明依据来自哪份文件,用户无法核实。
“这套流程最需要补上哪一环?”
场景系统自动处理客户的退款申请并直接驳回,被驳回的客户找不到人申诉。
“上线前最该补齐的是什么?”
场景团队凭感觉调了两周提示词,准备直接上线,但说不出这一版比上一版好在哪里。
“这份上线方案最明显的缺口是什么?”
场景新模型直接替换旧版本全量上线,团队没有保留旧版本,也没有准备切换开关。
加入真实约束:数据不全、成本有限、错误不可逆,边界开始变模糊。
练成:能在带约束的场景里判断方案的适用边界,而不是套用结论。
“制度文档持续增长,还把全文拼进提示词吗?”
场景团队有数千份制度文档且每月新增,员工提问必须能点开原文核对,预算只够单次调用一万字以内。
“高风险场景里,通用模型的回答可以直接采信吗?”
场景医疗咨询团队想让模型直接给出用药剂量建议,一旦出错后果严重,而团队手上只有通用模型可用。
“换成更大的上下文窗口,就能答对近期政策吗?”
场景客服团队发现模型常答错近期政策,采购建议换成上下文窗口更大的模型,团队想知道这能否解决问题。
“字段规则明确的录入任务,一定要用大模型吗?”
场景财务团队要把报销单按十几个字段录入系统,字段规则明确,团队希望压低单次成本并保证格式稳定。
“结论必须能回到原文时,提示词该怎么写?”
场景合规团队要求每条结论都能定位到制度原文的具体条款,而模型目前只给结论、不给任何依据。
“数据不全时,这个自动分类机会还成立吗?”
场景团队想用历史工单训练分类模型,但只有近三个月记录,而且标签由不同客服手填,口径并不一致。
“错误不可逆的动作,应该交给模型自动执行吗?”
场景销售团队想让模型自动给客户发送报价邮件,价格一旦发错就无法撤回,而团队希望全自动以提升响应速度。
“这项提效投入,该怎么判断值不值?”
场景内容团队每月产出两百篇稿,希望用模型做初稿,但需要两人长期维护提示词与评测,团队想先算清值不值。
“需求方说的方案,和现场问题对得上吗?”
场景需求方说要一个智能问答机器人,实地观察后发现客服大部分时间花在跨系统查订单状态,而不是回答知识问题。
“合规受限时,这个训练机会还有别的做法吗?”
场景团队想用客户通话录音训练客服助手,法务指出录音涉及个人信息,未经同意不能用于模型训练。
“知识每周更新,还应该靠微调记住它吗?”
场景政策问答助手每周都有新文件,团队考虑用微调把知识写进模型,但文件还在持续增加且要求当天可查。
“步骤固定的多步任务,该用工作流还是 Agent?”
场景团队要把合同审批做成自动流程,步骤固定且每一步都要留痕,但中间有一步需要判断条款是否异常。
“检索召回不到内容时,能直接让模型自己生成吗?”
场景客服知识库里长尾问题很多,检索经常召回不到内容,团队想知道是不是该放弃检索、改成让模型直接生成。
“延迟和成本都卡死时,模型档位怎么定?”
场景在线客服助手要求两秒内响应,且单次成本有硬上限,团队在大模型和小模型之间犹豫不决。
“既要理解自然语言又要查准数字,该怎么组合?”
场景内部知识助手既要回答概念问题,也要按条件查库存,团队发现纯检索答不准数字,纯查询又听不懂自然语言。
“专业用户和普通用户能共用一套控制设计吗?”
场景同一套诊断功能,一边给工程师用,一边给普通用户用,团队想用同一套界面与同一套默认权限。
“低频功能也需要完整的控制面板吗?”
场景一个功能每月只用一两次,团队却为它设计了复杂的确认流程与参数面板,用户每次都要重新学习。
“用户不信任输出时,应该加什么?”
场景系统准确率其实不低,但用户每次都要重新核对一遍结果,导致实际效率并没有提升。
“多轮对话里,怎么避免关键约束被忘掉?”
场景用户在第 8 轮修改需求时,助手已经忘记第 2 轮说过的限制条件,反复给出不合要求的方案。
“上千条批量修改,怎么保证可控?”
场景运营团队要一次修改上千条商品文案,系统只能整体提交,提交之后无法逐条检查,文案对外可见。
“评测集只有几十条,能上线吗?”
场景团队只攒了三十条测试用例就要上线,业务方认为样本太少不能说明问题,而上线时间已经很近。
“离线分数很高,为什么线上还是出问题?”
场景离线评测分数很高,上线后用户投诉却变多,团队开始怀疑评测集与真实使用之间的差距太大。
“准确率和响应速度冲突时,先动哪一边?”
场景用户要求在数秒内看到答复,但多轮检索加重排能明显提升准确率,团队的时间预算非常紧张。
“成本超预算时,应该先砍哪一块?”
场景上线后单次调用成本超出预算,团队提出三个方向:缩短提示词、换小模型、减少检索条数,需要排出先后。
“护栏误拦太多,能不能直接关掉?”
场景安全护栏上线后频繁拦截正常提问,用户抱怨问什么都答不了,团队又担心直接关掉会出事。
“老系统没有接口,智能问答还做得成吗?”
场景企业想给十年历史的订单系统加智能问答,系统没有接口文档,数据分散在多个库,团队希望三个月上线。
“预算只够少量调用时,功能范围怎么定?”
场景方案要覆盖全公司两千名员工,但预算只够每人每天几十次调用,团队还想让功能看起来足够完整。
“只有一个人维护时,功能该加多快?”
场景项目只有一名算法工程师,却同时要维护检索、评测和线上服务,团队还计划每月新增两个功能。
“时间窗口压死时,质量验证能省吗?”
场景业务要求在大促前两周上线推荐文案功能,但评测集还没有建立,团队只能压缩质量验证环节。
“方案没问题但组织不配合,该怎么推?”
场景方案能减少一半重复工作,但会改变客服的考核方式,一线主管明确表示不配合,项目推不动。
两个目标同时成立且互相冲突,必须放弃一个,并说清放弃的代价。
练成:能在冲突目标之间做取舍,并为取舍结果写下可评审的理由。
“简历初筛要更准,还是要能说明理由?”
场景招聘团队想用模型提高简历初筛准确率,但合规要求每个淘汰决定都能向候选人说明理由,而最准的模型给不出稳定解释。
“结算摘要要覆盖更难的表述,还是要结果每次都一致?”
场景财务团队希望模型能处理各种口语化报销说明,但月度结算要求同样输入每次得到同样结果,而生成式模型输出并不稳定。
“术语理解要通用,还是要贴合本行业表达?”
场景内容团队希望模型看懂行业黑话,但同一套系统还要服务多条业务线,通用模型理解稳定却常把专业说法解释错。
“客服机器人要多接问题,还是要少答错?”
场景客服团队希望机器人多覆盖用户提问、少转人工,但错误回答会带来投诉,而机器人只在一部分问题上足够可靠。
“运维助手要多自动执行,还是要每步可追溯?”
场景运维团队希望助手自动排查并修复常见故障,但事故复盘要求每一步操作都能追溯到指令、依据与执行人。
“免费额度要照顾用户体验,还是要压住单次成本?”
场景增长团队希望新用户免费试用更长时间以提升转化,但财务测算显示免费调用量越大,单客获取成本越高。
“需求要先赶上节点,还是要留下可维护的结构?”
场景业务方要求本季度上线智能问答,但工程团队评估按当前设计后续每次改知识都要改代码,维护成本会持续累积。
“助手要服务更多岗位,还是先在一个岗位做到能用?”
场景平台团队希望助手尽快覆盖多个岗位以证明通用性,但只有客服岗位的数据与流程足够清晰,其他岗位仍在摸索。
“用户增长要快,还是先守住回答质量线?”
场景运营团队希望尽快开放注册冲量,但当前评测显示部分问题类型回答质量不稳定,质量下滑会直接影响留存。
“核心能力要自己建,还是先用外部服务抢时间?”
场景团队在评估知识问答能力,自研可控但周期长,采购能立刻上线,而核心能力的差异会影响后续产品空间。
“检索回答要更准,还是要更快返回?”
场景知识助手要回答一线员工提问,检索更多片段能提升答案准确率,但每次检索与重排都会拉长等待时间。
“Agent 要少打断人,还是要每步都能拦住?”
场景销售团队希望 Agent 自动整理客户资料并推进后续动作,但任何对外发送或改数据都可能造成难以撤回的影响。
“输出风格要更贴合,还是要长期改得动?”
场景内容团队希望模型输出更贴合品牌语气,微调效果明显,但语气规范会随季度调整,团队没有长期标注人力。
“流程要一次做全,还是先跑最小闭环?”
场景团队希望把审批、检索、生成、回写串成完整自动化流程,但其中多步依赖不稳定,一旦失败整条链路都要重跑。
“旧系统要一次换掉,还是要边跑边改?”
场景现有问答系统结构混乱、迭代变慢,团队想一次性重写,但业务不能停机,且重写期间新需求仍在涌入。
“批量操作要一步完成,还是要让人逐条确认?”
场景运营团队希望一键把模型生成的文案批量发布,但文案会直接触达用户,错发之后很难逐条撤回。
“系统要多替用户做决定,还是要让人看清在做什么?”
场景产品希望自动替用户整理并归档文件以减少操作,但用户看不到分类依据,担心文件被放错位置后找不到。
“结果页要多给依据,还是要让人快速下判断?”
场景审核团队希望模型输出所有判断依据以便复核,但依据条目过多,审核员每次都要逐条读完才能做决定。
“回答要按人调整,还是要对所有用户口径一致?”
场景客服助手希望按用户历史偏好调整话术以提升满意度,但同一政策问题若说法不同,容易引发用户之间对比与争议。
“助手要多主动提醒风险,还是要少打断当前操作?”
场景写作助手希望在检测到表述风险时立刻提示,但用户正连续输入,频繁弹出提示会打断思路并让人关掉提醒。
“回答质量要拉满,还是要压住每次调用的成本?”
场景知识助手希望用更强的模型与更长上下文提升回答质量,但按当前调用量测算,成本会超出可承受的运营预算。
“版本要尽快上线,还是先补足评测样本?”
场景团队承诺本周上线新提示版本,但评测集里高风险的失败类型样本偏少,现有结论不足以判断改动是否安全。
“检索要多召回相关内容,还是要让结果都精准可用?”
场景法务检索希望尽量不漏掉相关条款,但召回放宽后大量不相关条文混入结果,律师仍要逐条筛掉。
“审核要投入更多人力,还是要控制人工成本?”
场景平台希望降低内容审核的人力投入,但漏放违规内容会带来处罚与口碑损失,而抽检比例降低后漏检风险上升。
“监控要记录每一次调用细节,还是要控制日志带来的开销?”
场景团队希望完整记录每次调用的输入输出以便排查问题,但全量日志带来存储成本,还会拖慢高峰期的响应速度。
“项目要按期交付,还是要保住完整功能范围?”
场景综合项目定在季度末评审,但核心场景的评测与护栏还没做完,若保范围就要延期,若按期就要砍掉部分能力。
“这个季度要还技术债,还是要继续交新功能?”
场景团队评估显示当前结构已拖慢迭代,但业务方本季度的功能承诺已经对外公布,两条路线需要同一批人力。
“优化要盯住单一指标,还是要照顾整体体验?”
场景团队希望提升首次解决率,但把这个指标做高的一种方式是让助手少转人工,而少转人工会让答错的用户无处求助。
“流程要满足合规留痕,还是要让用户操作更顺?”
场景产品希望简化企业客户的授权与确认步骤以缩短开通时间,但合规要求每次数据处理都有可追溯的授权记录。
“试点经验要直接复制,还是要为规模化重做一遍?”
场景试点团队反馈效果很好,但试点依赖人工兜底与专人维护,规模化后这些投入无法按同样比例扩张。