Concept Faceoff · 12 Pairs

易混概念同屏 PK 对决台

分不清 RAG 还是微调?分不清慢思考推理还是端到端大模型? 这里精选工业级 12 组最高频混淆概念,提供左右分屏定义对比、5 维量化权衡与实战选型自测,不再被技术忽悠。

PK 焦点

RAG (检索增强) vs Fine-Tuning (模型微调)

外部事实实时注入 vs 领域行为与专业语调内化

AI 产品选型中最著名的经典两难。核心分水岭在“外部新知识的注入”与“特定任务格式/风格的固化”。

方案 A

RAG (检索增强生成)

Retrieval-Augmented Generation查看词条详情 →

本质一句话

通过检索模块从外部向量库即时提取相关文档片段,动态拼装进 Prompt 供模型参考生成。

生活直觉比喻

带进开卷考场的笔记本:随时更新翻看,答案必须注明抄自哪一页。

最佳适用场景

  • 企业内部知识库、客服政策等经常变更的事实性数据
  • 要求严格标注引用源(可溯源)以防法律风险的场景
  • 团队缺乏算力资源与专业算法微调人才

致命短板与硬约束

  • 检索召回率与切片粒度决定了上限,召回错误会导致回答跑偏
  • 每次调用都会拼入大量文本,消耗更多上下文与 Token 成本

成本结构特征

初始部署成本低,持续查询 Token 与向量检索费用中等。

方案 B

Fine-Tuning (模型微调)

Fine-Tuning查看词条详情 →

本质一句话

用成对的领域指令与样本数据继续调整模型权重参数,使其内生具备该领域特有模式。

生活直觉比喻

送进全封闭集训营深造:内化为个人直觉与说话风格,但学完后无法随时补充昨日新闻。

最佳适用场景

  • 固定复杂格式输出(如银行特殊报文、复杂 SQL 语法)
  • 特定人格特质、客服极度谦和的专属企业腔调
  • 高频极低延迟场景(微调后无需长 Prompt 示例即可理解)

致命短板与硬约束

  • 不能用于持续更新动态事实,用微调背新事实极易产生灾难性遗忘与固执幻觉
  • 清洗标注数据集门槛极高,重新训练迭代周期按周/月计算

成本结构特征

前期标注与算力成本极高,单次推理 Prompt 消耗相对较省。

量化权衡对比

5 维工程与业务指标对撞

开发上线周期数值越低越快
1-2 周 (快速验证)
1-2 个月 (数据清洗与对齐)
单次推理 Token 消耗数值越低越省
偏高 (附带千字文档)
偏低 (无需冗长示例)
事实数据更新时效数值越高越好
秒级同步入库
需重新准备数据训练
来源引证与防幻觉数值越高越可信
高 (直接附带原文页码)
弱 (黑盒权重,无法确凿引证)
定制特定输出风格数值越高越强
受限 (仅靠 Prompt 模仿)
极高 (直接内化语法结构)

选型法则

PM 极简决策树

何时果断选 A(RAG (检索增强生成))?

  • 知识每周或每月都在发生增删改变动
  • 回答如果出现虚构事实会引发合规灾难,必须提供精准溯源引用
  • 业务处于验证期,需要几天内跑通原型验证 ROI

何时果断选 B(Fine-Tuning (模型微调))?

  • 输入输出具有极严格的私有格式规范,通用模型反复出错
  • 对推理延迟极其敏感(毫秒级),无法忍受额外带几千 Token 的输入
  • 需要完全抹掉大模型通用的“AI 腔调”,展现专属企业品牌口吻
实战自测

选型判定器:遇到这个情境,你选 A 还是 B?

情境 1

电商平台商品售后退换货助手,退换货规则每逢大促动态调整,且答复须明确展示《平台规则》条款出处。

关键约束:预算有限,必须一周内上线,不能出现过时规则误导。

情境 2

工业设备物联网数据分析,需要将实时上报的非标传感器日志翻译为极严苛的八层嵌套金融级审计报文,格式错一个标点即导致系统拒收。

关键约束:每次请求的上下文必须极短,网络带宽极低。