AI 工程、部署与运维进阶已核验核验于 2026-07-30

备用模型

Fallback Model

当主模型不可用、超时或不适合当前任务时接管请求的备用模型。

本页目录
快速跳转

它是什么

备用模型是在主模型不可用、受限流、超时或触发明确不可接受条件时,由系统切换使用的预先评测过的替代模型或配置。它服务于故障恢复和优雅降级,不是日常按任务择优的模型路由,也不是遇到任何失败就随机换一个供应商再试。[S1][S2]

为什么需要它

外部模型服务会出现区域故障、容量不足、限流和延迟尖峰。没有备用路径时,一个供应商问题可能让整个功能停止;设计良好的回退可以保留核心能力或给出可理解的降级结果。不过,可用不等于正确,未经验证的替换可能把服务故障变成更隐蔽的质量或安全故障。

它如何工作

团队先定义哪些错误可重试、重试次数和总截止时间,再为每类任务指定契约兼容且通过评测的备用路径。连续失败越过阈值时,熔断器暂停主路径并转向备用模型;响应要标记实际模型和降级状态,监控错误率、延迟与质量。主服务恢复后,通过健康探测和小流量试探逐步切回,而不是瞬间把全部请求压回去。[S1][S2]

必须澄清的误会

备用模型 ≠ 模型路由。 路由按请求特征主动选模型;备用模型是主路径失败后的兜底,触发条件是故障而不是任务类型。

备用模型 ≠ 回滚。 回滚把系统退回上一个已知可用的版本;备用模型是在同一版本内换一个模型继续服务,不涉及版本变更。

真实例子

企业知识助手的主模型连续三次返回可重试的服务错误,或单次调用超过 6 秒,就打开 30 秒熔断并使用已评测的小模型。备用模型只回答检索证据充分的常见问题,关闭复杂工具动作,并向用户显示“当前使用简化回答”。若备用模型也超时,系统停止级联调用,保留问题并提供人工渠道;主模型通过探测后才逐步恢复。

什么时候适合与不适合

对连续性有明确要求、调用量足以支持双路径测试的产品适合设计备用模型。高风险决策若不同模型无法满足同一安全和输出契约,宁可停止自动处理并转人工。模型之间可能在工具支持、上下文、语言、安全策略、成本和延迟上不同;回退还可能把流量集中到容量较小的次级服务,造成级联过载。[S1][S2]

亲自试一下

为一个生产调用写回退表,列出限流、服务错误、超时、结构错误和低质量五类触发器。每类明确是否重试、最大次数、备用路径、用户提示和停止条件,再设计“主服务恢复”和“备用服务也失败”两个演练。若任何分支可以无限重试,或切换后不记录实际模型,方案不合格。

接下来学什么

先回到AI 应用确定必须保留的核心任务,再学习模型路由区分正常选择与异常回退;工程上继续学习重试策略和错误恢复。

来源与修订

可靠性目标、错误和延迟阈值、简化模型回退、监控与优雅降级参考 Google Cloud AI/ML 可靠性指南 [S1];自动故障转移、备用模型测试及一致性与负载边界参考 AWS 的 LLM 网关韧性实践 [S2]。供应商、模型、配额、错误类别和响应语义会变化,回退清单需随版本和容量持续演练。

Learning questions

这个概念出现在哪些题里

下面的题目直接引用了本词条,适合先做判断,再回到正文核对边界。

Learning navigation

学习导航

沿认知链路:你现在在第 5 站,下一站是「给流程 · 怎么把做法沉淀下来」:先沿主路径补上这一层。

Relation topology

概念关系

本词条在知识拓扑中的连接关系。涵盖前置依赖、组成要素、对比差异与应用场景。

拓扑图谱网络 · 一度关联场

可拖拽节点、滚轮缩放、点击节点探索

Local relation field

备用模型的一层关系

2 个节点 · 1 条直接关系

关系类型
图谱进入视口后加载

交互图谱之外,本页下方保留完整文字关系与词条链接。

Source register

核验来源

  1. AI and ML perspective: ReliabilityGoogle Cloud · 访问于 2026-07-30
  2. Implementing resilience patterns with Amazon Bedrock and LLM gatewayAWS · 访问于 2026-07-30

发布 2026-07-30 · 更新 2026-07-30 · 核验 2026-07-30