Agent、工具调用与自动化进阶已弃用核验于 2026-07-30

反思机制

Reflection

Agent 对中间结果和执行轨迹进行再检查并决定是否修正的机制,不能保证自动发现所有错误。

本页目录
快速跳转

它是什么

反思机制让 Agent 根据一次尝试的执行轨迹和结果反馈,生成文字化经验,并把它作为后续决策的输入。它不直接更新模型权重,也不只是把最终回答解释得更长;重点是记录“哪里失败、证据是什么、下一次改变什么策略”。Reflexion 将这种文字反馈存入情节记忆,用于之后的尝试。[S1]

为什么需要它

多步 Agent 的失败往往来自搜索路径、工具选择或停止时机,而不仅是最后一句答案。只修正最终输出会丢掉过程信息,下一次仍可能走同一条错误路径。反思把环境反馈转成可复用策略,使后续尝试能避开已知失败;同时也要求系统防止错误总结长期污染记忆。

它如何工作

评价器先依据环境结果或明确标准检查任务,再结合完整轨迹形成反思:发生了什么、为什么失败、下一次采取什么可执行改变。系统把这段经验写入有范围和期限的短期或情节记忆,下一次规划时读取,随后再次由环境验证。若没有改善、反思重复或达到最大次数,就停止或转人工。[S1][S2]

真实例子

研究 Agent 生成报告后被核验器判定为“核心结论只有单一来源”。系统回看轨迹,记录反思:“在起草前,为每个核心主张寻找两个相互独立的来源;找不到就标注证据不足。”下一次规划会先执行交叉检索,再写作。模型或工作流升级后,这条记忆需要重新验证并过期,避免旧经验永久生效。

什么时候适合与不适合

反思适合可重复尝试、轨迹可记录且结果有外部反馈的 Agent 任务。一次性开放创作或评价标准含糊时,反思可能只是自洽叙述。错误反馈会产生错误经验,过多记忆会挤占上下文并干扰决策,无限循环还会增加成本。因而反思必须限定记忆范围、有效期、最大尝试次数,并始终接受环境结果检验。[S1][S2]

亲自试一下

拿一条五步执行轨迹,写一份包含失败证据、原因假设、下一次具体动作和过期条件的反思,再让 Agent 重新规划。只有新计划确实改变了指定动作,而且外部评价标准比上一轮改善,反思才算有效;如果只是解释更长或换了措辞,则不通过。

接下来学什么

先学习AI Agent理解规划、行动和环境反馈,再用Agent 记忆管理反思的范围与期限;若只需修订当前输出,可对照自我纠错选择更短的反馈循环。

来源与修订

轨迹反馈、文字反思与情节记忆机制参考 Reflexion [S1];以环境真实结果检查 Agent 行为、设置停止条件并控制循环成本的工程边界参考 Anthropic Building Effective Agents [S2]。记忆结构、评价器和循环上限会随具体架构变化。

Learning navigation

学习导航

同领域兜底:当前词条暂时没有下一站或真实语义关系,先从同一领域的其他入口继续探索。

Source register

核验来源

  1. Reflexion: Language Agents with Verbal Reinforcement LearningarXiv · 访问于 2026-07-30
  2. Building Effective AgentsAnthropic · 访问于 2026-07-30

发布 2026-07-30 · 更新 2026-07-30 · 核验 2026-07-30