开篇:你手下其实有三个 AI
HOOK · 三种性格的打工人
基于ReAct、Reflection(反思)、Plan-And-Execute(规划执行)这三种架构的Agent,你可以简单理解为它们就是三种性格的打工人。
小 A 边查边干。你问他"这周有哪些值得关注的开源项目",他不会先列提纲,而是先搜索,看了结果再决定下一步搜什么,走一步看一步。这是ReAct。
**小 B 做完还要自己改。**第一版写好了,他会自己通读一遍挑毛病,然后重写,再挑毛病再重写,直到满意。这是反思(Reflection)。
小 C 先交计划再动手。开工前先给你一份五步计划书,然后按部就班执行。这是规划执行(Plan-And-Execute)。
这三种模式,就是 2026 年你在几乎任何主流 Agent 框架里都能见到的三种最基础的大脑。后面那些看着很唬人的架构(LangGraph 的状态机、AutoGen 的多智能体、各种 Agent SDK 的编排),拆开来看,基本都是这三样的排列组合。所以搞懂这三样,看任何框架文档都能秒懂它在干什么。
02
PART
小白也能懂:三种模式的定义
BASICS · 三种"大脑"的运作方式
ReAct:边想边做,做中学
ReAct 是**Reasoning + Acting(推理 + 行动)**的缩写。它不要求模型动手前想好一切,而是把"思考"和"行动"织进同一个循环:
Thought(我想) → Action(我做) → Observation(我看到了什么) → 再思考…
用做饭打比方:你进厨房不会先在脑子里完整模拟一遍"番茄炒蛋"再开火——你是先开火、倒油、下番茄,炒着炒着发现汁水多了,才决定大火收汁。ReAct 就是这个节奏:每一步都根据刚刚看到的新信息,决定下一步干什么。
它解决的核心问题是:很多问题在动手之前拿不到关键信息。“今天适合晨跑吗?”——不查天气和空气质量,模型永远答不准。ReAct 就是让它先想"我需要数据"→ 调工具 → 看到数据 → 再想"根据数据怎么给建议" → 输出。现在的 Claude、ChatGPT 这类产品,底层跑的就是这个循环。
Reflection:先做,再自己挑刺
反思模式让 Agent 当自己的质检员。它不在乎一次生成得对不对,它赌的是——第二轮肯定比第一轮好。
生成一版答案 → 自己评估有什么毛病 → 根据毛病重写 → 再评估 → 满意就交稿
类比:写完作文初稿,你自己通读一遍,圈出"这段逻辑不通"“这个例子太空”,改出二稿。反思就是把这个"自己审稿"的动作制度化、循环化。
为什么有用?因为大模型有个毛病——它生成答案时是"自信地编",一次生成的答案经常流畅但不准确。给它一个二次机会审视自己的输出,很多低级错误能自己揪出来。我实测过写代码任务:加上一轮反思,编译错误率能降一半以上(数据在后面)。
注意,反思有两副面孔:自我反思(同一个模型自己评价自己,省钱,但容易自我感觉良好)和换裁判(另一个模型当质检员,也就是 LLM-as-Judge,更客观,但贵一倍)。这俩差别很大,后面细说。
Plan-And-Execute:先交计划,再照单执行
规划执行把 Agent 拆成两个角色:**规划器(Planner)**负责把大任务拆成步骤清单,**执行器(Executor)**负责一步步照做。
Planner:任务 → [步骤1, 步骤2, 步骤3, …]
Executor:逐条执行(某步失败 → 带着失败原因回去重新规划)
类比:出差前先做行程单——机票哪天、酒店订哪、第一天去哪。执行的时候就不用反复"动脑子"了,照着单子走。它最大的收益是省 token:规划只做一次,执行每个步骤时上下文里只放当前这一步。代价是灵活性差——计划赶不上变化的时候,它容易抓瞎。
03
PART
开发者实战:三种模式的核心循环
HANDS-ON · 不贴完整代码,只给骨架
用同一个需求——“调研 2026 年值得关注的开源 Agent 框架”——看三种模式的核心循环长什么样。不贴完整代码,只给骨架。
ReAct:一个 while 循环搞定
…skeleton
核心循环:Thought → Action → Observation
while 没交卷:
思考(当前上下文) # Thought
调工具(如果需要) # Action
上下文 += 工具结果 # Observation
每轮都重发完整历史 → token 贵的根源
核心就一句话:**每轮把完整对话历史重发一遍,直到模型认为信息够了、直接回答。**这也是它 token 贵的根源。两个必踩的坑:循环次数不能无限次,max_steps 必须设——我见过 Agent 因为工具返回格式不对,连调 50 次,token 费比任务本身还贵;工具返回格式必须和 schema 严格一致,不一致模型会反复调同一个工具试图"理解"。
反思:生成 → 评估 → 重写
…skeleton
answer = 生成(问题) # 第一版答案
while 评估(answer).分数 < 阈值: # 自己当质检员
answer = 重写(answer, 评估意见)
阈值必须设,否则白烧钱
两个设计点要强调:满意阈值必须设——反思不是免费的,我见过团队把反思开到 5 轮,结果 70% 的答案第一轮就是好的,白烧了 4 轮的钱;代码类任务自己反思就够,写作/方案类建议换裁判模型——让模型自己夸自己写的东西,和让人类自己夸自己一样不靠谱。
规划执行:规划器 + 执行器
…skeleton
plan = 规划器(任务) # 拆成步骤清单
for 步骤 in plan:
执行器(步骤) # 每步只带当前步骤上下文
某步失败 → 带着失败原因重新规划 (re-plan)
省 token 的秘密就在"每步只带当前步骤的上下文"——不用每次重放整个任务背景。但省下来的代价是灵活性:如果计划里第 2 步失败,后面步数全部作废。所以生产环境必须带 re-plan;没有 re-plan 的规划执行,就是个精致的纸老虎。
三版实测对比
同一个需求、同一个模型,在我本机各跑了一遍。数字是单次测试,模型和 temperature 都会影响,别当基准,但量级和趋势是稳的:
| 指标 | ReAct | 规划执行 | 反思(+1 轮) |
|---|---|---|---|
| 模型调用次数 | 8 | 6 | 10 |
| token 消耗(约) | 42k | 18k | 55k |
| 输出质量 | 中,信息覆盖不错但有点跑偏 | 中,步骤清晰但漏了 License 维度 | 高,补漏删错 |
| 中途出错时 | 自动调整下一步 | 需显式 re-plan | 只能改文字,改不了已做动作 |
三个数字一摆,前面的"三种性格"就具象了:小 A(ReAct)最能随机应变但最费钱;小 B(反思)质量最高但也最慢最贵,而且它只能改稿子,改不了已经干出去的事;小 C(规划执行)最省钱但最怕意外;
04
PART
进阶思考:区别与组合
ARCHITECTURE · 怎么选,以及它们其实总在一起
先上一张完整的区别表,这是全文的核心,建议收藏:
| 维度 | ReAct | Reflection | 规划执行 |
|---|---|---|---|
| 一句话定义 | 边想边做,思考与行动交替 | 先产出,再自我评估重写 | 先规划步骤,再逐步执行 |
| 决策时机 | 每步实时决策 | 产出后再决策改不改 | 开工前一次性决策 |
| 对外部信息依赖 | 强,专为此设计 | 弱,主要在文字层面打磨 | 中,执行阶段需要 |
| token 成本 | 高,每步重发全量上下文 | 中高,多几轮完整调用 | 低,上下文按步精简 |
| 灵活性 | 高,能根据中间结果转向 | 中,只改进输出不改行为 | 低,计划错了后面全错 |
| 典型翻车方式 | 死循环、越查越偏 | 过度反思改坏、自夸空转 | 计划漏步骤、意外失败全崩 |
| 适合场景 | 信息不确定、需边查边决定 | 质量是生命线、可反复改 | 步骤明确、可提前规划 |
三选一?不,生产环境都是组合拳
讲个反直觉的事:**真实生产环境里,几乎没有哪个正经 Agent 只用其中一种。**我见过的架构基本是这个套路:ReAct 是地基(任何需要调用工具的循环,默认就是它);复杂任务外层套规划执行把大方向定死,每个子步骤内部再跑 ReAct 应付细节;交付前最后加一轮反思做质检,把低级错误挡在门外。
**举个例子:**一个"自动写行业调研报告"的 Agent——规划执行负责定"搜什么→看什么→怎么写"的框架,每个"搜"的子步骤内部用 ReAct 决定搜什么词、看哪几页,最后整个报告生成完了,反思环节通读一遍补漏删错。三种性格各司其职,这才是 2026 年生产级 Agent 的真实长相。
我的 3 个判断问题
做技术选型时别问"哪个最好",问自己三个问题:
判断 1
任务需要外部信息、可能中途转向?
需要 → 用 ReAct。这是它唯一不可替代的价值。
判断 2
任务 70% 的步骤能提前确定?
能 → 认真考虑规划执行,token 直接省一半(上面实测 42k → 18k)。
判断 3
输出质量是生命线、且允许反复改?
是 → 加反思环节,但轮数压到 2 轮以内。
反思被严重高估了。80% 的质量提升在第一轮反思就拿到了,第二轮边际收益骤降,第三轮开始原地打转甚至改坏。它不是在"提高质量",而是在"花两倍的钱买 15% 的质量提升",值不值取决于场景。
规划执行被严重低估了。大部分人一上来就写 ReAct,因为它"最通用"。但很多任务根本不需要每步都重新思考——比如周报、批处理、定时报表这类结构固定的活。用规划执行 token 省一半,稳定性还更高,只是它的前提(任务结构稳定)经常被忽略,导致翻车后被一棍子打死。
2026 年的几点观察
**各家官方 SDK 默认给 ReAct。**Claude 的 computer-use、OpenAI 的 agent 都是,因为它最通用、最不会错。
**LangGraph 把规划执行图式化。**变成显式的图结构,你可以精确控制每个节点,代价是心智负担。
**反思正在被"外包"。**很多团队不再让 Agent 自我反思,而是用另一个模型甚至规则去质检,因为"自己查自己"天然不可靠。
**趋势是进一步融合。**框架帮你做组合,你只需要描述任务,架构由框架替你拼。
学AI大模型的正确顺序,千万不要搞错了
🤔2026年AI风口已来!各行各业的AI渗透肉眼可见,超多公司要么转型做AI相关产品,要么高薪挖AI技术人才,机遇直接摆在眼前!
有往AI方向发展,或者本身有后端编程基础的朋友,直接冲AI大模型应用开发转岗超合适!
就算暂时不打算转岗,了解大模型、RAG、Prompt、Agent这些热门概念,能上手做简单项目,也绝对是求职加分王🔋
📝给大家整理了超全最新的AI大模型应用开发学习清单和资料,手把手帮你快速入门!👇👇
学习路线:
✅大模型基础认知—大模型核心原理、发展历程、主流模型(GPT、文心一言等)特点解析
✅核心技术模块—RAG检索增强生成、Prompt工程实战、Agent智能体开发逻辑
✅开发基础能力—Python进阶、API接口调用、大模型开发框架(LangChain等)实操
✅应用场景开发—智能问答系统、企业知识库、AIGC内容生成工具、行业定制化大模型应用
✅项目落地流程—需求拆解、技术选型、模型调优、测试上线、运维迭代
✅面试求职冲刺—岗位JD解析、简历AI项目包装、高频面试题汇总、模拟面经
以上6大模块,看似清晰好上手,实则每个部分都有扎实的核心内容需要吃透!
我把大模型的学习全流程已经整理📚好了!抓住AI时代风口,轻松解锁职业新可能,希望大家都能把握机遇,实现薪资/职业跃迁~