从一句"请一步步思考"到自主拆解任务:LLM 规划能力的四年进化史
2026 年被业界称为"Agentic AI 元年"。几乎所有分析师都在重复同一个判断:大模型终于从"会聊天"走向了"会干活"。但很少有人说透,这场跃迁背后最核心的技术变量是什么。
答案藏在一个朴素的问题里:如何让大模型在面对复杂任务时,不再"一口气蹦出答案",而是学会像人一样先想清楚再动手。这就是所谓的"规划能力"——过去四年,从一句简单的提示词(prompt)开始,这项能力经历了四次范式级的进化,每一次都是对上一次局限性的精准突破。
CoT:一句话开启的推理显式化
故事要从 2022 年说起。在 Chain of Thought(思维链)出现之前,LLM 回答问题的方式是"端到端"的:接收输入,直接输出答案,中间没有任何可见的推理过程。这种模式对付简单问答尚可,但一旦遇到需要三步以上推导的逻辑题、数学题,错误率就会急剧攀升。
背后的机制并不复杂:Transformer 本质上是 next-token 预测机器,每个 token 的生成都依赖前面所有 token。当推理过程完全隐式地发生在模型内部时,跳步、误差累积几乎是必然的——你会看到模型自信地给出一个完全错误的答案,因为它从来没有"停下来检查过"。
CoT 的解决方案简单到近乎粗暴:在 prompt 末尾加一句"让我们一步步思考"(Zero-shot CoT),或者给几个带有完整推理过程的示例(Few-shot CoT)。就是这一句话的改动,让模型在 GSM8K 等推理基准上的准确率直接跃升了几十个百分点。
它为什么有效?因为当模型先输出推理步骤,这些写下来的内容会进入上下文,成为后续生成的依据——就像你在纸上演算数学题,把过程写出来本身就能显著降低出错概率。
但 CoT 的致命缺陷也从第一天就埋下了:它只有一条推理路径。如果第一步方向就错了,整条链会一路错到底,没有任何纠偏机制。
ToT 与 GoT:从单链到树,再到图
Tree of Thoughts(思维树)在 2023 年的出现,正是为了解决 CoT"一条道走到黑"的问题。
ToT 的核心改变是把"生成一条链"变成"探索一棵树":每一步都让 LLM 同时生成 3-5 个不同的推理方向,然后由模型自己(或另一个评估器)给每个方向打分,剪掉分数低的分支,只保留最有希望的路径继续深入,循环往复直到得出最终答案。这本质上是把搜索算法中的"生成-评估-剪枝"循环引入了 LLM 推理。
用一个生活类比:CoT 像你做题时只想了一个解法就一路做到底;ToT 则像你先列出三种可能的解题思路,快速评估哪个最靠谱,选最优的往下走,差的直接放弃。
效果是显著的:在 24 点游戏、创意写作、技术方案选型这类需要探索多种可能性的任务上,ToT 的准确率可以达到 CoT 的 1.5 到 2.5 倍。但代价同样直接:典型配置下(每层 3 条路径,搜索 2-3 层),ToT 的 LLM 调用次数是 CoT 的 3-5 倍;如果路径更多、搜索更深,成本可以飙升到 10 倍以上。
ToT 解决了方向错误的问题,但它的树形结构有另一个局限:不同分支之间完全独立,中间结论无法互相借用。这不符合人类思考的真实方式——人在处理复杂问题时,一个路径上的中间发现,常常可以用来辅助另一个路径的判断。
几个月后提出的 Graph of Thoughts(思维图)把树结构换成了有向无环图,允许一个推理节点接收来自任意多个前置节点的输出,不同路径的中间结果可以合并、复用。最典型的例子是"分别研究竞品 A 和 B,再做综合对比":在 ToT 的树结构里,研究 A 和研究 B 是两条独立分支,"综合对比"这个需要同时接收两个分支结论的节点无法自然表达;而在 GoT 的图结构里,这种汇聚是一等公民。
GoT 的表达能力最接近人类复杂推理,但落地复杂度极高,算力消耗可达 CoT 的 10 到 50 倍。直到今天,它基本还停留在学术研究阶段,生产环境里很少见到真正落地的案例。
Plan-and-Execute:工程界真正的主力
CoT、ToT、GoT 解决的都是"如何让单次推理质量更高"的问题。但在真实的 Agent 项目里,工程师们很快发现:对于需要调用多个工具、经历多个环节的长周期任务,单靠优化推理链是不够的——你需要先建立全局视角。
这就是 Plan-and-Execute(先规划再执行)模式在 2024-2025 年迅速成为工程界主流的原因。它的思路直白得像在写项目管理手册:面对复杂任务,不要上来就做,先用一次强模型调用制定一份完整的执行计划,把任务拆成若干步骤,然后再一步一步执行,每完成一步就检查进度,必要时动态调整后续计划。
具体来说,这个模式有三个核心角色:
- Planner(规划器):接收用户任务,生成步骤清单,比如"第一步搜索相关资料,第二步整理关键信息,第三步撰写总结报告"。
- Executor(执行器):按照清单逐步执行,每步可能涉及工具调用或 LLM 推理。
- Re-planner(重规划器):这是最容易被忽略也最关键的一环——每完成一步,都要回顾当前进展,判断原计划是否仍然适用,如果发现新信息或执行结果不符合预期,就动态调整后续步骤。
很多人会问它和 ReAct 的关系。简单来说:ReAct 是"思考-行动-观察"的单步循环,每一步都是即时决策,走一步看一步,适合快速应对动态变化;Plan-and-Execute 则在 ReAct 之上加了一层全局编排,负责"做什么"的整体安排。两者不是替代关系,而是经常搭配使用——Plan-and-Execute 决定任务拆分和步骤顺序,ReAct 负责每个具体步骤怎么执行。
这种架构分离带来了一个工程上的巨大好处:规划阶段可以用 GPT-4、Claude Opus 这类强模型保证方向正确,执行阶段则可以用速度更快、成本更低的模型(甚至小模型)来提高效率,两端可以独立优化成本和质量。包括 LangGraph 在内的主流 Agent 框架,现在都内置了对这种模式的原生支持。
2026 年的新现实:混合规划成为主流
时间走到 2026 年,行业正在从"单一规划范式"走向"混合规划"。根据最新的技术实践,主流 Agent 框架已经不再局限于某一种模式,而是根据任务特性动态选择合适的规划策略。
简单的、步骤在 5 步以内且没有分支的任务,直接用 CoT 就够了,成本最低、响应最快;需要探索多种可能性但不需要多源结论合并的任务(比如技术选型、创意发散),ToT 仍然是性价比最高的选择;而面对竞品分析、科研写作、复杂软件开发这类需要多源信息融合、多分支结论汇聚的长程任务,带有动态重规划能力的 Plan-and-Execute 是目前最稳妥的方案。
更前沿的探索已经在向图谱规划(GraphPlan)方向演进:用结构化的图来表示任务依赖关系,支持并行执行子任务,再将结果汇聚。配合 MCP 协议的标准化落地、推理成本的持续下降,以及多智能体协作模式的成熟,Agent 的规划能力正在从"单模型推理技巧"进化为一套完整的系统工程。
一个值得注意的趋势是:随着 Claude Code、Codex 等 AI Coding Agent,以及 Manus、Hermes 等新一代通用 Agent 框架的出现,2026 年的顶尖 Agent 已经开始具备"自进化"能力——它们不仅能完成任务,还能在执行过程中沉淀可复用的 Skill 库,通过自我反思和反馈循环持续优化规划质量。
写在最后:选型比追新更重要
回到最实际的问题:在今天做 Agent 开发,到底应该选哪种规划模式?
答案可能会让追逐前沿的人失望:90% 的生产场景,CoT 加 Plan-and-Execute 的组合就足够用了。CoT 几乎零成本,应该作为所有任务的默认配置;Plan-and-Execute 在长链路任务上提供全局视角,规划与执行分离的架构也便于成本优化。ToT 适合在准确率要求极高、且确实需要多路径探索的关键环节局部使用,不建议全链路铺开,否则 3-5 倍的调用成本会很快吃掉你的预算。至于 GoT,理解它的思想即可,除非你在做前沿研究,否则不必强行引入。
从一句"请一步步思考"的 prompt hack,到今天能够自主拆解任务、动态调整计划、持续自我进化的复杂规划系统,LLM 规划能力的四年进化史,其实也是大模型从"玩具"走向"工具"、从"演示"走向"生产"的缩影。真正重要的从来不是用上了最前沿的算法,而是在精度、成本、延迟这三者的三角博弈中,找到最适合你业务场景的那个平衡点。
毕竟,规划能力的终极目标从来不是"看起来聪明",而是"把事做成"。
沿的算法,而是在精度、成本、延迟这三者的三角博弈中,找到最适合你业务场景的那个平衡点。