news 2026/9/3 13:20:05

从一句请一步步思考到自主拆解任务:LLM规划能力的四年进化史

作者头像

张小明

前端开发工程师

1.2k 24
文章封面图
从一句请一步步思考到自主拆解任务:LLM规划能力的四年进化史

从一句"请一步步思考"到自主拆解任务:LLM 规划能力的四年进化史

2026 年被业界称为"Agentic AI 元年"。几乎所有分析师都在重复同一个判断:大模型终于从"会聊天"走向了"会干活"。但很少有人说透,这场跃迁背后最核心的技术变量是什么。

答案藏在一个朴素的问题里:如何让大模型在面对复杂任务时,不再"一口气蹦出答案",而是学会像人一样先想清楚再动手。这就是所谓的"规划能力"——过去四年,从一句简单的提示词(prompt)开始,这项能力经历了四次范式级的进化,每一次都是对上一次局限性的精准突破。

CoT:一句话开启的推理显式化

故事要从 2022 年说起。在 Chain of Thought(思维链)出现之前,LLM 回答问题的方式是"端到端"的:接收输入,直接输出答案,中间没有任何可见的推理过程。这种模式对付简单问答尚可,但一旦遇到需要三步以上推导的逻辑题、数学题,错误率就会急剧攀升。

背后的机制并不复杂:Transformer 本质上是 next-token 预测机器,每个 token 的生成都依赖前面所有 token。当推理过程完全隐式地发生在模型内部时,跳步、误差累积几乎是必然的——你会看到模型自信地给出一个完全错误的答案,因为它从来没有"停下来检查过"。

CoT 的解决方案简单到近乎粗暴:在 prompt 末尾加一句"让我们一步步思考"(Zero-shot CoT),或者给几个带有完整推理过程的示例(Few-shot CoT)。就是这一句话的改动,让模型在 GSM8K 等推理基准上的准确率直接跃升了几十个百分点。

它为什么有效?因为当模型先输出推理步骤,这些写下来的内容会进入上下文,成为后续生成的依据——就像你在纸上演算数学题,把过程写出来本身就能显著降低出错概率。

但 CoT 的致命缺陷也从第一天就埋下了:它只有一条推理路径。如果第一步方向就错了,整条链会一路错到底,没有任何纠偏机制。

ToT 与 GoT:从单链到树,再到图

Tree of Thoughts(思维树)在 2023 年的出现,正是为了解决 CoT"一条道走到黑"的问题。

ToT 的核心改变是把"生成一条链"变成"探索一棵树":每一步都让 LLM 同时生成 3-5 个不同的推理方向,然后由模型自己(或另一个评估器)给每个方向打分,剪掉分数低的分支,只保留最有希望的路径继续深入,循环往复直到得出最终答案。这本质上是把搜索算法中的"生成-评估-剪枝"循环引入了 LLM 推理。

用一个生活类比:CoT 像你做题时只想了一个解法就一路做到底;ToT 则像你先列出三种可能的解题思路,快速评估哪个最靠谱,选最优的往下走,差的直接放弃。

效果是显著的:在 24 点游戏、创意写作、技术方案选型这类需要探索多种可能性的任务上,ToT 的准确率可以达到 CoT 的 1.5 到 2.5 倍。但代价同样直接:典型配置下(每层 3 条路径,搜索 2-3 层),ToT 的 LLM 调用次数是 CoT 的 3-5 倍;如果路径更多、搜索更深,成本可以飙升到 10 倍以上。

ToT 解决了方向错误的问题,但它的树形结构有另一个局限:不同分支之间完全独立,中间结论无法互相借用。这不符合人类思考的真实方式——人在处理复杂问题时,一个路径上的中间发现,常常可以用来辅助另一个路径的判断。

几个月后提出的 Graph of Thoughts(思维图)把树结构换成了有向无环图,允许一个推理节点接收来自任意多个前置节点的输出,不同路径的中间结果可以合并、复用。最典型的例子是"分别研究竞品 A 和 B,再做综合对比":在 ToT 的树结构里,研究 A 和研究 B 是两条独立分支,"综合对比"这个需要同时接收两个分支结论的节点无法自然表达;而在 GoT 的图结构里,这种汇聚是一等公民。

GoT 的表达能力最接近人类复杂推理,但落地复杂度极高,算力消耗可达 CoT 的 10 到 50 倍。直到今天,它基本还停留在学术研究阶段,生产环境里很少见到真正落地的案例。

Plan-and-Execute:工程界真正的主力

CoT、ToT、GoT 解决的都是"如何让单次推理质量更高"的问题。但在真实的 Agent 项目里,工程师们很快发现:对于需要调用多个工具、经历多个环节的长周期任务,单靠优化推理链是不够的——你需要先建立全局视角。

这就是 Plan-and-Execute(先规划再执行)模式在 2024-2025 年迅速成为工程界主流的原因。它的思路直白得像在写项目管理手册:面对复杂任务,不要上来就做,先用一次强模型调用制定一份完整的执行计划,把任务拆成若干步骤,然后再一步一步执行,每完成一步就检查进度,必要时动态调整后续计划。

具体来说,这个模式有三个核心角色:

  • Planner(规划器):接收用户任务,生成步骤清单,比如"第一步搜索相关资料,第二步整理关键信息,第三步撰写总结报告"。
  • Executor(执行器):按照清单逐步执行,每步可能涉及工具调用或 LLM 推理。
  • Re-planner(重规划器):这是最容易被忽略也最关键的一环——每完成一步,都要回顾当前进展,判断原计划是否仍然适用,如果发现新信息或执行结果不符合预期,就动态调整后续步骤。

很多人会问它和 ReAct 的关系。简单来说:ReAct 是"思考-行动-观察"的单步循环,每一步都是即时决策,走一步看一步,适合快速应对动态变化;Plan-and-Execute 则在 ReAct 之上加了一层全局编排,负责"做什么"的整体安排。两者不是替代关系,而是经常搭配使用——Plan-and-Execute 决定任务拆分和步骤顺序,ReAct 负责每个具体步骤怎么执行。

这种架构分离带来了一个工程上的巨大好处:规划阶段可以用 GPT-4、Claude Opus 这类强模型保证方向正确,执行阶段则可以用速度更快、成本更低的模型(甚至小模型)来提高效率,两端可以独立优化成本和质量。包括 LangGraph 在内的主流 Agent 框架,现在都内置了对这种模式的原生支持。

2026 年的新现实:混合规划成为主流

时间走到 2026 年,行业正在从"单一规划范式"走向"混合规划"。根据最新的技术实践,主流 Agent 框架已经不再局限于某一种模式,而是根据任务特性动态选择合适的规划策略。

简单的、步骤在 5 步以内且没有分支的任务,直接用 CoT 就够了,成本最低、响应最快;需要探索多种可能性但不需要多源结论合并的任务(比如技术选型、创意发散),ToT 仍然是性价比最高的选择;而面对竞品分析、科研写作、复杂软件开发这类需要多源信息融合、多分支结论汇聚的长程任务,带有动态重规划能力的 Plan-and-Execute 是目前最稳妥的方案。

更前沿的探索已经在向图谱规划(GraphPlan)方向演进:用结构化的图来表示任务依赖关系,支持并行执行子任务,再将结果汇聚。配合 MCP 协议的标准化落地、推理成本的持续下降,以及多智能体协作模式的成熟,Agent 的规划能力正在从"单模型推理技巧"进化为一套完整的系统工程。

一个值得注意的趋势是:随着 Claude Code、Codex 等 AI Coding Agent,以及 Manus、Hermes 等新一代通用 Agent 框架的出现,2026 年的顶尖 Agent 已经开始具备"自进化"能力——它们不仅能完成任务,还能在执行过程中沉淀可复用的 Skill 库,通过自我反思和反馈循环持续优化规划质量。

写在最后:选型比追新更重要

回到最实际的问题:在今天做 Agent 开发,到底应该选哪种规划模式?

答案可能会让追逐前沿的人失望:90% 的生产场景,CoT 加 Plan-and-Execute 的组合就足够用了。CoT 几乎零成本,应该作为所有任务的默认配置;Plan-and-Execute 在长链路任务上提供全局视角,规划与执行分离的架构也便于成本优化。ToT 适合在准确率要求极高、且确实需要多路径探索的关键环节局部使用,不建议全链路铺开,否则 3-5 倍的调用成本会很快吃掉你的预算。至于 GoT,理解它的思想即可,除非你在做前沿研究,否则不必强行引入。

从一句"请一步步思考"的 prompt hack,到今天能够自主拆解任务、动态调整计划、持续自我进化的复杂规划系统,LLM 规划能力的四年进化史,其实也是大模型从"玩具"走向"工具"、从"演示"走向"生产"的缩影。真正重要的从来不是用上了最前沿的算法,而是在精度、成本、延迟这三者的三角博弈中,找到最适合你业务场景的那个平衡点。

毕竟,规划能力的终极目标从来不是"看起来聪明",而是"把事做成"。
沿的算法,而是在精度、成本、延迟这三者的三角博弈中,找到最适合你业务场景的那个平衡点。

版权声明: 本文来自互联网用户投稿,该文观点仅代表作者本人,不代表本站立场。本站仅提供信息存储空间服务,不拥有所有权,不承担相关法律责任。如若内容造成侵权/违法违规/事实不符,请联系邮箱:809451989@qq.com进行投诉反馈,一经查实,立即删除!
网站建设 2026/8/31 23:42:26

解决超声波测距稳定增长问题:从HC-SR04原理到STC15单片机代码优化

1. 项目概述:从“稳定增长”现象切入超声波测距核心最近在准备蓝桥杯单片机竞赛,特别是国赛和客观题部分,很多同学在调试超声波测距模块时,都会遇到一个经典又让人头疼的问题:代码烧录进去,超声波模块的返回…

作者头像 李华
网站建设 2026/9/1 5:41:08

双2.5G网口+AMD AI芯片的迷你主机:软路由、虚拟机与本地AI一体机

上周有个朋友问我:有没有一台小主机,能当软路由、能跑几个虚拟机、偶尔还能玩点本地小模型?我当时还没给出明确答案,因为他提的要求其实很分裂:软路由需要网口够多、功耗够省;本地 AI 推理需要 CPU 强、内存…

作者头像 李华
网站建设 2026/9/2 8:27:52

水面无人艇控制实战:从系统建模到PID轨迹跟踪与参数整定

简介:在无人系统运动控制领域,PID控制凭借结构简单、参数物理意义明确等优势,依然是工程落地的首选算法。但面对水面无人艇这类存在强非线性、模型不确定性与环境扰动的欠驱动系统,仅靠PID调试经验难以获得理想效果,其…

作者头像 李华
网站建设 2026/9/1 7:37:16

定制CPU上运行Doom:从交叉编译到性能验证的完整指南

“万物皆可 Doom”这句话在极客圈流传了很多年。过去几年它被反复验证:计算器、打印机、智能冰箱、键盘、法律文档、Windows 记事本,甚至生物细胞里都跑过《毁灭战士》。这次要看的,是这一类玩法里更贴近底层的一个方向:开发者在名…

作者头像 李华
网站建设 2026/9/2 7:48:34

英飞凌与Edge Impulse联手,边缘AI开发终于有了平台选择权

英飞凌和Edge Impulse的合作官宣有一阵子了,业内讨论不少,但多数文章停留在"两家签约了、联调了"这种新闻稿层面。我在嵌入式AI和TinyML这条线上摸爬滚打了几年,看到这条消息时第一反应是:这事儿对开发者最大的价值&…

作者头像 李华
网站建设 2026/9/1 7:34:52

STM32与FreeRTOS实战:电磁炮系统设计与嵌入式开发全解析

1. 项目概述:从零到一的电磁炮国赛冲刺之路2019年的全国大学生电子设计竞赛(电赛)已经过去几年,但“电磁炮”这个题目至今仍是许多电子爱好者、在校学生津津乐道的话题。它不像传统的电源或控制类题目那样有明确的“标准答案”&am…

作者头像 李华