gstack v1.71 提示词瘦身揭秘:62个技能的每次调用成本如何腰斩50%
【免费下载链接】gstackUse Garry Tan's exact Claude Code setup: 23 opinionated tools that serve as CEO, Designer, Eng Manager, Release Manager, Doc Engineer, and QA项目地址: https://gitcode.com/GitHub_Trending/gs/gstack
gstack 是 Y Combinator CEO Garry Tan 开源的 Claude Code 智能体工作流工具集,内置 CEO、设计师、工程经理、QA 等 23 个"专家技能"。刚发布的 v1.71 完成了一次针对 AI 编程提示词成本的关键优化:全部 62 个技能的单次调用提示词账单最高直降 51%,首次响应更快、每次调用更便宜,而所有技能的行为完全不变——这由 A/B 评测和 CI 成本上限双重锁定。本文拆解这次"提示词瘦身"的完整机制。
上图是作者 2013 年的贡献记录,而下面这张 2026 年的热力图正是 gstack 带来的节奏——一个人以"一支团队"的速度交付,前提就是每次技能调用的开销足够低。
为什么提示词本身就是一笔账单
每个 gstack 技能在被调用时,都要先支付一笔"固定提示词成本":前导说明、引导脚本、强制阅读参考……这些内容在真正干活之前就被送进模型上下文,按 token 计费。
gstack 内置了 lib/context-bill.ts 作为"token 物料清单"工具,把每笔开销算得明明白白:
| 成本层 | 谁在付钱 |
|---|---|
| 常驻成本(always-on) | 每个技能的 frontmatter,每次会话都要读 |
| 即时成本(eager) | SKILL.md + 强制参考,每次调用都要付 |
也就是说:你并行跑 10 个技能会话,这笔"入门税"就被付了 10 遍。作者经常同时跑 10–15 个并行冲刺,这笔固定成本的放大效应极为可观。
实测数据:哪些技能的账单腰斩了
v1.71 的账单由gstack-context-bill --diff对主分支与新分支的渲染结果实测对比得出(详见 CHANGELOG.md 的 v1.71.0.0 一节):
| 账单项 | 瘦身前 | 瘦身后 | 降幅 |
|---|---|---|---|
/review每次调用 | 109.5KB(约 26.6K token) | 53.7KB(约 13.0K token) | −51% |
/land-and-deploy每次调用 | 109.8KB | 54.4KB | −50% |
/codex每次调用 | 100.0KB | 53.9KB | −46% |
| 磁盘上全部技能语料 | 6.4MB(约 1,651K token) | 5.4MB(约 1,398K token) | −15% |
| 仓库 CLAUDE.md | 66.4KB | 44.9KB | −32% |
62 个已安装技能中 50 个实现了瘦身(其余是 fixture/别名条目,本就没有前导可减)。最小的真实降幅是每次调用 −4,780 token。最关键的一条红线:整个 diff 中没有任何一处常驻或即时成本增长。
瘦身三板斧
1. 把约 18KB 内联脚本搬进两个运行时脚本
以前每个 tier-2+ 技能的 SKILL.md 里都内联了一份引导脚本和"Artifacts Sync"围栏,每个技能约 13KB、乘以 50 个技能重复存在。v1.71 将它们合并为两个运行时脚本:
- bin/gstack-skill-start:接管技能启动的前导与遥测,输出与旧散文规则相同的 STATUS 行,并带
SKILL_START_PROTO: 1握手; - bin/gstack-skill-end:收尾遥测,会话 ID 绑定、透传输出被清洗以防指令注入。
技能正文只需一行调用,省下的是"每个技能重复携带"的那份字节。
2. 按需加载:section carve 从 9 个扩到 20 个技能
这是降幅最大的机制。以/review为例,它的重量级参考文档现在放在 review/ 目录下的清单化章节(manifest)里——骨架只在步骤真正需要时指令智能体去 Read 对应章节,而不是把全部内容塞进每次调用的上下文。
v1.71 为 review、codex、land-and-deploy、autoplan、spec、setup-gbrain、qa、browse、retro、design-html、design-shotgun 共 11 个新技能加上深度 carve 的 office-hours,让 carve 名单从 9 扩到 20。design 系 carve 还强制智能体在设计开工前必读 UX 章程。章节注册的守卫与加载场景由 test/helpers/carve-guards.ts 和 test/carve-section-loading.test.ts 覆盖——20 个技能全量验证"智能体确实先 Read 章节再动手"。
3. 一次性引导文案改为条件触发
过去"仅首次出现的引导说明"会跟随每次渲染反复携带。现在它只在对应门控真正触发时、以绑定会话 ID 的指令块形式出现。你已经回答过的引导问题,永远不会再渲染。
用棘轮测试把"瘦下来"锁死
如果只改不改守护,下个版本膨胀就会悄悄回来。v1.71 引入了上下文预算棘轮(context-budget ratchet):一个免费的 CI 测试把常驻目录和每个技能的单次调用成本与已提交的天花板对比——成本增长直接让测试套件失败,成本下降则重新捕获天花板、锁在更低的位置。
相关守护分布在:
- test/skill-size-budget.test.ts:静态 SKILL.md 尺寸回归,默认不允许任何增长,突破需要写明理由并写入审计日志;
- test/catalog-budget.test.ts:聚合"发现面"预算——所有技能 name+description 的总字节锁在 1,150 token 当量以内,单个技能描述超过 260 字节即视为"正文段落冒充目录条目"。
配合 A/B 评测(skill-e2e-preamble-script-ab将新脚本渲染钉死在旧内联渲染的行为上),升级承诺变得可验证:如果某个技能行为与 v1.69 之前不同,那就是 bug,而且会被评测抓到。
对普通用户意味着什么
- 零配置:
/gstack-upgrade升级即可,无需改任何设置; - 更快:智能体开工前读的样板少了一半,首 token 延迟下降;
- 更省:每次调用成本跨全部技能下降,作者日常 10–15 个并行冲刺的开销被显著摊薄;
- 自检:升级后跑一次
bun run test,棘轮会告诉你有没有任何东西悄悄变胖。
v1.71 是"提示词工程"从写得好走向算得准的一步:技能的价值没变,变的是每一点价值都要支付的入场费。对于把 Claude Code 当生产工具用的团队,这种固定成本的持续腰斩,才是 AI 编程能否规模化的隐性前提。
【免费下载链接】gstackUse Garry Tan's exact Claude Code setup: 23 opinionated tools that serve as CEO, Designer, Eng Manager, Release Manager, Doc Engineer, and QA项目地址: https://gitcode.com/GitHub_Trending/gs/gstack
创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考