
Claude Code 背后的构建者已经不再给 agent 写提示词了。这是他切换过去的那套 14 步系统。
Claude Code 创造者:「我已经不再提示 Claude 了。我有一堆循环在跑。是它们在提示 Claude,并搞清楚该做什么。我的工作是写循环。」
当打造这个工具的人告诉你,你现在的用法已经落后一代了,那就值得再认真看一眼。别再给 coding agent 一条条写提示词了。开始设计那些会替你提示 agent 的循环。
变化一句话就能说清。提示词运行一次就停下。循环会一遍遍运行,直到某个目标真的达成。所谓循环工程,就是把自己从「按回车的人」这个位置上替换掉。你设计一个系统,让它替你按。
大多数人把这件事想复杂了。它比那些炒作听起来要简单。这是一张 14 步路线图:从一次只敲一条提示词,走到让 agent 在你睡觉时也能把事情做完。
3 个部分。14 个步骤。停止提示。开始设计。
第一部分:从提示词使用者到循环工程师的转变
1. 先理解循环到底是什么
普通提示词是一次性的。你问,它答,它停下,然后你读完再问。循环则是一条会反复运行的提示,直到某个具体目标完成为止。推理、行动、观察,然后把结果拿去对照目标,再来一轮。它只有在做完时才会回到你这里。
2. 别再按任务思考,改按目标思考
提示词使用者的一整天,就是一条条小指令。循环工程师交出去的是一个目标,以及一条「完成」规则,然后让系统自己走到终点。你不再敲一百次键盘,而是写下一个目标,让循环自己去追。
3. 动手搭任何东西之前,先跑四条件测试
不是每个任务都值得做成循环。大多数都不值得。在你给某件事套上循环之前,先用四个问题筛一遍:
这个任务会重复发生吗?一次性任务只需要一条提示词。
有没有清晰的完成定义?循环需要一条它能识别的终点线。
你承担得起浪费吗?循环会一直自我提示,直到它满意为止,所以会烧 token。
它有没有完成任务并检查自己工作的工具?如果它不能验证,就不能形成循环。
四个问题全是 yes,这才是循环候选。少一个框没勾上,它就继续保留为手动提示。

4. 接受迭代曲线
AI 从来不会一次就做出什么好东西。把尝试次数放在一条轴上,把质量放在另一条轴上,你会看到曲线随着每轮反馈往上爬。第一次尝试也许只有 50%。每次修正都会把它再推高一点,直到到达你能接受的位置。关键洞察是:把这段「反馈—迭代」的爬坡交给 agent,而不是自己手动跑完。到了第三、第四次尝试,循环往往已经越过了你本来会停止打字的位置。
第二部分:一个有效循环的四个构件
剥掉术语,一个循环其实只有三个活动部件:触发器、动作、停止条件。搭好下面四个构件,这三个部件就会自己跑起来。
5. 触发器:什么启动循环
启动一个循环有三种简单方式,从最容易的开始:
- /loop 按你机器上的固定间隔运行。「每 6 小时检查一次今天的天气,告诉我是否应该改变计划。」简单,但你一合上笔记本它就停了。
- /schedule 在云端按你设定的节奏运行同一件事。每天早上 8 点,笔记本关着,它也在远程跑。
- 自定义循环编排 skill 是一个保存好的 skill,里面已经放着目标、步骤和验证方式。你输入 /check-weather-loop,按下回车,整套流程就启动。这就是构建者们日常实际运行它们的方式。
6. 执行 skill:最重要的构件
没有经过实战检验的 skill,就不要搭循环。skill 是一套保存好的指令,每次都以同样方式运行,所以你不用反复重打。第 5 步里的编排 skill 本身并不干活。它调用的是专门的执行 skill,每个执行 skill 只负责一个单一任务,而且 agent 已经知道要按你的方式去做。
这个差别就是关键所在。如果没有 /analyze-workout 这个 skill,循环看到下雨,只会说「取消你的跑步」。如果有一个知道你喜欢雨中跑步的 skill,答案就会反过来。skill 是你判断力存放的地方。先单独把它打磨到可靠,再让循环去调用它。
7. 目标:让它客观
每个循环都需要一个它能识别为「已经完成」的目标。「把网站发布到这个域名,并确保它在两秒内加载出来」比「把网站做好」强得多。最强的循环读起来像一个指标:持续迭代,直到这个数字达到那个目标。目标越模糊,agent 越容易漂移。
8. 验证:把抽象目标接到可检查的东西上
目标和验证其实是同一个动作。你不能设一个循环无法确认的目标。写代码时这很干净:访问域名,检查内容是否加载,测量加载时间,并让一个 review skill 在停止前批准这些改动。
对于模糊工作,你得自己搭桥。比如一个 /writing-voice skill 和一个 /fact-checker skill,各自返回 approved 或 not approved,或者给出 1 到 10 分。这样,一个抽象目标就有了可检查的关口。一个循环的上限,永远取决于它的完成检查有多好。
9. 加第二双眼睛
做出成果的那个 agent,会是一个有偏见的评分者。把输出交给另一个。一个独立的 sub-agent,或者完全不同的模型,都比写出这东西的 agent 更容易给出干净判断。这就是 maker-checker:一个 agent 负责做,一个 agent 负责评分,并把意见喂回循环。
10. 输出和记忆:所有人都会跳过的部分
循环会产出某个东西。这很明显。人们漏掉的另一半是记忆。除非你记录发生过什么,否则每个循环都从零开始;没有记录,就没有改进。你会在每次运行时撞上同一堵墙,并为同样的 token 付费。
Addy Osmani 用一句话说清了:agent 会忘,repo 不会。Anthropic 自己的指南也同样直白。给它一个写笔记的地方,哪怕只是一个 markdown 文件。把什么有效、什么失败记成一份日志,就能把一个只会重复的循环,变成一个会改进的循环。

第三部分:不用盯着它也能运行
11. 从小处开始,打开循环训练模式
挑一个你已经手动证明可行的最小任务。前几次运行时,打开循环训练模式,也就是一种步骤审批模式:循环每走一步都会暂停,等你批准。它的输出会像「在我烧 token 之前,先快速确认一下」这样,然后停在那里等你。你可以看着它执行你真正想要的动作,再把它放开。等你信任它之后,关掉训练模式,让它干净地跑完。
下面是一段用来搭脚手架的提示词:
You are helping me build a loop orchestration skill in Claude Code.
Goal of the loop: [the repeating task, in one sentence]
Definition of done: [the objective rule that means it's finished]
Build the skill with:
1. A trigger I can run as /[name]-loop
2. The execution skills it should call (list the ones that already exist)
3. A verification step that returns approved / not approved or a 1-10 score
4. A separate sub-agent to grade the output, not the agent that produced it
5. An output file and a memory file that logs what worked and what failed each run
Start in loop training mode: pause at every step for my approval before continuing.
Do not run past the done-check.
12. 设置你的人类检查点
把 agent 当成实习生。「策划公司派对」可能会跑向任何方向,所以在它花钱之前,你会希望先确认日期、场地和主题。循环也一样。找出那些一旦走错、后面整段运行都会偏掉的时刻,把它们设成人类验证检查点。你实际检查得越少,它偏航得越远。
13. 选择合适的循环形态
三种形态几乎覆盖所有场景:
- 单 agent 循环 - 一个 agent 推理、行动、观察、重复。大多数工作只需要这个。
- Maker-checker - 一个 agent 做事,另一个评分,并把反馈送回去。
- 带帮手的 manager - 一个 orchestrator 在下面调度几个 sub-agent。
别因为一条推文让你觉得自己落后了,就急着拉起一队全天候 agent。让架构规模匹配工作本身,而不是匹配截图。

14. 让循环匹配它的成本和你的真实工作
一个硬目标,加上一条硬性的完成检查,可以跑 12 个小时,而很多这样的运行并不值它消耗的成本。有用的循环通常是 30 分钟到几个小时,或者是睡前启动、早上读结果的一块大任务。让一个循环检查 45 个来源来决定该构建什么,值得等。跑四天通常不值得。
而且不是每个人都需要 agent 日夜不停地工作。做知识工作的 solo operator,使用循环的方式会不同于一个整天重构代码库的团队。借鉴方法,不要照搬别人的使用量。
复利所在
让一个循环真正运转起来的所有要素,可以压成一行:
一个可检查的目标。一个硬停止点。合适的工具。记忆。一个独立检查者。运行前有计划,运行后有日志。
漏掉验证,你就没有循环。你只有一个绕圈猜测的 agent。
提示词工程师要的是一个好输出,然后自己检查。循环工程师构建的是一个无需他盯着、就能产出已验证结果的系统。打字从来都不是最有价值的部分。
现在就拿你手头上的某件事跑一遍四条件测试。第一件你真的会交给循环的工作是什么?