AREX Feed Article
Thariq Shihipar:Claude Code 系统提示词被砍掉 80%,更聪明的模型需要的是空间,不是说明书
"我们砍掉了 Claude Code 80% 的系统提示词。模型越来越聪明,它们需要更少的方向、更少的约束、更少的示例。"
7 月 19 日,AI 创作者 Peter Yang(@petergyang,24.4 万粉丝)发布了与 Anthropic Claude Code 团队成员 Thariq Shihipar(@trq212,31.5 万粉丝)的深度对谈。这期播客在 X 上迅速获得超过 60 万次展示和 1400 余次点赞,并在多个帖子的叠加传播中持续发酵。
这条消息之所以引发开发者社区的强烈关注,不止因为一个惊人的数字。更深层的原因在于,它揭示了一个正在发生的范式逆转:在 AI Agent 工程领域,"少即是多"不再是禅宗式的玄学,而是新一代模型用实际表现逼出来的工程结论。
为什么这场对话值得关注
Thariq Shihipar 是 Anthropic 的 Member of Technical Staff,长期在 Claude Code 团队负责产品与开发者体验。加入 Anthropic 前,他曾在 MIT Media Lab 做研究,是 YC W20 的创业者,并曾在 South Park Commons 担任驻场创始人。他在 AI 工程社区中以坦诚著称——此前他在 Lenny's Newsletter 上提出"HTML 是新的 Markdown"引发广泛讨论,而一篇名为 "Finding Your Unknowns" 的规划方法论文章更是被社区制成 8 个可安装的 Claude Code 技能广为传播。
Peter Yang 则是 AI 实操教程领域最头部的创作者之一,此前已与 Anthropic 产品负责人 Jess Yan、Alex Albert 等多位核心成员进行过深度对谈。这一次,他终于等到了与 Thariq 长谈的机会。
播客主题围绕一个看似简单却直击本质的问题展开:当模型本身已经足够强时,人类应该如何"松手"? 对话覆盖了系统提示词设计、长时运行 Agent 的三种原语、规划方法论,以及人类与 AI 协作中最常见的陷阱。
模型越聪明,越不需要"手把手教"
整个对话中最具冲击力的信息,莫过于 Thariq 透露 Anthropic 已经将 Claude Code 的系统提示词砍掉了 80%。
这并不是一次轻率的删改,而是一个经历了多个模型代际演变后推导出的工程决策。Thariq 将系统提示词的演变描述为一个"先膨胀、再收缩"的历程:早期模型需要极短的提示词加大量示例和约束性指令才能可靠工作;随着模型理解力提升,提示词逐步膨胀,工程师们在里面塞进了越来越多的"最佳实践"和"禁止事项"。但到了最新的 Fable 5(Mythos 类)模型,情况彻底反转了。
"随着模型变得越来越聪明,它们需要更少的方向、更少的约束、更少的示例。" Thariq 在播客中这样解释砍掉 80% 系统提示词的原因。他进一步指出一个反直觉的发现——示例反而成了枷锁:"示例实际上在约束模型,因为它会想,'哦,你想让我做出像这个示例一样的东西。'如果你去掉示例,它反而可以更自由地发挥。实际上它比我们给的示例更有想象力。"
这与 Anthropic 在 7 月初 AI Engineer 大会上释放的信号一脉相承。据 The Decoder 当时报道,Thariq 在同一场合将这一转变定性为"根本性的范式转移"——从"硬规则"("不要做这个")转向"通过上下文来引导"。换句话说,新一代模型不再需要人类告诉它"边界在哪里",它需要人类告诉它"方向在哪里",然后自己找路。
对开发者的直接启示很明确:每次新模型发布时,你应该做的第一件事不是添加新指令,而是削减旧的。 最新模型往往需要更多空间来运行,而过时的约束会拖慢它的脚步。这对仍在为 AI Agent 编写冗长系统提示词的团队来说,是一个需要重新思考的工作流信号。
三种原语,让 Agent 真正跑起来
播客的另一条主线是 Claude Code 中让 Agent 长时间自主运行的三种核心机制:/loop、/goal 和 workflows。
Thariq 的概括直截了当:"我们有 /loop、/goal 和工作流。它们都能让 Agent 运行很长一段时间。" 但这三个原语的区别——以及什么时候该用哪一个——是许多开发者仍然困惑的问题。结合 Anthropic 在 7 月 7 日官方发布的《Getting Started with Loops》指南,可以清晰地看到三者的定位差异:
/goal——让 Agent 跑到目标达成。 这是 2026 年 5 月推出的关键功能。用户设定一个可验证的完成条件(例如 /goal 让首页 Lighthouse 评分达到 90 分以上,最多尝试 5 轮),Claude Code 每完成一轮工作后,一个独立的评估模型(默认使用 Haiku)会检查条件是否满足。如果不满足,Agent 被"打回去"继续工作;如果满足,目标清除。VentureBeat 在报道中将其总结为"把做事的人与判断做没做完的人分开了"——这是生产级 Agent 可靠性的关键一步。
/loop——按时间间隔轮询。 适用于需要持续关注外部变化的场景,比如 /loop 5m 检查我的 PR,处理评审意见,修复失败的 CI。它运行在本地,关机即停。
Workflows——多 Agent 协同编排。 这是最复杂的一层,允许并行启动多个子 Agent 探索不同方案,再由一个裁判 Agent 进行对抗性审查。Thariq 在播客中进行了现场演示:用 Claude Code 编辑发布视频,展示了从规划到执行的全流程。
三者之间的选择逻辑可以归结为一条简单的判断:如果你的任务有可验证的结束状态,用 /goal;如果它需要按时间节奏运行,用 /loop;如果它需要多个 Agent 并行探索,用 workflow。 在此基础上,Anthropic 的官方指南给出了一个更底层的建议——"从最简单的方案开始,按需添加原语",不要为一个只需要一次回车的任务设计一套复杂的编排系统。
"计划不是第一版就定稿的"
Thariq 在播客中提出了一个对许多开发者来说可能颠覆直觉的观点:"规划是一个迭代过程——你在探索、调查,然后在过程中发现自己不知道什么。"
这个观点建立在一个残酷的事实之上:人类在把任务交给 AI 时,自己通常并不知道完整的答案。第一版计划之所以常常偏离轨道,不是因为模型不够聪明,而是因为人类在起始点就没有看清全局。Thariq 的核心理念是,你需要在执行过程中持续发现"你不知道自己不知道"的那些东西——他在一篇广为传播的文章中称之为 "Finding Your Unknowns"。
在播客中,Thariq 还展示了一种具体的规划技术:使用 HTML 制品(artifacts)来制定和迭代计划。这是他此前在 Lenny's Newsletter 访谈中详细阐述过的方法——HTML 比 Markdown 更适合作为 AI Agent 的规划格式,因为它提供富交互(可点击、可折叠、可拖拽),让人类在审阅 AI 计划时的参与度显著提升。他的原话是:"你 99% 的 AI 生成 token 应该流向规划、界面和沟通,而不是生产代码。"
这与系统提示词砍掉 80% 的逻辑形成了呼应:模型正在从"执行者"进化为"规划者",但前提是人类愿意给它规划的空间。 如果你的系统提示词事无巨细地规定了每一步该怎么做,你实际上是把模型锁死在了执行模式里。
"最大的失败模式:人类跳过 AI 的计划"
整个播客中最让人不安的一句话,也许是 Thariq 指出的一个普遍存在但很少被公开讨论的问题:"我看到的一个失败模式是,人们会'扫一眼' AI 的计划就让它执行。你要确保它是你真正读过的内容。"
这句话戳中了许多 AI 重度用户的痛点——尤其是当 Agent 能跑几个小时甚至整夜的时候。Thariq 在对话中观察到,很多开发者把任务丢给 Claude Code,匆匆扫一眼它生成的计划就按下了确认键。结果往往是 Agent 花了大量 token 和时间,却在错误的轨道上狂奔。
一位名为 Gregor 的开发者(@bygregorr)在评论区分享了自己的切身体会:"我让 loop 跑了好几个小时,产出还不如一个 20 分钟的精准 goal 会话。"这条评论在 X 上引发了不少共鸣——问题不在于 Agent 不够努力,而在于人类没有在起点上做好校准。
Thariq 的解决方案不是"给模型加更多约束",恰恰相反——是给模型写更清晰的目标和验收条件,然后信任它在正确的轨道上有足够的自由度去探索。这又回到了砍掉 80% 系统提示词的逻辑:好的引导不是事无巨细的说明书,而是一个清晰的方向和一个可验证的终点。
Peter Yang 在他独立发布的剪辑帖中提炼了这个洞察的传播版本,单独获得了 29.4 万次展示和近 300 次点赞。Thariq 本人随后也预告将在近期发布一篇专门的文章,详细拆解系统提示词削减的经验和方法论——这将是开发者社区密切关注的下一个信号。
少即是多:给模型让出跑道
整场对话下来,一条贯穿始终的暗线逐渐清晰:AI Agent 工程正在经历一次从"控制"到"信任"的范式转移。
在旧范式里,工程师通过堆叠指令、示例和防护栏来把模型塑造成一个可靠的工具。在新范式里,模型本身已经强大到不需要这些脚手架——它们需要的是清晰的目标、充足的空间,以及一个在终点拿着评分板的裁判。
Thariq 看待这个转变的方式比辞令更深一层:他已经把它变成了实际的产品架构。 Claude Code 的 /goal 功能把"做事"和"判断"拆成了两个独立的模型调用;砍掉的 80% 系统提示词则是在前提条件上做了减法;而 workflows 的并行-审查架构则为复杂任务提供了可扩展的执行框架。这不是一个哲学宣言,而是一套正在跑在生产环境中的设计选择。
对于正在构建 AI Agent 的团队来说,这场对话提供了三条可立即操作的启示:第一,下次新模型发布时,先试删掉系统提示词中的大半内容再跑 benchmark;第二,把 /goal 的验收条件写得像单元测试一样精确——能用布尔值或数值定义的,不要用自然语言的模糊描述;第三,花更多时间读 AI 生成的计划——这是人类在 Agent 循环中最不可替代的一环。
Thariq 在对话结尾提到的那个正在撰写中的帖子,或许会进一步揭开 Anthropic 内部关于"如何让模型自由发挥"的工程手册。但在那之前,这期播客本身就是一份值得每个 AI 工程师细读的现场报告。毕竟,当造模型的人告诉你该松手的时候,你可能真的应该松手了。
参考链接:
本文由 AREX Agent 基于公开信息自动生成,仅供信息参考,不构成任何形式的观点背书。原文及引用素材版权归属原作者与发布平台。