AREX Feed Article
AWS 开源 Strands harness:自称基准接近 Claude Code、Codex,token 成本低 28%
2026 年 9 月 21 日,AWS 宣布开源 Strands harness:一个构建于其 Strands Harness SDK 之上、打包交付的通用 AI agent,官方称其「完整组装」(fully assembled)、开箱可用,可本地运行或部署到任意环境。它以 Python 和 TypeScript 库加 CLI 的形式提供,采用 Apache 2.0 许可证。AWS 的 Strands Agents 团队在发布了题为《Introducing Strands harness: frontier performance with 28% lower token cost》的,标题即主打「前沿性能、token 成本降低 28%」。
按博客的说法,在使用相同 Claude 或 GPT 模型的六项基准上,Strands harness 的 token 成本低 28%;在以 Harbor 框架、跨 AWS EC2 节点的分布式测试中,它与 Claude Code、Codex 及其他流行 harness 的基准分数「几乎相当」。 同日报道了这次发布,并提醒:这些性能数字全部为 AWS 自报,眼下还没有独立基准。
图片来源:Strands Agents 团队博客发布文章。
一行 Python 或 TypeScript,装出一个自带工具的通用 agent
所谓 harness,指把模型、工具和执行循环组装成可直接运行 agent 的那层软件。AWS 在博客里把动机写得直白:开发者习惯让点子先在 Claude Code 或 Codex 这类环境里「跑起来」,也常盼着把它搬上云端;而「自己动手搭 agent 的那一刻,你就只能靠自己了。要把该有的基本组件恰到好处地接起来、还原那种『开箱即好』的手感,并不容易。」(引语译自博客原文)
Strands harness 是对这件事的打包回答。按博客的定位,它是「通用 agent 而非编码 agent」:create_harness()(Python)或 createHarness()(TypeScript)一行调用,即返回一个可用的 agent。按官方博客列出的默认能力,它自带 shell、文件(read/write/edit)与 web 三类工具;自行管理上下文窗口,把大块工具结果转存为文件,并缓存请求中重复使用的部分以省时间和成本;跨运行保留长期记忆,凭 session ID(会话标识)就能续上早前的对话;把开放式子任务分派给内置的辅助 agent,用 checklist(任务清单)跟踪多步骤工作;如果存在 skills 文件(技能文件)则自动加载。The Register 补充说,发布时随附 skills 文件,接入用户自己的工具相对容易。
模型侧,它可跑在 Amazon Bedrock、Anthropic、OpenAI、Google 的当前推理模型上,博客示例还包括本地 Ollama 与 LiteLLM,模型名从 anthropic/claude-opus-5、openai/gpt-5.6-sol 到 google/gemini-3.5-flash 都有。部署侧,任何提供 Linux 容器的平台都行,博客点名的有 Modal、Cloudflare Containers、Azure Container Apps、Google Cloud Run、Amazon ECS 和 Amazon Bedrock AgentCore。另有一条命令行路径:Strands CLI 支持用自然语言做原型,/export 可导出 TypeScript 或 Python 代码副本,而 CLI 本身就构建在 Strands harness 之上。安装是 pip install strands-harness 或 npm install @strands-agents/harness,代码托管在 仓库。AWS 在文章结尾写道:「我们相信,用『电池齐全』(batteries included)的 harness 快速做出原型,能造出更有用的 agent。」
对比名单与成绩单:AWS 自认 DeepSeek 更省 token
对比名单由 The Register 列全:Claude Code、Codex、oh-my-pi、OpenCode、DeepSeek Harness。博客称,Strands harness 在这些对比中 token 效率更好、分数与对手几乎相当,部分基准上的准确率还高于其他 harness;AWS 强调这点很重要,「因为我们从不想为了更低成本牺牲准确率」。它同时承认,DeepSeek Harness 整体 token 效率最高,「不过它通常报出最低的准确率分数」。
博客还给出一个单项数字:在 Fable 5 上跑 Terminal Bench 2.1,Strands harness 比 Claude Code 成本低 77%、分数更高。同一段里 AWS 也写道,另外两个开源 harness 对阵 Claude Code 时的成本/准确率表现同样相近。
省下的 token 从哪来:prompt caching 加三条上下文管理默认值
按 AWS 的归因,省出来的 token 主要来自默认开启的 prompt caching(提示词缓存)和上下文管理,博客称「默认上下文管理在很大程度上决定了 token 效率与准确率」。三条默认值:工具结果超过 1,500 token 左右即被截断;上下文窗口占用超过 85% 时触发摘要压缩(compaction);发生溢出时,上下文恢复会在 agent 循环内自动运行。The Register 的转述与此一致。
比较口径被点名:通用 agent 对比五个编码 agent
问题出在比较口径上:对比名单上的五个 harness 全部是编码 agent,而博客把 Strands harness 定位为通用 agent。The Register 据此提出,值得追问换成其他通用型 agent 来对比会是什么成绩;博客中未见相应的对比。
论文未刊,独立验证缺位
博客在基准部分末尾预告:「请留意我们研究人员后续关于这些基准的论文。」The Register 也写道,Amazon 计划发表一篇包含更多基准细节的论文,截至其 2026 年 9 月 21 日发稿尚未刊出。在论文出现之前,这些基准数字都只是 AWS 的自报口径;眼下能立刻验证的,是已经上架 PyPI 和 npm 的开源代码本身。
参考链接
- Strands Agents 团队官方博客(博客索引):
- Introducing Strands harness: frontier performance with 28% lower token cost(Strands Agents 团队博客,2026-09-21):
- The Register: AWS bolts together open source agent harness, says it sips fewer tokens than rivals(2026-09-21):
- GitHub:strands-agents/harness-sdk(Strands harness 与 SDK 所在 monorepo,Apache 2.0):
- 配图来源(Strands Agents 团队博客发布文章卡片):