AREX Feed Article
微软放出 Orchard:3B 参数在 SWE-bench 砍下 73%,硬刚 10 倍大模型
3B 参数,在 SWE-bench 追平 300B 俱乐部
微软研究院 8 月 3 日开源了智能体建模框架 Orchard,其软件工程 agent Orchard-SWE 在 SWE-bench Verified 上达到 69.7%,经 value-model 重排序后升至 73.0%——而它只用了约 30 亿激活参数。
微软研究院在博客中写道,这"逼近使用 10 倍以上大模型的前沿系统"——论文中的对比图显示,达到类似分数的 MiniMax-M2.1(74.0%)、DeepSeek-V3.2(73.1%)和 GLM-4.7(73.8%)参数规模均远超 Orchard-SWE。
与框架一同放出的还有 107,000 条 SWE 训练轨迹、评估方法以及完整的 MIT 协议代码库。
社区反应:Wenlin Yao 亲自推广,Spotify 工程师直指核心
论文共同作者、微软研究院 Principle Researcher Wenlin Yao 在 Orchard 官宣后发推:"Orchard 现已全面开放——代码、数据和新结果。来试试!"
Spotify 后端工程师 Mohammed Aboullaite 评论称,Orchard 的架构思路值得注意——它不把模型当作整个 agent,而是将环境做成可复用层,直接在 Codex、OpenClaw 等真实部署 harness 中训练。他写道,这"很好地说明了 agent 性能正越来越多地成为一个系统工程问题,而不仅是模型规模问题"。
5 月挂论文,7 月放 RL,8 月全面开源
Orchard 的开源是一个渐进的节奏。论文早在 2026 年 5 月就已登上 arXiv(arXiv:2605.15040),当时报告 Orchard-SWE 在 SWE-bench Verified 的分数为 67.5%。
6 月,团队发布 OpenWebRL,将 Orchard-GUI 扩展到真实网站上的在线多轮强化学习。 7 月,OpenForge RL 上线——这套工具让 agent 可以直接在 ZeroClaw、OpenClaw、Codex 等真实 harness 中跑 RL 训练,消除了简化训练环境与真实部署之间的错配。
到 8 月 3 日,微软研究院通过官方博客将整个 Orchard 堆栈一次性放出:环境服务、三条训练配方(Orchard-SWE、Orchard-GUI、Orchard-Claw)、训练数据以及评估方法。 从论文到全面开源,前后不到三个月。
此前,开源 agent 研究长期受困于基础设施碎片化——每个团队需从零搭建沙箱、训练管线和评估流程。Orchard 的做法是把环境层做成独立服务,让不同任务共用一套底座,以此降低复现和比较的门槛。
环境层才是 agent 的胜负手
Orchard 的核心不是模型,是一个叫 Orchard Env 的环境服务层。
这套 Kubernetes 原生的轻量服务提供沙箱生命周期管理、命令执行、文件 I/O 和网络隔离,通过 REST API 对外暴露。性能数据:单条命令执行延迟平均 0.28 秒,比 E2B 快 2.7 倍,比 Modal 快 7.3 倍;并行拉起 1000 个沙箱,26 秒完成,成功率 100%。
Orchard 的另一项关键设计是让 agent 直接在真实部署 harness 中训练。大多数开源训练工具只能跑简化版 agent 逻辑,训练环境与部署环境存在错配。Orchard 通过轻量代理记录 harness 自身的模型调用作为训练数据,让 agent 在 Codex、OpenClaw、ZeroClaw 等真实环境中端到端训练。切换 harness 只需改一条命令,不用重建镜像。
训练方法上,Orchard-SWE 用了三个递进手段:credit-assignment SFT 从失败轨迹中提取有效片段,不让失败的尝试白费;Balanced Adaptive Rollout 在稀疏奖励条件下自适应分配 rollout 资源;最后训练一个 40 亿参数的 value model 对候选解重新排序,将分数从 69.7% 推至 73.0%。
过去拼模型大小,现在拼基础设施
在 Orchard 之前,SWE-bench Verified 的领先者几乎全是参数规模数百 B 甚至上 T 的模型。论文中的性能对比图显示:MiniMax-M2.1(74.0%)和 GLM-4.7(73.8%)位列前茅,开源社区的 OpenSWE-32B(62.4%)和 Scale-SWE-Agent(64.0%)则与前沿存在约 10 个百分点的差距。
Orchard 把差距缩小到了 1 个百分点以内——而且只用约 3B 激活参数。
这一转折的实质是:agent 性能的提升路径正在分化。一条路是继续放大模型,另一条路是优化训练环境和基础设施。Orchard 证明了后者在性价比上的竞争力。Spotify 工程师 Mohammed Aboullaite 的评价点到了核心——"agent 性能正越来越多地成为一个系统工程问题,而不仅是模型规模问题"。
微软研究院在博客中同时指出,团队计划让 Orchard 的训练经验可以累积复用——将已完成的 rollout 轨迹蒸馏为可复用的 value model,让新一代 agent 继承前人经验,而非每次从零开始。
agent 的下半场,从环境开始
3B 参数追平 300B 俱乐部,这件事的意义不在数字本身,而在于它揭露了一个被行业长期低估的事实:在 agent 这条赛道上,环境基础设施的差距,远比模型参数的差距更能决定最终表现。Orchard 把这件事做成了可复现的开源项目——这比任何一个 benchmark 分数都更有说服力。
Footnotes
-
Microsoft Research Blog, "Orchard: An open framework for scalable agentic AI," 2026-08-03.
-
Peng et al., "Orchard: An Open-Source Agentic Modeling Framework," arXiv:2605.15040, 2026-05.
-
GitHub, microsoft/Orchard.
-
Wenlin Yao (@YaoWenlin), X post, 2026-08-03.
-
Mohammed Aboullaite (@laytoun), X post, 2026-08-06.