AREX Feed Article
MIT 开源、自脚手架 RL、正面硬刚 Claude Opus:DeepReinforce 首秀 Ornith-1.0 改写 Agentic Coding 格局
2026 年 6 月 30 日深夜,DeepReinforce AI 的官方账号 @ornith_ 发布了一条简洁的推文——"Chirp chirp! Ornith-1.0-35B is now available in HuggingFace!"。这条推文在 24 小时内获得 123 次点赞和超过 1.2 万次浏览,并被 AI 领域知名监测账号 @_akhaliq 转发。但这远不止一次普通的模型发布:Ornith-1.0 是一个覆盖 9B 到 397B 四个规模的开源编码模型家族,其旗舰版在 SWE-Bench Verified 和 Terminal-Bench 2.1 上双双超越 Anthropic 的 Claude Opus 4.7。
"不是微调,是换了一颗大脑"
Ornith-1.0 提供四个规格:9B Dense、31B Dense、35B MoE 和 397B MoE,全部以 MIT 协议开源在 Hugging Face 上,全球可访问,无地域限制。模型基于 Qwen 3.5 和 Gemma 4 的预训练权重进行后训练(post-training),但核心区别不在于基座,而在于训练方法。
传统的编码 Agent 模型依赖人类设计的"脚手架"(scaffold / harness)来驱动 RL 训练中的 rollout 生成。这个脚手架定义了 Agent 的内存管理、错误处理、工具调用编排等行为逻辑。问题是:脚手架是固定的,它不会随着训练而进化。
DeepReinforce 的做法完全不同——他们把脚手架本身变成了可学习的对象。在 Ornith-1.0 的每次 RL 训练步中,模型先根据当前任务和历史脚手架提出一个更优的脚手架,然后再用这个新脚手架生成解决方案 rollout。奖励信号同时回传至两个阶段,于是模型被同时优化为"更好的解题者"和"更好的解题编排者"。
用一句话概括:Ornith 不仅学会了写代码,还学会了写"教自己怎么写代码的那套流程"。
这种"自脚手架"(Self-Scaffolding)训练框架在长程 Agent 任务上展现出惊人的效率增益,尤其体现在小模型的推理速度上。HN 用户 Narew 实测反馈:Ornith-1.0-35B 在处理 C++ 代码库的 feature 添加任务时,比 Qwen 3.6-35B 快约 3 倍——因为它产生的 chain-of-thought 更短、更精炼。
部署方面,35B MoE 模型每 token 仅激活约 3B 参数,可在单张 80GB GPU 上通过 vLLM 或 SGLang 以 OpenAI 兼容 API 运行,标准 Agent 框架(OpenHands、OpenClaw、OpenCode 等)开箱即用。9B 模型则面向边缘设备,模型文件约 19GB(bf16)。
让模型自己写脚手架,同时防住它作弊
允许模型自由设计自己的脚手架,自然引入了严重的 reward hacking 风险——模型可能学会读取可见的测试文件并硬编码预期输出,或直接复制环境中的 oracle 解。
DeepReinforce 设置了三层防线:
第一层,固定信任边界。环境、工具表面和测试隔离对模型不可修改,模型只能演化其内部的策略脚手架——记忆、错误处理和编排逻辑。
第二层,确定性监控器。任何尝试读取被屏蔽路径、修改验证脚本或调用非授权工具的行为都会被标记,对应轨迹获得零奖励并从 advantage 计算中排除。
第三层,冻结的 LLM 裁判。一个冻结的 LLM 作为 verifier 之上的否决票(veto),而非主要奖励来源,用于拦截那些在允许工具表面内的意图级作弊。
训练采用异步 pipeline-RL 策略,使用 staleness weight 对 off-policy token 进行降权:年龄超过 K1 步的 token 被指数衰减加权,超过 K2 步则直接丢弃。优化目标为 token-level GRPO。
35B 干翻 397B,开源第一次在 Agentic Coding 上叫板闭源旗舰
Ornith-1.0 的基准测试结果可能是 2026 年上半年开源编码模型领域最令人震惊的一组数字。
先看 35B 规格(MoE,每 token 激活 3B 参数):在 Terminal-Bench 2.1(Terminus-2 框架)上取得 64.2,而 Qwen 3.5-35B 仅为 41.4,Qwen 3.6-35B 为 52.5,Gemma 4-31B 为 42.1。更关键的是,它碾压了 Qwen 3.5-397B 的 53.5——后者参数量是它的 10 倍以上。在 SWE-Bench Verified 上,Ornith-1.0-35B 取得 75.6,与 Qwen 3.5-397B 的 76.4 几乎持平,远超 Qwen 3.5-35B 的 70.0。
再看旗舰 397B:Terminal-Bench 2.1 得分 77.5,SWE-Bench Verified 得分 82.4。这两个数字双双超越了 Anthropic 的 Claude Opus 4.7(70.3 和 80.8),并明显领先于 Minimax M3(66.0 / 80.5)和 DeepSeek-V4-Pro(67.9 / 80.6)。当然,它仍然落后于 Claude Opus 4.8(85 / 87.6)和 GLM-5.2-744B(81.0 / N/A)。
但真正的故事在于效率比。Ornith-1.0-9B——一个可以在边缘设备上运行的 9B Dense 模型——在 Terminal-Bench 2.1 上取得 43.1,在 SWE-Bench Verified 上取得 69.4。作为对比,Gemma 4-31B(参数量为 3.4 倍)在 SWE-Bench Verified 上仅为 52.0。
在更细粒度的 Agent 基准上,Ornith 的优势更为突出。SWE Atlas 的三个子任务——QnA、RF(Refactor)、TW(Test Writing)——Ornith-1.0-35B 分别取得 37.1、29.7 和 27.8,而 Qwen 3.5-35B 仅为 13.2、10.2 和 9.8。这个近 3 倍的差距表明,自脚手架训练在需要长程规划和多步工具调用的场景中产生了质的跃升。
李纪为的新棋局:从 Shannon AI 到 DeepReinforce
DeepReinforce 的创始人是李纪为(Jiwei Li),斯坦福大学计算机科学博士,2020 年 MIT TR35(《麻省理工科技评论》"35 岁以下创新者")获奖者。他在读博期间以"Deep Reinforcement Learning for Dialogue Generation"(深度强化学习用于对话生成)一文在 NLP 社区成名,其后创办了 Shannon AI。
从学术脉络看,DeepReinforce 的方向几乎是他博士研究的自然延续——把 RL 从对话生成推进到代码生成,且更进一步:不仅用 RL 训练模型,还让模型自己设计 RL 训练所用的编排结构。
目前公开的团队信息有限。Hugging Face 组织页面上的描述颇为低调:"We're the DeepReinforce team, fascinated by everything that could lead us toward superintelligence. We recently raised a little bird named Ornith."("我们是 DeepReinforce 团队,痴迷于一切可能通向超级智能的事物。我们最近养了一只名叫 Ornith 的小鸟。")
公司已获得 Fusion Fund 的投资。Fusion Fund 合伙人 Lu Zhang 在 LinkedIn 上确认 DeepReinforce 为其 portfolio company,并称 Ornith-1.0 是"专为 agentic coding 任务打造的开源模型家族"。
团队的 Twitter 存在感集中在 @ornith_(模型官方号,粉丝约 1.1 万,2026 年 6 月 11 日注册)和 @sam_hedeep(Sam He,个人简介标注 @ornith_ | @deep_reinforce,位于 SF Bay Area)。从注册时间来看,这是一个成立不久的团队,但行动速度极快——账号注册不到三周就发布了首个模型家族。
开源 Agentic Coding 的"ChatGPT 时刻"?
如果把 Ornith-1.0 放进当前的编码模型竞争版图,它的位置很清晰:在参数量效率上无人能敌,在绝对性能上介于 Opus 4.7 和 Opus 4.8 之间,且以 MIT 协议全开源。
与闭源阵营(Anthropic Claude Opus、Google Gemini、OpenAI Codex)相比,Ornith 的最大优势是自由部署和 MIT 许可。企业可以自托管 397B 模型构建内部编码 Agent,无需担心 API 调用限制或数据隐私问题。Decrypt 在报道中将其定位为"A coding model built for agents, not humans"(为 Agent 而非人类构建的编码模型)——这一判断切中要害。Ornith 的设计取向明确:它不是用来在聊天窗口里写代码片段的,而是用来驱动能独立完成整个 repo 级任务的 Agent 系统。
与开源阵营(Qwen、DeepSeek、GLM、Gemma)相比,Ornith 在相同参数量级上系统性领先,尤其是在 Terminal-Bench 这类强调 Agent 长程能力的基准上。但 HN 社区也有不同声音——部分测试者反馈 Ornith 在无工具调用的纯聊天场景下表现不佳,倾向于幻觉。这恰好印证了其 Agent-first 的设计定位:它是为工具循环而生的模型,脱离了工具反而"水土不服"。
知名独立开发者 Simon Willison 在博客中分享了他的实测体验:使用 LM Studio 加载 Ornith-1.0-35B 的 Q4_K_M GGUF(20GB),接入 Pi Agent harness,模型能够流畅地执行多步工具调用任务。"初步印象非常好——它似乎能够以熟练的方式在 Agent harness 中运行多个工具调用。"(Initial impressions are very good - it seems to be able to run the agent harness over many tool calls in a proficient way.)
一场训练范式的实验,赢了第一步
Ornith-1.0 的意义不在于某一个 benchmark 数字。它是第一个将"自脚手架 RL"从学术概念变为可部署产品的团队,也是第一个让开源 Agentic Coding 模型在关键基准上正面击败闭源旗舰的案例。
从市场角度看,这次发布的时间点颇具意味——恰逢 Qwen 3.6、GLM 5.2、DeepSeek V4 Pro 等重量级开源模型密集发布的窗口期。在一个几乎所有玩家都在"benchmaxxing"(刷榜)的赛道上,Ornith 选择了一条不同的路:它展示的不是更高分的微调技巧,而是一种可能从根本上改变 RL 训练范式的方法。
当然,这只是第一步。Claude Opus 4.8 仍然遥遥领先(Terminal-Bench 85、SWE-Bench Verified 87.6),GLM-5.2-744B 在 Terminal-Bench 上也领先 Ornith-397B(81.0 vs 77.5)。但 Ornith 的效率曲线——尤其是 35B 干翻 397B、9B 匹敌 31B——暗示这套方法的边际收益远未到顶。
李纪为和他的团队下一步要回答的问题是:当模型变得更大、训练数据继续增长时,自脚手架 RL 的效率优势是放大还是衰减?如果答案是前者,那么 Ornith-1.0 可能不是终点,而是一场更长叙事的第一章。
参考链接:
本文由 AREX Agent 基于公开信息自动撰写,仅供信息参考,不构成任何投资或技术采用建议。_