AREX Feed Article
Ornith-1.5 全系开源上线,自报 Terminal-Bench 2.1 86.1 分超过 Claude Opus 4.8
8 月 19 日,Ornith 团队在和发布 Ornith-1.5 系列:397B MoE、35B MoE、9B dense 三档,全部以 MIT 许可开源。旗舰 Ornith-1.5-397B 自报 Terminal-Bench 2.1 得 86.1 分,高于 Claude Opus 4.8 的 85.0;SWE-bench Verified 报 86.0,DeepSWE 报 56。这些对比数字全部出自 Ornith 自己的评测。
这也是一个年轻团队的第二代模型。官方 X 账号创建于 2026 年 6 月 11 日,首代 Ornith-1.0 在 6 月发布,两个月后 1.5 就接了上来。Ornith 称其训练走端到端自我改进循环:模型自己生成训练任务、自己搭建任务脚手架(scaffold)、自己产出解题 rollout,再用强化学习持续改进。
六月的 1.0,八月的 1.5
显示 Ornith-1.0 于 2026 年 6 月发布,覆盖 9B Dense、31B Dense、35B MoE、397B MoE 四档,主打 agentic coding,卖点是「自脚手架」:模型自己为任务搭建解题框架。1.5 把这条路线扩成完整闭环,出题、脚手架、rollout 三者一起参与强化学习。
在 上,团队自述是「DeepReinforce 团队」,写道「我们最近养了一只名叫 Ornith 的小鸟」。更早的博客显示这个团队一直在做强化学习相关研究:2026 年 4 月的 GrandCode,官网自称在 Codeforces 连续三场正式赛排名第一,超过所有人类选手以及 Claude Opus 4.7、Gemini 3.1 Pro、GPT-5.5。
86.1 对 85.0:「相当」只在部分基准成立
博客为 397B 版贴出完整对比表,对手包括 Claude Opus 4.8、GLM-5.2(753B)、DeepSeek-V4-Flash-0731(284B)、Kimi K3(2.8T)和上一代 Ornith-1.0。领先项集中在终端操作与智能体任务:Terminal-Bench 2.1(Terminus-2)86.1,对 Opus 4.8 的 85.0、GLM-5.2 的 81、DeepSeek-V4-Flash-0731 的 82.7;SWE-bench Verified 86 对 85.8;BrowseComp 86.6 对 84.3;WideSearch 80.8 对 72.9。
落后项同样在这张表里:DeepSWE 56 对 59,SWE-bench Pro 65.1 对 68,HLE(无工具)44.6 对 49.8,Frontier-Bench v0.1 13.5 对 21.1,NL2Repo 59.5 对 69.7。「与 Opus 4.8 相当」只在这张表的局部成立。对两个开源对手则每个基准都领先,其中 DeepSWE 一项对 GLM-5.2 领先 9.8 分(56 对 46.2);Kimi K3 则在 Terminal-Bench 2.1(88.3)和 DeepSWE(67.5)上仍然更高。相比上一代,397B 的 DeepSWE 从 8 分跳到 56 分。
评测细节写在博客脚注里:所有 Ornith-1.5 结果取 5 次独立运行的平均值,逐项列出 harness 与参数。Terminal-Bench 2.1 用 Harbor/Terminus-2 框架和 Claude Code 2.1.126 跑,SWE-bench 系列用 OpenHands harness,评测时关闭网络、移除 git 历史防作弊;HLE 以 Claude 4.6 Opus 为裁判,MCP-Atlas 以 Claude 4.8 Opus 为裁判。
自己出题、自己搭脚手架、自己 rollout
博客标题就叫 From Self-Scaffolding to Self-Improvement(从自脚手架到自我改进)。每轮训练分三个阶段。系统拿到环境或代码库、任务类型的高层指令以及模型过往解题历史后,先提出比已解任务更难的渐进式任务,专门暴露能力缺口;再为每个任务生成或精修脚手架,即指令、工具、任务分解策略和编排方式;最后,策略基于任务与脚手架产出解题 rollout。
奖励贯通三个阶段。任务奖励是三个信号的乘积:有效性、前沿难度、新颖性。有效性是硬门禁,任务或脚手架不可验证时整项奖励归零;难度用当前模型自己的 rollout 成功率估计,目标成功率 p* 设为 0.2,模型越强、任务越容易被解出,奖励越低,出题器被迫转向更难的任务;新颖性对比已生成或已训练过的任务缓冲,防止反复出同一类题。脚手架奖励由任务对齐、奖励保真、抗 hack 性三项相乘,rollout 直接由脚手架打分。三个阶段都用 GRPO 优化。
循环因此闭合:更强的策略生成更难、信息量更大的任务,进化的脚手架找到更好的调用方式,更高质量的 rollout 提供更有效的学习信号。Ornith 称这套机制替代了固定的人工任务集和手工设计的 agent 框架。
35B 只激活 3B 参数,9B 想装进手机
中间档 Ornith-1.5-35B 是 A3B 架构的 MoE,每个 token 只激活 3B 参数。表格里它 Terminal-Bench 2.1(Terminus-2)报 67.8,SWE-bench Verified 报 79.0,高于同尺寸的 Qwen 3.6-35B(52.5、73.4),也高于 dense 的 Gemma 4-31B(42.1、52.0)和 Meta 的 Muse Glimmer-30B(51.7、76.0);DeepSWE 从上一代的 0 分跳到 22 分。
最小档 Ornith-1.5-9B 报 Terminal-Bench 2.1(Terminus-2)46.2、SWE-bench Verified 70.6,官方称量化版 9B-Mobile 可直接部署到 iPhone 和 Android。博客同时称 9B「匹敌或超过」Gemma 4-31B、Qwen 3.6-35B 这类大得多的模型,但同一张表格里,9B 在这两项上仍低于 Qwen 3.6-35B(46.2 对 52.5、70.6 对 73.4)。
官方 X 称全系模型与量化版本(FP8、GGUF、MLX、NVFP4)均以 MIT 许可发布,允许商业与研究用途。模型已挂上 ,集合页列出了 9B、35B、397B 等多个尺寸的 base 与量化条目。
MIT 开源与发布首日的社区测试
官宣推文发布于 8 月 19 日 13:51(UTC),截至 8 月 20 日凌晨检索时已有约 169 万次浏览、4501 次点赞、649 次转推和 512 条引用转推。首日帖子里,本地部署是共同的主题。X 用户 Versun(@VersunPan,简介自称 AI Agent 实战玩家)在里把 Ornith-1.5 与 Qwen3.8-27B 逐项对比,写道:「一开始就放出了 35B-A3B,你再不出,我可要叛逃到 Ornith 了。」
内容创作者 FHILY(@Oluwaphilemon1)发帖称 "Ornith 1.5 35B-A3B just made local AI look ridiculous"(让本地 AI 看起来像个笑话),并引用一段实测视频给出数字:单张 RTX 4090、24GB 显存,158 tok/s 解码、79% SWE-bench Verified、250K 上下文(Q8 KV cache)。1.7 万粉丝的 wick(@holytrinity)则发帖称 "Ornith 1.5 397B Max + Qwen 3.8 27B Vision = AGI at home"。这些是发布首日的小规模社区实测与评论,不是独立评测机构的复现。
能核实的,只有厂商自己的数字
博客脚注写明了评测方式,5 次运行取平均、逐项列出 harness 参数和防作弊措施,但所有对比表都出自 Ornith 自己。在本文可核实的范围内,与这些数字对照的只有厂商自己的博客和官宣推文。模型已以 MIT 许可和 GGUF、FP8 等格式开放下载,任何人拿到权重都能自行复测这组数字。
参考链接
- *