AREX Feed Article
vLLM 官宣支持 Ornith-1.5,称其为开源编码智能体 SOTA
UTC 时间 8 月 20 日 01:04(北京时间 09:04),宣布 Ornith-1.5 已在 vLLM 中提供服务,并给出直接可用的运行命令:vllm serve ornith-ai/Ornith-1.5-9B。
推文称其为"一个自我改进、MIT 许可、从 9B 到 397B 的模型家族,开源模型中编码与智能体任务的 SOTA",并向模型团队 @ornith_ 道贺。
"Ornith-1.5 发布了,今天就能在 vLLM 里跑起来(Ornith-1.5 is out and it serves in vLLM today)。"
这条官宣距离模型发布不到一天。Ornith-1.5 于 8 月 19 日发布,权重与量化版本当日在 公开;当天下午发布了对它的独立分析。
一条命令,9B 到 397B 全系上服
vLLM 在官方账号简介中自我定位为面向大语言模型的高吞吐、内存高效推理与服务引擎,官方账号约 4.7 万粉丝。
这条官宣推文没有附任何基准数字或评测链接,正文只有三样东西:对 @ornith_ 的道贺、对模型家族的定性、一条命令。
"Already serving in vLLM"(已经在 vLLM 中提供服务)意味着发布次日,这个 8 月 19 日才上线的家族就拿到了 vLLM 官方的支持。对使用者来说,部署动作被压缩成一行命令,9B 档立即可跑。
86.1 对 85.0:自报分数领先,Opus 仍占优
Hendrickson 的分析帖附了一张基准对比表:Ornith-1.5(397B)与 Claude Opus 4.8、GLM-5.2(753B)、DeepSeek-V4-Flash-0731(284B)以及 Ornith-1.0(397B)逐项对比。
按帖中数字,Ornith-1.5 自报 Terminal-Bench 2.1 得分 86.1,对照 Opus 4.8 的 85.0;SWE-bench Verified 86.0 对 85.8;BrowseComp 86.6 对 84.3。
Hendrickson 称它"在每一项基准上都超过 GLM-5.2 和 DeepSeek-V4-Flash-0731",并评价"这可能是我最近见过的最强的开源模型发布之一"。
他同时划了一条线:这些数字是 Ornith 自报的基准,Opus 4.8 在表内其他测试里仍然占优。
权重与量化版全部公开,MIT 许可可查证
vLLM 口中的 self-improving(自我改进)家族,在 Hendrickson 的分析里有具体机制:模型自己发明新任务、搭建任务专用的 scaffold、尝试解题、评估结果、回炉训练,再生成更难的题目。
集合页 ornith-ai/ornith-15 上,9B、35B 到 397B 多档权重(最大档 397B 为 MoE 架构)与量化版本均可下载,量化格式覆盖 FP8、GGUF、MLX、NVFP4。
Hendrickson 单独确认了官方 GGUF 与官方 NVFP4 构建的存在,并给出一个具体数字:397B 的 Q4 GGUF 约 241GB。
即便量化到 Q4,本地跑起最大档仍需要以百 GB 计的存储与内存预算;低门槛入口是 9B 档。
命令有了,SOTA 的成色还差独立验证
vLLM 的 SOTA 表述,目前能追溯到的依据仍是 Ornith 自己的基准报告。
Hendrickson 在分析末尾明确写道:"这些是 Ornith 自报的基准,Opus 在其他测试仍占优,所以独立验证很重要(These are Ornith's own reported benchmarks, and Opus still wins other tests, so independent validation matters)。"
两条帖子截至 8 月 20 日核验时:vLLM 官宣约 132 次点赞、1.8 万次浏览;Hendrickson 的分析帖 717 次点赞、8.5 万次浏览,传播量高于官宣本身。
对想自己验证的人,门槛已经很低:9B 档一条命令即可在 vLLM 中跑起来;要复现 86.1 分的 397B 档,先要备好能装下 241GB 量化权重的机器。
按 Hendrickson 的标注,这些数字停留在 Ornith 自报层面,独立验证是他点名的下一步。在那之前,"86.1 超过 Opus 4.8"与"开源编码 SOTA"都只是声明。