AREX Feed Article
Qwen3.8-27B 拿下 Code Arena 第 9,阿里称前十唯一同尺寸模型
8 月 25 日,阿里 Qwen 团队官方 X 账号 @Alibaba_Qwen 发推宣布,Qwen3.8-27B 在 Code Arena 综合排行榜位列第 9,是前十名中唯一属于该尺寸级别的模型,并感谢榜单运营方 @arena 的认可()。这项排名并非厂商自报:榜单运营方 Arena.ai(@arena)8 月 24 日已先行公布,Qwen3.8-27B 在 Code Arena 的 WebDev 榜以 1595 分排综合第 9,并称它"重塑了 Pareto 前沿"();截至发稿,仍显示 qwen3.8-27b 排第 9。
截至发稿,Qwen 这条推文已获超过 1000 次点赞、约 8.2 万次浏览;@arena 的原帖热度更高,转发 127 次、点赞 1342 次、浏览量约 25 万。
第 9 名前后:GLM-5.3-Max 与 Gemini-3.7-Flash-High
Code Arena 是 arena.ai 面向前端 Web 开发任务的竞技场榜单,覆盖需要多步推理和工具调用的 agentic 编码流程,由社区投票驱动。榜单快照标注 2026 年 8 月 21 日,累计 603,789 票、118 个模型。
qwen3.8-27b 以 1595 分(±13)、2,464 票排第 9,前后分别是 GLM-5.3-Max(1599 分)和 Gemini-3.7-Flash-High(1587 分)。榜单将其标注为 "Alibaba · Apache 2.0",参考价为每百万 token 0.5 美元输入、3 美元输出,是前十名中标价最低的一档。同一榜单上,Qwen 自家旗舰 Qwen3.8-Max 以 1669 分排第 3(标注 Proprietary、状态 Preliminary),Grok-4.6-High 和 Gemini-3.7-Flash-High 的名次同样标注为 Preliminary。@arena 特别对比了两个数字:27B 版只落后 Qwen3.8-Max 6 个名次,而 4 月发布的 Gemma 4-31B 排在第 80。
在细分领域里 27B 版排名更高:@arena 同日发布的分类榜显示,它在 Consumer Product 排第 6(1587 分)、Brand & Marketing 排第 7(1627 分)、Gaming 排第 8(1645 分)()。
前十名里唯一的 27B,也是唯一 Apache 2.0
前十名其余九席是 Claude Opus 5 Max、Kimi K3 Max、Qwen3.8-Max、Claude Opus 5 High、Grok-4.6 High、Claude Fable 5、GPT-5.6 Sol、GLM-5.3-Max 和 Gemini-3.7-Flash-High,多数是参数规模大得多的旗舰或闭源模型。Qwen3.8-27B 是其中唯一的 27B 级开放权重模型,也是唯一采用 Apache 2.0 许可的(GLM-5.3-Max 为 MIT)。
@arena 用"重塑 Pareto 前沿"概括它的意义:在性能对价格的散点图上,qwen3.8-27b 以约 2.35 美元/百万 token(3:1 混合价)的点位进入前沿线(见封面图),与输入价数倍于它的闭源旗舰站在同一条能力曲线上。
8 月 14 日开源,四比特量化后约 17GB
Qwen3.8-27B 于 8 月 14 日以 Apache 2.0 许可在 Hugging Face 发布,是 27B 参数的稠密多模态模型,原生支持图像与视频理解,上下文长度 262,144 token、可扩展至 100 万,思考模式默认开启,可用 reasoning_effort 在 xhigh/medium/low 之间调节推理深度()。
模型卡中厂商自报的基准成绩包括 SWE-bench Pro 61.7、LiveCodeBench v6 90.3、Terminal Bench 2.1 73.0、CoWorkBench 70.7、OSWorld-Verified 84.3。VentureBeat 的报道补充了硬件门槛并给出提醒:16-bit 全精度约需 56GB 显存,FP8 约 28GB,4-bit 量化后约 17GB,可跑在消费级显卡上;但部分评测为阿里内部进行,各基准 harness 并不一致,不足以据此宣布全面胜出()。
"1595 分的 27B 是本地 Max 的故事"
@arena 原帖下的讨论把重点从"第 9 名"转向"这个尺寸意味着什么"。AI 资讯博主 Josh(@JustJorshin)写道:"1595 分的 27B 是本地 Max 的故事,不是总榜的故事……我会把 27B 当作默认的本地编码模型,不会等 Max 能塞进本地再换"()。独立游戏开发者 Paul(@staydown124)说,27B 排第 9"对我来说比 Max 的排名重要得多,这是第一个能塞进一张 24GB 显卡的档位,也是我能离线交付的档位"()。io.net 联合创始人 Tory Green 认为"Pareto 前沿向左移动这么多,可能比 Qwen 排第 9 更重要"()。微软首席软件工程师 Farrukh Masud 的评价是:"小型开源模型与大型闭源模型在真实编码任务上的差距在持续缩小"()。
质疑同样存在。柏林开发者 Greg Glazewski 说:"WebDev 上的 1595 分说明不了它处理真正混乱代码库的能力"()。独立评测账号 Latent Node 则指出,点估计是第 9,但实时榜单给出的排名区间是 8–13(1594.8 分,区间 1581.7–1607.9,基于 2,464 票),"比 Max 落后 6 名"的说法暗示了 bootstrap 榜单并不支持的分隔()。
实时区间 8–13,百倍参数对比测试待出分
这是 Qwen3.8-27B 发布以来官方晒出的最新一份第三方排名。此前 Qwen 官方账号已自称该模型登上 Hugging Face 热门榜第一(8 月 16 日,);VentureBeat 则援引 Cybernews 报道称,发布头三天的 Hugging Face 下载量突破 300 万。
榜单本身仍在滚动:@arena 公布时的点估计是 1595 分、2,464 票,独立评测账号 Latent Node 从实时榜单推算的排名区间是 8–13,第 9 名只是一个点估计。@arena 8 月 22 日还预告了另一项测试:用 Qwen3.8-27B 与参数规模最大 100 倍于它的模型(DeepSeek v4、Qwen3.8-Max、Kimi K3、GLM 5.3、Grok 4.6、GPT-5.6、Fable)在相同的一步生成与 agentic 任务上对比,"分数即将公布"()。在这组分数出来之前,第 9 名会随社区投票继续移动;@arena 给出的参照是,同为 31B 级的 Gemma 4-31B 目前排在第 80,前十中还没有第二个 27B–31B 级别的模型。
参考链接
- Qwen 官方账号推文:
- @arena 公布排名的推文:
- @arena 分类榜推文:
- Code Arena | WebDev 榜单页:
- Qwen3.8-27B 模型卡(Hugging Face):
- VentureBeat 报道:
- Josh(@JustJorshin)回复:
- Paul(@staydown124)回复:
- Tory Green(@MTorygreen)回复:
- Farrukh Masud(@FarrukhMasud)回复:
- Greg Glazewski(@Greg_GL_87)回复:
- Latent Node(@latent_node)回复:
- @arena 预告百倍参数对比测试:
- Qwen 官方账号称登 Hugging Face 热门榜第一:
- 配图来源一(@arena 推文附图):
- 配图来源二(@arena 推文附图):