AREX Feed Article
Qwen3.8-27B 登顶 Image-to-WebDev 开源榜,官方预告当晚惊喜
8 月 26 日 05:49 UTC(北京时间 13:49),阿里 Qwen 官方 X 账号 发布推文宣布:Qwen3.8-27B 在 Arena.ai 的 Image-to-WebDev 榜单上位列开源模型第一、总榜第七;"仅 27B 参数,表现与规模约 100 倍于它的模型相当"(Just 27B parameters, on par with models 100x its size)。
推文末尾抛出一个悬念:"猜猜我们今晚要放出什么惊喜?"(can you guess what surprise we're dropping tonight?)。关于惊喜本身,官方没有给出任何细节。
这份排名可以在榜单本身核对。(截至 8 月 25 日,累计 110,117 票、44 个模型)显示,qwen3.8-27b(Alibaba,Apache 2.0)以 1574 分排在总榜第 7,是榜单上排名最高的开源权重模型,前面六名全部是闭源模型。
前一天(8 月 25 日 17:22 UTC)的公告给出了更具体的对照:1574 分的表现与 2.8T 参数的 Kimi K3 (Max) 相当,2.8T 约是 27B 的 104 倍。
图为 Qwen3.8-27B 在 的展示卡片。
第 7 名之上,没有一个开源模型
Image-to-WebDev 是 Arena.ai 旗下 Code Arena 的一个子榜,测的是模型"根据图片和截图生成网站、并完成涉及多步推理与工具调用的 agentic 编码任务"的能力。qwen3.8-27b 在 8 月 25 日才被加入该榜(),以 1,686 次投票拿下 1574 分(±15)。
排在它前面的六名是:claude-opus-5-max(1664)、claude-fable-5(1623)、qwen3.8-max(1618,阿里自家闭源版,标记 Preliminary)、gpt-5.6-sol-xhigh(1606)、claude-opus-4-7-high(1576)、grok-4.5(1574)。
第 6 到第 8 名的分数挤在 1574、1574、1573:grok-4.5 与 qwen3.8-27b 同分,紧随其后的 kimi-k3-max(Moonshot,榜上许可标注为 Kimi K3 license)只有 1 分之差,三者的置信区间(±15 上下)相互重叠。
开源阵营的其他模型要低一截:kimi-k2.6 第 18(1521)、kimi-k2.7-code 第 20(1511)、mistral-large-3 第 41(1356)。
这是 Qwen3.8-27B 一周内第二次在 Arena 系榜单收获官方宣布的名次,但两次不是同一件事。8 月 25 日,它在 Code Arena(WebDev)综合第 9、以 1595 分成为前十名中唯一同尺寸级别的模型;,它只比自家大得多的 Qwen3.8-Max 低 6 位,而 4 月发布的 Gemma 4-31B 排在约第 80。今天这次的第 7 名来自另一个榜单:Image-to-WebDev。
"100 倍"的说法来自哪里
Qwen 推文里"约 100 倍"的依据,是 Arena 官方公告里那组对照:qwen3.8-27b 以 27B 参数拿到 1574 分,"表现与 2.8T 参数的 Kimi K3 (Max) 相当",并称它"移动了 Image-to-WebDev 的帕累托前沿"。
这组对照里还有价格。榜上 qwen3.8-27b 的 API 定价是每百万输入/输出 token $0.40/$3;前六名里最便宜的 qwen3.8-max 和 grok-4.5 也要 $2/$6,榜首 claude-opus-5-max 是 $5/$25。
模型本身的底细:Qwen3.8 系列 8 月 2 日先发布 2.4T 参数的 Qwen3.8-Max, 显示 Max 级开源版 Qwen3.8-2.4T-A95B 于 8 月 12 日、Qwen3.8-27B 于 8 月 14 日上线 Hugging Face 与 ModelScope。
与 Max 的开源版不同,27B 是 Apache 2.0 全能力权重,上下文 262,144 token。 评价它是"目前能在消费级电脑上本地运行的最强模型"。
口径要分清:榜单排名是 Arena 运营的用户盲测投票结果;"与 2.8T 相当"的表述,来自 Qwen 官方推文与 Arena 官方公告两方。
"不是营销,是数学":社区的兴奋与质疑
截至本文写作时,Qwen 这条推文获得 503 个赞、40 次转发、56 条回复、约 4 万次查看;Arena 的公告推文热度更高:1,086 个赞、79 次转发、约 19.2 万次查看。
回复里两类声音都有。X 用户 算了一笔账:"今早我重做了推理成本模型。27B 每百万 token $0.40/$3,输出却匹配 2.8T?这不是营销,是数学。本地部署变得难以忽视。"
Rurban OS 创始人 说:"说实话,27B 这个数字比排名更让我感兴趣……一个能贴近数据的小模型,可能是更好的工具。" 的判断是:27B 落在这么高的位置,"可能把'截图转前端'从偶尔展示的玩法,变成团队在迭代中反复使用的工具"。
中文用户里也有直接表达, 留言:"270亿吊打30000亿,这才是人民的ai"。
质疑同样具体。 指出,1574 对 1573 落在任何 Elo 型榜单的置信区间内,"真正的故事不是第一,而是 27B 在这个任务上与 2.8T 的差距在噪声范围内,这说明基准比模型先饱和了"。
评论者 提醒,Arena 这里的评分衡量的是"对着截图的一次性视觉还原",而生产环境的前端工作大部分是首版之后的修改、语义标记和响应式断点,"那是另一种技能"。 则从成本角度泼冷水:"单 token 便宜,但早期测试它大约烧 3 倍的 token。按任务算成本才是关键。"
预告里的惊喜:社区猜是 Qwen3.8-Flash-Next
官方推文除了"今晚"(tonight)之外,没有给出惊喜的任何线索——名字、尺寸、发布时间都没提。回复区因此变成一场竞猜。
最集中的答案是 Qwen3.8-Flash-Next。连 都在回复里写下"Qwen3.8-Flash-Next!",但这是对"你猜是什么"的回应,官方口径没有确认。
社区已经按这个猜测行动:本地 AI 开发者 转发称"8 小时后!服务器和评测都准备好了,就等下载开跑";AI Engineer 已经预建了名为 Qwen3.8-Flash-Next 的 GGUF 和 NVFP4 仓库,称发布后立刻转换; 说"已经等不及 Qwen3.8-Flash-Next 了"。
其他猜测还有: 问"今晚的和 27B 同一个重量级,还是更大?"; 猜是新视觉编码器;AI Builder 先排除一个选项:"它不会是 100B 以上的 dense"。
截至本文写作时,Qwen 官方账号在预告之外没有发布更多信息。惊喜的名字、参数规模与具体发布时间,都停留在社区猜测层面。