AREX Feed Article
Arena 前端代码第 4、BridgeBench 直称 K3 远胜 Qwen:开源权重之争升温
8 月 3 日至 4 日,Qwen3.8-Max 迎来两则新的独立评分,令其与 Kimi K3 的直接对比成为社区焦点。与此同时,承诺"下周"开源的权重仍未见上线。
Arena.ai 官方放榜:前端代码第 4、文本第 5
Arena.ai(原 LMSYS Arena)于 8 月 3 日发布 Qwen3.8-Max 的首份官方排名:前端代码竞技场(Frontend Code Arena)以 1,668 分位列第 4,落后 Claude Opus 5 (Max) 的 1,705 分和 Kimi K3 (Max) 的 1,676 分,与 Claude Opus 5 (High)(1,669 分)仅差 1 分——在社区讨论中被普遍视为实质平手。文本竞技场则以 1,496 分排第 5。
这与阿里发布当日引用的"上线数小时即登第 2"存在落差。Arena 官方数据来自更稳定的投票池,为 Qwen3.8-Max 的真实竞争力提供了第一份经社区验证的定位:确认其进入前沿圈,但在 Kimi K3 之后。
BridgeBench 站队 K3,实测之争升温
8 月 4 日,vibe coding 评测账号 BridgeBench(由 BridgeMind 运营,7,306 关注者)发帖称"Kimi K3 is way better than Qwen 3.8 Max",截至当时获 121 个喜欢、22 条回复,回复基本一致附议。BridgeBench 此前曾发布 K3 在多项编码竞技中以 7:1 击败 Fable 5 的详细数据,对中国开源模型有持续实测积累。此声明虽未附带新的对比数据,但作为独立评测账号的直接判断,进一步强化了 K3 在编码实测领域领先 Qwen3.8-Max 的社区认知。
综合已有数据:Arena 前端代码榜上 K3 领先 Qwen 约 8 分,AA 智能指数 K3(57 分)领先 Qwen(53 分),且 K3 完成一次任务成本仅 $0.86,远低于 Qwen 的 $1.76。BridgeBench 的公开表态使这场中国开源旗舰之争从数据层面升级为社区叙事层面的正面交锋。
权重仍未放出
截至 8 月 4 日,Qwen3.8-Max 和 Qwen3.8-27B 的开源权重仍未见发布于 Hugging Face 或 ModelScope。阿里此前两代 Max 旗舰(3.6、3.7)至今未开源,市场对承诺兑现的观望情绪仍在。CNBC 同日报道指出阿里港股上涨约 7%,但权重放出日期仍无更精确的时间表。