AREX Feed Article
许可条款引爆争议:开源或禁止欧美韩使用?Vals AI 独立评分落定,与 Opus 4.7 打平
Qwen3.8-Max 承诺"下周开源"的话音刚落,许可条款率先引爆争议。AI 工具开发者 OstrisAI 在阅读已披露的许可文本后指出,条款似乎禁止在美国、欧盟、英国和韩国使用该模型,甚至禁止从美国境内下载权重。截至目前阿里未作澄清,许可条款的最终范围仍悬而未决。
这一争议直接冲击了"开源旗舰"叙事:如果权重上线后附带的许可确实限定地理使用范围,所谓"开放"将大打折扣,尤其对欧美企业用户构成实质性法律障碍。此前 VentureBeat 已预警这一风险——阿里从未披露许可类型,而 Moonshot AI 的 Kimi K3 就曾在开放权重时附加了商业使用条款。
Vals AI 首份独立评估:与 Claude Opus 4.7 打平,但 Terminal-Bench 分数远低于官方
独立评测机构 Vals AI 于 8 月 4 日发布 Qwen3.8-Max 的首份完整评估。Vals Index 得分 66.1,在 43 个模型中排名 第 10,在开源模型中列 第 2(仅次于 Kimi K3)。该分数与 Claude Opus 4.7(66.1)完全持平,但完成每次测试的成本仅为 $2.68,约为 Opus 4.7($6.17)的 43%。
关键单项数据:
- SWE-bench:87.3%,领先 GPT-5.5(82.6%)和 GLM-5.2(83.3%),但落后 Claude Opus 4.8(89.2%)
- Terminal-Bench 2.1:67.4,较 Qwen 3.7 Max(61.0)提升显著,但远低于阿里官方宣称的 86.6
Vals AI 特别指出,阿里官方 Terminal-Bench 分数修改了基准超时设定,而 Vals 保留了原始超时。这一方法论差异解释了 19.2 分的巨大缺口,也再次坐实此前报道中"基准方法学存在多处警示"的判断。
从代际角度看,Qwen 3.7 Max 的 Vals Index 为 57.5 → 3.8 Max 为 66.1,约 2.5 个月内提升 8.6 分,进步幅度可圈可点。
Vision Arena 排名第 2,补全 Arena 表现图谱
LMSYS Arena 官方同步放出了 Vision Arena 排名:Qwen3.8-Max 以 1,305 分位列 第 2,仅落后榜首 Claude Fable 5 (High) 13 分。这与此前报道的前端代码第 4(1,668 分)、文本第 5(1,496 分)共同构成完整竞技场画像:视觉能力是其相对最强的单项。
权重仍未放出,许可条款成更大悬念
截至 8 月 5 日,Qwen3.8-Max 和 Qwen3.8-27B 的权重仍未上线 Hugging Face 或 ModelScope。"下周"承诺的首个工作日尚未兑现。但此刻更大的悬念已从"会不会开源"转向"以什么条件开源"——如果许可真如 OstrisAI 所解读的那样限制欧美韩使用,即便权重放出,对西方开发者和企业的实际价值也将大打折扣。
Latent Space 在综述中指出,真正推动实际部署普及的可能是较小的 Qwen3.8-27B,而非需要超级节点才能运行的 2.4 万亿参数旗舰。但 27B 的许可条款同样悬而未决。