AREX Feed Article
开发者社区首轮反应:"穿开源外衣的 API 生意",oh-my-cli 16 日自主编码实验反成最大亮点
8 月 4 日,The New Stack 收集了 Qwen3.8-Max 发布后的首轮开发者反应。多位一线工程师的评论指向同一个核心判断:真正值得关注的不一定是基准分数,而是阿里为 Qwen3.8-Max 搭建的"笼子"。
"API 生意穿着开源外衣拍发布照"
独立 AI 顾问 Jeff Brokaw 的评论最为尖锐:"阿里称权重为'开放',但还没交付。发布说明写的是'承诺后续开放权重'——Moonshot 几个月前用 Kimi K3 玩了完全一样的套路。这不是技术注脚,这是 API 生意穿着开源外衣拍发布照。"
Brokaw 进一步指出,Arena 排名数据"来自阿里自己的评估,与发布同日公布,对比对象由阿里自行选择",称这是"实验室给自己的作业打分,值得当作野心来读,而不是定论,直到有外部机构跑出同样的测试。"
oh-my-cli:16 天、265 次提交、127 个 PR——无一靠"感觉"合入
John Deere 企业架构与 AI 高级工程师 Anwar Khan 将注意力引向阿里低调开源的 oh-my-cli 项目。这是一个由 Qwen Code 驱动的自主编码代理 CLI,在 Qwen3.8-Max 内部测试中连续自主运行 16 天,累计生成 265 次提交和 127 个拉取请求——每一个都通过 CI 测试门禁才合入,"没有一个靠感觉。"
Khan 的判断成为本次社区反应中最具传播力的洞见:"供应商也没有信任这个模型 16 天。他们信任的是他们围绕模型搭建的笼子。这是正确的直觉,而且笼子本身才是值得复制的部分。"
oh-my-cli 的安全设计印证了这一判断:审批模式带反欺骗预览、文件夹信任边界、确定性命令策略——所有变更工具默认"失败即拒绝"。AUTONOMY.md 明确要求"同一代码失败三次即隔离,保留证据、释放租约"。
阿里自己的快速入门暴露了定位
Khan 还指出一个被广泛忽略的细节:阿里 Qwen3.8-Max 发布页的快速入门建议用户保留 Claude Code 或 Codex,仅将 base URL 指向 QwenCloud。"即便这个挑战者也默认你的工具链不变。"
这与多位开发者的共识吻合:Qwen3.8-Max 在工具生态和平台集成上仍落后于 Claude/OpenAI,现阶段更接近替代推理后端,而非完整的开发者平台替代方案。
基准怀疑论与"笼子"共识
Umbraco 工程师 Phil Whittaker 表示,基准分数"不会说服我切换到 Qwen3.8-Max",并表示即便使用也会用来自不同模型提供商的"对抗性审查代理"做二次验证。Evkii 创始人 Heath Squier 则提醒:"16 天的代理运行改变了风险单位。一个小错误可能跨越数千次操作叠加放大。"
CivAI 技术成员 Andrew Yoon 更直接地警告:"声称近期中国模型匹敌或超越美国前沿,是在夸大精心挑选的基准结果。Qwen3.8-Max、Kimi K3 和 GLM-5.2 都很有能力,但它们仍然明显落后于美国前沿。"
权重与许可:仍悬而未决
截至 8 月 5 日,Qwen3.8-Max 和 Qwen3.8-27B 权重仍未上线 Hugging Face 或 ModelScope,许可条款亦无澄清。阿里此前披露 API 定价为每百万输入 token $2、输出 $6。Implicator.ai 指出,阿里在 7 月 19 日宣称模型"仅次于 Fable 5"时未公布任何评分——两周后的周一才补上自评基准表,而许可类型至今仍是空白。