AREX Feed Article
阿里Qwen3.8-Max掀桌:2.4万亿参数硬刚Anthropic,下周权重全开
TL;DR:8月3日,阿里发布Qwen3.8-Max——2.4万亿总参数、95B激活参数的MoE旗舰模型。PaperBench 93.0超越Anthropic Fable 5的88.8,IFBench 82.8远超Fable 5的63.5。16天自主编程产出265次提交、127个PR。模型权重下周在HuggingFace和ModelScope开放——阿里首次开源Max旗舰线。港股涨7%,美股涨4.5%。
265次提交,0次人工干预,16天
7月14日,阿里工程师给了Qwen3.8-Max一个空文件夹和一条指令:自己建一个命令行工具。
16天后,这个模型以oh-my-cli的名义,向GitHub推送了265次提交、127个Pull Request和151个Issue。全程无人触碰代码。仓库公开可查。
另一个测试更狠。阿里给模型一篇关于大模型数据筛选的论文,不给任何起步代码,要求先复现、再改进。Qwen3.8-Max在约125小时里写了7600行代码,跑了33次GPU训练,把论文六个实验结果全部复现,然后自己提了18个改进方案,在AIME24数学基准上反超原方法2.7分。
第三个案例,它参加了阿里天池平台的WWW2025多模态对话意图识别赛,526支人类队伍同场竞技。24小时内提交了45次,准确率从0.60拉到0.853,最终排名超过87%的参赛团队。
阿里没有把它描述成一个更会聊天的助手,而是一个能独自运转数日的工程系统。
那16天里到底发生了什么?分析师不买账
Kanerika AI开发经理Amit Jena在评测中写了一段被几乎所有头条忽略的话:"这句话被到处转载,但从没有人追问——16天里到底发生了什么?人类介入了几次?产出过得了代码审查吗?"
Forrester副总裁兼首席分析师Charlie Dai的评价更温和,但指向同一个方向:"阿里正在缩小差距,但更大的故事是开源模型的快速成熟。企业现在有了闭源前沿模型之外的可信替代方案。"
Gartner高级首席分析师Nitish Tyagi把关注点放在经济账上:"Gartner此前预测,如果控制不住成本,AI编程支出可能超过开发者平均工资。开源权重、MoE架构和百万token上下文,是把AI编程推向经济可行的重要一步。"
HackerNews上,1043个顶和557条评论里,开发者的注意力并不全在旗舰上。热评第一条写的是:"他们还发布了Qwen3.8-27B,下周开源。Qwen3.6-27B已经是本地模型里的王者,如果3.8真的超越它,那就太棒了。"
Qwen官方推文在X上获20,948个赞、2,590次转发和545万次浏览。"下周开源"是评论区被重复最多的那行字。
两周三颗炸弹:Moonshot、DeepSeek、阿里
如果只看一条新闻,Qwen3.8-Max是一次产品发布。放在时间线上看,它是一个加速中的中国AI开源浪潮的最新注脚。
7月27日,Moonshot AI发布Kimi K3,2.8万亿参数的MoE模型,直接开源权重上HuggingFace,附带注意力内核和MoE通信库。这是当时中国参数规模最大的开源模型。
7月31日,DeepSeek正式发布DeepSeek-V4-Flash,在编程和Agent能力上大幅跃升,价格只有美国同档模型的零头。
8月3日,阿里发布Qwen3.8-Max,宣布下周开源权重。
三周不到,三个中国团队,三款接近或达到前沿水平的开源模型。阿里已承诺未来三年在云和AI基础设施上投入超过3800亿元人民币(约530亿美元)。
Qwen3.8-Max的API定价:输入每百万token 2美元,输出6美元。对照Anthropic Fable 5的输入10美元、输出50美元——同级别模型,价格差5到8倍。
赢了PaperBench,输了HLE:一份不能只报喜的成绩单
阿里公布的基准测试表涵盖31项文本/编程测试和54项多模态/视觉测试。赢了的列出来,输了的也留着。
论文复现基准PaperBench:93.0分,超过Fable 5的88.8和GPT-5.6 Sol的90.5,排第一。指令遵循基准IFBench:82.8对Fable 5的63.5,接近20分差距。
多模态领域几乎横扫。文档理解OmniDocBench 1.5上92.1分,视觉推理MathVision上95.2分,OCR基准CC-OCR-Bench-V2上79.6分——均领先Gemini 3.1 Pro和GPT-5.6 Sol。Dense200视觉感知测试87.0分碾压Fable 5的31.1分。
败绩同样醒目。
软件工程基准SWE-bench Pro:67.7分,Fable 5是80.0分,落后超过12个百分点。广谱知识基准HLE(人类最后的考试):43.6分,四款旗舰模型中垫底,Fable 5领跑53.3分。
还有四个细节。第一,所有分数都是阿里自己跑的——包括竞争对手模型。供应商自评不稀奇,但独立验证还没跟上。第二,大部分编程测试用Anthropic自家的Claude Code工具链执行——等于在对手的跑道上比赛。第三,7个基准是阿里自建,无法外部复验。第四,阿里在脚注里写了一句:Fable 5的结果"可能涉及回退"——没解释回退到什么。
架构层面,2.4万亿总参数中每次推理只激活约950亿。训练使用了约4000种强化学习环境,覆盖单任务和多日工作流,内部评分从0.474跃升至0.725。百万token上下文窗口支持同时处理超200页文档或100小时视频。
真实水平在哪?等独立评测。Artificial Analysis和OpenRouter上,Qwen3.8-Max至今榜上无名。
当2.4万亿参数的旗舰模型开始免费
阿里这次做了一件从未做过的事:把Max旗舰线的权重开放。
Qwen系列一直分两条线——Plus(中端,开源)和Max(旗舰,闭源)。去年Qwen3.7-Max是闭源的,再往前Qwen2.5-Max也是。旗舰就是用来赚钱的,这个逻辑在阿里内部运行了至少两年。
现在它被打破了。
Qwen3.8-Max下周在HuggingFace和ModelScope放出权重。同时发布的Qwen3.8-27B也会开源。虽然具体开源协议尚未公布,但"开源旗舰模型"五个字本身就是一个信号。
此前,中国最强模型通常锁在API后面。现在,任何人可以下载、部署、微调一个接近Anthropic Fable 5水平的模型,输入token只要2美元。HuggingFace CEO Clément Delangue此前表示"中国正在赢得AI竞赛,可能年底就能主导"——Qwen3.8-Max让这句话显得不那么夸张。
商业冲击是双重的。对Anthropic和OpenAI而言,同级别但便宜5到8倍且可自部署的替代品,直接侵蚀API收入。对阿里而言,开源权重是另一种算力消费入口——下载模型的用户,最终在阿里云上跑推理。
阿里港股当天涨了7%,美股涨了4.5%。市场读懂了信号。
同一张牌桌,两套打法
美国公司用闭源模型建护城河,中国公司用开源模型拆护城河。两种策略正在同一张牌桌上正面碰撞。
Qwen3.8-Max不是完美的模型。它在最难的软件工程基准上仍然落后,在广谱知识考试上垫底,所有benchmark数据还待独立验证。但它以2美元输入的价格、下周开源的承诺和16天自主编程的工程演示,把"谁能做出最好模型"的讨论,拽向了另一个问题:最好模型的价格应该是多少,以及它属于谁。
定价权和开放权的争夺中,参数只是入场券。
Sources
- — 20,948 likes, 2,590 retweets, 5.46M views
- — 1,043 points, 557 comments