AREX Feed Article
阿里Qwen3.8-Max跑赢Fable 5,2.4T参数模型下周开源
北京时间8月3日凌晨,阿里巴巴发布了Qwen3.8-Max——Qwen家族迄今最强模型,2.4万亿参数,95B激活,百万token上下文。Alibaba_Qwen的官宣推文在12小时内拿下16528个赞、317万次浏览。模型即日起在QwenCloud上线,输入$2/百万token,输出$6。更关键的一句:权重下周开源。
凌晨两点,阿里掏出一枚2.4T参数的炸弹
Alibaba_Qwen在推文中列出四条核心能力:10天以上的自主编程,从空文件夹跑出可交付项目;跨数百个职业的实战产出;500+轮芯片设计优化和全年电商策略的长期规划;以及视觉驱动的闭环执行与自纠错。
独立评测平台Arena.ai在发布后一小时内给出数据:Qwen3.8-Max在Frontend Code Arena拿下1668分,排名第4,仅次于Claude Opus 5 Max的1705分和Kimi K3 Max的1676分。Text Arena排第5,Vision Arena排第2。Arena.ai的推文拿下2421个赞和43.5万次浏览。
CNBC报道,阿里巴巴港股周一上涨7%,美股盘前涨4.73%至$128。彭博、路透、Fortune、雅虎财经均在数小时内发布了专题报道。
Cline创始人一句话刷屏,OpenCode连夜接入
"开源权重已超越闭源模型。"Cline创始人(@cline,7.1万粉丝)在推文中写道,这条推文拿下705个赞和3.37万次浏览。他特别指出Qwen3.8-Max在Terminal-Bench上比Fable 5高出2个百分点。
Databricks联合创始人Yuchen Jin(@Yuchenj_UW,23.9万粉丝)迅速跟进:"这是Qwen首次开源Max级模型的权重,也是继Kimi K3之后第二个超过2万亿参数的开源模型。Let's go OSS LLMs。"342个赞,2.6万浏览。
Nous Research联合创始人Teknium(@Teknium,11.3万粉丝)转发了官方发布视频,他的Hermes Agent被用作演示案例,推文收获1137个赞和8.6万次浏览。开源编程工具OpenCode(13.2万粉丝)宣布Qwen3.8-Max已在OpenCode Go上线,2082个赞。
中文社区同样沸腾。AI博主"余温"(@gkxspace,4.3万粉丝)实测了房屋3D装修和开放世界城市游戏两个长任务,称模型"自己查出灯光问题,改渲染方式拉回50帧",赞叹"Coding的想象空间太大了"。
质疑声也在。用户@bygregorr指出:"2%的Terminal-Bench差距算不上'超越'——尤其是双方都在针对性训练这个榜单。"@ankurdotai提醒:"这些是自报benchmark,等第三方评测再说。"
Kimi K3炸场两周后,阿里带着2.4T参数反杀
7月16日,Moonshot AI发布Kimi K3,2.8万亿参数,开源权重,将中国模型首次推至与GPT-5.6和Fable 5直接竞争的位置。《纽约时报》称之为"中国AI的分水岭时刻"。K3的API定价$3/$15,订阅量暴增导致Moonshot一度暂停新用户注册。
7月31日,DeepSeek发布V4 Flash,在编程和Agent能力上大幅提升,价格压到$0.14/$0.28,不到K3的十分之一。两篇论文持续刺激着"中国开源模型正在赶上"的叙事。
仅隔三天,Qwen3.8-Max上线。Alibaba_Qwen在推文中直指K3不曾覆盖的战场:连续16天无人干预完成内部软件工程项目,在天池竞赛中以0.853准确率击败526支人类队伍中的458支。SCMP指出,这是阿里在保持多代旗舰闭源后首次回归开源策略。
四天内三家中国公司,一家比一家激进。节奏本身比任何单篇评测都更有说服力。
PaperBench 93分登顶,16天自主编程不喊停
Qwen3.8-Max的benchmark表最抢眼的是PaperBench:93.0分,超过GPT-5.6 Sol的90.5和Fable 5的88.8,在参评模型中登顶。PaperBench测试的是模型阅读研究论文并复现实验的能力——恰好对应阿里宣传的"16天自主编程"场景。
Terminal-Bench 2.1拿到86.6分,超过Fable 5和Opus 4.8的84.6,排在GPT-5.6 Sol的88.8之后。OSWorld-Verified拿到86.1,在全部参评模型中最高。多模态维度更凶猛——36项视觉benchmark中领先Fable 5和GPT-5.6 Sol。
代际跳跃同样显著。对比Qwen3.7-Max,DeepSWE从21.6跃升至56.6,FrontierSWE从40.7跃升至73.5,JobBench从31.3跃升至53.4。
Marktechpost在评测中提醒两个注意事项:多模态对比基线用的是Qwen3.7-Plus而非Max,夸大了代际差距;阿里自己的RL scaling曲线显示性能在约4000个训练环境后达到峰值0.725,随后下降至0.689——模型仍有天花板。
定价锚点值得关注:$2/$6的API价格处于Qwen3.7-Max的$1.25/$3.75和Kimi K3的$3/$15之间,缓存读取仅$0.25/百万token。这与DeepSeek V4 Flash的$0.14/$0.28形成"开源双轨"——一条走极致性价比,一条冲性能天花板。
彭博、路透、CNBC同时把"开源反超"写进标题
过去六个月,中国AI模型的叙事是"追赶"——Qwen3.6对标GPT-5,DeepSeek V4对标Claude Opus。每一次发布都在缩小差距,但始终是"接近"。
Qwen3.8-Max的发布改变了这个框架。彭博的标题是"阿里巴巴发布性能比肩Anthropic的AI模型",路透写"阿里巴巴发布迄今最强AI模型,逼近Moonshot的规模"。不再是"追赶",而是"竞争"。
Benzinga引用SCMP报道指出,阿里此前将多代旗舰模型保持闭源,此次回归开源是战略级转向。CNBC补充了股市反应:阿里港股涨7%,美股盘前涨4.73%,分析师平均目标价$192.67。
中文博主@LoongUp的评论精准概括了社区情绪:"2.4T参数+下周开源,这节奏把2026 Q3的闭源优势直接抹平了。DeepSeek V4 Flash还在账上,OpenAI还没拿出可比的反击,Anthropic这场PR拖得越久越亏。"
多家工具平台在数小时内完成接入——OpenCode、Qoder、TokenRouter、Vercel AI Gateway——这个速度本身就说明开发者社区对"开源权重旗舰"的高度期待。
下周开源,才是真正的核弹
Qwen3.8-Max不是第一个对标Fable 5的中国模型。Kimi K3已做过。但它做了K3没做的事:把2.4万亿参数的Max级权重完整开源。
历史上,阿里从未开源过Qwen-Max系列的权重。这次一并开源的还有Qwen3.8-27B——一个据称17GB显存就能跑的小模型。Cline创始人已经预告将在Cline中接入,Nous Research在官宣视频中出镜。基础设施准备就绪,只等许可证落地。
从Kimi K3到DeepSeek V4 Flash再到Qwen3.8-Max,中国开源模型的闪电战在三周内走完了美国闭源厂商用两年才走完的路。下周开源的不是模型权重,是一个新的竞争范式。