AREX Feed Article
阿里巴巴云栖大会宣布:Qwen 4 正在训练、未来模型拟扩至 5~10 万亿参数追逐人工超级智能,Zhenwu V900 芯片同场发布
据 报道,9 月 22 日,阿里巴巴在杭州举行年度云栖大会(Apsara Conference),宣布下一代基础模型 Qwen 4 正在训练中,规划中的 Qwen 4.5 与 Qwen 5 系列将把参数规模扩展到 5~10 万亿,而现役旗舰 Qwen3.8-Max 为 2.4 万亿参数,以追求人工超级智能(artificial superintelligence)。同一场主题演讲还发布了旗下芯片设计部门 T-Head 的新一代 AI 芯片 Zhenwu V900,官方称其性能为上一代 M890 的 3 倍,计划 2027 年一季度量产并商用。
受发布推动,阿里巴巴港股周二上涨 5.1%,升至近一个月高位。
图为阿里云官方新闻稿发布的主题演讲现场照片,称演讲者为阿里巴巴集团 CEO Eddie Wu;舞台屏幕上写着「20GW」「2032 年 阿里云」,旁边是一条从 2022 年到 2032 年的 10 倍增长曲线。
「机器思考不足人类的 3%」:通往超级智能的模型路线
「今天,机器思考的总量还不到全人类思考量的 3%。」CEO Eddie Wu 在主题演讲中说。他预测,机器最终将产出超过全人类 1,000 倍的「思考」;当机器成为「思考」的主要提供者、智能变成可以规模化供应的商品时,「机器智能时代真正具有突破性的产品还没有到来」。
按 Wu 的规划,Qwen 团队要训练的新模型需要处理「更复杂、更长程的任务」(more complex, longer-horizon tasks),以此追求一种超越人类能力的智能。阿里在大会期间发布的另一份声明表示,Qwen 4 目前正在训练,未来的 Qwen 4.5 与 Qwen 5 系列预计将扩展到这一参数规模。Wu 还把 AI 编程比作电气时代的灯泡:它是早期应用,而不是那个尚未问世的突破性产品。
33 轮全自动迭代:公司口径下的递归自我改进
Wu 说,Qwen 团队在递归自我改进(recursive self-improvement)上取得了「有意义」(meaningful)的进展:模型会识别自身弱点、开展实验,并在有限的人工参与下生成训练数据。
阿里云官方新闻稿(经 分发)给出了更具体的数字:在超过一个月的全自动运行中——覆盖流水线设计、数据验证、迭代实验与错误诊断——Qwen3.8-Max 完成 33 轮迭代;经自主训练优化与后训练技术,其 Artificial Analysis 评分从 40 升至 45。新闻稿还描述了一项芯片设计实验:模型在 60 多个小时内跑完整条设计链路,调用 EDA(电子设计自动化)工具超过 10,000 次,产出生产级芯片总线模块,芯片面积缩减 42%,官方称性能未因此受损。这些结果均出自阿里的自行发布,新闻稿末尾注明内容由发布方全权负责。
Zhenwu V900:216GB 显存与最多 50 万卡的超节点
Zhenwu V900 由 T-Head 设计,定位为 AI 训练与推理处理器;路透社报道称,阿里在大会上称其为「中国最强」的 AI 芯片。官方列出的规格包括 216GB 显存、1,200GB/s 片间互联带宽,以及 FP8、FP4 等多种精度的原生支持,用于同时覆盖高精度模型训练与超低精度推理。
按官方新闻稿的说法,集成 Zhenwu V900 的升级版超节点服务器搭配 ICN Switch、Panmai SmartNIC 与 Zhenyue SSD 控制器芯片,最多可支持 50 万卡的集群;Wu 说,这样的集群规模用来训练和运行最大的 AI 模型。
路透社指出,此次发布正值美国出口管制收紧、中国科技公司竞相开发英伟达(Nvidia)AI 处理器国产替代品之际。上一代 M890 于今年 5 月发布;Wu 预计阿里年度 AI 芯片出货量将有「显著增长」。官方数据显示,Zhenwu 系列 AI 芯片已服务超过 650 家客户,覆盖汽车、金融、大语言模型、具身智能、能源与制造等行业。同场公布的还有面向智能体(agentic)AI 任务的自研 CPU 路线图:Yitian 720 与 Yitian 730 计划 2027 年推出,后者是 T-Head 首款基于自研微架构的 CPU,官方称其 SPECint2017/GHz 性能较上一代 Yitian 710 最高提升 40%。
从 2.8 秒同传到 AI 手机智能体:模型与平台同场亮相
阿里巴巴集团董事会主席 Joe Tsai 在演讲中把本届大会主题「Intelligence Goes Beyond」(智能超越)解读为「引导 AI 从技术突破走向价值创造」。同场发布的多模态模型与智能体平台,是这一表述对应的具体产品。
据官方新闻稿,同传模型 Qwen3.8-LiveTranslate 将同传延迟指标(LAAL)降低近 20%,从 2.8 秒降至 2.3 秒;音频模型 Qwen-Audio-3.1-TTS-Next 能从一份文本脚本一次性生成包含对白与环境音的完整声景,面向有声书、影视、播客和游戏等制作场景,同系列还包括语音识别、语音合成与实时交互模型;图像生成模型 Qwen-Image 3.1 面向创意设计与电商营销,官方称能把视觉设计交付从数小时压缩到数秒、支持原生透明背景生成,计划年内晚些时候发布。
Qwen Intelligence 则是一个面向手机厂商的全栈智能体方案,目标是让下一代 AI 手机可靠地完成跨应用的复杂任务。云端的配套是阿里云的「智能体云」升级:围绕模型(model)、框架(harness)与上下文(context)三层展开,其中 AgentCore 平台负责企业智能体从构建、运行到安全管理的全生命周期,Agent Context 服务为企业数据接入实时上下文与长期记忆,官方称在客服、AI 编程、数据分析等知识密集场景最多可节省 67% 的 token 用量。
20GW 目标与「供不应求」的算力缺口
Wu 在演讲中定下目标:到 2032 年,阿里云运营的全球数据中心容量将超过 20GW。他说,客户对 AI 的需求「异常强劲」,正在加速阿里云的收入增长,但供应链约束限制了扩张速度。「行业的中长期需求远超我们的供应能力。」Wu 说。
阿里云给出的近期动作是:从本季度开始,把 AI 超节点以商用规模上线。