AREX Feed Article
智源 FlagOS 宣布九家芯片 Day-0 适配 Qwen3.8-2.4T-A95B,三种精度开箱即用
8月13日,智源研究院在官方公号宣布:众智FlagOS社区已对阿里巴巴开源的超大规模MoE模型Qwen3.8-2.4T-A95B完成Day-0多芯片适配。按转述的公告,模型已在平头哥、英伟达、摩尔线程、华为昇腾、沐曦、昆仑芯、海光、清微智能、燧原9家AI芯片上完成基于FlagOS统一开源技术栈的多芯适配、精度对齐与部署验证,并针对不同芯片提供BF16、FP8、INT8三种精度的版本,开发者可直接获取对应芯片的开箱即用方案。
这个适配对象是8月12日开放权重的Qwen家族首个Max级模型,总参数2.4T、激活参数95B;同一天了对NVIDIA与AMD硬件的Day-0支持。智源这套适配把“发布当天能跑”的范围扩到9家芯片厂商。
社区公告中展示的FlagOS技术栈全景:FlagGems算子库、FlagTree编译器、FlagCX通信库、FlagScale框架,加上vLLM-plugin-FL、SGLang-plugin-FL两个推理插件,是这次跨芯适配的技术底座(来源:众智FlagOS社区)。
九家芯片,三种精度,权重和镜像直接拉取
8月13日15时44分,社区在CSDN发布了题为《》的完整文章,列出FlagRelease平台上线的适配版本:平头哥拿INT8版(仓库名后缀zhenwu),英伟达同时有FP8和INT8两版,摩尔线程和燧原走FP8,沐曦、海光、昆仑芯、华为昇腾、清微智能走INT8。10个模型实例在魔搭和Hugging Face双平台发布,配套镜像预置了FlagGems算子库和FlagTree编译器,社区称“加载模型时底层优化自动生效”,业务代码与标准调用接口无需修改。
社区解释为什么多数芯片走INT8:Qwen3.8-2.4T的参数规模比Qwen3.5-397B扩大了6倍,而“当下80%以上存量AI算力不支持FP8”。为此这次在FlagOS-Compressor工具链里新增了统一INT8量化支持,提供从FP8/BF16原生权重到INT8的两条压缩路径(W8A8),把权重和激活从BF16压到INT8,降低显存占用与访存压力。
以昇腾INT8版核对交付物:里有213个权重分片,README给出4节点共64卡的SGLang部署命令(tp=16、pp=4),以及harbor.baai.ac.cn上的FlagOS-Ascend容器镜像(tag 202608122129)。仓库提交记录覆盖8月11日21时50分到8月12日23时02分,最后一批文件完成于8月12日深夜;智源官方公号在8月13日宣布适配完成。
和英伟达原生 FP8 差多少?社区公布了对齐表
公告的第二项是精度对齐。社区文章把各芯片量化、跨芯迁移后的权重与英伟达原生CUDA FP8版本对照,给出MUSR与GPQA_Diamond两项基准的平均分偏差(百分点):
表格下方注明“本表为阶段性评测结果”。昇腾INT8两项偏差为+2.00%和+1.10%,沐曦INT8在GPQA_Diamond上+3.80%,摩尔线程FP8为+1.00%和+0.40%;负向最大的是海光INT8和平头哥INT8,GPQA_Diamond各-3.60%。社区据此称各芯片偏差“均在对齐区间内”,量化加跨芯迁移后模型质量与原版一致。
昇腾模型卡的README单独列出一组绝对值:INT8-Ascend-FlagOS的GPQA_Diamond为92.42,对照INT8-Nvidia-Origin的91.41;MUSR谋杀之谜子项80.8对79.2。这些数字全部来自社区自己的评测。
谁在等这份 24 小时方案:中小 Token 服务商
智源相关负责人对表示,FlagOS Day-0适配“将新模型从发布到多芯可用的周期压缩至24小时以内”,为国产AI算力云服务抢占新模型的“首发窗口”。
社区文章把受益者指向中小型Token算力服务商:它们采购规模和技术资源有限,难以推动芯片厂商为单一模型做专项适配,也养不起完整的底层适配团队,而每一次新模型发布都意味着一次新的迁移和适配。目前腾讯云HAI社区、超算互联网等云平台已把FlagOS适配的模型纳入容器镜像中心,开发者可以直接拉镜像部署MaaS推理服务。
对智算中心,公告的说法是让“存量的当代和上一代AI算力也有机会继续承载最新的超大规模MoE模型”。它同时划了边界:“目标并非让旧硬件获得与新一代硬件相同的性能,也不是无条件延长所有设备的生命周期,而是在部署条件、模型精度和性能表现均可验证的前提下”提供选择。
这次适配有积累做底:自今年2月首次开展MiniCPM4.5-o的Day-0适配以来,FlagOS累计完成来自7大头部模型团队、12款主流开源模型、覆盖多达10款芯片的跨芯适配;截至2026年8月,FlagRelease已发布覆盖10余家芯片厂商、12余款硬件、80余个开源模型实例。
精度表上还有两栏“测试中”
公告说9家芯片完成“多芯适配、精度对齐与部署验证”,但社区公布的对齐表里,清微智能和燧原两栏整列还是“测试中”,沐曦的MUSR一项也是“测试中”。社区文章自己把两件事分开说:各家芯片完成的是“功能跑通与部署验证”,“精度对齐进度以评测章节的表格为准”。也就是说,清微智能INT8和燧原FP8的权重已经能下载,精度对齐数字还没出。
名单口径也有出入。媒体转述的公告列了9家;魔搭上昇腾INT8模型卡的README写的是“10 AI chips including Alibaba T-Head, NVIDIA, Moore Threads, Huawei Ascend, Metax, Kunlunxin, Hygon, Tianshu Zhixin, Tsingmicro, and Enflame”,比公告多出天数智芯一家,两者之间为什么差一家,文章没有交代。
对开发者而言,眼下能直接比对的精度数字,就是表格中已经填上数字的那些格子;清微智能与燧原两家的偏差数字还不在表格里。