AREX Feed Article
智源众智 FlagOS 上线 Qwen3.8-27B 昇腾 BF16 权重,附 GPQA Diamond 89.9 vs 90.4 基准
8 月 15 日 13:19,ModelScope 上的 仓库提交了 README。这份文档由智源(BAAI)众智 FlagOS 社区上传,为 Qwen3.8-27B 的昇腾 BF16 适配权重补上对比基准和部署指南。
基准只有两行:GPQA Diamond,NVIDIA 原生 90.4、昇腾 FlagOS 89.9;musr_murder_mysteries,71.6 对 76.31。仓库本体是 18 个 safetensors 分片,合计约 55.6 GB,Apache 2.0 许可。
阿里开源的 是一款 27B 参数视觉语言模型,官方仓库同样以 Apache 2.0 提供权重;FlagOS 社区此前的做法,是在新模型发布当天给出多芯片适配版本。
权重先传完,README 隔了近一天才上线
ModelScope 元数据显示,仓库创建于北京时间 8 月 14 日 10:16,创建者是 FlagRelease 组织。model-00001-of-00018 到 model-00018-of-00018 共 18 个权重分片在当天 14:48 提交完毕,合计 55,563,006,776 字节,约 55.6 GB。
config.json、tokenizer 等文件当晚 23:23 更新,README.md 直到 8 月 15 日 13:19 才进入仓库。元数据把架构字段标为 Qwen3_5ForConditionalGeneration,许可证字段为 apache-2.0。
README 的许可证一节写明,权重来自阿里官方仓库:"The model weights are derived from Qwen/Qwen3.8-27B and are open-sourced under the Apache License 2.0."
文档还介绍,FlagRelease 平台利用 FlagOS 软件栈自动产出并发布各种芯片与开源模型的组合。截至本文核验时(北京时间 8 月 15 日下午),仓库 API 返回的下载数为 3 次。
GPQA Diamond 差 0.5 分,MuSR 反超 4.7 分
README 的 Evaluation Results 只有一张表、两行数据,两列分别对应 NVIDIA 原生栈与昇腾 FlagOS 栈。musr_murder_mysteries 一项,NVIDIA 原生 71.6,昇腾 FlagOS 76.31,高出 4.71 分;GPQA Diamond 一项 90.4 对 89.9,差 0.5 分。
README 称,结果来自把 FlagOS 软件栈与原生栈放在多个公开基准上并排比较。但文档没有给出评测工具版本、样本口径或运行配置,昇腾侧的 89.9 和 76.31 暂时只有这一行数字可查。
一条 docker pull 起步,示例集群开到 4 节点 64 张 NPU
部署指南给出完整路径:先 docker pull 拉取 FlagOS-Ascend 容器镜像,镜像名以 sglang-plugin-fl-qwen3.8-ascend001 开头、tag 以 202608122129 结尾,托管在 harbor.baai.ac.cn;再用 modelscope download 下载权重;最后用 sglang.launch_server 启动。
启动脚本的关键参数是 --device npu、--dtype bfloat16、--tp-size 16 --pp-size 4 --nnodes 4,容器内挂载 /dev/davinci0 到 /dev/davinci15 共 16 张昇腾 NPU。按 4 节点计算,这份示例最多铺开 64 张 NPU。
脚本同时指定 --reasoning-parser qwen3,服务挂在 30000 端口,对 /v1/chat/completions 提供 OpenAI 兼容接口,README 末尾另附 AnythingLLM 接入步骤。环境要求写明 Docker 25.0.3、内核 Linux 4.19.90-2102.2.0.0068.3.ctl2.aarch64。
11 款芯片的 Day-0 清单,比 2.4T 时代多了两张新面孔
README 开篇声称,Qwen3.8-27B 已在 11 款 AI 芯片上完成 Day-0 多芯片适配、精度对齐与部署验证,清单为平头哥、NVIDIA、摩尔线程、沐曦、昆仑芯、昇腾、海光、Iluvatar CoreX、清微智能、燧原和 Sunrise。
其中 NVIDIA 与摩尔线程支持 FP8,其余为 BF16。同一段还称 FlagOS 首次把最新 Qwen 模型的适配扩展到 ARM 端侧平台,提供 W4A8 低比特版本。
需要说明:11 款芯片和端侧 W4A8 目前只出现在 README 文字里,本次仓库实际提供下载的只有昇腾 BF16 这一套权重。
8 月 13 日 Qwen3.8-2.4T-A95B 的 Day-0 适配时,芯片清单是九家:平头哥、英伟达、摩尔线程、昇腾、沐曦、昆仑芯、海光、清微智能、燧原。
与 11 款清单相减,本轮新增的是 Iluvatar CoreX 与 Sunrise。该报道还提到,FlagOS 把新模型从发布到多芯可用的周期压缩到 24 小时以内。
两行数据之外的验证,仓库没有给
基准只有两行,昇腾侧的评测环境、脚本参数和原始输出都没有随仓库公开;README 里的 FlagEval 章节描述了评测框架,但没有把这两项指标的复现步骤串起来。
想核实 89.9 与 76.31 的昇腾用户只能照部署指南自己跑:拉镜像、下权重、起服务,再用仓库附带的 curl 调用脚本测一轮。
在第三方复现结果公开之前,这份对比只能按 FlagOS 社区的单方声明来读;而验证的起点已经开源:镜像在 BAAI 的 harbor,权重在 ModelScope,脚本在 README。