AREX Feed Article
ModelScope 预告 Qwen3.8-Flash-Next 今晚 23 点开源,Qwen4 架构先行亮相
北京时间 8 月 25 日 19 点,魔搭社区 ModelScope 官方 X 账号(@ModelScope2022)发布预告推文:「支撑 Qwen4 的下一代架构已经就位(The next-gen architecture powering Qwen4 is now here!),准备好迎接 Qwen3.8-Flash-Next 的开源发布,倒计时现在开始(The countdown starts now!)」。附上了,但没有写发布时间。
时间表在魔搭社区的模型页面上。据 ,页面显示 Qwen3.8-Flash-Next 将于北京时间 8 月 26 日 23:00 开源,届时发布 Qwen3.8-Flash-Next 和 Qwen3.8-Flash-Next-FP8 两个版本;这是一款基于下一代 Qwen4 架构构建的多模态 MoE 模型,官方称提前放出架构改进,是为了让社区为即将推出的完整 Qwen4 模型家族做好准备。8 月 26 日下午,阿里千问官方账号 在宣布 Qwen3.8-27B 拿下 Image-to-WebDev Arena 开源模型第一后补了一句:「猜猜我们今晚要放什么惊喜?」
倒计时终点:北京时间今晚 23 点
配发了上面这张页面截图:左上角是「即将开源」角标,中间是「喜欢并订阅发布提醒」按钮和一组倒计时数字(截取时显示 1 天 0 小时 17 分 20 秒),下方一行「预计发布时间:2026-08-26 23:00(UTC+08:00)」,页面显示已有 246 人正在等待发布。截图来自 IT 之家 8 月 25 日晚的报道,由新浪科技转载时配发。
这次开源的特殊之处在于版本构成:标准版之外还准备了 FP8 版本。除此之外,IT 之家在报道末尾注明:官方暂未公布更多信息。
125B 主模型、51B N-gram:数字全是流传
关于模型规格,目前唯一能确认的官方口径只有一句话:多模态 MoE、基于下一代 Qwen4 架构。其余都是社区流传。 称早期页面列出过「125B 主参数、每 token 激活 6B、外加 51B N-gram 记忆」,并提醒最终规格仍需确认;中文社区里 的说法是「目前流传的参数大概是主模型 125B,额外挂了 51B 的 N-gram Embedding,每 token 只激活 6B 左右」。AI 资讯账号 说得更直接:参数信息现在「乱成一团」,同样是 125B 总量,激活参数他看到过 6B 和 60B 两种说法,「没人证实过任何数字」。
唯一把机制讲清楚的是本地跑分博主 Alexey Fateev(@superalesha,自称在 4×RTX 3090 上测本地 LLM)。他在里解释:51B N-gram embedding 是一张可训练的查表记忆,模型把最近几个 token 的 N-gram 做哈希、从表里取向量混进隐状态,主模型就不用费力重建高频的局部模式;代价是这 51B 参数得存在显存、内存或专门的 offload 里。按理想的 4 bit 量化估算,125B 主权重占 58.2 GiB、51B 表占 23.7 GiB,合计约 82 GiB,在他的 96GB 机器上只剩约 14 GiB。他的判断是:「真正决定我在家能不能跑 Qwen4 架构的,就是这 51B N-gram 用什么精度存储、checkpoint 长什么样、支不支持量化和 offload。」
评论区里还有一个更反常的观察。 说,125B-A6 加 51B embedding 的架构数字在 Qwen 3.x 任何型号里都没有出现过,「既然是新架构,为什么不直接叫 Qwen4?」
十二天前,Qwen3.8-27B 刚开源
「3.8-Flash-Next」容易让人以为是例行小更新,实际上 Qwen3.8 系列开张还不到两周。:Apache 2.0 协议、原生多模态 dense 架构、三档 reasoning_effort、262K 原生上下文(可用 YaRN 扩到 1M),量化后消费级显卡可跑。,是同尺寸里唯一进前十的模型。
而这次预告的 Flash-Next 换了路线:12 天前的 27B 还是「原生多模态 dense 架构」,今天的 Flash-Next 已是「基于下一代 Qwen4 架构的多模态 MoE」。用 Pearl AI 的分析说,大多数实验室会把旗舰架构捂到 Qwen4 发布才一次性放出,运行时生态要手忙脚乱好几周;阿里这次反着来,先把架构装进一个小模型交给社区,量化和工具链提前备好,「等真正的 Qwen4 家族落地时,不会走进一间冷屋子」。
有人备好 96GB 显存,有人问「图什么」
预告发出后不到一天,这条推文在 X 上获得约 2,263 次点赞、308 次转发、257 条引用推文和 90.7 万次浏览(截至发稿)。评论区里随即分成两种声音。Fateev 在里写道,「如果它塞得进我的 96GB,发布当天我就跑分;塞不进,我就量化到塞得进,发布当天照样跑分」; 的推测是「Qwen4 一定已经在训练了」。
另一种声音是质疑。(3.7 万粉丝的新加坡 Crypto×AI 博主)在引用推文里提问:如果 Flash-Next 只和 Qwen3.7 Plus 相当,在 DGX Spark 上追求最强本地智能,为什么不继续跑 Qwen3.8-27B 或 DeepSeek V4 Flash 0731?「也许它只是让开发者提前熟悉 Qwen4.0 的基础设施,和『下一代速度和智能』关系不大。」做中国 AI API 网关的 SinoRouter(Jeff)提醒的则是另一件事:该盯的不是倒计时,而是「artifact contract」,即许可证、运行时配方和评测曲线,「在那之前,别把它当成一个可部署的选择」。Hacker News 上()的讨论已经算到硬件:有人等着看它和 DeepSeek v4 Flash 的对比,有人说「如果一张二手 3090 加 DDR4 内存就能跑出不错的速度,本地 AI 元年就要来了」。
截至发稿,官方还没给出参数表
把两条官方消息并排看,信息缺口很清楚:ModelScope 的推文只说了「架构就绪、倒计时开始」,Qwen 官方只说「今晚有惊喜」;按 IT 之家的记录,模型页面上也没有参数、许可证或评测。23 点权重一开放,社区流传的 125B、6B、51B 是真是假立刻见分晓,Fateev 已经放话要在发布当天跑分。完整版 Qwen4 家族何时到来,官方口径里目前只有一句:提前放出这套架构,就是让社区先做好准备。