AREX Feed Article
Xenova 演示 Qwen3.8-27B 浏览器运行:AA 52 分追平 GPT-5.6 Luna
8 月 17 日,Xenova(@xenovacom,X 简介写着正在 Hugging Face 做 Transformers.js)在 :阿里 Qwen 团队开源的 Qwen3.8-27B 在 Artificial Analysis Intelligence Index 上拿到 52 分,与 OpenAI 的 GPT-5.6 Luna (max) 持平;这个 27B 参数的开源权重模型不仅能本地运行,「甚至能用自定义 WebGPU 内核跑在浏览器里」,推文附了一段演示视频。截至 8 月 19 日检索时,这条推文已获约 13.4 万次浏览、1200 余次点赞。
Artificial Analysis 的 显示其智能指数确为 52 分,在开放权重小模型(4B–40B)档位的 135 款模型中位列第 1;同样显示 52 分。
52 分是什么水平:同类 135 款里的第 1
Artificial Analysis Intelligence Index v4.1.1 由 9 项评测合成:GDPval-AA v2、τ³-Banking、Terminal-Bench v2.1、SciCode、Humanity's Last Exam、GPQA Diamond、CritPt、AA-Omniscience 与 AA-LCR,由 Artificial Analysis 独立运行。AA 页面显示,Qwen3.8-27B 所处的开放权重小模型档位中位数只有 9 分;作为对比,GPT-5.6 Luna (max) 是 OpenAI 7 月 9 日发布的专有模型,1M 上下文、158.6 tokens/s,在同类 172 款中排第 1。
升级幅度有多大,HN 用户 beltsazar 在里给了参照:上一代 Qwen3.6-27B 是 38 分,Qwen3.8-27B 不仅超过它,还超过了所有 40B–150B 的中型模型,与 DeepSeek V4 Flash 0731 同分(后者在大模型档排名第 5)。
但 AA 同时标注了拿到这个分数的代价:该模型在智能指数评测中生成了 1.6 亿输出 token,同类中位数只有 4300 万,冗长度排第 23/135;API 中位价是 $0.45/百万输入 token、$3.20/百万输出 token。AA 的页面结论是:在同类开放权重模型中,「属于偏贵的一档」。
一款默认「疯狂思考」的 27B 稠密模型
Qwen3.8-27B 于 8 月 14 日发布(AA 的 FAQ 与 Simon Willison 的博客均确认)。称这是「Qwen 开放模型家族迄今最强的一代」:基于 Qwen3.5 架构的稠密 27B,原生支持图像与视频理解,上下文 262,144 token 原生、可扩展至 100 万,Apache 2.0 许可。思考模式默认开启,推理深度分 xhigh、medium、low 三档,默认是 xhigh。
模型卡上的自测数据:Terminal Bench 2.1(agentic 终端编码)73.0,对比 Qwen3.6-27B 的 63.4;SWE-bench Pro 61.7(上代 53.5);GPQA Diamond 89.2;Humanity's Last Exam 30.8(上代 24.0)。这些是 Qwen 团队的自测数据。Simon Willison 在 8 月 16 日的里写道,还要看独立基准怎么说。他重点记录的是 xhigh 默认档让模型「疯狂过度思考」:画一个圆的 SVG 要思考几分钟。
Willison 用 17GB 的 Q4_K_M 量化版在 128GB M5 Max MacBook Pro 和 NVIDIA DGX Spark 上跑,LM Studio 下约 15–30 tokens/s;换用模型自带的 MTP(Multi-Token Prediction)投机解码后,速度提升约 72%。他的结论是:「17GB 的文件能在我的家用机器上干这些事,是个奇迹」,唯一拦路的是速度。
浏览器里的 27B:Xenova 的自定义 WebGPU 内核
过去几个月,Xenova 持续在把模型搬进浏览器:8 月 11 日 在 WebGPU 上以约 25 tokens/s 运行(M4 Max),6 月 17 日。这次的推文只附了视频,没有给出 repo 或演示地址;视频内容是 Qwen3.8-27B 在浏览器中的运行演示。
转发者 Yevhen Dubinin(iOS 开发者):「简直像魔法,即使只有 11 tokens/sec。」Maziyar Panahi(自述在 CNRS 做 AI 基础设施与研究、在 Arcee AI 做开源模型)在:「那个 Qwen WebGPU 太漂亮了!」。
评论区里反复出现两个问题:repo 在哪、要多少显存(「where is the repo? how much vram?」)。一位用户回复了 Hugging Face 的 ,称「我打赌每小时都有几千人在刷新这个页面」。
官方下场转发,社区吵着要 repo
Qwen 官方账号 @Alibaba_Qwen 在 8 月 18 日:「强到能跟上前沿,轻到能在你自己的笔记本上跑。来看看它能做什么!」(Strong enough to keep up with the frontier, light enough to run on your own laptop),该转发获 1300 余次点赞。HN 上同一话题的讨论帖已有 372 分、174 条评论。
HN 用户 phsource 指出,Qwen3.8-27B 在评测中的 token 消耗量约为 GPT-5.6 Luna (max) 的 2.3 倍、Kimi K3 的近 2 倍,他推测这与 xhigh 默认档产生的超长推理轨迹有关。开发者 Kamran Wajdani 「匹配」的定义:「匹配一个基准分数令人印象深刻,但『匹配 GPT-5.6 Luna』需要任务级对等:确切的评测版本、提示词、工具调用、上下文长度和方差。」Adel Bucetta :「这更像公关噱头,而不是真正的突破。」开发者 Knowix :「这大概也会给 API 定价带来更大压力。」
14GB 显存这道门槛
浏览器运行不等于零门槛。ML 工程师、AI 博士生 Sebastian Buzdugan :27B 参数在 4-bit 下仍需约 14GB 显存,「浏览器支持排除了很多笔记本」。:「『在浏览器里本地运行』听起来很棒,直到你问是在什么硬件上。27B 模型不会因为走 WebGPU 就神奇地消失硬件需求。」相对温和:「开源权重与前沿闭源模型的差距正从底部不断收窄,不过 VRAM 仍是瓶颈。」
Xenova 的视频证明了「能跑」。但推文没有给出 demo 地址、硬件要求或速度指标,评论区还在等 repo 和显存数字。能拿来评估的公开数字,是视频里约 11 tokens/s 的表现和 4-bit 下约 14GB 的显存估算;52 分能不能以这个速度在浏览器里兑现,目前没有公开数字支撑。