AREX Feed Article
Cline:Qwen3.8-27B 以 52 分追平 GPT-5.6 Luna,称首个达前沿水平的本地模型
开源 coding agent 开发商 Cline 的8 月 17 日发推宣布,阿里开源的 Qwen3.8-27B 在独立评测机构 Artificial Analysis 的 Intelligence Index 上拿到与 DeepSeek V4-Pro、GPT-5.6 Luna 同一档的成绩,称"这是本地模型第一次拿到前沿模型(frontier model)能力评分"(This is the first time a local model has scored frontier model capability),"我们没想到本地模型会这么快到这个水平"(We weren't expecting this pace of local progress anywhere near this soon)。截至核验时,这条推文已有约 8 万次浏览、1,698 个赞和 111 次转发。
Cline 自称"接管你的编辑器、终端和浏览器来自动完成工作的开源编码代理"。它口中的"同档"可以直接在 上核对:Qwen3.8 27B 的 Intelligence Index 是 52 分,在同类 135 个模型中排第 1;OpenAI 的 同为 52 分; 为 53 分,只高 1 分。而"首个达前沿能力的本地模型"这个定性出自 Cline 官方之口,Artificial Analysis 的页面本身没有这样的表述。
52 分是什么水平:追平 Luna,差 V4-Pro 一分
Artificial Analysis 的 Intelligence Index(当前版本 v4.1.1)由 9 项评测合成:GDPval-AA v2、τ³-Banking、Terminal-Bench v2.1、SciCode、Humanity's Last Exam、GPQA Diamond、CritPt、AA-Omniscience 和 AA-LCR,覆盖编码、终端操作、科学推理与知识问答。榜单分档比较:开放权重模型按参数量分档,闭源模型按价格区间分档。
Qwen3.8 27B 的 52 分来自"Small"档(4B–40B 开放权重)内 135 个模型的比较,它是该档第 1 名。作为对照:GPT-5.6 Luna(max)是 OpenAI 7 月发布的闭源模型,1M 上下文,52 分,在其价格档 165 个模型中排第 1;DeepSeek V4 Pro 0813(max)是 8 月发布的 1600B 总参数(49B 激活)模型,53 分,在其档位排第 3。三个模型的 AA 页面都标注为 2026 年 7 至 8 月间发布。
AA 页面上,Qwen3.8 27B 的速度数据是 N/A,输入与输出价格均为 $0.00(自托管开放权重模型,AA 未列出 API 定价)。
27B 稠密模型,凭什么跑出这个分
按阿里在 ,Qwen3.8-27B 是 27B 参数的稠密模型,原生支持图像与视频理解,上下文 262,144 token、可扩展到 1M,thinking 模式默认开启,可用 reasoning_effort(xhigh/medium/low)调节推理深度。架构采用 Gated DeltaNet 混合线性注意力加多头预测(MTP),Apache 2.0 协议开放权重。
阿里公布的自家基准显示,它比上一代 Qwen3.6-27B 有明显跃升:Terminal Bench 2.1 从 63.4 涨到 73.0(闭源对照 Opus4.6 Max 为 78.2),SWE-bench Pro 61.7 对 53.5,DeepSWE 1.1 从 13.3 跳到 42.2,LiveCodeBench v6 90.3 对 83.9(反超 Opus4.6 Max 的 88.8),GPQA Diamond 89.2,HLE 30.8 对 24.0。这些数字出自阿里自己的模型卡;AA 的 52 分才是第三方独立跑出来的结果。模型卡还预告 Qwen Cloud 将提供托管版(默认 1M 上下文),"服务即将上线"。
先泼冷水:任务构成、双倍 token 与"刷榜"怀疑
质疑集中在三个点上:任务构成、token 消耗和刷榜嫌疑。BoldMetrics 联创、正在搭建 VulcanBench 评测的 在回复里追问:这种指数里的 coding 任务是不是只占约 8%?"我会用 100% 的 coding 任务重新测一遍。这种模型我只会拿来写代码,不会用于其他事。"
token 消耗是另一处焦点。自称"主要做软件开发"的 贴出对比图称,Qwen3.8 每个任务消耗的 token 约为 Luna 的两倍,"它很好,但别掉进 Qwen3.6 同一个坑"。AA 页面上的数据部分支持"冗长"这个判断:Qwen3.8 27B 在指数评测中共输出 160M token(同类中位数为 43M),而 GPT-5.6 Luna(max)为 130M。
还有人直接怀疑刷榜。 认为"27B 这么小,数学上不可能到这个水平,恐怕是在这些基准上训练过";更干脆:"这肯定是被 benchmark 特训出来的"(ts gotta be benchmaxxed);则指出"指数分数掩盖了工具调用(tool calling)的差距"。以上质疑均出自社区个人账号,本文核验范围内没有能证实或证伪它们的第三方材料。
一台 5090 就能跑:接入方式与显存门槛
Cline 在里给出了接入方式:npm i -g cline 后用 ollama launch cline --model qwen3.8 启动,或在 Cline 里直接用模型 ID qwen/qwen3.8-27b。也就是说,Cline 给了这个"前沿水平"模型一个可以直接在自家产品里调用的模型 ID;回复还指向其 。
硬件门槛还在。呼吁有人测一下各量化档:"30GB 以上在个人硬件上很难跑,4bit 量化约 20GB 应该可行";说它在 24GB 显存上跑得很好。负面样本也有:试了 MLX 版,结果"第一件事就是让 Ollama 失控,锁死了我的远程机器……是个有趣的模型,但还没到生产可用"。
从"还要 2-3 年"到"不用数据中心了"
"我们原以为前沿模型和本地模型的差距收窄要等 2-3 年,没想到现在就发生了。"这条回复点出了预期的时间差。概括道:"27B 参数、5090 本地跑、前沿模型性能、2026 年 8 月。" 说"你需要数据中心"这个说法弱多了; 说这是"用电费换前沿能力"。中文用户 写道:"一个 27B 的 qwen 3.8,竟然和 dsv4pro, glm 5.2, gpt5.6 luna 平起平坐。"关注电动车与芯片的博主 把场景延伸到车端,称联发科已宣布 C-X1 座舱平台 Day-9 支持 Qwen3.8-27B,"车端也有了前沿模型能力"(该说法出自他个人,本文未独立核实)。
这场讨论停在一个具体问题上:52 分是在指数混合任务上跑出来的,Morgan 因此放话,要用 100% 的 coding 任务重新评测。在那之前,"本地模型达到前沿水平"仍只是 Cline 官方给出的判断,外加 Artificial Analysis 页面上那个 52 分。