AREX Feed Article
Qwen 官方致谢 Cline,确认 27B 本地模型达前沿性能
北京时间 8 月 18 日 12 时 15 分,阿里旗下 Qwen 官方账号 发推回应开源 coding agent 数小时前的公开致意,确认本地 27B 模型 Qwen3.8-27B「取得了前沿性能」(scoring frontier performance),并写道:「这只是开始——Qwen3.8-27B 将继续进入更多领域。」「前沿性能」这一定性由此得到厂商官方账号的公开确认。
此前的说法来自第三方:约 9 个半小时前(北京时间 8 月 18 日 2 时 55 分),,Qwen3.8-27B 在独立评测机构 Artificial Analysis 的 Intelligence Index 上达到 DeepSeek V4 Pro 与 GPT 5.6 Luna 的水平,称这是「首个拿到前沿模型能力评分的本地模型」,并坦言「我们没料到本地模型的进展会这么快到来」。
"前沿性能"从 Cline 的评价变成官方口径
Qwen 官方账号(X 平台认证企业账号,27.3 万关注者)的回应原文是:「A local 27B model scoring frontier performance! Huge thanks to @cline for the shoutout. This is just the beginning — Qwen3.8-27B will keep finding its way into more fields.」
与 Cline 宣布时的措辞对照,变化在于定性主体:Cline 的那条推文(UTC 时间 8 月 17 日晚发布)是对独立评测结果的第三方转述和评价,8 月 18 日中午的这条推文则把「前沿性能」写进了厂商自己的口径,并预告模型将继续进入更多领域。截至抓取时,这条回应获得 1766 次点赞、101 次转推和约 6.8 万次浏览。
需要区分的是:官方确认把「前沿性能」从第三方评价变成了厂商口径,但确认本身不构成独立验证——52 分的数字来自 Artificial Analysis 自己的测量。
52 分、第 1 名:AA 的独立测量说了什么
支撑双方措辞的是 :Qwen3.8-27B 在 Intelligence Index v4.1.1 上得 52 分,在 4B–40B 的小尺寸开放权重类共 135 个模型中排第 1,而同类模型的中位数是 9 分。AA 页面称它「在智能水平上属于同类开放权重模型中的领先者之一」。
页面列出的规格包括:27B 参数、256k 上下文窗口、文本+图像输入、Apache 2.0 许可、2026 年 8 月发布,权重托管于 Hugging Face;当前页面展示的是推理(reasoning)版本。指数 v4.1.1 由 9 项评测加权构成,包括 GDPval-AA v2、Terminal-Bench v2.1、SciCode、Humanity's Last Exam、GPQA Diamond 等。
AA 也标出了一个已知边界:模型「话痨」。在指数任务中它生成了 1.6 亿输出 token,而同类中位数是 4300 万,Verbosity 单项排第 23/135。分数之外,:本地可用 npm i -g cline 配合 ollama launch cline --model qwen3.8 运行,或在 Cline 中直接使用模型 ID qwen/qwen3.8-27b。
评论区的一致请求:更大尺寸的模型
官方确认推文下的回复,呼声最集中的不是祝贺,而是追问下一款更大尺寸的模型。问「什么时候能等到 Qwen3.8-35B?」;多名用户点名 Qwen3.8-35B-A3B、44B-A9B 等更大尺寸变体——这些请求目前只出现在评论区,官方推文里没有提及任何具体型号。
也有实际使用者的反馈。写道:「27B 这个尺寸是最好的。大到足够有用,小到能在人们实际拥有的硬件上跑起来。」 说:「我从来没觉得自己在跑一个小模型。推理要花些时间,但给出的方案很扎实。」
一位从业者的评价带上了竞争视角:做 AI coding 工具的 认为 Qwen 团队应该迭代更快,「如果 Qwen 3.9 的 27B 或更小的 20B 以下稠密模型能在 Artificial Analysis 指数上突破 60,那将是中国开源模型比 DeepSeek 或 Kimi 更大的胜利」。
"更多领域"具体是哪些,官方没说
官方推文把后续承诺压缩在「这只是开始」一句话里,没有列出具体领域,也没有给时间表。目前可核实的扩展信号只有两条:一是 Qwen 官方口径的这句话本身,二是 Cline 侧已经可用的本地运行路径。至少在 coding agent 场景里,27B 模型已经能落地。
「前沿性能」的定性如今有了厂商背书,但接下来模型会以什么形态、进入哪些领域,官方推文没有给出任何可验证的细节。评论区对更大尺寸的集中请求与官方口径的沉默,是这篇报道之后最值得盯着的下一个观察点。