AREX Feed Article
Qwen 宣布 Qwen3.8-27B 在 Cerebras 上线,并邀请用户试用
北京时间 9 月 12 日下午,阿里巴巴 Qwen 的官方 X 账号 @Alibaba_Qwen 宣布,Qwen3.8-27B「现已在 @cerebras 上以快速推理运行」,并邀请用户「现在就试」。
更具体的规格由 Cerebras 一侧给出:在 Qwen 发帖前约 11 小时(北京时间 9 月 12 日凌晨),Cerebras 的官方账号该模型「现已以 Cerebras 的速度上线」,并称这个来自 @Alibaba_Qwen 的稠密(dense)、开源权重模型在 Artificial Analysis Intelligence Index 上得分 34,与 GPT-5.6 Luna、DeepseekV4 Pro、Claude Sonnet 4.6 相当。Cerebras 的则把标称速度列为约 1,850 tokens/s。
帖文只有三句:一句口号、一句宣布、一句邀请
帖文以一句「快遇上开放」(Fast meets open)开场,宣布与邀请各占一句。帖文没有给出评测分数或速度数字,「现在就试」也没有附上链接或调用入口;速度、价格与调用方式等细节来自 Cerebras 一侧的资料。截至发稿,这条帖文有约 11.7 万次浏览、900 多个点赞和 50 多条回复。
Cerebras 端点:$0.99/$1.49 定价、64K/128K 上下文
Cerebras 的给出模型 ID qwen-3.8-27b 和更细的数字:输入每百万 token 收 $0.99、输出每百万 token 收 $1.49;免费试用的上下文上限是 64K、最大输出 32K;付费层及试用客户为 128K 与 40K;推理强度(reasoning effort)默认 high,可以用 reasoning_effort 设为 none 关闭。图像输入必须走 Chat Completions 接口、以 base64 编码的 PNG 或 JPEG 提交,免费试用每条请求最多 2 张、共享层的开发者与企业账户最多 10 张;其余能力包括流式输出、结构化输出、工具调用、并行工具调用和提示缓存。
Qwen3.8-27B:稠密、多模态、Apache 2.0
阿里巴巴在中介绍,Qwen3.8-27B 是 Qwen3.8 系列的开源权重成员:一个原生多模态的稠密模型,能理解图像和视频,可在消费级硬件上运行,量化后甚至能装进笔记本;主要面向编码、专业工作、研究与长程 agent(智能体)任务。模型采用 Apache 2.0 许可,原生上下文 262K,可扩展到 100 万 token;阿里称它的表现与 Qwen3.7-Plus 相当,后者是规模十倍于它的 MoE(混合专家)模型。
Hugging Face 的给出同样的上下文数字(262,144 原生、可扩展至 1,000,000),并写明官方托管版服务「即将推出」。
在 Cerebras 端点上,可用上下文的上限是 64K(免费试用)或 128K(付费),低于模型原生的 262K。
公告还引用 Hugging Face 数据称,Qwen 的衍生模型约 15.1 万个,在各机构中居首,约为 Meta 相关总量的 2.6 倍。
回复区反馈:速度获好评,编码与成本被点名
帖文下方的回复方向并不一致。 评价它是「一个好模型(而且非常非常快)」; 回应「可惜它对任何编码任务都用不了,其他方面真的很棒」; 说它「知识类很好,但用于编码非常贵」,从成本考虑,Flash 变体会是首选。
的追问更接近机制层面:他称这个 34 分来自 xhigh 推理档,并追问 Cerebras 端点服务的是哪个档位;他认为若同样是 xhigh,输出 token 的消耗会抵消速度优势。
共享层的限额:每分钟 15 万 token
模型详情页还列出了额度:免费试用每分钟 5 次请求、3 万个未缓存 token、9 万总 token,每天 100 万 token;开发者档每分钟 300 次请求、15 万个未缓存 token、45 万总 token,没有每日上限。
Hacker News 9 月初关于这个端点的里,开发者的看法并不统一:nostrebored 认为这项限额「很可能让它在很多编码任务上不可用」;Aurornis 反驳说这个额度已经很高,真正的天花板是 128K 上下文;wild_egg 按输入 token 计算,一分钟大约只够 3 个 5 万 token 的请求。
Cerebras 的目录页注明,这类公共端点覆盖免费试用与按量付费两档;需要预留容量、更高吞吐与生产级 SLA(服务等级协议)的团队,应改用专用端点。至于标称速度在真实负载、尤其是长上下文下能兑现多少,开发者 已在 Qwen 的帖文下提问:「长上下文下吞吐还能保持吗?」