AREX Feed Article
Qwen3.8-Flash 生产版 API 上线:输入 $0.15、缓存命中 $0.016
8 月 27 日 06:49 UTC(北京时间 14:49),Qwen 官方账号宣布 Qwen3.8-Flash 生产版 API 已在 QwenCloud 上线,最终定价为输入每百万 token 0.15 美元、输出 0.47 美元、缓存命中 0.016 美元()。其中缓存命中价是 8 月 26 日开源公告里没有出现过的数字。
前一天的开源公告为此做了铺垫:8 月 26 日 12:34 UTC,Qwen 开源 Qwen3.8-Flash 与 Qwen3.8-Flash-Next 权重时预告,生产版 Qwen3.8-Flash「即将」通过 QwenCloud API 提供,输入价 0.16 美元、输出价 0.47 美元()。正式上线的输入价最终定为 0.15 美元,比预告低 0.01 美元;输出价维持 0.47 美元。
0.15 与 0.16:正式价和预告价差在哪
Qwen 的定价推文原文是:"Qwen3.8-Flash on @qwen_cloud: $0.15/1M input tokens, $0.47/1M output tokens, and just $0.016/1M on cache hits."
对照 8 月 26 日的预告,变动的只有输入价:0.16 美元降到 0.15 美元。输出价 0.47 美元未动;缓存命中价 0.016 美元约为输入价的十分之一(0.016 ÷ 0.15 ≈ 10.7%)。
缓存命中价直接决定长上下文场景的实际成本。Qwen 在公告里把模型原生上下文定为 262K token、可用 YaRN 扩展到 1M,agent 反复读取同一段前缀、代码库分析多次命中同一上下文时,命中的输入 token 按 0.016 美元计费,而不是 0.15 美元。对这类反复命中同一前缀的用法,缓存命中价直接决定单次请求的成本。
OpenRouter 上架,页面报价与官方一字不差
OpenRouter 官方账号在 8 月 26 日 22:00 UTC 宣布 Qwen3.8 Flash 已在其平台上线(),称其为面向编程助手、agentic 工作流、视觉理解、代码库与文档分析、桌面交互、图表与长视频的多模态推理模型,并附上模型页链接()。
页面报价与 Qwen 官方口径一致:输入 0.15 美元、输出 0.47 美元、缓存读取 0.016 美元(每百万 token)。页面还列出了官方推文没有给的数字:缓存创建(5 分钟)0.20 美元/百万 token,比标准输入价高约三分之一;上下文 1M token,单次输出上限 131,072 token;支持 tool calling 与结构化输出;输入支持文本、图片和视频。
需要区分的是,OpenRouter 上架的是 Flash,不是同一天开源权重、作为 Qwen4 架构早期预览的 Flash-Next。页面显示该模型由单一提供商 Alibaba Cloud Int. 托管,OpenRouter 把所有请求直接转发给阿里云,不做路由分流。页面上的监控数据包括 P50 延迟 4.70 秒、吞吐 41 tok/s、近 3 天 uptime 99.99%,而模型页标注的上线日期是 8 月 26 日。
缓存写入价是多少?评论区在追问
定价推文发出后,回复区讨论集中在 0.016 这个数字上,也集中在它没回答的问题上。
Maziyar PANAHI(账号简介自述在 CNRS 从事 AI 基础设施研究、参与开源模型工作)说,缓存命中价是「最疯狂的数字」,还想看看 262K 上下文下的首 token 延迟()。账号 DDU 算了一笔账:命中价相对输入价是约 9 倍折扣,「但决定缓存划不划算的是写入溢价,而这条推文里没有」()。在 YC 公司 evo__hq 做 AI 成本优化的 Lakshmi Narayana 问得更具体:长 agent 前缀写入缓存时,是按完整 0.15 美元计费,还是同样打折()?独立游戏开发者 Paul · SpellWright 则问 262K 上下文是否全程按同一输入价计费、会不会分档()。
也有正面和批评的声音。做 LLM agent 的 Charis Mitsakis 认为 1M 上下文配 0.15 美元输入价「确实很划算」,并问有没有人对比过 glm-5.3-flash();Fahad Saleem 说只要价格维持现状就用 API,成本大涨才考虑本地机器()。账号 Moiraion 则直接说这是「糟糕的价格」,「Qwen 团队需要让 DeepSeek 给他们上一堂 tokenomics 入门课」()。截至 8 月 27 日晚核验时,定价推文获得 176 个赞和 27 条回复,OpenRouter 的上架推文为 225 个赞。
这些数字目前都出自厂商自己的页面
本次的价格、规格与监控数据,全部来自 Qwen 官方推文和 OpenRouter 官方页面两个渠道,均为厂商自述口径;官方公告能证明的是厂商作出了这些声明,本身不构成独立验证。
悬而未决的具体问题是缓存写入计费。Qwen 的推文只给了输入、输出、命中三个数字,没有说明写缓存如何计费,评论区已经有人追问;目前可见的唯一「写缓存」价格来自 OpenRouter 页面:缓存创建(5 分钟)0.20 美元/百万 token,高于标准输入价。命中价 0.016 美元大约是输入价的十分之一,写入却比普通输入贵约三分之一,这组数字最终决定长上下文 agent 场景里缓存是否划算,而 Qwen 官方目前只公布了其中一半。