AREX Feed Article
OpenRouter 称 DeepSeek V4.1 Flash 在其平台 24 小时处理 1T tokens,预计 48 小时约 2.8T
北京时间 9 月 12 日凌晨(UTC 9 月 11 日 20:07),LLM(大语言模型)统一接口平台 OpenRouter 在 X 上称:DeepSeek 9 月 10 日发布的 V4.1 Flash 在平台上线的第一个 24 小时处理了 1T tokens(约 1 万亿个词元);按其走势,48 小时合计预计约 2.8T(约 2.8 万亿个词元),将是任何付费模型发布中最大的 48 小时。
帖文还给出了这批用量的构成与定价:这些 tokens 中 90% 是缓存读取(cache reads),其市场价约为 $0.006/M(每百万 tokens 0.006 美元),比 GLM-5.3 Flash 等同类模型便宜 5 倍。以上数字与对比均来自 OpenRouter 的平台数据。
实测到 37 小时的 1.91T,48 小时为虚线外推
帖文附带的用量图把节奏标得更细:曲线在 24 小时处标注 1.0T;实线在约 37 小时处结束于 1.91T 的实测点;从那里到 48 小时的约 2.8T 用虚线连出,图注写明虚线代表预测,数据来源标注为 OpenRouter analytics。
作为量级参照,OpenRouter (数据截至 9 月 9 日,即 V4.1 Flash 发布之前)显示,按周统计处理量最大的模型是腾讯的 Hy4 preview,约 19.7T tokens。该页面同时注明,token 量衡量的是采用度而非质量,也不等于请求数、用户数或花费。
供应商标价与 DeepSeek 官方价目表
$0.006/M 这个数字能对应到平台价目表上:OpenRouter 显示,该模型由 8 家供应商提供,其中 DeepSeek、GMICloud、NovitaAI、Parasail、DeepInfra 五家的缓存读取标价均为 $0.006/M;io.net 为 $0.003/M,Fireworks 为 $0.007/M,Morph 为 $0.03/M。同一张表里,缓存未命中的普通输入为 $0.15~$0.30/M,输出为 $0.60~$1.20/M。
九成的缓存占比也有旁证。模型页的价格历史按供应商列出缓存命中率:DeepSeek 94.1%、GMICloud 93.1%、NovitaAI 85.9%,三家合计覆盖了该模型超过 96% 的单日 token 份额。
DeepSeek 的给出了对应的官方价格:V4.1 Flash 的缓存命中在高峰时段为 $0.006/M、非高峰为 $0.003/M;缓存未命中的输入为 $0.30/M 与 $0.15/M,输出为 $1.20/M 与 $0.60/M。这套价格从 UTC 9 月 10 日 04:00 起生效。
KV 缓存压缩与 agent 负载
DeepSeek 在公告中把缓存命中费用列为 agent(智能体)成本的组成部分:「缓存命中费用往往在 agent 成本中占据很大一部分,压缩缓存能显著削减这部分开销。」同一份公告给出的数字是:V4.1 Flash 的 KV(键值)缓存占用降到了上一代的四分之一(HBM,即高带宽内存)和八分之一(SSD 存储);每 token 的全局 KV 缓存为 890 字节,上一代 V4-Flash 为 3,514 字节。
与高缓存占比相呼应的是应用类型:OpenRouter 模型页把 Nous Research 的 Hermes Agent、Anthropic 的 Claude Code 等 agent 工具列在向该模型发送流量最多的公开应用之中。
差价只在缓存读取,缓存之外排序相反
OpenRouter 称 V4.1 Flash 比 GLM-5.3 Flash 等同类模型便宜 5 倍。对照 OpenRouter 上两款模型的价目表,5 倍差距出在缓存读取:V4.1 Flash 多数供应商的缓存读取标价为 $0.006/M,8 月 26 日发布的 标价为 $0.03/M(部分供应商有折扣,折后 $0.015~$0.0264/M);按标价算,$0.03 正好是 $0.006 的 5 倍。
缓存读取之外则是另一套排序:V4.1 Flash 的普通输入价为 $0.15~$0.30/M,GLM-5.3 Flash 标价 $0.15/M、多个供应商折后低至 $0.075/M。帖文下,回复者 Arthur :「但不算缓存读取的话,比 GLM-5.3 Flash 贵多了。」这与价目表给出的排序一致。
对缓存读取占比的两种读法
90% 这个数字,在帖文回复里引出了不同的解读。回复者 Ibesh :「90% 的 token 是缓存读取,这本身就是最能说明问题的数字:那是人们在整天挂着 agent 循环,而不是聊天;便宜的缓存读取让这个循环可以一直开着。」
回复者 John Rood :「缓存读取只有在上下文稳定时才能保持九成。跑长程 agent 时,每次上下文压缩都会重写前缀,缓存恰恰在上下文大到开始有意义的时候失效。那是个冷启动数字,稳态会更难看。」
V4-Pro 请求将在 9 月 14 日改道
按 OpenRouter 模型页的介绍,V4.1 Flash 是 DeepSeek 家族里定位成本档的稀疏 MoE(混合专家)模型:总参数 552B(5,520 亿),输入侧激活 8B(80 亿)、输出侧 16B(160 亿),也是该公司新 CED(Causal Encoder-Decoder)架构下的首个模型。DeepSeek 在公告中称,多方测试显示它在性能、成本、速度和总运行时间上超过 V4-Pro,并给出了换代安排:上一代 V4-Flash 已退役,V4-Pro 则在淘汰中——从 UTC 9 月 14 日 04:00 起,所有 deepseek-v4-pro 请求将改道到 V4.1 Flash,按 V4.1 Flash 的价格计费,直到 V4.1-Pro 发布。
从那天起,V4-Pro 的存量请求将计入 V4.1 Flash 的 token 用量。