AREX Feed Article
Mia 实测 DeepSeek V4.1 Flash API:5 亿多 token 花 2.96 美元,解码峰值 315.5 tok/s
9 月 15 日,X 账号 Mia(@MiaAI_lab)发布了一组针对新近上线的 DeepSeek V4.1 Flash API 的实测数字:处理超过 5 亿 token(模型识别文本的最小单位)的成本不到 3 美元,解码峰值约 315 tok/s(每秒 token 数),prefill(处理输入提示的阶段)约 52k。
这组数字来自 Mia 的单方记录:一张她贴出的用量面板截图,加上两句帖文。帖子没有说明测试所用的 harness(运行框架)、请求类型与负载构成;数字记录的是她自己在截图时段内的账单与吞吐。
截图里的六个数值
帖子发布于 9 月 15 日 07:28 UTC。截图是一张端点用量面板,标注为「DeepSeek API」,时间筛选为「Today」;上排三项性能指标是 Context window(上下文窗口)1,000,000 tokens、Decode 315.5 tok/s、Prefill 52,005 tok/s,下排三张数字卡片是 Cost 2.96 美元、API requests 1,080、Tokens 500,053,374。
帖文与截图给出的口径一致:她写道「通过 API 使用 DeepSeek V4.1 Flash,5 亿多 token 的成本不到 3 美元」,「更夸张的是,我测到约 315 tok/s 的解码峰值和约 52k 的 prefill」;截图给出的对应数值是 315.5 tok/s 与 52,005 tok/s,成本一栏是 2.96 美元。截图没有标注模型名,也没有缓存命中率一类的指标;「DeepSeek V4.1 Flash」出自帖文正文。
折合每百万 token 约 0.0059 美元:接近峰时缓存命中价
把 2.96 美元平摊到 500,053,374 token,平均每 100 万 token 约 0.0059 美元;摊到 1,080 次请求,平均每次约 0.27 美分。对照 DeepSeek 官方价目表(V4.1 Flash,单位:每 100 万 token):输入缓存命中,峰时 0.006 美元、非峰时 0.003 美元;输入未命中,峰时 0.3 美元、非峰时 0.15 美元;输出,峰时 1.2 美元、非峰时 0.6 美元。峰时指工作日 UTC 01:00~04:00 与 06:00~10:00,其余时段按半价计;这套价格自 9 月 10 日 04:00 UTC 起生效。
5 亿多 token 若全部按峰时缓存命中价计费,代价约 3.00 美元,与截图里的 2.96 美元只差约 4 美分;若全部按峰时未命中输入价计费,同样的量要花超过 150 美元。这份账单能落在 3 美元以内,对应的是绝大多数 token 以缓存命中价计费的情形。同一份价目表里,缓存命中与未命中的输入单价相差 50 倍。
引用帖里,Josué Hernández 也按截图折算:500,053,374 token 除以 1,080 次请求,平均每次约 46.3 万 token;他认为这个量级反映的主要是输入(prefill),并算出按 52k tok/s 的 prefill 速度,填满 100 万 token 上下文需要在首个 token 之前等约 19 秒。
官方公告里的 V4.1 Flash:552B MoE、1M 上下文与压缩的 KV cache
按 9 月 10 日的官方公告,Mia 测的这款模型是 DeepSeek 新架构家族里最小的一个。它采用 552B 参数的混合专家(MoE)架构和新的因果编码器—解码器结构,输入侧激活 8B 参数、输出侧激活 16B;通过 API 提供原生多模态支持,调用模型名为 deepseek-flash,此前的 deepseek-v4-flash 等名称暂时路由到新模型。定价页列出的规格为 1M 上下文、最大 384K 输出。
公告称,V4.1 Flash 的 KV cache(键值缓存)只需要上一代 1/4 的 HBM(高带宽内存)和 1/8 的 SSD(固态硬盘)存储;压缩缓存的原因很直接:官方称缓存命中费用在 agent(智能体)成本中往往占很大一块。公告还称,来自多方的测试显示,V4.1 Flash 在性能、成本、速度和总运行时间上领先 V4-Pro;自 9 月 14 日 04:00 UTC 起,deepseek-v4-pro 的请求由 V4.1 Flash 承接、按 V4.1 Flash 的价格计费,直到 V4.1 Pro 推出。定价页另有一条注记:应部分用户要求,V4 Pro 的 API 服务在 9 月 14 日之后继续提供,计费方式不变。
回复区:官方 API 的确认、对照数字与怀疑
在回复区,有用户追问「是官方 API 吗?除非缓存命中率达到 99%,否则这种用量不可能」,Mia 回复「是的」。、
另一位用户 easthambuilds 报出相近的体验:他称自己测得 271 tok/s,并说自己的编排器现在要求通过 API 调用 DeepSeek V4.1 Flash 子代理,同时准备把夜间的审计、找 bug 与对抗性检查放到本地推理硬件上。
也有人报出更高的账单。vyomant 写道「我用了 3 亿 token,花掉 12 美元以上,为什么?」;vysecurity 则问「怎么这么便宜」,并称自己每两三天要烧掉约 20 美元。、
中文回复里,shenshengdahan 给出一条经验数字:「一亿 token 四元人民币左右,缓存命中有时候能达到 99.7%」。用户 shax1347 则提醒,token 单价是标价、账单是另一回事:他的 agent 每 30 秒轮询一次,空闲时段每小时产生约 120 次完整前缀重读且全部计费,加上约 30% 的重试,9 美元的 API 用量变成约 13 美元,换来 85 个被接受的任务,平均每个约 0.15 美元;他认为,只有当 harness 不再反复重读前缀时,便宜的 token 才真正划算。、
Mia 在自己的帖子下补了一句:「是的,我仍然更愿意在本地运行它。」
复现这份账单还缺什么:缓存命中率与负载构成
决定这份账单能否复现的,是这批请求的缓存命中率、峰谷时段分布与负载构成;截图只给出成本、token 数、请求数和速度,没有列出这些变量。回复区里有人直接追问测试环境:「用的什么 harness?」
面板的时间筛选是「Today」,记录范围只有一天。在这些变量得到说明之前,2.96 美元是 Mia 单日负载下的一份读数。