AREX Feed Article
V4 Flash 涨价生效日,Composio 实测通过率仅 53.8%
8 月 16 日, 刊出对 DeepSeek V4 Flash 的一份独立实测:Composio 把模型放进 8 个 agent harness(包括 Claude Code、Codex、OpenCode),去跑 30 个刻意提高难度的多步任务,任务要操作 Gmail、GitHub、Slack、Google Sheets 等真实工具。240 次运行通过 129 次,完成率 53.8%;30 个工作流只有 6 个被所有 harness 全部跑通。
同一个模型,换一个 harness、工具配置、缓存行为、重试次数或 provider 栈,结果就大不一样。VentureBeat 认为,模型能否在企业场景落地,更取决于编排层而非裸模型能力。
同一天,DeepSeek 的新费率开始生效。它 8 月 13 日发布 V4 Pro 正式版时一并宣布涨价: 算出 V4 Pro 高峰输出价从每百万 tokens 0.87 美元涨到 3.96 美元,V4 Flash 从 0.28 美元涨到 1.32 美元,低谷时段半价,整体约四倍。按 ,生效时间为 8 月 16 日 16:00 UTC,写作北京时间 8 月 17 日 0 时; 引述的涨幅区间是 50% 到 1,100%。
榜单第一,240 次运行只通过 129 次
V4 Flash 7 月 31 日开放公测,2840 亿参数,为走量和速度设计;V4 Pro 8 月 13 日 GA,1.6 万亿参数,面向更复杂的工作流。两款模型都提供 low / high / max 三档思考强度。
公测以来,Flash 一直占据 OpenRouter 用量榜第一,按周 token 量计算是平台上用量最大的模型。机器学习研究员 Nathan Lambert 在 X 上写道,V4 Flash 初版的采用数字 "insane",新版 "scored the same as GLM 5.2",是会被大规模使用的 "total monster"。
Composio 的实测对象正是这个"榜单第一"。30 个任务刻意设计成多步、要操作真实工具,同一工作流换个 harness 就可能失败。VentureBeat 把差距归到编排层:缓存、重试、工具配置这些环节,比模型分数更能决定一次运行成不成。
每 24 小时有 17 小时半价
新费率下,V4 Flash 低谷价输入 0.22 美元、输出 0.66 美元,高峰输入 0.44 美元、输出 1.32 美元,涨幅 57% 到 371%;V4 Pro 低谷输入 0.66 美元、输出 1.98 美元,高峰输入 1.32 美元、输出 3.96 美元,涨幅 51% 到 355%。缓存命中价涨得最狠,52% 到 1,100%。
人民币口径更直观。据 ,V4 Pro 高峰时段输入(缓存命中)0.3 元、输入(缓存未命中)9 元、输出 27 元,此前是 0.025 元、3 元、6 元,缓存命中输入一项就涨 1,100%。
DeepSeek 的解释是,采用峰谷定价是为了"更加合理地调配资源",闲时半价"鼓励用户根据实际使用情况调整任务时间"。VentureBeat 算过,每 24 小时里有 17 小时是半价,这套结构反而让中国市场定价最高。Engadget 补了一笔背景:现行促销价原本 5 月 31 日就该结束,DeepSeek 当月曾说要把折扣价永久化,最终仍决定涨价。
Greyhound Research 的 Sanchit Vir Gogia 认为这不是一次简单涨价:"This is not a simple price rise. It is a pricing architecture that makes the timing of inference an economic variable."(这不是一次简单的涨价,而是一套把推理时点变成经济变量的定价架构。)批量评估、合成数据、夜间开发跑批可以挪进便宜时段,交互式 agent 和线上运营挪不动。
分析师:看着像自杀式提价,算完账还是便宜
科技分析师 Carmi Levy 说,第一眼看过去,这像一家"还在向更老牌的模型厂商争取可信度"的平台做出的 "suicidal move"(自杀式动作)。涨幅会吃掉 DeepSeek 的价格优势,让客户更认真地掂量其中资背景带来的顾虑。
但按所有口径,它的价格仍远低于 OpenAI、Anthropic、Google、Cohere、xAI 的同类模型。Levy 判断,优势会随时间收窄,因为 DeepSeek 会继续把价格向市场现实对齐,但眼下商业账仍算得过来。Gogia 则说,开发者和企业的不满真实而响亮,可过去的低价不等于永远便宜的义务。
Engadget 的横比给出参考系:Moonshot 的 Kimi K3 输出价 15 美元,OpenAI 最高端的 GPT-5.6 Sol 要 30 美元;但 OpenAI 的低价款 GPT-5.6 Luna 只要 1.20 美元,比高峰时段的 V4 Flash 还便宜。
X 上, 指出一个反方向趋势:开源模型在涨价,ChatGPT、Grok、Muse Spark 这些闭源前沿模型却在连续降价。 发帖:"THE ERA OF SUBSIDIZED AI COMPUTE IS ENDING!"(补贴算力的时代结束了),并标注 355% 的涨幅。
厂商自己承认:基准分不是生产就绪
Gogia 提醒,Flash 的 API 仍处公测,没有可查证的企业采用记录、真实部署和署名客户。"The model is mainstream by traffic and still unproven by contract."(论流量它已是主流,论合同它仍未获证明。)
DeepSeek 自己的公告也在给这个判断提供证据:中文公告脚注写明,公开基准测试集里的 Code Agent 任务是 V4-Pro-0813 用自家 DeepSeek Harness 极简模式跑的,其他框架下结果可能略有不同。财新报道称,DeepSeek 同日发布 Harness 开发者预览版,设计思路是"一切皆插件"。Gogia 还指出,DeepSeek 至少一个流行 agent 环境的集成文档写明,内置 V4 条目不做兼容覆盖就不足以可靠运行。他的解读是,这是厂商在准确告诉市场,基准表现不等于生产就绪:"A model can score beautifully and still misbehave once tools, credentials, and state enter the room."(模型可以考出漂亮分数,一旦工具、凭据和状态进场,照样出乱子。)
服务层也一样:同一套开源权重由不同托管方跑,吞吐和可用时间有肉眼可见的差异。Gogia 说,选 Flash 只回答了一个采购问题,又开了三个:谁来服务、跑在哪里、周围有什么控制。
也有企业下了单。EmpirioLabs AI 的 CEO Adam Dalloul 说,有个企业客户点名只要 V4 Flash,速度和成本之外加一个"够用的智能阈值",测了一圈只有它满足。他团队在一个 API 上托管 100 多个模型,按任务分流:日常用 Flash,复杂任务换 Pro。
Meta 软件工程师 Naman Ahuja 用 V4 Flash 给自己做了个家居自动化 agent(个人项目,与 Meta 无关)。他的体会是,模型一旦能执行动作,可靠性就和智能同样重要:"A failed text response is inconvenient; a failed action in an operational workflow can have real consequences."(答错一句文本只是不便,工作流里做错一个动作会有真实后果。)他给的指标是:从每 token 成本,转向每次成功完成工作流的成本。
53.8% 的通过率公布当天,约四倍的涨价开始生效。Gogia 的现状判断是,模型靠流量成了主流,靠合同仍未获证明;定价架构已经换了,补上这句话的生产证据还没出现。
参考链接