AREX Feed Article
DeepSeek V4-Flash 正式发布:Agent 基准全线反超旗舰,单任务成本$0.03引爆"死亡区"定价讨论
2026年7月31日,DeepSeek 将 V4-Flash 从预览版升级为正式公测版本(DeepSeek-V4-Flash-0731)。这款 284B 总参/13B 激活的 MoE 模型以 MIT 协议开源,通过纯后训练(无架构改动)在全部9项官方 Agent 与编程基准上反超了自家旗舰 V4-Pro-Preview。官方推文浏览量超过880万,社区已在消费级硬件上成功运行,Fortune 与 Financial Post 则据此提出"DeepSeek 死亡区"概念——定价更高或同价更弱的模型将面临生存危机。
事件:一次纯后训练的 Agent 能力跃升
7月31日 UTC 06:56,DeepSeek 官方 X 账号发布 V4-Flash 正式版公测消息,称其 Agent 能力"远超 V4-Pro-Preview"。同日,MIT 许可的模型权重在 Hugging Face 上线,Codex 原生适配到位,Responses API 格式获得原生支持。API 调用方式保持不变——仍使用 deepseek-v4-flash 标识符,用户无需改动代码即可获得新版本。
DeepSeek 明确表示,此次更新仅重跑了后训练阶段,模型架构和参数量与预览版完全一致。V4-Pro 预览版和 App/Web 端模型此次均未更新,官方 Pro 正式版"将尽快发布"。
自测基准:Flash 全面压制 Pro 预览版
DeepSeek 在模型卡片中公布了9项 Agent 基准分数,Flash-0731 在所有项目上均超过 V4-Pro-Preview。以下为核心对比(均为 DeepSeek 自报数据):
| 基准 | Flash-0731 | Flash 预览 | Pro 预览 | Opus 4.8 |
|---|---|---|---|---|
| Terminal-Bench 2.1 | 82.7 | 61.8 | 72.1 | 85.0 |
| DeepSWE | 54.4 | 7.3 | 12.8 | 58.0 |
| Cybergym | 76.7 | 38.7 | 52.7 | 83.1 |
| Toolathlon-Verified | 70.3 | 49.7 | 55.9 | 76.2 |
| NL2Repo | 54.2 | 39.4 | 38.5 | 69.7 |
关键限制: Agent 基准均使用 DeepSeek 自研 Harness 框架(尚未公开发布)在 minimal 模式下运行,温度 1.0、top_p 0.95。Agent 分数对评测框架高度敏感,独立复现结果可能偏离官方数据。DSBench-FullStack 和 DSBench-Hard 为内部测试集,不可与第三方直接比较。
独立评测:Artificial Analysis 确认智力跃升
第三方评测机构 Artificial Analysis 对0731版本进行了独立测试,关键结论:
- Intelligence Index 50,较4月预览版提升10点,反超 V4-Pro(44)6个点
- 追平 Gemini 3.6 Flash(Intelligence Index 50),距 GPT-5.6 Luna(max)仅差1点
- GDPval-AA v2(真实工作 Agent 任务)Elo 从 1189 跃升至 1559
- Terminal-Bench 2.1 达 79%(+17个百分点),与 DeepSeek 自报的 82.7 趋势一致
- 幻觉率下降 12 个百分点,但整体仍偏高(Forbes 引用数据显示约 84% 幻觉率)
定价与"死亡区"
V4-Flash 定价维持预览版水平:
| 计费项 | V4-Flash | V4-Pro 预览 |
|---|---|---|
| 输入(缓存未命中) | $0.14/百万 token | $0.435/百万 token |
| 输入(缓存命中) | $0.0028/百万 token | $0.003625/百万 token |
| 输出 | $0.28/百万 token | $0.87/百万 token |
缓存命中价格仅 $0.0028,为输入价的 98% 折扣——Artificial Analysis 称这是行业内最激进的缓存策略。对于反复发送系统提示和工具定义的 Agent 工作流,实际成本远低于标价。
Artificial Analysis 实测单次 Intelligence Index 任务成本约 $0.03,对比 Claude Fable 5 的 $3.15(约 105 倍差距)和 Opus 5 的 $1.86。
Financial Post 8月4日报道据此提出"DeepSeek 死亡区"(DeepSeek death zone)概念:在 Artificial Analysis 广泛流传的性价比图表上,V4-Flash 划定了一条残酷边界——定价高于它且能力不显著更强的模型,将极难在开发者市场立足。报道引用上海咨询公司 ZenGen Labs 创始人 Dermot McGrath 的话称:"V4-Flash 真正改变的是 Agent 工作负载的经济学。"
Forbes 8月3日以"105倍便宜于 Fable 5"为题报道,同时警告 V4-Flash 在知识准确性任务上的局限——高幻觉率使其不适合关键企业场景。
社区部署:从 DGX Spark 到 RTX 3060
开放权重和 MIT 许可已引发社区广泛自部署:
- DGX Spark:社区已在单台 DGX Spark 上成功运行完整 V4-Flash(NVIDIA 开发者论坛讨论)
- 双 RTX 3060 + 96GB RAM:Reddit 用户报告 IQ2_M 量化版本约 3.5 tok/s,约 90 分钟推理
- Unsloth 提供动态 GGUF 量化:无损 8-bit 版本 162 GB,3-bit 版本 103 GB,需约 110 GB 总内存
- DeepSeek 推荐:vLLM 在单节点 4×GB300 上以全精度服务
- 纯 CPU 推理方案也在社区中传播
实际意义与限制
"廉价层即强力层"正在改写 Agent 经济学底线。 开发者无需在高性能和高性价比之间二选一——Flash 在 Agent 任务上同时提供了更强性能和更低成本。这一格局使依赖高价差获利的闭源模型面临前所未有的定价压力。
然而,多项限制不容忽视:
- Agent 基准的跨框架可移植性未经验证,独立评测结果可能低于官方数据
- 复杂规划能力仍被认为弱于 Claude Opus 4.8 等前沿旗舰,更适合执行层而非架构层
- 幻觉率虽有改善但仍偏高,知识密集型场景建议配合 RAG 或继续使用 V4-Pro 预览版
- 峰值时段 2× 定价政策已预告但尚未生效(北京时间 09:00–12:00、14:00–18:00)