AREX Feed Article
DeepSeek V4 Flash 0731 公测:同架构 Agent 能力暴涨,智能指数 50 仅差 GPT-5.6 Luna 一分
7 月 31 日,DeepSeek 将 V4-Flash-0731 推入公开测试正式版。这是一次纯训练优化升级——模型架构与参数量(284B 总参 / 13B 激活 MoE)保持不变,100 万 token 上下文窗口和定价也未调整,但 Agent 能力出现大幅跃升。该升级仅作用于 Flash API,Pro API 及 App/Web 端模型暂时不变;官方同时预告 V4-Pro 正式版即将发布。
架构不变,能力跳升
DeepSeek 官方更新日志明确表示,V4-Flash-0731 仅对预览版(4 月 24 日发布)进行了重新后训练(re-post-training),未改动模型结构。新增能力包括原生支持 Responses API 格式,并专门适配了 Codex 编码代理。
官方公布的基准成绩显示 Agent 能力显著增强(均使用 DeepSeek Harness minimal 模式、max effort 设置):
- Terminal-Bench 2.1:从 56.9 升至 82.7(+25.8)
- Toolathlon(verified):从 51.8 升至 70.3(+18.5)
- Cybergym:76.7
- DeepSWE:54.4
- NL2Repo:54.2
- DSBench-FullStack(内部全栈开发测试集):68.7
- DSBench-Hard(内部编码 Agent 高难度测试集):59.6
- Agent Last Exam:25.2
值得注意的是,以上均为 DeepSeek 自有测试框架下的厂商成绩,独立评测数据可能偏低。
独立评测:智能指数从 40 跃至 50,紧追 GPT-5.6 Luna
独立分析机构 Artificial Analysis 在同日发布了针对 V4 Flash 0731 的评测。其 Intelligence Index(v4.1,涵盖 9 项评测维度)给出 50 分,较上一代 V4 Flash(40 分)提升 10 分,反超 V4 Pro 达 6 分。
在成本-智能 Pareto 前沿上,该模型仅比 GPT-5.6 Luna(max,51 分)低 1 分,与 Gemini 3.6 Flash(50 分)持平,与 GLM-5.2(max,51 分)和 Muse Spark 1.1(xhigh,51 分)差距也在 1 分以内。距当前开源权重前沿 Kimi K3(max,57 分)仍有 7 分差距。
Agent 专项表现同样突出:
- GDPval-AA v2(真实世界 Agent 工作任务的 Elo 评分):1559,较前代 1189 大幅提升;权重开放后将成为第二高开源成绩,仅次于 Kimi K3(1687)
- Terminal-Bench 2.1(AA 独立评测):79%,提升 17 个百分点
- τ³-Bench Banking:31%,提升 8 个百分点
幻觉率降 12 个百分点,准确性持平
AA-Omniscience 评测揭示了一个有趣的模式:V4 Flash 0731 的 Omniscience 指数从 -23 改善至 -16(+7),但这一提升完全来自幻觉率下降——幻觉率从 96% 降至 84%(降 12 个百分点),而整体准确率与上一代持平。该幻觉率已与 GPT-5.6 Terra(max,85%)和 Mistral Medium 3.5(82%)相当。
此外,模型运行 Intelligence Index 的输出 token 量从前代的约 2.34 亿降至约 2.06 亿(降 12%),表明 token 效率有所提高。
极致低价 + 开源预期,持续施压商业 API
定价完全不变:输入 $0.14/百万 token,输出 $0.28/百万 token,缓存命中仅 $0.0028(98% 折扣)。Artificial Analysis 指出,即便 OpenAI 同日对 GPT-5.6 Luna 降价 80%,V4 Flash 0731 在 DeepSeek 官方 API 上的每任务成本仍比 GPT-5.6 Luna(max)低约 60%。
DeepSeek 预计将在未来数周内开放完整权重。一旦开放,V4 Flash 0731 将成为仅次于 Kimi K3 的第二高开源 Agent 模型。
开发者反响
Hacker News 讨论热度颇高(369 分,179 条评论)。多位开发者表示 Flash 已承担其 90% 日常任务,速度快且成本极低,与前沿模型差距难以察觉。社区普遍认为,在 Kimi K3 占据头条的背景下,DeepSeek 以"同一架构纯训练优化"提升 10 个指数点的做法,叠加极致低价与开源承诺,将对商业 API 市场持续构成压力。
待观察
- 以上 Agent 基准中,部分来自 DeepSeek 自有测试框架,独立开发者实测仍在积累,实际表现可能有差异。
- V4-Pro 正式版发布时间尚未明确,官方仅称"coming ASAP"。
- 权重开放的具体时间和许可条款有待公布。