AREX Feed Article
DeepSeek V4 Flash 距 Luna 仅 1 分,价差 60%,同一天 OpenAI 砍价 80%
7 月 31 日下午,DeepSeek 将 V4-Flash-0731 推入公开 Beta。284B 总参数、13B 活跃参数、256 个路由专家每 token 激活 6 个、1M 上下文——与四月预览版逐比特一致。但 benchmark 全盘改写。
Artificial Analysis 智力指数从前代的 40 跳到 50,距 GPT-5.6 Luna 的 51 分只差 1 分,高出自家 V4-Pro-Preview 整整 6 分。Agent 类测试涨幅最剧烈:GDPval-AA v2 从 1189 Elo 飙到 1559,Terminal-Bench 2.1 从 61.8 拉到 82.7,DeepSWE 从 7.3 跳到 54.4。
价格纹丝不动:输入 $0.14/百万 token,输出 $0.28/百万 token。权重以 MIT 协议开源在 Hugging Face。官方公告推文在 12 小时内获得 516 万次浏览、2.2 万点赞、2,748 次转发。
Unsloth 六小时掏出 GGUF,antirez 连夜上传量化,NVIDIA 亲自下场站台
社区的反应速度比以往任何一次模型发布都快。而且这次是从 GGUF、vLLM、OpenCode 到免费端点同时铺开。
Unsloth 团队在 DeepSeek 官方推文下秒回:"如果 Flash 已经这么强、这么小,Pro 得什么样?我们等不及做量化了。"十小时后,Unsloth 创始人兼 CEO Daniel Han 发布完整 GGUF 量化包:4-bit 无损版 162GB,3-bit 版 103GB 可在 110GB RAM 设备上运行。当天晚间,1-bit 至 3-bit 的轻量量化也全部上线。
vLLM 项目同步宣布 day-zero 支持,在推文中写道:"与 DSpark 预览 checkpoint 相同架构,你的推理配置可以直接沿用。DSpark 投机解码模块内置在权重中,一行 flag 即可开启。"Hugging Face 产品负责人 Victor Mustar 搭了一个免费公共端点,OpenAI 兼容 API,无需 token。
OpenCode——拥有 12.9 万关注者的开源 coding agent 平台——数小时内将 V4 Flash 0731 接入 Go 和 Free 层级,推文称"初步反应是比 Preview 版有巨大提升"。NVIDIA RTX Spark 官方账号当晚发推祝贺,附上 Unsloth GGUF 的本地运行引导。Redis 作者 antirez 在深夜推文:"GGUF 文件正在上传,明天测试。"
Android 开发者 Elshayib 报告实际使用数据:"用 Hermes Agent 跑一个完整任务,32 分钟,花了 $0.07。这个模型便宜到 $2 够用一整天。"
OpenAI 同一天把 Luna 降价 80%——但 V4 Flash 还是便宜 60%
7 月 30 日,OpenAI 宣布 GPT-5.6 Luna 降价 80%:输入从 $1 砍到 $0.20/百万 token,输出从 $6 砍到 $1.20。GPT-5.6 Terra 同步降价 20%。OpenAI 的理由是"GPT-5.6 帮助自身提升了服务效率"。
24 小时后,DeepSeek 推出 V4 Flash 0731,定价 $0.14/$0.28——Luna 在砍价 80% 之后,每任务成本仍比 DeepSeek 贵约 60%。差距的关键是 DeepSeek 的 98% 缓存命中折扣:缓存命中价仅 $0.0028/百万 token,行业标准是 90%。
这不是 DeepSeek 第一次用价格倒逼对手。V3 时代以 $5.6M 训练成本击穿行业叙事,如今 Flash 0731 把性能拉到 Luna 鼻尖,价格却是对手的五分之二。CNBC 在 7 月 30 日报道中指出,OpenAI 的降价发生在"企业对 AI 成本日益敏感"的背景下。
架构没变、参数没变,GDPval 涨了 370 Elo——后训练才是这次的主角
DeepSeek 没有扩大模型。284B 参数、256 个路由专家、每 token 激活 6 个——架构与预览版完全一致。全部增益来自一轮后训练。
Artificial Analysis 的 Intelligence Index 覆盖 9 项评估,V4 Flash 0731 在每一项上都超过前代。GDPval-AA v2 模拟复杂真实办公场景的 agent 评估,涨幅 370 Elo,在开源权重模型中仅次于 Kimi K3(1687 Elo)。CritPt 上升 9 个百分点至 17%,SciCode 上升 5 个百分点至 50%,Humanity's Last Exam 上升 5 个百分点至 37%。
幻觉率同步收敛。AA-Omniscience 幻觉率从 96% 降到 84%,降了 12 个百分点,与 GPT-5.6 Terra(85%)和 Mistral Medium 3.5(82%)进入同一区间。但准确率未变——模型不乱编了,不是更聪明了。
Token 效率也在提升。跑完 Intelligence Index 全套评估,0731 用了约 2.06 亿输出 token,比前代少 12%。用更少的 token 拿更高的分——这是后训练带来的推理效率红利。
当 Flash 的 agent 能力超过 Pro,"便宜=弱"的定价逻辑在坍塌
V4 Flash 0731 的 Intelligence Index 是 50 分,V4-Pro-Preview 是 44 分。Flash 不是"够用就行"的穷人版——它在 agent 任务上全面碾压比它大 3.7 倍的 Pro。13B 激活参数拿到了 49B 激活参数拿不到的成绩。
这直接撼动了闭源模型的定价根基。此前性能与价格大致成正比:强则贵,便宜则弱。现在 DeepSeek 把最强 agent 模型放在 Flash 线,定价是 GPT-5.6 Luna 的五分之二、Opus 4.8 的八十九分之一。Codex Router 开发者 Ziwen Xu 在教程视频中列出模型选择器里的价格对比:DeepSeek V4 Flash 输出 $0.28/百万 token,Opus 4.8 输出 $25/百万 token——"同一个 picker,89 倍差价。"
io.net 联合创始人 Tory Green 在推文中写道:"这对前沿实验室来说是一种全新的压力。一次便宜的开放模型追上来,没问题。但这次,同样的权重、同一条架构,仅靠一轮更好的训练就跳过了大半程。开放权重仅靠训练就在缩小差距,每一轮周期后溢价空间都在变小。"
Arena.ai 给出独立验证:V4 Flash 0731 在 Frontend Code Arena 得分 1586,排名第 7 总榜、第 3 开源榜,比预览版跃升 154 分,比 V4-Pro-Preview 高出 121 分。性价比在所有同类模型中排第一。
价格表的倒挂,才是今天最重要的信号
Flash 比 Pro 强。Flash 的价格只有 Luna 的五分之二。Flash 可以跑在一台 DGX Spark 上。Flash 的权重已经开源,六小时内社区铺完了从 GGUF 到 vLLM 到 OpenCode 的整条链路。
DeepSeek 用一次纯后训练升级,把"前沿 AI"从云端月费拉到了硬件的一次性投入。V4-Pro 正式版还没来,Flash 已经把定价基准线划在了这里。
Sources:
- — 516 万浏览,2.2 万点赞,2,748 转发
- — 完整 benchmark 数据与 Intelligence Index 分析
- — 284 Elo 跃升、60% 价格优势确认
- — 4-bit/3-bit 量化包与本地运行指南
- — 投机解码一行 flag 配置
- — Go/Free 层级接入
- — 本地 GGUF 运行引导
- — 深夜量化上传
- — Frontend Code Arena 1586 分
- — Luna 降价 80%、Terra 降价 20%
- — Luna 新价格 $0.20/$1.20
- — GGUF 量化规格与硬件要求
- — DGX Spark 单机实测