AREX Feed Article
NVIDIA 公开站台 DeepSeek,后者用 13B 激活参数干翻自家 Pro 预览版
OpenAI 刚在 7 月 31 日发布 GPT-5.6 Luna,号称把性价比前沿往前推了一大步。不到 12 小时,DeepSeek 就甩出了一记更狠的:同样的模型架构,只靠重新跑一轮后训练,就让 V4 Flash 在几乎所有 agent 基准上碾压了自己更大、更贵的 V4-Pro 预览版。更耐人寻味的是,NVIDIA 官方账号随后发推公开祝贺。一家芯片巨头恭喜一家中国 AI 公司,措辞里还附上了用自家 DGX Spark 跑本地版的教程。竞品给竞品站台,这种事不常见。
只改后训练,不改架构,benchmark 全面跃升
DeepSeek-V4-Flash-0731 保持与预览版完全相同的模型架构和参数规模:284B 总参数,13B 激活参数(MoE 稀疏架构),1M token 上下文窗口。唯一的变量是后训练(post-training)被重新跑了一遍。
结果是 benchmark 数据全面飙升。HuggingFace 模型卡和 Artificial Analysis 的独立评测给出了同一幅画面——没有一项公开基准出现倒退:
| 基准测试 | V4-Flash-0731 | V4-Flash (Preview) | V4-Pro (Preview) | 对比 Opus-4.8 |
|---|---|---|---|---|
| Terminal Bench 2.1 | 82.7 | 61.8 | 72.1 | 85.0 |
| NL2Repo | 54.2 | 39.4 | 38.5 | 69.7 |
| Cybergym | 76.7 | 38.7 | 52.7 | 83.1 |
| DeepSWE | 54.4 | 7.3 | 12.8 | 58.0 |
| Toolathlon-Verified | 70.3 | 49.7 | 55.9 | 76.2 |
| Agents' Last Exam | 25.2 | 15.8 | 16.5 | 25.7 |
| AutomationBench Public | 25.1 | 10.8 | 12.8 | 27.2 |
| DSBench-FullStack † | 68.7 | 37.0 | 41.8 | 71.6 |
| DSBench-Hard † | 59.6 | 25.8 | 31.1 | 71.7 |
† 为 DeepSeek 内部评测集。DSBench-FullStack 是全栈开发任务,DSBench-Hard 是困难 coding-agent 问题集。
三组数字特别值得拆开看。第一,DeepSWE 从 7.3 跳到 54.4——超过 7 倍的提升。同一架构,后训练策略的改变能在真实软件工程任务上产生这种量级的差异,说明 preview 版本的后训练远未触及天花板。第二,Cybergym 从 38.7 翻到 76.7,接近翻倍。第三,Terminal Bench 2.1 的 82.7 距离 Opus-4.8 的 85.0 只差 2.3 分,而 V4 Flash 的 API 定价仅为 Opus-4.8 的零头。
Artificial Analysis 将 V4 Flash 0731(推理模式,max effort)排在旗下 Intelligence Index 的第 3 名,仅次于两家未具名的前沿闭源模型。在 Coding Index 上排第 4 名(超过 85% 的模型),Agentic Index 排第 2 名(超过 92% 的模型)。综合来看,这是目前最强的开源权重模型。
技术细节上,V4 Flash 0731 保留了 DSpark 投机解码模块。用 vLLM 或 SGLang 部署时,开启 --speculative-config '{"method":"dspark"}' 即可获得加速。DeepSeek 还预告将发布 DeepSeek Harness——一个专门为 code agent 场景设计的 agent 框架,本次 benchmark 中所有 coding agent 任务都是用它跑的。
NVIDIA 站台,Unsloth 第一时间出量化版
事件在 X 上的传播路径很说明问题。DeepSeek 官方账号 @deepseek_ai(107 万粉丝)的官宣推文截至 8 月 1 日获得 3277 次转发、2.7 万点赞、751 万次查看。但真正让这条新闻在开发者圈层破圈的,是 NVIDIA 旗下账号 @NVIDIARTXSpark(5.3 万粉丝,蓝 V 认证)在北京时间 8 月 1 日 7:10 发的一条推文:
"Congratulations @deepseek_ai on the launch of DeepSeek V4 Flash 0731! Get started today by running the model locally via the @UnslothAI GGUF."
措辞干脆,没有"我们的 GPU 也能跑"那一套。这条推文获得了 475 次点赞和 28 次转发,但更关键的是它来自谁。@NVIDIARTXSpark 是 NVIDIA 面向开发者的 RTX/Spark 生态账号,公开祝贺一家同时是 GPU 大客户和潜在竞争对手的中国 AI 公司。在当前的 AI 地缘政治氛围下,这不是无心之举。
Unsloth AI 联合创始人 Daniel Han(前 NVIDIA ML 工程师,YC S24)在同一天发布了完整的 GGUF 量化矩阵:UD-Q8_K_XL(162GB)完全无损,UD-Q4_K_XL(155GB)保留 96% top-1 准确率,UD-Q3_K_XL(129GB)保留 87%,一直到 UD-IQ1_S(83GB)保留 73%。Unsloth 官方账号随后确认:"DeepSeek-V4-Flash-0731 runs amazingly well on a NVIDIA DGX Spark and DGX Station!"
Hacker News 上,讨论帖一天内获得 567 个 upvote 和超过 300 条评论。一位用户贴出了将 V4 Flash 0731 的数据点加入 OpenAI 昨天发布的性价比前沿图的结果——V4 Flash 稳稳落在前沿线上。Reddit 的 r/LocalLLaMA 和 r/unsloth 社区也在热议:一个 284B 的 MoE 模型,4-bit 量化后能在 168GB 内存上跑,3-bit 降到 110GB,这在本地部署场景中是实用门槛的突破。
同一架构,两次后训练,两种结果
DeepSeek 做了一件教科书级别的事:保持架构和参数量不变,只改后训练,然后用 benchmark 证明改对了。
这意味着什么?编辑观察:后训练(post-training)——包括 SFT、RLHF、以及更激进的 RL for reasoning/agent——正在成为模型竞争力的主战场,其重要性可能超过预训练阶段的 scaling。如果 284B 参数经过两轮不同的后训练能产生从 "被 Pro 碾压" 到 "碾压 Pro" 的逆转,那么"模型多大"这个问题正在让位于"模型怎么训的"。
DeepSeek 的 API 定价维持不变:$0.14/百万输入 token,$0.28/百万输出 token,缓存命中时输入价格仅为 $0.003。加上 DeepInfra、Fireworks、Novita、Cloudflare 等多家提供商的竞价,加权平均实际输入价格已降至 $0.030/百万 token。以这个价格获得 #3 全球排名的模型——Kaitchup 的作者 Benjamin Marie 的判断很准确:"这不是一个更专的模型,这是一个全面的提升。"
OpenAI 发 Luna,DeepSeek 发 Flash,性价比战争进入小时级
把时间线拉平看:7 月 31 日,OpenAI 发布 GPT-5.6 Luna,定位是将前沿能力压到更低价格点。同一天,DeepSeek 发布 V4 Flash 0731,在 OpenAI 的图上插了一面旗。社区戏称"GPT-5.6 Luna 的性价比之王称号享年半天"。
这已经不是巧合。过去 18 个月,DeepSeek 的发布节奏越来越接近 OpenAI:V3 → R1 → V3.1 → V4,每一步都踩在竞争对手的发布窗口附近。这一次,V4 Flash 0731 的时间点精准到小时级。
更大的图景是:开源权重模型与闭源旗舰之间的能力差距正在从"追赶"变为"交织"。V4 Flash 0731 在多个 agent 基准上已经进入与 Opus-4.8、GPT-5.6 同一梯队。MIT 许可证意味着任何公司都可以拿这个模型去做商业部署、微调、蒸馏。
DeepSeek 在官宣中特别注明:"V4-Pro 的正式版即将发布(coming ASAP)。" 如果 V4 Flash 在只用后训练优化的情况下已经追平甚至超越 V4-Pro 预览版,那么 V4-Pro 正式版的预期被拉到了一个很高的位置。结合 DeepSeek 一贯的节奏——发布当天同步开源权重——V4-Pro 正式版可能在几周内就会到来。
NVIDIA 下场恭喜,竞品给竞品站台
NVIDIA 公开祝贺 DeepSeek,这件事本身比 benchmark 数据更值得关注。一家靠卖 GPU 赚钱的公司,恭喜一家把模型推理成本打到地板价的中国公司,还顺带教你怎么在自己的硬件上跑——这要么是极度自信("你们跑得越多,GPU 卖得越多"),要么是对行业格局的判断发生了微妙偏移。
对开发者来说,今天出现了一个实际可用的选项:花不到一毛钱处理一百万 token 的输入,获得全球前三的模型能力,或者花 168GB 内存在自己机器上跑 4-bit 量化版。两者都可用,两者都不贵。DeepSeek 把"便宜"和"强"这对矛盾体塞进了同一个模型里。
参考链接: