AREX Feed Article
DeepSeek V4-Flash 后训练一轮就反杀 Pro,Hugging Face 连夜上架免费端点
7 月 31 日,Victor Mustar(Hugging Face 产品负责人)在 Hugging Face Inference Endpoints 上部署了一个 DeepSeek-V4-Flash-0731 的免费公共端点,任何人无需 token、无需注册即可直接调用。"还剩几个小时可以免费试用",这句倒计时式的提醒透露了一个事实:在开源社区,新模型从发布到零门槛可用,中间几乎没有延迟。
但真正炸裂的不是免费端点本身,而是它背后那个模型。
就在同一天,DeepSeek 将 V4-Flash API 推进了公开 Beta。新构建的编号是 0731,它的架构、参数量、上下文窗口与 4 月发布的 Preview 版本完全一致。改变只有一件事:重新做了一轮后训练。就是这一轮后训练,让这个激活参数仅 13B(总参数 284B)的"轻量"模型,在 DeepSeek 自己公布的 9 项 Agent 基准上,全线反超了激活参数 49B 的自家旗舰 V4-Pro-Preview。
284B 模型靠后训练反杀 1.6T 旗舰
DeepSeek-V4-Flash-0731 是一个 284B 总参数的稀疏 MoE 模型,每 token 只激活 13B 参数,上下文窗口 100 万 token,MIT 开源协议。和 Preview 版本相比,这些规格一个字都没改。
改的是后训练。DeepSeek 在 API changelog 中用了"was only re-post-trained"来描述这次更新。所谓 re-post-training,指的是对已经完成预训练和基础后训练的模型,在特定领域再做一轮强化学习。对 coding agent 而言,核心机制是利用代码执行作为可验证奖赏信号。模型尝试多步骤编程任务,代码执行,测试通过或失败,模型被更新为偏爱那些通向成功的决策序列。
效果是惊人的。以 DeepSWE 为例。这是 Datacurve 设计的真实 GitHub Issue 解决测试,覆盖 91 个开源仓库的 113 个任务,误判率仅 0.3%。Preview 版仅 7.3 分,0731 版直接跃升到 54.4 分。645% 的提升,来自同一个模型,换了后训练。
其他基准的涨幅同样剧烈:
- Terminal Bench 2.1(命令行 agent 任务):61.8 → 82.7。这个分数不仅碾压了 V4-Pro-Preview 的 72.1,也超过了 Kimi K3 发布时引以为傲的 76.1。
- Cybergym(网络安全 agent):38.7 → 76.7。
- DeepSWE:7.3 → 54.4。
- NL2Repo(代码仓库导航):39.4 → 54.2。
- Toolathlon(工具调用):49.7 → 70.3。
V4-Pro-Preview 在所有 9 项基准上被反超,没有一项幸存。一个激活参数不到 Pro 三分之一的"预算模型",靠一轮后训练就成了 Agent 领域更强的那个。
DeepSeek 在发布中特别注明,这些分数使用的是自家的 DeepSeek Harness 框架("即将开源"),而非默认的任务框架。Harness 和模型是联合设计的,这是否意味着分数的提升部分来自框架优化而非纯模型能力,目前无法从第三方验证。独立评测机构 Artificial Analysis 对 0731 的 Intelligence Index 评分为 50,在 162 个被测模型中排第 2,中位数为 17。但 AA 同时指出模型极为冗长,评测套件中生成了 2.1 亿 token,而所有模型的中位数仅 6200 万,实际使用成本会高于标价。
102 t/s 的免费端点和一个 10 美元的部署按钮
Victor Mustar 的动作比绝大多数开发者都快。他在 DeepSeek 官宣后几小时内就在 Hugging Face 上架了免费端点,四卡 NVIDIA H200 跑到 102 t/s。社区反响炸裂。他的主推文收获 739 个赞、516 次收藏、11 万曝光。
免费端点之外,Mustar 还提供了两条路径:一个直接聊天的 Gradio 界面,以及一个一键部署按钮,在 Hugging Face Inference Endpoints 上自部署,每小时 10 美元,支持 scale-to-zero,不用不付费。端点兼容 OpenAI API 格式,这意味着从 GPT 或 Claude 切换到 DeepSeek,改一行 model 参数就够了。
Unsloth AI 在 DeepSeek 官宣推文下回复:"If DeepSeek-V4-Flash is this good and this small, imagine DeepSeek-V4-Pro! 🤯 And imagine running Flash locally on your own device! 🔥" 这条回复获得了 1780 个赞。Unsloth 已经表示将制作 0731 的量化版本,让用户在消费级硬件上本地运行。
Ahmad Awais(CommandCode AI CEO)也在第一时间将 0731 接入 CommandCode,称"Hard to believe how much better it is"。社区开发者 @f311a 在 Hacker News 上写道:"I've been driving flash model for 90% of my tasks. It's better than pro (for unknown reasons), very cheap and fast." 这条评论获得了数百个赞同。
不换架构、不加参数——这背后是一道行业选择题
Preview 版的 Flash 在 DeepSWE 上只拿了 7.3 分,当时没有引起太多注意。"轻量模型不擅长长链 agent 任务"在业内几乎是一种共识。共识的另一半是:要做出更好的 agent,需要更大的模型、更多的预训练数据、更高的算力投入。
0731 用一次后训练把这两条共识都撕了。
DeepSeek 的做法揭示了 AI 能力提升的一个关键转向:预训练决定了模型"知道什么",后训练决定了模型"怎么用这些知识"。对于 agent 任务,多步骤规划、工具调用、错误恢复、代码执行,知识储备是必要的但远非充分的条件。真正的瓶颈在于模型是否被训练成在长链决策中做出正确的选择。后训练用代码执行这个天然可验证的奖赏信号,正好击中了这个瓶颈。
这解释了为什么 Flash 在知识类基准上未必强于 Pro(DeepSeek 没有公布非 agent 基准的对比数据),但在 agent 基准上却能全线反超。Pro 的额外参数量给了它更广阔的知识面,但 Flash 的后训练让它更善于"做事"。
OpenAI 在 0731 发布前 24 小时将 GPT-5.6 Luna 的价格砍掉 80%,降至每百万 token $0.20/$1.20。社区用户 @SourceCodeplz 在 DeepSeek 官宣推文下直接发问:"openai also reduced the price of Luna model by 80%, just few hours before. coincidence?" 开源模型在 agent 性能上的跃升,正在逼迫闭源厂商从"溢价卖能力"转向"薄利卖生态"。
当 Flash 追到 Opus 身后 2.3 分
把 0731 放到整个市场的坐标系里,信号更明确。以 Terminal Bench 2.1 为锚点:
- Anthropic Opus-4.8:85.0
- DeepSeek V4-Flash-0731:82.7
- GLM-5.2:81.0
- Kimi K3:76.1
- DeepSeek V4-Pro-Preview:72.1
0731 离当前 Agent 能力最强的闭源模型 Opus-4.8 只差 2.3 分。而在 Agents' Last Exam 上,差距仅 0.5 分(25.2 vs 25.7)。考虑到价格差距:0731 输出每百万 token $0.28,Opus-4.8 约 $15+。开源价格对标闭源旗舰 Agent 能力,上一次出现这种局面还要往前翻很久。
DSBench-FullStack 和 DSBench-Hard 是 DeepSeek 的内部测试集,0731 分别拿到 68.7 和 59.6。作为参考,Opus-4.8 在这两项上分别是 71.6 和 71.7。Flash 在 FullStack 上追得非常近,Hard 上还有明显差距,这符合预期:更难的编程问题确实需要更强的推理能力。
GLM-5.2 和 Kimi K3 是另外两个值得关注的参照物。GLM-5.2 在 Agent 基准上整体接近 0731,但在 DeepSWE 上落后 8.2 分(46.2 vs 54.4)。Kimi K3 发布时 Terminal Bench 76.1 的成绩曾被认为确立了开源 Agent 能力的天花板,0731 在一个月内将这条线往上推了 6.6 分。
价格方面,0731 保持了 Preview 版的定价:输入 $0.14/百万 token,缓存命中 $0.003,输出 $0.28。DeepSeek 同时预告了峰谷分时定价,北京时间 9:00-12:00 和 14:00-18:00 为高峰时段,价格为标准价的 2 倍,正式生效日期尚未公布。
免费端点关掉之后
Victor Mustar 的推文标题是"还剩几个小时可以免费试用"。免费端点终会关闭,但 0731 的权重已经在 Hugging Face 上开放下载。MIT 协议,任何人可以自行部署,也可以花 $10/小时在 HF Inference Endpoints 上一键启动。对于不想折腾基础设施的开发者,DeepSeek 官方的 API 价格维持不变,只需把 model 参数改成 deepseek-v4-flash。
DeepSeek 在官宣中明确表示 V4-Pro 的正式版"coming ASAP"。如果 V4-Pro 经历一轮同等级别的后训练,49B 激活参数的推理能力叠加 Flash 已验证的 Agent 后训练方法论,结果可能不会是线性的。在那一天到来之前,Flash 0731 已经把开源模型的 Agent 天花板推到了离闭源最强模型不到 3 分的位置。而 Victor Mustar 和 Hugging Face 用一条推文和几行配置告诉所有人:门槛已经没了。
参考链接: