AREX Feed Article
DeepSeek V4 Flash 正式上线:284B 反杀 1.6T Pro
7 月 31 日,DeepSeek 将 V4 Flash API 正式推进公开测试。模型名设为 deepseek-v4-flash,调用方式不变。
但性能变了。同一 284B 参数架构、同一 13B 激活、同一 1M 上下文窗口——架构和规模一丝未改,仅靠重新后训练,V4 Flash 0731 在 DeepSeek 发布的每一项 agent 基准上都碾压了售价三倍于己的 V4 Pro 预览版。
Terminal Bench 2.1 从 61.8 跳到 82.7。DeepSWE 从 7.3 跳到 54.4,提升 645%。Cybergym 从 38.7 翻倍至 76.7。
预算版干掉了旗舰预览版。DeepSeek 自己的发布说明措辞毫不含蓄:结果 "far exceed V4-Pro-Preview"。
HN 576 分登顶,开发者连夜压 GGUF:用脚投票
Hacker News 上,Artificial Analysis 的 V4 Flash 0731 评测页面拿下 576 分、309 条评论,冲上首页。
用户 pmxi 贴出了一张更新后的价格-性能前沿图,在 OpenAI 前一天发布的 Luna 降价曲线旁标注了 V4 Flash 0731 的位置。用户 fcanesin 只回了一个词:"LOL",附上 Artificial Analysis 的智能度对比页。
另一位用户 k__ 接道:"Haha, and I almost felt bad after seeing this chart yesterday"。前一天 OpenAI 发 Luna 降价图表时,他一度以为闭源已经守住了性价比前线。
在 NVIDIA 开发者论坛,Unsloth 团队在模型发布数小时内放出了 GGUF 版本。Q8 全精度 162GB,Q3 压缩版 103GB,需要约 110GB 的 RAM 加 VRAM。社区用户 chriswalz86 贴出完整 llama-server 启动命令,Q2 量化后在消费级硬件上跑通。用户 anotheralvin 反馈 MTP 暂未适配社区版 vLLM。
Reddit 的 r/LocalLLaMA 上,一条高赞帖子的标题直击要害:"Models you can run locally now have the intelligence score of the top frontier model from March 2026"。r/DeepSeek 社区实测后反馈两极:agent 和 coding 场景大幅改善,部分用户仍遇指令遵循不稳定。
HN 用户 bwfan123 的反馈代表了相当一部分开发者的体感:"With reasonix or pi, I can code all day long and pay a few pennies for it. No token anxiety."
48 小时内两记重拳:模型定价的绞杀战已经打响
V4 Flash 0731 的发布不是一个孤立事件。
7 月 30 日,OpenAI 宣布 GPT-5.6 Luna 降价 80%:输入从 $1.00 砍到 $0.20,输出从 $6.00 砍到 $1.20。GPT-5.6 Terra 同步降价 20%。Sam Altman 本人在 X 上称之为 "major price cuts"。降价机制本身值得注意:OpenAI 称 GPT-5.6 Sol 重写了自身生产环境的内核代码,将端到端服务成本压低了 20%。
但 VentureBeat 的定价对比表上,Luna 砍价后合计 $1.40/M tokens,仍然排在 DeepSeek V4 Flash($0.42)和 Xiaomi MiMo-V2.5 Flash($0.40)之后。
8 月 1 日,OpenAI 公布 Astra 模型解决了 10 个长期悬而未决的数学和理论计算机科学问题,附带 Lean 形式化证明,全部算力成本约 $2,000。r/singularity 和 Hacker News 上同时出现了两条并行讨论:一条关于 Astra 的数学突破,一条关于 V4 Flash 的 agent 性价比。
48 小时内,开源阵营亮出了 agent 性价比的底牌,闭源阵营则以前沿科学能力和激进降价同时回应。两条路线在同一个时间窗口正面碰撞。
DeepSWE 从 7.3 跳到 54.4:后训练才是 agent 的主战场
这次更新最反直觉的地方:架构没变,模型大小没变。DeepSeek 的发布说明明确写道,0731 版本 "was only re-post-trained"。三个核心变化支撑了这次跳跃。
第一,agent 任务重训。DeepSeek 用更强的 agentic 任务偏好重新跑了一遍后训练管线,重点强化终端操作、代码仓库导航和工具调用。效果集中体现在 Terminal Bench 2.1 的 82.7 分上——压过了 Kimi K3 上线时 76.1 的成绩,后者当时已经是所有被追踪闭源模型的最高分。
第二,指令遵循大幅改善。预览版最受诟病的痛点就是无视 rules 和 prompts 约束。0731 版本在多轮 agent 回路上显著降低了偏离指令的概率。NL2Repo 从 39.4 跳到 54.2,AutomationBench 从 10.8 跳到 25.1,均指向同一方向。
第三,DeepSWE 上 7.3 到 54.4,提升 645%,是这次更新最惊人的单个数据。同一个模型在真实软件工程任务上,从"基本不可用"直接跃入与 Claude Opus 4.8(58.0)同一竞争区间。Toolathlon Verified 从 49.7 升至 70.3,与 Opus 4.8 的 76.2 差距缩至 6 分以内。
Artificial Analysis 独立评测给出了量化坐标:Intelligence Index 得分 50,在 162 个被测模型中排第 3。但附了一条提醒:模型"话多",评测套件中生成了 210M tokens,是中位数 100M 的两倍多,实际成本高于贴纸价。
需要注意:所有 agent 基准数字均为 DeepSeek 自报,使用了尚未开源的 DeepSeek Harness minimal mode 作为评测框架。独立复现数据可能偏离。
中间价位的闭源模型,生存空间正在蒸发
VentureBeat 7 月 30 日的 40 余款模型定价对比表提供了最清晰的格局快照。
过去,闭源模型在高价区建立质量和体验壁垒,开源模型在低价区提供替代方案。两条轨道平行运行。Anthropic 的 Claude Fable 5 挂价 $60/M tokens 合计,OpenAI 的 Sol 挂价 $35,而 DeepSeek V4 Flash 挂价 $0.42。输出价差达到 178 倍,但 agent 基准上的性能差距远不到 178 倍。
转折点是 V4 Flash 0731 在全部 agent 基准上反超自家 Pro 预览版,同时保持全球第二低的合计定价。Developers Digest 在评测中直接点破:"any lab charging real money for agentic coding now has to explain what the premium buys." 他们的网站自动化任务已经跑在 Flash 0731 上,并非一次性评测演示。
未来的走向:中间层正在被挤碎。Developers Digest 的判断是, "the middle collapses." 实验室要么像 OpenAI 降 Luna 那样朝开源定价竞赛,要么像 Anthropic 那样用开源还没追上的能力守住一个不断缩水的高价区。每次一次 V4 Flash 0731 式的发布,都会把那条"开源做不到"的线往上推一点。
终端 agent 的冠军,现在姓开源了
V4 Flash 0731 回答了一个此前悬而未决的问题:当开源模型的 agent 能力追上来时,闭源的定价体系会发生什么?
48 小时内,我们看到了一部分答案:OpenAI 砍价 80%,Anthropic 坚守 $60 高价,开源社区连夜部署 GGUF。定价对比表上 Flash 0731 的位置,比任何分析报告都更精确地标出了这场竞赛当下的重心。
对于跑 agent 舰队的团队,赢家已经明确。Hacker News 上一位用户的总结足够精确:"I can code all day long and pay a few pennies for it. No token anxiety."
Sources: , , , , , , , , , , __