AREX Feed Article
Nous 狂砍九成卖 DeepSeek V4 Flash,Agent 碾压 Fable 5,成本仅千分之一
千分之一的成本,一样的分数
8 月 2 日,Nous Research 宣布 DeepSeek V4 Flash 0731 在 Nous Portal 上打九折,限时 7 天,合作方为 Novita Labs。
Nous Research 在公告中写道:在这个折扣价下,该模型比 Fable 5 便宜 1000 倍以上,同时在 Terminal-Bench 2.1 上仍然击败 Fable 5。
公告发布后 12 小时内,推文获得 2,115 次点赞、143 次转发、69 次引用,浏览量超过 36 万次。Nous Research 同步宣布,平台其他模型一律八折,GPT-5.6 Terra 和 Luna 五折。
「几美分就能建一个帝国」
Nous Research 联合创始人兼 Hermes Agent 负责人 Teknium 转发公告时写道:"智能便宜到了你想按美分计费来炫耀的程度——几美分就能建一个帝国。"
Cline 官方账号引用了 Artificial Analysis 的独立测试数据:DeepSeek V4 Flash 0731 以同等 benchmark 任务计算,总成本仅为 Fable 5 的 105 分之一——每个 benchmark 任务花费 $0.03,而 Fable 5 需要 $3.15。该推文获得 4,732 次点赞。
拥有 13 万关注者的科技分析师 Kimmonismus 称这是 "DeepSeek 2.0 时刻"。VulcanBench 作者 Morgan Linton 则报告,在他的独立基准测试中,DeepSeek V4 Flash 拿下第一,Fable 5 被挤出前三——"完全没想到"。
日本技术博主 h_a_t_a_r_a_k_e 做了详细算账:Nous Portal 折扣后输入 $0.01/百万 token,输出 $0.02/百万 token,"高性能模型的执行部队,已沉到了近乎免费的价格带。"
没换架构,只换了一次后训练
DeepSeek V4 Flash 0731 于 7 月 31 日进入公开 beta。DeepSeek 明确表示:模型结构和尺寸与预览版完全相同——284B 总参数,13B 激活参数,MoE 架构,1M token 上下文窗口。唯一的变化是重新做了一遍后训练。
结果却是 Agent 能力全面跃升。DeepSeek 官方公布的九项 Agent 基准全部超过自家 V4 Pro 预览版(49B 激活参数)。
就在此前一周,Anthropic 刚刚发布了 Fable 5,在多项 Agent 基准上确立领先地位。而 Kimi K3 的开源发布也让社区兴奋不已。V4 Flash 0731 选择了第三条路:不卷参数规模,卷后训练质量,然后用 MIT 开源协议把权重放出来,让任何人在本地工作站上跑。
io.net 联合创始人 Tory Green 评论称:"能在 110GB 内存的单机上跑的近前沿能力——不需要 API,没有月费。"
13B 激活打赢 49B:Agent 的瓶颈从来不是参数
DeepSeek V4 Flash 0731 的提升来自纯后训练,没有改动基础模型。
Terminal-Bench 2.1 从 61.8 跳升到 82.7,超越 Fable 5 的 80.5,直逼 Opus 4.8 的 85.0。这在长周期终端/Shell Agent 任务上是质的飞跃。
DeepSWE 从 7.3 飙到 54.4,翻了 7 倍多。这个跳跃主要来自模型学会了 Agent harness 的交互协议——正如 Eyisha Zyer 所指出:"Agent 的瓶颈从来不是参数数量,是没人教这些模型怎么用工具。"
Cybergym 从 38.7 升至 76.7,NL2Repo 从 39.4 升至 54.2。Toolathlon 验证版从 49.7 升至 70.3。
Artificial Analysis 的独立评估显示:0731 在其 Intelligence Index 上得分 50,仅比 GPT-5.6 Luna 低 1 分。成本方面,DeepSeek 官方 API 定价 $0.14/$0.28 每百万 token 输入/输出,cache hit 折扣高达 98%,命中后仅 $0.0028。
从「谁的模型最强」到「谁的 Agent 最值」
此前,前沿 Agent 模型的定价格局是阶梯式的:Anthropic 的 Fable 5 和 Opus 4.8 在最顶端,按每百万 token $15/$75 计费;Google Gemini 和 OpenAI GPT-5.6 在中段;开源模型通常性能差一档。
这次转折在于,V4 Flash 0731 不仅在 Terminal-Bench 上超越了 Fable 5,还同时撞碎了价格地板。Nous Portal 折扣后的价格——约 $1/十亿 token——让"跑 100 个 Agent 同时工作一整天"从企业预算问题变成了个人零花钱问题。
社区用户 @1kartikkabadi1 在回复中写道:"我可以同时跑几百个 Hermes Agent,一天花费不到 $0.30。"另一位用户 @mjtechguy 感叹:"十亿 token 一美元?!这会是很忙的一周。"
VulcanBench 的 Linton 进一步指出:DeepSeek V4 Flash 在他的独立基准中夺冠,用的还不是最高推理档位——是中等档位。而 Grok 4.5 Medium 拿了第二,Fable 5 跌出前三。"这就是为什么必须在不同推理档位上做基准测试。"
中文社区同样反应热烈。程序员鱼皮(25,922 关注者)直接画了一张"斩杀线"图:DeepSeek V4 Flash 在性能和价格的双轴上都把大多数对手划入了淘汰区。"比它聪明的都贵很多倍,比它便宜的都没它能打。"
Agent 的边际成本正在归零
这不是一次促销。这是 Agent 经济的价格信号灯从黄变绿。
当一款 MIT 开源的 13B 激活模型在后训练纯优化后,能在 Terminal-Bench 上胜过 Anthropic 的旗舰 Agent 模型、成本却只有千分之一——"选哪个模型"这个问题本身已经过时了。
新的问题是:当 Agent 的边际成本趋近于零,你会用它做什么?