AREX Feed Article
独立评测落地:DeepSeek V4-Flash 单任务 3 美分,帕累托前沿被重画
8 月 7 日,ARC Prize 在 X 平台公布了 DeepSeek V4-Flash 在 ARC-AGI 基准上的验证结果:ARC-AGI-2 得分 61.4%,单任务成本仅 0.04 美元;ARC-AGI-1 得分 89.0%,单任务成本 0.02 美元。,该模型「在成本-性能帕累托前沿设立了新标准」。
这一结论与四天前 Artificial Analysis 发布的独立评估高度吻合。据 ,该研究机构测得 V4-Flash 每次基准测试运行成本约 3 美分,是全球主流模型中最低——对比 Moonshot AI 的 Kimi K3(0.86 美元)、OpenAI 的 GPT-5.6 Sol(1.86 美元)和 Anthropic 的 Claude Fable 5(3.15 美元),差距在两个数量级。
两份独立评测,一个共同发现
Artificial Analysis 和 ARC Prize 的评测方法不同,指向的结论却一致:V4-Flash 用极低的价格提供了可用的智能。
Artificial Analysis 的 Intelligence Index 给 V4-Flash 打出 50 分(满分 100),这是一个由九项独立基准综合而成的指标,覆盖编码能力、推理能力和实际工作场景。50 分意味着它与 Google 的 Gemini 3.6 Flash 持平,比 Meta 的 Muse Spark 1.1 和智谱的 GLM-5.2 仅低 1 分。作为参照,Moonshot 的 Kimi K3 为 57 分,Anthropic 的 Claude Opus 5 和 Fable 5、OpenAI 的 GPT-5.6 均领先 V4-Flash 至少 9 分。
但 Intelligence Index 的排位只有和成本放在一起看才有商业意义。Artificial Analysis 偏好用「每次测试成本」而非 token 标价来衡量模型经济性——一个 token 单价看起来便宜的模型,如果推理时需要更多步骤才能答对,实际账单可能更高。V4-Flash 的官方定价为每百万输入 token 0.14 美元、每百万输出 token 0.28 美元。
ARC Prize 从另一个维度切入。ARC-AGI 测试的是模型在未曾见过的模式中推理的能力,不依赖记忆和预训练数据覆盖。V4-Flash 在 ARC-AGI-2 上拿到 61.4%,同时将单任务成本压到 0.04 美元——这个成本-性能组合,按照 ARC Prize 的说法,此前在帕累托前沿上并不存在。
Intelligence Index 50 配 3 美分单价,拆开数字看
Artificial Analysis 采用的「每次测试成本」指标揭示了 token 标价与实际开销之间的裂缝。V4-Flash 每次基准测试约 3 美分,而 Anthropic 的 Claude Fable 5 需要约 3.15 美元——约 105 倍的差距。OpenAI 的 GPT-5.6 Sol 为 1.86 美元,约 62 倍。即便是同为中国厂商的 Kimi K3,每次测试也要 0.86 美元,接近 V4-Flash 的 29 倍。
在能力端,Intelligence Index 50 分的位置意味着 V4-Flash 并非要在推理深度上与旗舰模型正面竞争。它追平的是 Gemini 3.6 Flash——Google 自家轻量级产品线中的主力——且仅比 Muse Spark 1.1 和 GLM-5.2 差 1 分。换句话说,V4-Flash 在「够用的智能」这个区间里,把价格拉到了竞争对手难以匹配的水平。
ARC-AGI 的结果补充了另一层信息。ARC-AGI-2 的 61.4% 并非顶尖——该基准旨在测量抽象推理和模式归纳,而非知识检索。但结合 0.04 美元的单任务成本来看,这个分数说明模型在执行层任务上具备可用的推理能力,同时保持极低的单位经济成本。ARC-AGI-1 的 89.0% 和 0.02 美元成本则进一步拉低了入门门槛。
ARC-AGI 的设计初衷正是测量模型对新奇问题的泛化能力,而非对训练数据中已见模式的检索。V4-Flash 在这条路线上尚不前沿,但它以极低成本达到了中等偏上的泛化水平,这本身就改变了「廉价模型」的能力预期。
V4-Flash 的每次测试成本会随任务复杂度波动。简单的单轮问答和需要多步推理的 Agent 任务,消耗的 token 量差异巨大。3 美分是一个综合均值,在 Agent 场景下实际开销可能更高,但相对排序不变——它仍然是目前可比的已评测模型中最便宜的。
OpenAI 被迫降价,阿里祭出 Qwen3.8-Max
V4-Flash 的定价压力正在向全行业传导。Quartz 报道指出,OpenAI 已对 GPT-5.6 进行降价,「以回应竞争压力,反映了市场价格快速走低的更广泛趋势」。
几乎与 V4-Flash 评测落地的同一周,阿里巴巴于周一发布了 Qwen3.8-Max,被描述为其「迄今最大、能力最强的 AI 模型」。中国 AI 厂商在开源和低价两条线上的推进速度没有放缓迹象。
DeepSeek 自身也获得了弹药补充。Quartz 引述 The Next Web 报道称,DeepSeek 已完成首轮外部融资,金额超过 70 亿美元——这笔资金应能支撑其在价格战中持续压低对手。V4-Flash 瞄准的是「规模主导型」使用场景:客户服务 chatbot、开发者工具、自动化的后台工作流,这些场景的请求量以百万计,每单位节省几分钱也能累积为显著的总体成本差异。
DeepSeek 同时在扩大硬件适配范围。V4-Flash 和尚未正式发布的 V4-Pro 均设计为可运行在华为昇腾 AI 处理器上,而非仅限 Nvidia 硬件。
DeepSeek 今年早些时候曾对 V4-Pro 提供 75% 的促销折扣。到 V4-Flash,激进定价直接变成了常态价格。DeepSeek 正在系统性地将低价作为产品定义的一部分。
便宜到对手无法匹配之后,短板在哪里
V4-Flash 的两组独立数据都指向同一个现实:在「执行层智能」这个区间,极低价格不再是能力妥协的结果,而是一种产品策略。但 Intelligence Index 50 分也意味着,在需要深度推理、长链规划和复杂多步决策的场景中,Claude Fable 5 和 GPT-5.6 仍有 V4-Flash 无法覆盖的优势——领先至少 9 分的差距不是靠降价能抹平的。
Intelligence Index 的九项基准覆盖编码、推理和实际工作场景,但未专门测试 Agent 连续任务完成率。V4-Flash 在单次基准测试中表现出色,连续多步推理时是否会因为模型规模限制而出现累积错误,目前公开的第三方评测尚未覆盖这一维度。
DeepSeek 已将更高端的 V4-Pro 列入发布计划,但未给出具体时间。从产品线布局来看,V4-Flash 承担的是「铺量」角色——用极低成本覆盖大规模执行层任务——而 V4-Pro 才是与旗舰模型争夺推理深度的那一张牌。两张牌都还没完全翻过来。
但无论后续产品如何补位,8 月第一周的两份独立评测已经做了同一件事:把「廉价模型」从一种市场定位变成了可量化的能力证明。当一道 ARC-AGI 题目的成本降到 4 美分,企业采购决策的算术就不再是「选最好的」,而是「算总账」。