AREX Feed Article
Artificial Analysis 独立评测 DeepSeek V4.1 Flash:智能指数 40 分,称其取代 V4 Pro 0813 成为 DeepSeek 新旗舰
独立评测机构 Artificial Analysis 于 2026 年 9 月 10 日 20:36(UTC)发布对 DeepSeek V4.1 Flash 的评测结果:该模型在 AA Intelligence Index(Artificial Analysis 智能指数)得 40 分,超过 DeepSeek V4 Pro 0813,Artificial Analysis 在帖文中称其由此取代后者、成为 DeepSeek 的新旗舰模型()。与 DeepSeek 官方此前公布的数字不同,这份成绩出自独立评测机构。
V4.1 Flash 是 DeepSeek 当天发布的开源模型,Artificial Analysis 在评测帖中将其描述为 DeepSeek V4 Flash 0731 的后继者:帖文正文口径为 552B 参数 MoE(混合专家模型),采用新的 Causal Encoder-Decoder(因果编码器-解码器)架构,输入与输出分别只激活 8B 和 16B 参数;上下文窗口 100 万 tokens,支持文本与图像输入,MIT 许可,目前仅在 DeepSeek 一方 API 提供()。
552B 对 1.6T:更小参数与约四分之一的单价
Artificial Analysis 在评测帖开头给出的核心判断是:V4.1 Flash 以「仅 552B 参数」跑赢了 1.6T 参数的 V4 Pro 0813,而且每 token 成本约为后者的四分之一,只因其输出冗长而略低于智能—成本 Pareto 前沿(帕累托前沿,即智能与成本的最佳边界)()。评测附图中,V4 Pro 0813 的 Intelligence Index 为 36 分,比 V4.1 Flash 的 40 分低 4 分()。
AutomationBench-AA 并列第一:代理与长上下文分项同步抬升
按 Artificial Analysis 的分项数据,V4.1 Flash 以 69% 登上 AutomationBench-AA 第一名,与 GPT-6 Astra 持平、高于 Grok 4.6 的 67%。该基准覆盖 39 个 SaaS(软件即服务)应用——含 Salesforce、Jira、Gmail、Zendesk 和 Google Sheets——共 657 个任务,考察模型能否在不触发防护规则的前提下完成目标;与 DeepSeek 自家模型相比,V4.1 Flash 比 V4 Flash 0731 的 54% 高出 15 个百分点,比 V4 Pro 0813 的 57% 高 12 个百分点,比 GLM-5.3 的 62% 高 7 个百分点()。
其余分项方面:GDPval-AA v2 Elo 从 1,468 升至 1,632,上涨 164 分,排在 Kimi K3(1,584)之前;AA-LCR v1.1 得 84%,与 GPT-5.6 Sol、Gemini 3.8 Flash 同一水平;Terminal-Bench v4.0 得 27%。Artificial Analysis 认为,结合 100 万 tokens 上下文,这使 V4.1 Flash 适合以 flash 档价格处理长文档和大仓库任务()。
单任务 89k tokens:冗长输出抬高成本,低价将其抵消
Artificial Analysis 同时指出 V4.1 Flash 的明显短板:每个 Intelligence Index 任务消耗约 89k tokens,是该公司测过的最冗长模型之一——比 Z AI 旗舰 GLM-5.3(71k)多 25%,比 GLM-5.3-Flash(69k)多 29%,比 DeepSeek V4 Pro 0813(55k)多 62%,甚至超过 Fable 5.1(78k)和 Claude Opus 5(73k)这些前沿模型的输出量()。
冗长直接推高单任务成本,但低单价把它拉了回来。按 DeepSeek 一方 API 的价格——每 100 万 tokens 输入 0.30 美元、输出 1.20 美元,缓存命中输入仅 0.006 美元(98% 折扣),谷时再打五折——V4.1 Flash 每个 Intelligence Index 任务成本为 0.27 美元,约为 GLM-5.3(2.01 美元)和 Kimi K3(2.00 美元)的七分之一,约为 V4 Pro 0813(0.67 美元)的 40%。Artificial Analysis 在跟帖中补充:冗长让每任务成本高于每 token 价格给人的直觉,但这一成本仍显著低于多数开放权重同行;评测帖还提到,V4.1 Flash 比 V4 Flash 0731 便宜约 20%(、)。
评论区:从性价比认可到对榜单公信力的质疑
对这份评测的反应并不一致。@0x0SojalSec 质疑「GLM 5.3 Flash 不是比 DeepSeek V4.1 Flash 更聪明吗」——按评测附图,GLM-5.3-Flash 的 Intelligence Index 为 42,高于 V4.1 Flash 的 40()。Julian Pscheid 称这次发布「没有打动我」,认为相比 V4 Flash 0731 只多了几分智能、却破坏了后者的价值()。中文评论区则有用户直接质疑榜单公信力,@yuansou3 写道「你们想让谁排名高谁就可以排名高」()。认可方向上,@EnvolDev 表示 89k tokens 的输出量不意外,「真正让我惊讶的是每任务仍只花 0.27 美元」()。
同一帖文两种参数:552B 与 763B 并存
这篇评测帖本身留有一处未解释的矛盾:正文与开头均称 V4.1 Flash 为 552B 参数模型,但帖末的模型详情栏给出「763B total parameters」(总参数 763B),同样标注输入激活 8B、输出激活 16B,两种总参数口径并存()。另有一处表述自相矛盾:Terminal-Bench v4.0 一节写道「27%,比 DeepSeek V4.0 Flash 的 27% 高出一倍多」,两个数字相同却称翻倍;评论者 Joan(@joanpyqt)随即指出这是笔误()。
截至发稿,这篇评测帖未对两种参数口径的差异作出说明;V4.1 Flash 的真实总参数规模,是 40 分之外仍待厘清的数字。