AREX Feed Article
Artificial Analysis 独立验证 Inkling-Small:综合智力指数 40 追平 DeepSeek V4 Flash,token 效率显著优于同级模型
7 月 30 日,第三方评测机构 Artificial Analysis 发布了对 Thinking Machines Lab 新模型 Inkling-Small 的独立深度评测,确认其综合智力指数(AA Intelligence Index v4.1)为 40 分,与 Inkling 旗舰(41 分)仅差 1 分,并以不足三分之一的参数量(276B 总参/12B 激活 vs. 975B/41B)追平了今年 4 月版 DeepSeek V4 Flash(284B/13B 激活,同为 40 分)。更值得注意的是,Inkling-Small 在达成同等智力水平时展现出显著的 token 效率优势。
token 效率:同等分数,不到一半输出量
Artificial Analysis 的独立评测揭示了一个官方公告中未强调的效率维度:Inkling-Small 在完成 Intelligence Index 全部评测任务时,平均每个任务仅产生约 24K 输出 token,与 Inkling(约 25K)基本持平。而同等分数的 DeepSeek V4 Flash(4 月版)平均每个任务约 45K token,GPT-5.4 mini(xhigh 设置)更高达约 78K token。
这意味着在推理效率层面,Inkling-Small 以明显更少的思考 token 达成了同等智能水平。Artificial Analysis 将这一结果归因于模型"输出简洁"而非思考不足——其全量 Intelligence Index 评测累计约 131M 输出 token,仅略高于 Inkling 的约 128M。
AA-Briefcase:报告质量驱动的反超
在长周期智能体知识工作基准 AA-Briefcase 上,Inkling-Small 以 917 Elo 大幅领先 Inkling 的 839 Elo。但 Artificial Analysis 指出,这一领先主要来自报告呈现质量的提升,而非答案正确率的实质飞跃——两模型的评分标准通过率几乎一致(20% vs. 19%)。真正关键的效率指标是:Inkling-Small 平均仅需 34 轮完成任务,不到 Inkling 的 81 轮的一半。
幻觉率反而更低
在 AA-Omniscience 指数上,Inkling-Small 得分为 -9(Inkling 为 +2),意味着错误回答多于正确回答。但分解数据显示,这一差距完全由准确率驱动(31% vs. 40%),而非幻觉率——Inkling-Small 的幻觉率为 57%,反而低于 Inkling 的 63%。这对一个参数量仅为其四分之一的模型而言,是一个反直觉但积极的安全信号。
时效注记:对标基线已更新
需要指出的是,DeepSeek 于 7 月 31 日(Inkling-Small 发布次日)即上线了 V4 Flash 0731 正式版,同架构、同参数、仅重做后训练,AA Intelligence Index 从 40 跃升至 50。Inkling-Small 追平的 V4 Flash 是 4 月版,而非这一最新版本。这意味着同等参数量级的竞争基准仍在快速上移。
本次更新来源
- (2026-07-30,独立评测核心来源)
- (官方公告,供交叉核对)