AREX Feed Article
Artificial Analysis 发布 Apodex 1.1 首个第三方评测:Intelligence Index 44,GDPval 领先 DeepSeek V4 Pro
独立评测机构 Artificial Analysis 于 2026 年 8 月 31 日发布 Apodex 1.1 的。其官方 X 账号(@ArtificialAnlys,简介为「Independent analysis of AI」)公布的数据显示:Apodex 1.1 在 Artificial Analysis Intelligence Index 上拿到 44 分,与 Kimi K2.6(45 分)、MiniMax-M3(45 分)同处一个档位;在真实世界 agent 工作基准 GDPval-AA v2 上,其 Elo 为 1348,高于 DeepSeek V4 Pro 的 1333。
推文发布于 UTC 时间 8 月 31 日 02:52(北京时间 10:52),并明确说明这是 Apodex 旗下模型首次登上 Artificial Analysis 平台。同一份评测还给出短板数据:AA-Omniscience 指数 -21.9 分,幻觉率 78.4%。Apodex 1.1 支持 256K 上下文,每百万 token 定价输入 $0.30、输出 $3.00,目前仅通过 Apodex 自家 API(first party API)提供。
44 分,与 Kimi K2.6、MiniMax-M3 同档
Intelligence Index 是 Artificial Analysis 的合成智能指数,现行 v4.1.1 版本由九项评测合成,包括 GDPval-AA v2、𝜏³-Banking、Terminal-Bench v2.1、SciCode、Humanity's Last Exam、GPQA Diamond、CritPt、AA-Omniscience 与 AA-LCR。在 AA 官网的上,Apodex 1.1 以 44 分排在 177 款同类模型的第 11 位,远高于同类中位数 18。
推文把 Apodex 1.1 与 Kimi K2.6(45)、MiniMax-M3(45)、Inkling(42)归入同一档位,并概括其画像:在 agent 任务和知识工作评测上表现突出,但在知识可靠性和前沿学术推理上存在明显取舍。
GDPval Elo 1348:agent 任务领先 DeepSeek V4 Pro
AA 推文重点展开的是 agent 任务数据。在 GDPval-AA v2(AA 自建的「真实世界 agent 工作」基准)上,Apodex 1.1 的 Elo 为 1348,排在 DeepSeek V4 Pro(1333)、Qwen3.7 Max(1308)与 Kimi K2.6(1202)之前。
最典型的错位来自 Kimi K2.6:整体指数 45 分高于 Apodex 1.1 的 44,GDPval-AA v2 上却以 1202 对 1348 落后一百多分。
在 TerminalBench v2.1(agent 编程与终端使用基准)上,Apodex 1.1 拿到 70%,高于 Kimi K2.6 的 66%,低于 Qwen3.7 Max 的 75%。AA 在推文开头就用「在其智能档位中,agent 任务表现突出」概括这款模型。
知识可靠性偏弱:幻觉率 78.4%、指数 -21.9
AA-Omniscience 衡量模型的知识可靠性与幻觉倾向:答对加分、幻觉扣分、拒绝作答不扣分,得分范围 -100 到 100,0 分意味着答对与答错一样多。Apodex 1.1 得 -21.9 分,即错误答案多于正确答案。
在单题层面,其准确率只有 32%,幻觉率高达 78.4%,而且 87% 的问题它都选择作答而不是拒绝回答。AA 在推文中把「知识可靠性与前沿学术推理上的取舍」列为该模型的主要短板,与 agent 任务上的强势形成对照。
256K 上下文、$0.30/$3.00 定价,每任务输出约 1.7 万 token
模型规格:上下文窗口 256K token;定价每百万 token 输入 $0.30、输出 $3.00,缓存命中价 $0.03,官网标注缓存折扣 90%。模型支持文本与图像输入、文本输出,属于推理模型;官网未披露参数量,仅注明由 Apodex 开发、通过其自家 API 提供。
AA 官网显示,跑完整套 Intelligence Index 评测,Apodex 1.1 共生成 1.8 亿输出 token,在 177 款模型中排第 61 位,官网描述为「非常啰嗦」(同类中位数 6,700 万)。
推文给出另一组口径:平均每个任务约 1.7 万输出 token,对照是 DeepSeek V4 Pro 的 16,842、Qwen3.7 Max 的 9,391 与 MiniMax-M3 的 8,133。按这组数字,Apodex 1.1 比三款对照都更费 token,与推文「比 DeepSeek V4 Pro 更省 token」的说法直接矛盾。
成本数字同样存在出入。推文称每任务成本约 $0.05,比 Qwen3.7 Max(约 $0.07)与 Kimi K2.6(约 $0.06)都便宜,「落在最具吸引力的象限」。官网模型页目前把每任务成本列为 $0.23(成本排名第 53),并记录整套指数评测共花费 $618.41。
发论文一周后,Apodex 迎来首份独立成绩单
Apodex 1.1 是 Apodex 旗下首个登上 Artificial Analysis 平台的模型。AA 推文提到,该公司此前已推出 Apodex 1.0 与 Apodex 1.0 mini;Apodex 1.1 于 8 月 30 日发布,属专有模型,参数量未披露。
一周前,其技术报告《Apodex 1.1: Scaling Agentic Intelligence for Complex Work》上线 arXiv(编号 2608.23283),8 月 24 日进入 ,页面标注为当日第一(#1 Paper of the day)、获 203 次点赞。
报告的核心主张是沿着「环境扩展」(Environment Scaling)与「智能体协调扩展」(Agentic Coordination Scaling)两条路径,训练模型在长周期任务中做到状态维护、故障恢复与可验证交付。论文页同时公布了 35B 参数的开放权重版本 Apodex 1.1 mini,以及开源研究工作台 FrontierAgent。
实验室回应:「为长周期任务、真实文件、循环验证而生」
推文发布约三小时后,Apodex 实验室的一位负责人公开回应了这份评测。Apodex_AI 的推理模型与训练首席科学家 Simon Shaolei Du(其 X 主页资料同时标注为华盛顿大学副教授),写道:
「Apodex 1.1 在 @ArtificialAnlys 上完成首秀。它拿到 44 分,与 Kimi K2.6、MiniMax-M3 同档;GDPval-AA v2 上 Elo 1348,领先 DeepSeek V4 Pro(1333)。Apodex 1.1 就是为此而生:长周期任务、真实文件、验证在环(long horizons, real files, verification in the loop)。」
这条转发与 AA 的数据放在一起,构成首评里最直观的一组对照:实验室把「验证在环」写进自我定位,而 AA 测出的知识可靠性是 -21.9 分、幻觉率 78.4%,且 87% 的问题它选择作答而不是拒绝回答。