AREX Feed Article
Moonshot AI 开源 PerceptionBench:16 个前沿模型视觉感知无一过 60%
16 个前沿多模态模型,没有一个能在纯视觉感知上拿到 60% 的准确率。这是 Moonshot AI 新基准 PerceptionBench 给出的结果。据 ,该基准把视觉感知从逻辑推理和外部知识中剥离出来单独评分,GPT-5.6 Sol 以 59.7% 居首。
第 2 至第 4 位是 Kimi K3(58.5%)、Claude Fable 5(57.2%)和 Gemini 3.1 Pro(56.2%)。基准作者由此判断,许多被归为「推理错误」的失败,在读图阶段就已发生。数据集与评测代码开源在 (Apache 2.0),论文挂在 。
十项子技能从 42 个基准的真实错误里挖出来
里说明了构建逻辑:42 个现有开源基准各自只覆盖窄窄一片感知错误,两两错误分布的平均加权 Jaccard 系数只有 0.20,任何单一基准或小组合都测不全视觉感知。
分类是倒推出来的:把前沿模型在这 42 个基准上的失败样本,逐条追到推理链中最早出错的一步,再把错误标签聚类成统一分类体系,得到五大类错误(感知、推理、知识、前提、其他),共 22 种细分类型。
其中的感知分支定义了十项「原子」技能:Visual Relation、Counting、Attribute、Depth & 3D、Localization、Comparison、Fine-grained Recognition、Context Integration、OCR、Hallucination。
发布的 3,000 道题出自一个 17,000+ 题的内部池子:1,800 道(60%)由真实失败样本拆解而来,1,200 道(40%)在补充图片上新造。每道题都经过多阶段验证,难度只来自感知,不来自推理或知识。
题目平淡得近乎琐碎:表盘上的 Gemini 符号在几点钟位置(答案 6);红框里有多少朵花的主体(答案 2);两个笔筒,哪个是灰粉拼色、哪个是纯粉带卡通图案。每道题只靠看图就能答。
前五名只差不到 4 个百分点,制作方的 Kimi K3 列第二
16 个模型(10 个闭源、6 个开源)用统一 prompt 和最高可用推理预算跑完 3,000 道题。题目全部开放作答、答案唯一,由 GPT-oss-120B 判分;在 300 题的抽样审计中,判分器与人工判断的一致率是 99.7%。
总榜上没有一家越过 60%:GPT-5.6 Sol 59.7%,Kimi K3 58.5%,Claude Fable 5 57.2%,Gemini 3.1 Pro 56.2%,GPT-5.5 55.8%,前五名差距不到 4 个百分点。开源模型中 Qwen3.5-397B-A17B 拿到 47.5%,垫底的 GLM-4.6V 只有 32.5%。
制作基准的 Moonshot 自己的开源模型 Kimi K3 列第二,与榜首差 1.2 分。the-decoder 补充的背景是:K3 在综合基准上已把与 Claude Fable 5、GPT-5.6 Sol 的差距追到几分以内,但在攻击性网络安全、复杂数学等专项仍明显落后;在视觉感知上,K3 已与西方对手打平。
幻觉是全场最弱项:总榜第一只有 26.9%,第七名反而拿到 50.6%
平均而言,十项技能里最弱的是感知类幻觉:总榜第一的 GPT-5.6 Sol 在这一项只有 26.9%,总榜第七的 Gemini 3.5 Flash 却以 50.6% 排进该项前列。
这类题考的是模型会不会凭空造出画面里没有的东西,正确答案常常就是「0」。博客样题:图中的 15 个图案里,有几个带狗的标志(答案 0);办公室里有几张白色桌子(答案 0)。
论文正文还记录了另一条证据:相当一部分答对的题,在重复运行时答案并不稳定,样本层面的感知会漂移,即便总分看起来稳定。
作者的核心论点是下游推理无法恢复读图阶段漏掉、误读或幻觉出来的内容,这一步失败会污染整条推理链。论文据此判断,原子感知仍然是多模态模型的关键瓶颈。
从 WorldVQA 到 BabyVision,同一批人一直在拆「看」
把「看」单独拎出来考,不是这个团队第一次做。the-decoder 提到,同一研究团队此前发布 WorldVQA,把物体识别与推理分开评测:当时最好的 Gemini 3 Pro 只有 47.4%,而且所有模型都系统性高估了自己的置信度。
另一项由中方机构主导、Moonshot AI 参与的研究用 BabyVision 测与儿童早期发育相关的基础视觉任务,如描线和数被挡住的积木:Gemini 3 Pro 拿到 49.7%,人类对照是 94.1%。研究者把差距归因于「语言化瓶颈」,视觉信息转成语言时丢失保真度。
PerceptionBench 沿这条线再进一步:把多步任务拆成纯感知子问题,直接指出失效的是哪一项视觉能力。论文中的四个案例演示了拆法,一道原始问题被拆成若干只需看图作答的子问题。
开源的是一把诊断工具,任何 OpenAI 兼容端点都能跑
除 GitHub 仓库(7 月 23 日建仓)外,数据集同步发布在 。README 给出一键评测路径:克隆仓库,在 .env 里填好任何 OpenAI 兼容端点的密钥,运行 eval.py,每题由 GPT-oss-120B 按 0/1 严格判分,总分和十项技能分数分别落盘。
它输出总分和十项技能两套分数。总分接近的模型在各子项上差距显著,聚合分会掩盖模型实际掌握了、缺失了哪些感知能力。
总榜第一在「画面里没有的东西」这类题上只答对 26.9%。PerceptionBench 把这类失败按技能拆开、逐项量化,模型哪一项没学会,现在可以一项一项地查。