AREX Feed Article
Hugging Face 产品负责人 Victor M 发布 DeepSeek-V4.1-Flash 评测:称其 Boeing 747 自检循环连跑数小时、成绩为所见开源最佳
9 月 11 日,Hugging Face 产品负责人 Victor M(@victormustar)在 X 上了他对 DeepSeek-V4.1-Flash 的评测。这款模型,被他放进了自己的「Boeing 基准」。他写道,这是他从开源模型上见过的最好的 Boeing 基准成绩,「好出一大截」(by far)。
测试条件他写得很具体:harness(执行框架)是 Claude Code,提示词是一条 /goal 指令,任务是让模型用 THREEJS 做出最逼真的 Boeing 747、并靠视觉能力自校验。他说这次运行持续了好几个小时。这些结论出自他一人:测试由他设定,判断由他给出。
一条 /goal 提示词与自校验循环
提示词的译文是:「/goal 用 THREEJS 创建最逼真的 Boeing 747,用你的视觉能力搭一个可自校验的系统,进入循环,直到你对结果 100% 满意(你可以搭一个相机系统来检查每个角度)。」
他描述的过程是:模型在循环里不断「检查、发现缺陷、放大、诊断、修复」,然后重复。他强调了两件事:一是这样的循环能在长程(long horizon)上维持,二是模型在「判断该修哪里」上表现很好。他对比说,其他模型常常很快停滞,而它一直在改进。
随帖的视频是他展示这一过程的主要材料。视频封面是一架 THREEJS 渲染的 Boeing 747,上方横幅写着 DeepSeek-V4.1-Flash;在他看来,视频展示的正是这种维持能力。
结果放在一个可拖拽环绕的 747 查看器里
主帖发出后,他给出查看入口,消息是「非常好,结果在这里可以查看」,链接指向 Hugging Face 上一个名为「DeepSeek V4.1 Flash Boeing 747」的 (托管应用)。
随后他又,说「更多细节,因为这很美」。截图里是一个 3D 查看器界面:右上角有 Auto orbit、Reset view、Fullscreen 三个按钮,左下角标注「DeepSeek-V4.1-Flash」和「BOEING 747 · DRAG TO ORBIT · SCROLL / PINCH TO ZOOM」,也就是拖动可环绕、滚轮或双指可缩放。
「Boeing 基准」:他持续跑了半年多的个人测试
「Boeing 基准」(他有时也写 Boeing bench)是 Victor M 自己的一套对比测试:同一类任务反复换模型来跑,结果通常以视频和他名下的 Hugging Face Space 发布,好坏由他个人比较得出。
2 月 11 日,他说 ,是第一个做到这一点的开源模型。7 月 24 日,他:Fable 5 用时 42 分钟,产出 4 个文件、约 1,000 行,渲染 17 遍、检查了 54 张截图,验证完全靠视觉;Opus 5 用时 71 分钟、20 个模块、约 4,000 行,还写了测量脚本,把渲染轮廓与公开的 747-400 数据按 14 项指标逐项比对。
9 月 1 日,他「惊人,明显好于 5.0」。9 月 10 日,V4.1-Flash 发布当天,他「看起来 DeepSeek 4.1 Flash 在 Boeing bench 上很能打(还没有最终结果)」;最终结论在第二天发出。
被测的 V4.1-Flash:552B MoE 与原生视觉
据 DeepSeek 的,V4.1-Flash 是新架构家族里最小的模型,带原生视觉理解;参数量为 552B 的 MoE(混合专家架构),采用新的 Causal Encoder–Decoder 架构,输入端只有 8B 激活参数、输出端 16B,KV cache(键值缓存)所需的 HBM(高带宽内存)是前代的 1/4、SSD 存储是 1/8。
DeepSeek 还称,多方测试显示它在性能、成本、速度和总运行时间上优于旗舰的 V4-Pro,因此计划逐步淘汰 V4-Pro:从 9 月 14 日 04:00 UTC 起,所有 deepseek-v4-pro 请求会被路由到 V4.1-Flash,直到 V4.1-Pro 发布。官方生态伙伴 WorkBuddy(含 CodeBuddy)和 OpenCode 已支持这个模型。
这次评测依赖的自校验循环,要求模型「看」自己渲染的画面来判断缺陷;DeepSeek 把原生视觉理解列为 V4.1-Flash 的卖点之一。
回复里的追问:harness、router、上下文与成本
主帖的回复里出现了几个具体的复现问题。 说:「看样子我得换个 harness 了,我用 opencode 跑 DeepSeek 的结果并不满意,也许问题出在 harness 上。」 问的是接入方式:用哪个 router(路由)才能在 Claude Code 里调用 DSV4.1。 追问机制:几个小时的「检查→修复」循环,是全程同一个上下文窗口,还是 /goal 会起新的子代理;他想知道什么上下文策略让它几小时不「腐烂」。 的回复只有一句:「花了多少?」引用转发的 则写道:「当你的开放权重模型在 Claude Code 里表现最好时。」
对想自己复现的人来说,回复里的追问更具体:用什么 router 接入、这次运行花了多少钱、上下文策略是什么。