AREX Feed Article
Aikido 渗透测试负责人实测:DeepSeek V4.1 Flash 预览版 CVE 单次复现率升至 65.6%,自称超过 Grok 4.6、Opus 5、GPT-5.6-Sol
网络安全公司 Aikido Security 的 AI 渗透测试负责人 Philippe Dourassov 9 月 9 日在 X 上发布了对 DeepSeek V4.1 Flash 预览版(模型标识 deepseek-v4.1-flash-expires-on-0910)的一手实测:在 Aikido 自有的网络安全基准上,模型单次运行能复现 65.6% 的近期 CVE(通用漏洞披露编号),旧版为 55.2%;三轮运行取并集(pass@3,即三次中至少一次命中即计入)达到 84.4%,旧版为 75%。 按他的口径,这个 pass@3 成绩高于同一基准中的 Grok 4.6、Opus 5 与 GPT-5.6-Sol;对单任务成本差距,他的估算是约 50 倍。
他同时注明,测的是预览版,「正式发布版很可能更好」。整组结果以三条推文连同图表发出,收尾一条感谢 DeepSeek 团队为跑分提高了调用限额,并附上让外部团队在自家代码上运行同一套 harness(评测框架)的入口。 这批数字出自 Aikido 自维护的基准,由 Dourassov 一方测试并发布。
误报变少,单任务开销更低
同一篇帖子还给出两组配套数字:精度(提交的发现中被接受的占比)从 73.8% 升到 78.9%,他写道模型噪声更少、报告的误报变少;缓存命中率从 94.5% 升到 95.5%,叠加每回合能执行更多动作,单任务价格随之下降。
更肯干,但报告里仍常缺「安全影响」
补充了行为层面的变化:范围内找不到漏洞时,Agent(AI 智能体)会转去排查其他位置,而不是停下;每回合的工具调用数从 1.7 升到 1.79,仍远低于 GPT-6 Astra 的 4.67。他总结,新模型「既更聪明,也更坚持」。
他同时承认一个遗留毛病:新模型经常找到并报告 bug,却不查看和描述安全影响,往往只给入口点。Aikido 只把描述了安全问题(而非仅指出入口点)的发现计为有效,这条规则直接决定哪些报告算作命中。
烧掉 117 亿 token 的基准怎么测
这次跑分所依赖的方法,Aikido 在 8 月 21 日发表的博客里公开过,署名作者之一正是 Dourassov。那篇题为「我们烧掉 117 亿 token 只为找出最好的网络安全 AI 模型」的报告写道:团队从真实仓库中挑选 32 个近期披露的 CVE,让每个模型把 32 个案例各跑三轮(共 96 轮),Agent 每轮最多 30 个回合、无互联网访问,案例、提示词、工具与评估规则全部冻结;选近期披露的漏洞,为的是降低模型在训练中见过漏洞、writeup(漏洞披露后的分析文章)或补丁、凭记忆作答的可能。
那份报告中的旧版 Flash(模型标识 V4 Flash 0731)三轮取并集复现 24/32,即 75%,也就是本次推文里旧版 pass@3 的成绩,三轮成本约 108 美元。作为参照:三轮 DeepSeek V4 Pro 0813 花约 295 美元复现 28/32,超过 Opus 5、Grok 4.6、GPT-5.6-Sol 的任何单轮(那些单轮每次约 450~590 美元)。本次推文没有重述新一次测试的题量与逐项开销,新旧对比均以百分比给出。
便宜的那一端:成本—召回曲线
随帖图表把成本与召回画在一起:横轴是按对数缩放的战役成本(campaign cost),纵轴是复现的 CVE 比例;空心、半实、实心圆点分别代表一轮、两轮与三轮取并集,带圈的点位于帕累托前沿。按图中坐标,DeepSeek V4.1 Flash 的战役成本约 60 美元,处在最便宜的一端;最贵一端的 GPT-6 Astra 以约 4,000 美元换回约 90% 的复现率。Dourassov 由此写道,「单任务成本差距巨大」。
「近期 CVE」与训练数据:记忆污染之问
发帖后数小时,多位 X 用户在回复中追问这组数字的边界。Rompel(账号 ukrroot)指出,复现已知 CVE 与发现未知漏洞不是同一种能力——模型可能只是在训练数据里读过 writeup——并问基准是否控制了披露日期与训练截止时间的关系。 Dourassov 回答,题集只取最近披露的 CVE,刷新机制是一旦看到模型凭记忆复现就换题。
Marius Laurusevicius 问得更具体:基准条目是否私有,是否跟踪披露日期,以防新 checkpoint 已经在训练中读过 writeup。 Dourassov 确认条目是公开 CVE、并不私有,题集始终选自最新披露的一批。
机器学习工程师 Sebastian Buzdugan 则从统计角度发问:三轮运行的失败模式若相关,84.4% 会高估实际覆盖——这些尝试真的独立吗? Dourassov 答复称各次尝试确实独立、结果分别汇总再去重,也承认「噪声会随具体配置迅速累积」。
Rompel 随即把问题推向时间尺度:一个 CVE 从披露到进入训练数据要多久,披露后一个月内会不会已经出现污染? 截至本文检索时,这条追问还没有公开回复;而关于刷新机制的那条答复,也没有给出时间窗的量化数据。