AREX Feed Article
伦敦安全研究员实测:DeepSeek V4.1 Flash 花 $12.79 检出 44 个漏洞,称居所测开源模型之首
UTC 时间 9 月 9 日 14:38(北京时间当日 22:38),X 账号 @Zaddyzaddy(自称安全研究员、UCL 计算机科学博士生,标注常驻伦敦)发布了一组第一手实测结果:他给 DeepSeek 的新模型 V4.1 Flash 100 个已知存在漏洞的 pull request(PR,代码合并请求),每个 PR 限时一小时,模型共找出 44 个漏洞,审阅成本为 $12.79,折合每个漏洞约 $0.29。,在所测过的所有开源模型中,V4.1 Flash 发现「由 PR 引入的漏洞」的能力最高,「接近前沿模型的表现,成本只是零头」。
对比数字同样来自他的单方面报告:同一批 PR 中,Anthropic 的 Opus 5 找到 48 个、花费 $448,约为 Flash 审阅成本的 35 倍;xAI 的 Grok 4.6 找到 54 个、花费 $120,约为 9 倍,两个对比模型只比 Flash 多找到 4 个和 10 个。帖子发布数小时后的公开数据约为 3,200 次查看、70 余个赞、6 次转发(截至抓取时)。
一句话的方法交代和一张 bugbunny.ai 的图
主帖关于样本与规则只写了一句话,其余信息都在这张配图里。散点图横轴是审阅 100 个 PR 的总成本($0~$500),纵轴是漏洞检出率(20%~60%),图上方标题写着「How good is DeepSeek V4.1 Flash at finding vulnerabilities introduced by pull requests?」,日期标注 09 SEP 2026,角标为 bugbunny.ai / VulnPR-100。
数小时前(UTC 09:31),他曾在,DeepSeek V4.1 在 @BugBunny_ai 的漏洞检测 harness(自动化测试框架)上「好得离谱,难以置信」。BugBunny.ai 在自称「你的 AI 网络安全雇员」,主打在 Slack、Teams 里执行 pull request 安全审查与持续渗透测试等任务。测试是否由 BugBunny 平台执行、100 个 PR 从哪来、如何确认漏洞「已知」、怎样的输出算一次有效检出,主帖都没有说明,也没有附带数据集或判定记录。
把成本摊到每个漏洞上
把发帖人的两组数字折算到单个漏洞:Opus 5 每找到一个约 $9.33,Grok 4.6 约 $2.22,同口径下 Flash 约 $0.29。他据此把结论落在成本效率上,称这是「接近前沿模型水平、成本只是零头」,并称赞「@deepseek_ai 团队的这次发布令人印象深刻」。
口径要跟着他走:「开源模型中最高」只限于他自己测过的模型集合;Opus 5 的 48 个和 Grok 4.6 的 54 个同样出自他的这一次测试。图表里还有其他模型的数据点,他没有逐一说明各点的检出数与成本。
被测对象是 9 月 10 日自动下线的预览版
这条实测跑在 DeepSeek 一个尚未正式发布的预览模型上。据,DeepSeek 于 9 月 8 日下午低调开放 V4.1 Flash 的限时测试,模型 ID 为 deepseek-v4.1-flash-expires-on-0910——按命名,该版本于 9 月 10 日自动下线,测试窗口只有两天;定价与 V4 Flash 完全一致,但每个账号仅限 20 个并发请求(正式版 V4 Flash 为 2,500)。按该报道的分析,这样的并发上限只够功能验证与性能评估,DeepSeek 的这次 beta 定位是验证,而非承载生产负载。
另一组测试者 pilvar222(自称 Aikido Security AI 渗透测试负责人、常驻瑞士洛桑)也里特别注明:「注意这是预览版(deepseek-v4.1-flash-expires-on-0910),正式版很可能还会更好。」Zaddyzaddy 的实测帖发布于 9 月 9 日晚,正处两天预览窗口的第二天。
同一天的另一组独立测试:单次跑通 65.6%
同一天稍早(UTC 时间 9 月 9 日 09:51),pilvar222 发布了他对同一预览版在 Aikido 自家网络安全基准上的测试:单次运行能重新发现基准中 65.6% 的近期 CVE(通用漏洞编号,旧版为 55.2%);三次运行汇总后(pass@3)达到 84.4%,超过他基准里的 Grok 4.6、Opus 5 和 GPT-5.6-Sol;精确率从 73.8% 升到 78.9%;他称 Flash 现在以约 50 分之一的成本追平前沿模型。在他补充说,新版本更「肯干活」:在划定范围内找不到东西时会去别处继续查,每轮工具调用数从 1.7 增至 1.79;遗留问题是它常只报出漏洞入口而不描述安全影响,「我们只把描述安全问题本身、而非只提入口的报告算作有效发现」。
两组测试的样本与口径不同——一个是审阅 100 个含已知漏洞的 PR,一个是重新发现近期 CVE——无法互相验证,但作为两次相互独立的测试可以互相参照。
回复里的另一种读法与对方法的质疑
主帖下为数不多的回复里,已经出现另一种读法:「所以 Grok 比它们都好」——若只比检出数量,54 个的 Grok 4.6 确实排在 48 个的 Opus 5 和 44 个的 Flash 之前;用户 sl4x0(自称全职安全研究员)则,DeepSeek 是他用过的性价比最好的模型,「除非 DeepSeek 出更好的,否则我很难换」。
在当天更早那条称赞 harness 的帖子下,,以他的经验,DeepSeek「有点太快把话说满」,并问它在漏洞利用与验证(exploitation/proofing)上的表现如何;「DeepSeek v4.1 审查得太厉害」。针对「用已知漏洞做样本」的做法,在 pilvar222 的测试帖下,:模型可能已经在训练数据里见过这些漏洞的公开分析,「你的基准有没有控制披露日期与训练截止点,还是说这高分有一部分是把记忆当成了 pass@3?」
截至抓取时,主帖下没有出现任何声称复现或证伪的回复或引用。而被测的预览版按命名将于 9 月 10 日自动下线;正式版发布后,这次个人测试能否被独立复现,还没有公开答案。