AREX Feed Article
GPT-6 Astra 登顶 Vercel DeepsecBench:49 分钟跑完 Sol 约 4 小时的任务
Vercel CEO Guillermo Rauch(@rauchg)于北京时间 9 月 6 日凌晨 1 点 11 分(UTC 9 月 5 日 17:11)宣布:OpenAI 的 GPT-6 Astra 已在 Vercel 运营的网络安全基准 DeepsecBench 上成为「全球最好的网络安全模型」。他给出的两组对比数字是:「它用 49 分钟完成了 Sol 花约 4 小时做的事,分数更高,成本几乎相同。它比 Claude Opus 5 max 更有效,还便宜 50%」。
这不是 Rauch 一个人的口径。同一消息,比他早约 13 分钟,措辞也更保守:Astra 单任务成本「略高于上一任榜首 5.6 Sol」,同时把跑分用时缩短了两个多小时。两人附的是同一个链接——。
图:Vercel AI Gateway 为 GPT-6 Astra(openai/gpt-6-astra)生成的。
榜首这一行,每个数字都经得起核对
北京时间 9 月 6 日凌晨 2 点 35 分查询的排行榜页面显示,榜首是 GPT-6 Astra 的高推理档(xhigh,openai/gpt-6-astra):37.79 分,查全率(recall)32.8%,查准率(precision)97.9%。
Astra 在 232 条人工判定漏洞中找出 76 条、误报 2 条,跑分用时 2,986.9 秒(49 分 47 秒),成本 63.70 美元。
第二名是 GPT-5.6 Sol xhigh:35.44 分,找出 71 条,用时 3 小时 39 分 2 秒,成本 55.98 美元。第三名是 Anthropic 的 Claude Opus 5 max:32.44 分,65 条,2 小时 34 分 19 秒,成本 127.93 美元。
Rauch 推文与榜单逐条对得上:49 分 47 秒对「约 4 小时」的 Sol;37.79 分高于 35.44 分;63.70 美元比 Opus 5 max 的 127.93 美元低 50.2%,「便宜 50%」成立。
需要斟酌的是「成本几乎相同」:Astra 比 Sol 的 55.98 美元贵约 14%,Vercel 官方账号的「略高于」更贴近数字。
Astra 的中档配置(medium)同样在榜,排在第四:29.33 分,用时 21 分 49 秒,成本 35.20 美元,找出 58 条漏洞。
Vercel 自建的考场:题面保密,三次跑分取中位数
DeepsecBench 是 Vercel 今年 7 月 27 日随发布的基准。测法是把一个开源代码库停在大量漏洞被修复之前的提交状态,选出 50 个入口文件,以 231 条人工判定发现为答案集(golden set;当前排行榜每行显示的总题量已变为 232 条)。
模型找到答案集之外的发现时,由裁判模型判定真假,计入查准率。分数是查全率权重两倍的 F2 值(Score = 100 × 5PR/(4P+R)),Vercel 的解释是:漏掉的漏洞不会自动修复,误报至少不会让代码库更不安全。
防作弊靠保密:基准的仓库、提交、文件与答案全部不公开,「模型背下修复方案就能拿接近满分的查全率」,但发布时最好的成绩只找到 30.7% 的漏洞,25 次跑分里 20 次低于 20%。每次跑分执行三遍,公布中位数。
成本口径也写明了:跑分成本只覆盖 50 个文件,真实生产代码库约为其 100 倍,全量扫一遍按当时榜单价格约 1,200 美元(Kimi K3)到超过 5,000 美元(当时最强的 OpenAI 前沿模型)。
所有跑分经由 Vercel AI Gateway 完成,博客原文说得很直白:「我们在基准中用的同一条路由,可以用来跑你的安全扫描程序」。基准与网关生意共用一套基础设施,解读榜单时值得留意。
发布两天上榜,网络安全正是 Astra 被单独设限的一块
Astra 是 OpenAI 9 月 3 日(周四)发布的新旗舰,称总裁 Greg Brockman 称之为「代际飞跃」,并在发布会结束时说「欢迎来到 AGI(通用人工智能)时代」。
自称 Astra 在网络安全、软件工程、computer use(让模型直接操作电脑完成任务)等多项评估上达到新水平,其中 ExploitBench 取得 100%。
而网络安全正是这次发布中被单独设限的一块。OpenAI 在 9 月 1 日的中说明,Astra 是其首个达到准备框架(Preparedness Framework)「关键」级网络安全阈值的模型:在配备工具与权限后,无需人工逐步指导,即可在防护严密的系统中发现此前未知的漏洞并制定利用策略。
因此其高级网络安全能力初期只向一组测试人员开放,随后通过 Daybreak Blue 扩大至防御性用途。
同文中 OpenAI 还称,Astra 在包含 20 个近期披露的 V8 高危漏洞的内部移植版测试里,用远少于 GPT-5.6 Sol 的 token(词元)取得更高的任意代码执行成功率;评估期间还发现并利用了链入同一条漏洞利用链的两个零日漏洞,正报送厂商。
这些是 OpenAI 的单方口径。DeepsecBench 这次更新提供的,是一组来自模型厂商之外的公开测量:用时、成本、查全率与查准率,而不是模型厂商自报的分数。
评论区真正在意的差距是时间
截至 UTC 18:40(发推约一个半小时后)的快照,Rauch 的推文获 458 赞、37 条回复、约 2.5 万次浏览。翻看回复,不少人的重点不是分数本身,而是 49 分钟对约 4 小时的时间差。
自称做营销的 Sammie(@nexgencoded)说:「49 分钟对约 4 小时是我真正在意的差距,不是因为分数更好看,而是它开始改变团队在生产里实际能跑什么」。
自称 AI 工程负责人的 Mikhail Rogov(@i_mika_el)得更直接:「49 分钟对 4 小时才是真正的标题;省钱的次要,速度快到能让你更频繁地跑才重要」。
两条回复读了榜单的细账。自称在 AudaciousHQ 做 AI、曾任 GoCodeoAI CTO 的 Jatin Garg(@jatingargiitk):「中档跑更有意思,29 分、21 分钟、35 美元,接近 Opus 5 max,但便宜到可以每次合并都跑」。
自称 2023 年发明 serverless 向量数据库的 John Rood(@johnroodepic)精度与查全的组合:「97.9% 查准率配上 32.8% 查全率才是真实的生产形态。几乎没有误报,但仍然漏掉三分之二的漏洞。跑在每次合并上可以,别拿它替代完整审计」。
一句运营方口径的「全球最佳」,以及缺考的 Fable
边界要分清:榜首名次、用时与成本这些数字来自 Vercel 运营的公开页面,可以自行复核。
「全球最佳」是基准运营方 CEO 的定性,而 DeepsecBench 连同跑分所用的 AI Gateway 路由都是 Vercel 自己的产品。
另一个对照组缺席。7 月发布基准时 Vercel 就写明:Anthropic 当时最强的模型 Fable 5 不在榜上,因为它拒绝安全任务,包括防御性任务。
9 月 5 日,:「测过了,Fable 拒绝」("We have. Fable refuses")。目前 Anthropic 在榜的最高分仍由 Claude Opus 5 max 保持,而 Fable 是否、何时参测,Rauch 没有给出时间表。