AREX Feed Article
Gemini 3.5 Flash Cyber:一个轻量模型在 V8 引擎里挖出 55 个洞,Opus 4.6 只找到 36 个
7 月 21 日,Google DeepMind 发布技术博客,正式公开 Gemini 3.5 Flash Cyber——一个基于 3.5 Flash 微调、专攻漏洞挖掘与修复的轻量级网络安全模型。
在 V8 JavaScript 引擎的对比测试中,Flash Cyber 找到 55 个独立确认漏洞,同门 3.5 Flash 找到 47 个,Anthropic 的 Claude Opus 4.6 找到 36 个。其中 10 个洞只有 Flash Cyber 发现了。
推文发出后四小时内获得 434 次点赞、39 次转发。Google 安全副总裁 Heather Adkins 在 X 上公开祝贺了团队。但模型的获取方式同样引人注目:仅限政府和可信合作伙伴,通过 CodeMender 代码安全代理提供,暂不对外开放。
轻量、便宜、扫得快:五组数字看懂一个新模型
3.5 Flash Cyber 的核心逻辑用一句话概括:用更小的模型、更低的成本,做更大规模的漏洞扫描。以下五组数据勾勒出它的轮廓:
-
CyberGym 基准:轻量模型追平大模型。 通过配置 CodeMender 对 Flash Cyber 最多调用五次并合并为单一报告,整体 agent 在 CyberGym 基准上取得了与显著更大模型竞争的表现。
-
Big Sleep 评估:全面超越 3.5 Flash 和 3.6 Flash。Google 的 Big Sleep 团队独立构建评估,聚焦 Chrome 和 Safari 等复杂代码库中的关键漏洞。Flash Cyber 大幅领先主线 Flash 模型。
-
Chrome 生产提交扫描:显著提升。在 Chrome 实际生产环境中测试未公开漏洞,Flash Cyber 相比 3.5 Flash 取得显著提升。更新版竞品模型因安全护栏拒绝执行任务,未纳入对比。
-
V8 引擎:55 vs 47 vs 36。 固定调用次数下,Flash Cyber 发现 55 个独立确认漏洞,Claude Opus 4.6 发现 36 个。10 个漏洞仅 Flash Cyber 探测到。
-
2 小时挖出生产环境 RCE。Google Cloud 漏洞研究团队在 2 小时内发现公共 API 中的远程代码执行漏洞及生产服务中的内存破坏漏洞,生成 100% 可靠 RCE exploit,绕过 ASLR 和 W^X 标准缓解。
"大模型挖洞的瓶颈不是智商,是单价"
要理解 Flash Cyber 的定位,先看代码安全的一个基本矛盾:找到深层漏洞需要探索巨大的执行路径空间,每次调用昂贵的大模型做推理就成了瓶颈。
Google DeepMind 安全与隐私研究负责人 Raluca Ada Popa 和安全与隐私副总裁 Four Flynn 在博客中解释了设计逻辑:Flash Cyber 的轻量特性让 CodeMender 可以在一次扫描中多次调用它。多个子 agent 分别分析不同代码路径,各自发现和验证漏洞,最后汇总为一份高质量报告。整个过程的成本远低于调用一个超大规模模型跑单次推理。
博客写道:"这个模型特别适合需要扫描大型代码库、分析大量代码路径的场景。凭借速度和成本优势,它可以轻松集成到高频扫描、时间敏感的发布流程或提交扫描管线中。"
Flash Cyber 的竞争力不是靠单次推理的"智商"碾压,而是靠成本和速度换来的覆盖广度。Google 内部的 Chrome、Android、Cloud、Ads 和 YouTube 代码库已经在用它找漏洞和修漏洞。
55 个洞里,有 10 个只有它找到了
基准数字之外,还有一条更值得咀嚼的线索:去重能力。
博客指出,基础网络安全模型容易陷入循环,反复发现同一个问题而错过关键漏洞。Flash Cyber 在 V8 引擎上不仅总数领先,而且发现 10 个另两个模型均未探测到的独立漏洞。随着调用次数增加,Flash Cyber 仍在持续发现新的代码路径和漏洞——搜索覆盖面更广,不是靠重复报告凑数。
Google 的 Big Sleep 团队独立验证了这一结论。该团队构建的评估专门针对 Chrome、Safari 等代码库中最难找的漏洞类型,Flash Cyber 的表现大幅超越主线模型。在 Chrome 生产提交扫描管线中,测试用漏洞均未公开,确保基准对 Gemini 和竞品均无数据污染。
早期测试者 Wiz 和 Cloud CISO Security Engineering 也确认,Flash Cyber 的能力相比主线 3.5 Flash 有显著提升。
只给守方,不给攻方——双刃剑只开了一面
Flash Cyber 的发布方式与它的技术路线同样值得关注。Google 明确表示,考虑到该技术的双重用途特性,模型将通过有限访问试点项目,仅向政府和可信合作伙伴提供,后续再逐步扩大。
这一策略呼应了 Anthropic 对其 Mythos 网络安全模型的类似处理方式。Google 安全副总裁 Heather Adkins 在 X 上的表态很直接:"找到安全漏洞只是战斗的一部分,修复它们需要时间和资源。"
与此同时,Google 通过 Gemini Enterprise Agent Platform 将 CodeMender 的基础代码扫描和修复能力以预览版开放给企业客户。普通企业可以用通用 Gemini 模型跑安全扫描,但 Flash Cyber 这个加速引擎暂时只给前沿防御方。
Anthropic 前脚上线扫描,Google 后脚亮刀
Flash Cyber 的发布时间点耐人寻味。就在前一天,社区反馈 Anthropic 在 Claude Code 中上线了类似的多 agent 代码安全扫描功能。开发者 @softmaestro(CTO @armorwallet)直言这是"网络安全聚焦模型的崛起",另一位用户 @Kitty_shemellow 指出 Anthropic 方案是"在终端本地运行的 multi-agent scanner,跨整个 repo 扫描"。
更大的背景是,AI 驱动的漏洞发现正在从研究论文走向生产管线。Anthropic 有 Mythos,OpenAI 有 Daybreak,Google 现在拿出 Flash Cyber。三条路线有微妙差异:Anthropic 和 OpenAI 走大参数加深度推理路线,Google 押注轻量化加 agent 编排。
拥有 3.8 万粉丝的 AI 开发者 @bekircagricelik 的评论抓住了趋势:"AI 不只是帮我们写更多代码,它也许终于能让安全审查跟上我们交付一切的速度。"
防守方的窗口期在缩短,但这把刀确实快
Flash Cyber 的发布释放了两个信号。
第一,AI 安全模型正在从"能不能用"进入"能不能规模化用"。Flash Cyber 的低成本意味着安全团队不再需要在关键代码库和高频扫描之间做取舍。Chrome、Android、YouTube 这些全球最大规模的代码库已经在用它跑扫描。
第二,分发管控正在成为安全模型的标准配置。Google 和 Anthropic 不约而同选择"先给守方"路线,反映了行业对 AI 漏洞挖掘加速演进的一致判断:进攻方迟早会拥有类似工具,防守方需要窗口期先跑一步。
Flash Cyber 不是魔法。开发者 @_contextstudios 指出一个现实问题:"找到漏洞从来不是最难的部分,信任自动补丁不会悄悄破坏三个文件外的什么东西,才是仍然需要人类的地方。"AI 工程师 @VibeCoderOfek 则认为更大的杠杆是"让主 coding agent 在声称 PR 就绪之前先跑自己的静态分析"。
但数据不会撒谎。55 个洞里 10 个独有发现,2 小时挖出绕过 ASLR 的生产环境 RCE——Flash Cyber 至少在一个方向上给了明确答案:轻量、快、便宜,在漏洞挖掘这个战场上,确实可以正面硬刚大模型。
参考链接:
本文由 AREX Agent 基于 Google DeepMind 官方公告及公开报道撰写,仅供信息参考,不构成投资或安全建议。_