AREX Feed Article
微软掏出首款安全模型,Suleyman 放话:Mythos、Gemini、GPT 全输了
TL;DR — 7 月 27 日,微软在旧金山发布首款自研网络安全模型 MAI-Cyber-1-Flash 和 agentic 安全平台 Project Perception。MDASH 系统搭载该模型与 GPT-5.4 后,在 CyberGym 基准上跑出 95.95%,比 Anthropic 的 Mythos 5 高出约 12 个百分点,成本仅为此前方案的一半。Project Perception 以红、蓝、绿三色 agent 编队实现攻击模拟、漏洞检测和自动修复的闭环,8 月 3 日开放公开预览。CEO Satya Nadella 亲自发推,Mustafa Suleyman 在台上逐一点名四个竞争对手——微软正式杀入 AI 安全赛道。
96%,成本砍半——微软把安全牌桌掀了
7 月 27 日,旧金山。微软 AI 首席执行官 Mustafa Suleyman 站上台,一口气念出了四个名字:Gemini、GPT-5.5 Cyber、GPT-5.6 Sol、Mythos 5。
"我们把它们全打下去了,"Suleyman 说。他指的是 CyberGym——AI 安全领域公认的基准测试,用 1507 个真实漏洞复现任务衡量系统在大型代码库中推理并找出漏洞的能力。
微软给出的数字是 95.95%。作为参照,Anthropic 的 Mythos 5、Google 的 Gemini、OpenAI 的 GPT-5.5 Cyber 等竞品得分落在 83.2% 到 85.6% 之间。差距超过 10 个百分点。
与此同时,微软宣布这套配置的运行成本比此前方案降低了约 50%。不是模型稍微便宜了一点,是直接砍半。
"我们立刻把它投入生产,"Suleyman 补充道。
Nadella 亲自发推,Suleyman 站上旧金山一口气点了四个对手
Satya Nadella 的推文在 24 小时内拿下了 547 次转发、5238 个赞、58 万次浏览。这位微软 CEO 罕见地亲自为单款安全产品站台,且在推文中点出了这轮发布的核心逻辑:"将 harness、context/signals 和 action space 与单一模型家族解耦——这才是把成本打到极致的关键。"
Suleyman 在 VentureBeat 专访中说得更直白。当被问及为何要在系统中保留 OpenAI 的 GPT-5.4 作为兜底模型时,他回答:"GPT-5.6 太贵了。GPT-5.4 相对于其成本来说非常出色。整场游戏就是降低成本——Mythos 这些模型极其昂贵,而客户要的是更便宜地拿到更好的效果。"
微软安全业务副总裁 Hayete Gallot 则把 Perception 定位为速度答案:"攻击者已经在用 AI,防守方必须用 AI 对抗 AI,而且要在攻击者拥有的速度和规模上做到这一点。"
Perception 首席工程师 Dave Weston 给出的时间对比更直观:过去需要安全团队里多个专业角色花数小时完成的工作——漏洞发现、优先级排序、检测、态势修复、代码修复,"现在几分钟就搞定了。"
安全社区的反应同样迅速。拥有 6700+ 粉丝的微软 MVP Maarten Goet、伦敦安全研究者 Prasenjit Sarkar、华尔街快讯账号 Wall St Engine(42 万粉,463 赞)均在第一时间转发并解读。Sarkar 的分析尤为精准:"每家主流安全平台都在向同样的架构收敛——CrowdStrike 的 Charlotte AI、Google 的 Unified Security、Palo Alto 的 Cortex XSIAM。微软的差异在于,它在每个节点上放了什么。"
五月 MDASH 才拿了 88%,七月就拉到 96%——中间发生了什么
今年 5 月,微软首次对外披露 MDASH 系统时,CyberGym 得分是 88.45%。当时这个成绩已经是公开排行榜最高分,领先第二名约 5 个百分点。
两个月后,同一个系统跑到了 95.95%。提升的幅度恰好揭示了一个事实:MDASH 本身就是一个不断自我进化的攻防飞轮。
微软安全响应中心(MSRC)每天接收漏洞报告,微软的身份、终端、云、数据、浏览器、应用堆栈上每天有超过 100 万亿条安全信号流过,160 万企业客户在这些产品上被攻击、被防御、被修复。每一个"发现漏洞 → 确认利用 → 阻断利用 → 实际修复"的完整链路,都在为模型提供训练信号。
Suleyman 对此毫不掩饰:"这是一个竞争对手无法复制的数据护城河。不仅是数据量,还有几十年积累的专业知识,以及整个机构经历这些过程后留下的经验。"
往前回溯,Anthropic 在 2026 年初通过 Glasswing 计划向少数合作企业推出 Mythos 安全平台,OpenAI 则在 5 月启动了名为 Daybreak 的安全方案。微软入场的时间不早不晚——恰好卡在 AI 安全从"概念验证"向"生产部署"过渡的节点上。
137B 总参数只激活 5B,90% 任务自己扛,剩下的扔给 GPT-5.4
MAI-Cyber-1-Flash 的核心规格可能出乎大多数人的预期。
它是一台 137B 总参数、仅 5B 激活参数的稀疏 MoE 模型,256K 上下文窗口,纯文本输入输出。架构源自 MAI-Thinking-1 系列,在 MAI-Code-1-Flash 的基础上做了安全专项微调。换言之,这是一个不到主流旗舰模型百分之一规模的小模型。
但小模型的价值不在单打独斗,而在路由架构中的定位。
MDASH 系统内部管理着超过 100 个专业化 agent,分为 Prepare、Scan、Validate、Dedupe、Prove 五个阶段运转。Auditor agent 负责发现,debater agent 通过"争论"来验证漏洞是否真实可利用,最后的 Prove 阶段则直接对 C/C++ 目标执行触发输入并挂上 ASan 检测。
MAI-Cyber-1-Flash 被设计来处理其中 高达 90% 的任务。只有遇到真正棘手的 10%,系统才会把问题升级到 GPT-5.4。这套路由逻辑带来的成本节省是 50%,对比对象是此前用 GPT-5.4 + 5.4 mini + 5.3 codex 拼凑的配置。
还有一组数据值得留意。独立终端测试中,该模型在 CVEBench 得分 0.314,CyberSecEval4 威胁情报 0.553,CRSBench 0.651。但在 ExploitGym 的三个子项上——内核 / 用户态 / 浏览器利用——三项全部为零。这是故意为之:模型被训练成只做漏洞修补,不编写攻击利用代码。对一个面向企业防守的产品来说,这既是安全承诺,也是合规底线。
同样关键的还有 MDASH 的历史验证记录:在回顾测试中,它从 Windows 内核驱动 clfs.sys 的 28 个 MSRC 案例中挖回了 96%,从 tcpip.sys 的 7 个案例中全部命中。此前,MDASH 辅助生成的工作已经产出了 16 个 CVE,其中包括 4 个 Critical 级别的远程代码执行漏洞。
当 CrowdStrike、Palo Alto、SentinelOne 都在堆 agent,微软掏出了数据底牌
2026 年的企业安全市场出现了一个清晰的收敛方向:每一家主流平台都在向 agentic 架构迁移。
CrowdStrike 的 Charlotte AI 在编排专业检测 agent,Google 的 Unified Security 跑着 Gemini 驱动的分析链,Palo Alto 的 Cortex XSIAM 在做自动调查到响应的闭环,SentinelOne、Darktrace、Palantir 今年全部在输出 agent 层产品。
微软的不同在于两张牌。
第一张是模型牌。MAI-Cyber-1-Flash 不是通用模型套个安全外壳,而是从训练阶段就埋在微软安全数据里的专用模型。Suleyman 在访谈中透露了一个关键信息:"我们只用到了不到 1% 的数据。"如果这个数字属实,意味着微软的安全模型进步空间才刚刚打开。
第二张是数据牌。100 万亿条日活安全信号、160 万企业客户在真实环境中的攻防记录、MSRC 几十年的漏洞数据库——任何模型实验室都无法通过购买或合成数据来复现这个语料池。Suleyman 直接称之为 "data moat"。
反映到 Project Perception 上,这套平台不只是 agent 的集合,而是一个六层架构的完整安全栈:信号与传感器 → 安全上下文 → 多模型选择 → 编排层(harness) → agent 层 → 执行器。关键在于,安全上下文层把原始信号转化为 token 高效的语义表示,让 agent 不需要每次都重新解析环境状态——这直接决定了持续防御场景下的成本基线。
绿队 agent 的实际价值值得单拎出来说。业内观察者 Prasenjit Sarkar 指出,"大多数平台都在绿队这一步止步了——真正自动写修复代码并部署。如果它在实践中奏效,平均修复时间(MTTR)将从几周压缩到几小时。这才是安全买家愿意掏钱的指标。"
Suleyman 说下一个模型"会非常惊人"——这才刚起了个头
微软进入安全模型赛道的时间并不长。Suleyman 坦言团队"没在这个方向上工作太久",但紧接着扔下一句话:"下一个模型会非常惊人。"
这不是一次模型发布,而是一场系统级竞争的序章。微软的赌注很清楚:在企业 AI 安全这场长跑里,赢家不会是那个造出最大模型的人,而是能把专用模型、多模型路由、安全上下文和十余年的攻防数据拧成一台持续自进化的机器的那个人。
它的护城河不在模型权重里,在每天流过的 100 万亿条信号里。
转载声明:本文基于 Microsoft AI 官方博客、Microsoft 官方博客、TechCrunch、VentureBeat、iAfrica、MarkTechPost 及 X/Twitter 公开讨论编写,数据截至 2026 年 7 月 28 日 12:00 UTC。
Sources