AREX Feed Article
微软发布首个网络安全专用基础模型 MAI-Cyber-1-Flash,嵌入代理式安全系统 MDASH
7 月 27 日,微软在旧金山的一场小型发布会上正式推出其首个网络安全专用 AI 模型 MAI-Cyber-1-Flash,并同步发布多代理漏洞识别与修复平台 MDASH(Microsoft Defender AI Security Harness)以及代理式安全系统 Project Perception。这是大型云平台首次推出安全垂直领域的基础模型,标志着前沿 AI 能力竞争从通用模型延伸至安全专用赛道。
模型架构:137B 总参、5B 激活的稀疏 MoE
MAI-Cyber-1-Flash 采用稀疏混合专家(MoE)Transformer 架构,总参数量 137B,但推理时仅激活约 5B 参数,上下文窗口 256K token,仅支持文本输入/输出。该模型是 MAI-Code-1-Flash 的网络安全专项微调版本,源自微软 MAI-Thinking-1 模型谱系。模型仅通过 MDASH 系统提供,不单独开放权重或独立 API 端点。
微软 AI CEO Mustafa Suleyman 与安全业务 EVP Hayete Gallot 联名发布的官方博文称,该模型的设计目标是"在复杂代码库中发现具有挑战性的漏洞"。
性能声明:CyberGym 95.95%,较 Mythos 高出约 12 个百分点
微软称,MDASH 集成 MAI-Cyber-1-Flash 与 GPT-5.4 后,在 CyberGym Level 1 基准上取得 95.95% 的成绩。据微软公布的对比数据,Anthropic Mythos 5 约为 83.8%,OpenAI GPT-5.5 Cyber 约 85.6%,Wiz Atlas 约 90.9%。今年 5 月 MDASH 首次亮相时,使用通用模型的成绩为 88.45%。
CyberGym 是 2026 年 ICLR 发表的基准,包含来自 188 个 OSS-Fuzz 项目的 1,507 个真实漏洞复现任务。Level 1 提供漏洞源码和高层描述,要求系统复现已知漏洞,但不测量盲测发现能力或补丁正确性。
分工策略:专用模型处理 90% 常规任务
MDASH 管理超过 100 个专用代理,按五阶段流水线运行:准备、扫描、验证、去重和证明。其核心成本控制策略是将约 90% 的常规安全任务交由 MAI-Cyber-1-Flash 处理,剩余 10% 最难任务升级至 GPT-5.4。微软称该方案相比此前全 GPT 配置(GPT-5.4 + 5.4 mini + 5.3 codex)降低 50% 成本。
Project Perception:多团队代理安全平台
同时发布的 Project Perception 将 AI 代理组织为三个团队:红队模拟攻击路径与威胁行为者,蓝队检测与分类风险,绿队执行修复与加固。公开预览定于 2026 年 11 月 3 日开放,但初始版本不含自主修复功能——可逆操作(如机器隔离)计划在 2026 年底推出,补丁等高危操作保持人工把关。
MDASH 首席工程师 Dave Weston 称,该平台将"数小时由多名安全专家完成的手动工作压缩至数分钟"。
防御导向设计:漏洞利用能力刻意归零
微软模型卡与 MarkTechPost 的报道均指出,MAI-Cyber-1-Flash 在 ExploitGym(漏洞利用生成基准)上三个子项——内核、用户空间、浏览器——得分均为 0/0/0。这是刻意设计:模型仅训练执行防御任务(漏洞发现、修复),不训练进攻性能力。模型经过了微软 AI 红队的四阶段评估和独立第三方评估。
微软安全业务已积累超过 100 万亿条日常安全信号,涵盖身份、端点、云端和网络层。MDASH 在今年 5 月曾通过辅助分析生成 16 个 CVE 编号,包括 4 个 Windows 网络栈中的关键远程代码执行漏洞。
待验证的问题
尽管声称的 95.95% 成绩引人注目,多个独立分析指出了需审慎对待的方面:
- 分数为自报,非公开榜单成绩。 截至 7 月 28 日,CyberGym 公开排行榜仍显示微软旧成绩 88.4%,Wiz Atlas 以 90.9% 领先。95.95% 尚未经独立第三方验证挂榜。
- 是系统分数而非模型分数。 该成绩涵盖 MDASH 整体(MAI-Cyber-1-Flash + GPT-5.4 + 100+ 专用代理),单独模型的基准表现较为温和:CVEBench 0.314、CyberSecEval4 威胁情报 0.553、恶意软件分析 0.33。
- CyberGym 为微软主导基准。 Level 1 仅测试已知漏洞复现,不涉及盲测发现和补丁正确性验证。
- 成本声明缺乏公开数据支撑。 50% 成本缩减未附带 token 用量、延迟或计算分配明细。
- 第三方评估方未具名。 微软称经过独立第三方评估,但未公开评估机构身份或报告全文。
分析师普遍认为,微软的真正壁垒不在模型本身,而在其企业安全部署的深度渗透——Active Directory、Entra 身份、Windows 端点等既有基础设施,以及无可复制的安全信号数据积累。
竞争格局
此次发布使 AI 安全赛道形成四强并立格局:微软(Project Perception/MDASH)、Anthropic(Mythos/Glasswing)、OpenAI(Daybreak,5 月推出)和 Google(AI Threat Defence)。与此同时,近期 OpenAI Agent 入侵事件和 RufRoot 满分漏洞等安全事件持续推高"Agent 时代攻防"议题热度。