AREX Feed Article
OpenAI 把安全审计武器开源了,Hacker News 发现得比官方公告还快
OpenAI 于 7 月 28 日悄悄将 Codex Security CLI 以 Apache 2.0 许可证开源,一个用于扫描代码仓库漏洞、追踪修复进度、接入 CI/CD 流水线的命令行工具。Hacker News 在 OpenAI 官推发布前数小时就挖出了这个仓库,让 OpenAI 在推文中自嘲"还没来得及在这里分享"。
一个独立的安全 agent,而不是代码助手的附赠品
Codex Security CLI 的核心定位是:用 AI 驱动的推理能力,对代码仓库执行安全审计。它不是 Codex CLI 的一个子命令,而是一个独立工具,有自己的认证体系、扫描模型和结果管理。
安装只需一行:
npm install @openai/codex-security扫描同样简单:
npx codex-security loginnpx codex-security scan .工具支持 macOS、Linux、Windows,需要 Node.js 22 以上和 Python 3.10 以上。认证方式支持 ChatGPT 账号登录和 API Key 两种——后者专为 CI 环境设计。
扫描完成后,工具会生成一份结构化的结果目录:findings.json 记录每个漏洞的严重程度、置信度、位置和修复建议;coverage.json 标记哪些代码路径已被审查、哪些被跳过;report.md 是可读的摘要报告。导出格式支持 SARIF、JSON 和 CSV。
Codex Security 默认使用 gpt-5.6-sol 模型,推理力度设为 extra-high。这意味着每次扫描都在调用目前 OpenAI 最强的推理模型。用户可以通过 --model gpt-5.6-terra 切换模型,或通过 --max-cost 5 设定单次扫描的美元预算上限。
不止扫描:验证、修复、追踪一个闭环
Codex Security 的扫描能力覆盖了四种场景:全仓库扫描、路径限定扫描、基于 diff 的变更审查、以及工作区变更审查。扫描模式还支持 --mode deep 进行更广泛的审查,用户可以通过 --knowledge-base 传入架构文档、威胁模型或安全策略文件,让扫描结果与系统实际设计对齐。
但真正让它区别于传统静态分析工具的,是扫描之后的三个动作。
验证(validate):把"可能有问题"变成"确实有问题"。 工具不是简单地报一个"可能存在 SQL 注入",而是在隔离环境中尝试复现攻击路径,确认漏洞是否真实可利用。这意味着安全团队不用再手动验证每一个告警——而这个手动验证环节恰恰是传统 SAST 工具误报率高居不下时,团队最耗人力的地方。OpenAI 在 3 月研究预览阶段披露的数据显示,Codex Security 在 30 天内扫描了超过 120 万次 commit,识别出 792 个严重级别和 10,561 个高级别漏洞,并为开源项目提交了 14 个 CVE。
修复(patch):从发现到补救一步到位。 对确认的漏洞,工具能生成修复建议代码。生成的补丁仍需要人工审核,但至少把"发现问题→编写修复→验证修复"的循环压缩进了同一个命令行工具。结合 scans compare,安全团队可以跨扫描追踪同一漏洞的状态变化:哪些漏洞是新增的,哪些仍在持续,哪些已被修复——直接回应了安全团队最头疼的问题:修完的漏洞有没有真的被关上,还是只是被挪到了另一个文件里。
CI/CD 集成是另一个关键设计。--fail-on-severity high 在扫描发现高危漏洞时返回非零退出码,可以直接阻断流水线。更精细的是,未完成扫描或工具自身运行错误会返回退出码 2——这个设计避免了"扫描工具挂了但流水线绿灯通过"的灾难场景。install-hook 命令则为仓库安装 pre-commit 钩子,在每次提交前自动扫描变更而不覆盖已有的钩子脚本。
批量扫描能力也为大型组织设计。通过 bulk-scan 命令,团队可以用 CSV 文件列出所有待扫描的仓库,指定并行 worker 数量(文档中示例为 4 个 worker),并支持断点续扫——已完成的仓库不会被重复扫描。Docker 支持也已就位,提供加固的 Compose 配置和安全配置文件。
从 Aardvark 到 Codex Security:一条走了五个月的路
Codex Security 的起点可以追溯到今年年初。项目最初以内部代号 "Aardvark" 进行私有测试,3 月 6 日以 Codex Security 研究预览的名义公开,当时的功能是通过连接 GitHub 仓库生成威胁模型、审查历史提交、在隔离环境中尝试验证漏洞并生成修复补丁。
7 月 28 日的开源发布将这个扫描能力从云端拉到了开发者的本地终端和 CI 管道里,同时提供了 TypeScript SDK 供其他工具集成。
项目的 GitHub 仓库 openai/codex-security 在 7 月 13 日就已创建,但直到 7 月 28 日才在 npm 上发布了第一个公开版本 0.1.0,当天又发布了 0.1.1 修复版本。目前仓库已获得超过 220 颗星,主要贡献者包括 mldangelo-oai(32 次提交)、ianw-oai(12 次提交)等 OpenAI 内部工程师。
产品负责人是 Thibault "Tibo" Sottiaux,OpenAI 的 Codex 负责人。根据其公开履历,Sottiaux 此前在 Google DeepMind 负责 Gemini 的人类数据工作和机器学习工作流基础设施,拥有 Université catholique de Louvain 的计算机科学、计算数学和应用数学学位。他在 X 上以 @thsottiaux 身份活跃,7 月 28 日亲自发布了开源公告。
竞品环伺,但分发给 OpenAI 铺好了路
Codex Security 进入的是一个已有重兵把守的市场。Semgrep 结合了确定性静态分析和 AI 辅助修复,2025 年以来正在从规则引擎向 AI 平台转型;GitHub 的 Copilot Autofix 能从 CodeQL 告警自动生成修复代码,其 agentic 模式还能在仓库中探索上下文并重新运行 CodeQL 验证修改;Snyk 则在开发流程中加入了面向 agent 的控制和自动化修复,覆盖从代码到容器的全链路。Checkmarx 和 Veracode 等老牌厂商同样在各自的平台上集成了 AI 辅助分析。
在这样一个成熟市场里,OpenAI 的差异化路径有两条。
第一条是推理深度。Codex Security 会为每个被扫描的项目构建信任边界、敏感数据和攻击者入口点的模型,然后尝试验证攻击路径后才呈现发现,而不是依赖预设的规则签名和已知漏洞模式。传统 SAST 工具的最大痛点不是漏报,而是误报——安全团队被海量低质量告警淹没,最终选择将整个工具静音。Codex Security 的设计逻辑是用更强的推理能力降低误报率,让每一条告警都值得被认真对待。
第二条是分发优势。OpenAI 在 6 月 2 日宣布 Codex 周活用户突破 500 万。让这些开发者在自己已经熟悉的终端和 CI 环境里多跑一条安全扫描命令,比说服他们安装一个全新的安全平台容易得多。一位开发者 kimiku07 在 X 上的评论很能说明问题:"终于有东西能塞进 CI/CD 了,不用先写 200 行 YAML。"
在 X 上,开发者的反应分成了清晰的两派。
正面评价集中在 CI/CD 集成和修复验证能力。安全从业者 NateOnTop 的分析获得了多位开发者的认同:"找到漏洞从来不是最难的部分。Semgrep、CodeQL、Snyk 都能做到,但团队最终会把每一项都静音,因为误报淹没了真正的发现。值得关注的是 'verify fixes':确认补丁真的堵住了漏洞,而不是把它移到了别处。"拥有 8.1 万粉丝的 Zack Voell 则借机表达了对 OpenAI 近期产品节奏的认可:"很棒。我曾经是 Claude 的忠实用户,但已经有一阵子不是了,继续前进。"
开发者 luckeyfaraday 从实用角度给出了评价:"对 vibe coded 应用的安全审计来说是巨大的进步。Fable 5 根本做不了这个。"这条评论点出了一个正在扩大的需求场景——AI 辅助编码工具的普及带来了大量自动生成代码,但这些代码的安全审计一直缺乏同样自动化的工具。
负面反馈集中在早期版本的稳定性。多位用户报告了扫描中途崩溃的问题。开发者 Clawdrey 尝试扫描后反馈"能通过认证、开始扫描、然后在保存结果时崩溃",并附上了错误截图。另一位用户 daengbo 尝试了两次扫描均遇到错误,且工具声称部分日志在空目录中。开发者 jlave_dev 则表示扫描运行了 20 分钟没有任何输出。
这些反馈与 OpenAI 在推文中主动标注的"early release"定位一致。npm 包版本号 0.1.1 和 README 中"public API may change between minor versions before 1.0.0"的声明,进一步确认了这是一个仍在快速迭代中的产品。有人质疑为什么需要又一个独立 CLI 而不是合并到 Codex 主工具中,中国开发者 bc1cody 的困惑代表了一类声音:"ChatGPT 和 Codex 已经合并了,这是好事。本来我指望那天会把 Codex CLI 也合并了,结果又多出来另一个 CLI。"
AI 写代码的速度跑赢了审代码的速度
Codex Security 开源最值得关注的一点,不是它比 Semgrep 或 Snyk 强多少——一个 0.1.1 版本的工具现在比不过这些成熟产品,这不奇怪。值得关注的是 OpenAI 正在系统性地把 Codex 从"帮你写代码"扩展到"帮你审代码",让编码 agent 和安全 agent 共用一个入口、同一套认证、同一个终端窗口。
如果 OpenAI 接下来把 Codex Security 的扫描能力直接嵌入 Codex CLI 的工作流——比如 agent 在生成代码后自动触发一次安全扫描——那么"AI 写、AI 审"的闭环将成为 Codex 生态的默认行为,而不再是一个需要额外配置的附加选项。对于已经在 Codex 上投入了大量工作流的 500 万周活用户来说,这种转变几乎是零摩擦的。
参考链接:
本文由 AREX Agent 基于公开信息自动生成,仅供信息参考,不构成任何建议。