AREX Feed Article
哥伦比亚大学助理教授 Zhuo Zhang 称 GPT-6 分别用不到 20 分钟解出两道高难度逆向挑战
9 月 15 日,哥伦比亚大学计算机科学系助理教授 Zhuo Zhang 在 X 上发帖称,他正与 CrackmesOne 社区合作开发新的 AI 逆向工程基准;其间测试的两道高难度逆向挑战,被 GPT-6 分别用不到 20 分钟解出()。帖文给出了两道题的公开链接,并在结尾征集更难的题目。
按帖文说法,两道题涉及的防护机制包括编译期变形(build-time metamorphism)、门级自定义 CPU(用逻辑门搭建的处理器)、加密内存,以及由 SIGSEGV(段错误信号)驱动的解密与控制流混淆。两道题都来自 crackmes.one 平台:victormeloasm 的 Froggate II: Croackpocallypse,以及 xutaxkamay 的 HellGates。这一结果由 Zhuo Zhang 一方公布:帖文没有说明测试使用的 GPT-6 具体变体与评测配置,也没有附上解题记录。
(图源:SRE-Bench 项目主页)
三条帖文:解出声明、挑战链接与征集请求
帖文发布于 9 月 15 日 16:06 UTC,北京时间已是 9 月 16 日凌晨 0 点 06 分。第一条交代测试节奏:与 CrackmesOne 社区的合作「过程非常愉快」,两道题是用「短短几天」测完的。随后是那句关键声明:
「这两道题手动逆向起来想必是种折磨人的乐趣。幸运的是(也可以说是不幸的是),GPT-6 把两道题都解了出来,每道不到 20 分钟。」
第二条是:两道 crackmes.one 的题目链接,以及两位作者的 GitHub 与个人网站,结尾是「欢迎你们自己来破解」。第三条是:「如果你认为你的 crackme(逆向练习程序)能难倒 GPT-6,请联系我们,帮我们证明 GPT-6 并非不可战胜。」他同时补充一句:不要用针对 AI 的特殊技巧或提示注入,「我们要的是真正困难、能检验 AI 能力的逆向工程问题」。
(截图:X 上的原帖)
两道题的来历:一道上架不到四天,一道公开九个多月
Froggate II: Croackpocallypse 是一道新题。显示,它由 victormeloasm 在 2026 年 9 月 11 日 21:26 上传,x86-64 架构、C/C++ 编写,比帖文早不到四天。题面用沼泽怪物的口吻写着「Froggate 回来了,带着更深的怨恨」,随后是几条限制:「NO AI NO PATCHING NO HOOKING NO FUNNY TRICKS」;目标是「Build a keygen」,即构造一个密钥生成器。
HellGates 则老得多:2025 年 11 月 30 日上传,x86-64,题目文件太大(1 GB),以 GitHub 等外部链接提供()。作者 xutaxkamay 说,这是他的第一个公开挑战,「我认为它难到离谱(不是全职,但我写它花了一年)」;目标是「在(假的)LCD 上输入正确的字母序列」,像输入作弊码。他称会尽量给第一个找到密码的人一笔 XMR(门罗币)奖励,个人网站()也挂着同一件事:把 flag(题目答案)或密码连同 XMR 地址发给他,并说明如何解出。
截至发稿,两个挑战页面显示的 writeup(公开解题报告)数量都是 0;HellGates 累计下载 370 次,Froggate II 是 17 次。
HellGates 的评论区:作者说无人破解,AI 也失败过
HellGates 的公开页面上留有一段持续数月的尝试记录。2026 年 2 月底,一名叫 TheSwedishLord 的解题者开始在这里留言;3 月初,他的一个 AI 助手(他后来说那是自己的 OpenClaw 实例)在评论区贴出长篇分析,声称已提取出门电路、还原了执行流程。xutaxkamay 的回应很直接:「你发来的东西有一半是错的」「你的 AI 大概是在用胡说八道弥补技能不足」。他逐条纠正,说题里没有 LFSR(线性反馈移位寄存器)解密、也没有 JIT(即时编译),只有信号处理器(signal handler)里层层递归加密的 shellcode(一段可直接运行的机器码),故障是故意埋进二进制里对抗静态分析的,并写道「我不会帮 AI 做这件事」。
3 月 6 日,作者又留了一句:「其实我挺高兴 AI 还解不出它(至少现在?),看它失败挺有意思。」解题者随后道歉,称那是自动化助手所为,已撤销其权限。作者对 AI 并非一味排斥:到 5 月,他又补了一句,自己这个月刚开始用 LLM(大语言模型),「用起来挺方便,但并不完美」。
7 月 22 日,作者问「这题真有这么难吗?」。8 月 1 日,一位新解题者表示想试试,他回复:这道题发布已经八个多月、在 GitHub 和 LSE 网站上挂了一年,「还没有人破解」,「所以我想这套混淆是有效的」。同一条回复里他谈到奖励:「目前我只有大约 0.6 XMR」;如果还是没人解出,他打算再等几周到几个月,也许写一篇博客讲讲这道题。
一个半月后,9 月 15 日的帖文称,这道题被 GPT-6 解出了。
SRE-Bench:从「逆向远未解决」到 GPT-6 接近全解
这次测试属于一条更长的合作线。9 月 10 日,Zhuo Zhang 发帖宣布 SRE-Bench 与 CrackmesOne 的合作规划:把平台上的未解挑战带进 SRE-Bench,「看看它们能否难倒前沿模型」,并逐一联系挑战作者询问意愿()。同一天他提到评测进展:多数模型还「差点火候」,而「GPT-6 Astra 把我们的当前基准彻底解掉了」,所以是时候做更难、更好的版本了()。在另一条帖文里,他把要回答的问题概括为:智能体逆向工程还差在哪些环节,或者 2026 年是否已经可以说逆向工程「被解决」了()。
8 月 11 日,介绍 SRE-Bench 的论文提交到 arXiv。论文称它是「第一个真实、无污染的逆向工程基准」:由逆向专家从零构建、投入超过 5,000 小时,包含 19 个从未公开的私有程序,平均约 1.69 万行代码,覆盖网络协议、游戏、文件格式、恶意软件、固件五个领域;团队自研 44 个反分析原语,生成 262 个二进制实例、1,572 项可确定性判分的任务。论文对五款前沿模型(GPT-5.6-sol、Claude-Opus-5、GPT-5.5、Grok-4.5、GLM-5.2)的结论是:逆向工程「远未解决」,最强的 GPT-5.6-sol 实例级得分 61.4%,完全解出的实例只有 31.5%,强源代码安全能力尚未迁移到二进制分析()。
(图源:SRE-Bench 论文 arXiv:2608.11469 图 1)
SRE-Bench 官网()则称,团队与 OpenAI 合作评测了后者最强的模型 GPT-6 Astra:「该模型在 SRE-Bench 上取得了接近 100% 的解出率,而我们评测的其他模型都低于 60%。」官网还说,这些结果促使他们把难度继续上探,用一系列与 OpenAI 合作的试点评测探索更难的设置。
论文作者之一,就是发帖的 Zhuo Zhang。哥伦比亚大学工程与应用科学学院官网显示,他是该校计算机科学系助理教授(2026 年起任职),研究软件与系统安全;他此前在普渡大学取得计算机科学博士学位,本科毕业于上海交通大学()。
(图源:哥伦比亚大学工程与应用科学学院官网)
征集规则:没被模型解出、没有公开 writeup、不含针对 AI 的花招
SRE-Bench 的把参与方式写得很细。它接受三类贡献:种子程序(用于生成新评测目标的私有程序)、完整的 CTF(夺旗赛)风格逆向挑战,以及让题目更难的反分析工具;所有材料都发给 Zhuo Zhang,经内部评审后决定是否收录。以 CTF 挑战为例,提交者要提供题面、二进制(附名称、应用类型和源语言)、源代码、校验器或期望答案、推荐工具清单;题目运行在 Linux Docker 容器里,源代码会被交给 GPT-5.6-sol 试跑,用来确认题目确实有解;页面举的反例是,有的题会要求解题者做分解 RSA-2048 这类没人做得到的事。
四道收录门槛是:没有被 GPT-5.6-Sol Max 解出,因为「模型已经能解的题不会给基准带来任何增益」;没有公开 writeup;不含针对 AI 的花招,即「二进制和题面里都不能出现针对模型而非分析者的内容:不得提示注入,不得对智能体下指令,不得设计用来让它跑偏的内容」;作者身份可验证(机构、公司,或在 crackmes.one 这类平台上有信誉的账号)。征集页还写明:「我们会对每一份提交运行 GPT-6,并根据结果决定它是否加入基准。」
Crackmes.one 在 Zhuo Zhang 发帖约半小时后转发了征集:「想让你的 crackme/逆向挑战与 Astra 6 过招吗?来参与 SRE-Bench!」()
按征集页的说明,被接受的挑战会出现在 SRE-Bench 的任务页上,作为一项独立条目。这条合作要找的,是一道能让 GPT-6 停下来的题。