AREX Feed Article
Jack Morris:隐藏 CoT 挡不住蒸馏,逆向推理链的军备竞赛已经开始
"搞清楚如何逼近前沿模型的推理 trace,可能会成为开源权重模型的生存级问题。"
8 月 9 日晚,Engram Lab 研究员 Jack Morris(@jxmnop),将半年来围绕中国开源模型蒸馏的争议推到了一个新的焦点上。他不是在宣布什么发现,而是在连接两件事:一则正在 AI 研究圈流传的传闻,和他自己 3 月发表的一篇论文。
一条推文,一篇论文,一个持续半年的争议
Morris 是 (arXiv:2603.07267)的作者之一,这篇论文论证了一个令前沿模型厂商不安的结论:即使 API 只输出经过压缩的"推理摘要"而不暴露完整思维链,攻击者仍然可以通过训练一个"逆向推理模型"(trace inversion model),从答案和摘要中重建出足以用于蒸馏的高质量推理链。
而此刻他在推文中描述的传闻,恰好把这一学术发现拉进了产业现实。据他所转述的传闻,中国的 AI 实验室在 2026 年初找到了一种方法,通过逆向工程从 Claude Code 和 OpenAI Codex 中提取出隐藏的推理 trace,并以此收集了大量带有完整推理链的长程数据,"这次越狱带来了我们过去几个月享受到的新一波开源模型。"
Morris 随即补充了两个关键限定:第一,"我不确定这件事有多真实";第二,他自己的研究发现了一条不同的路径——不需要逆向工程产品本身,只需要训练一个好的逆向推理模型,就能从任何前沿模型的公开输出中重建推理链。
Claude Code 和 Codex 里到底藏着什么?
要理解这则传闻为什么重要,需要先看清 Claude Code 和 Codex 在 AI 开发生态中的位置。
Claude Code 是 Anthropic 推出的 AI 编程代理,Codex 则是 OpenAI 的对应产品。两者都不是简单的代码补全工具——它们在与开发者交互时,会在内部执行复杂的多步推理:阅读代码库、规划修改方案、调用终端命令、检查输出、修正错误。这些推理步骤对用户部分可见(以摘要或简略形式呈现),但模型在每一个决策节点的详细推演过程被厂商刻意隐藏。
这正是蒸馏的关键所在。AI 模型蒸馏的原理是用一个更强的"教师模型"的输出训练一个"学生模型"。当教师模型的输出包含完整的逐步推理过程时,蒸馏效果远优于只使用最终答案。Anthropic 中说得直白:DeepSeek 就曾通过精心设计的 prompt,要求 Claude "想象并写出已完成回复背后的内部推理过程",从而批量生成思维链训练数据。
而传闻的核心,即通过逆向工程 Claude Code 和 Codex 来提取这些推理 trace,如果属实,意味着中国实验室可能找到了一个更系统的入口:不是通过 prompt 工程诱导模型"回忆"自己的推理,而是从编程代理的工具调用、文件读写和中间输出中重建推理路径。
Morris 本人对这个说法持保留态度。他在回复中引用了 Anthropic 关于蒸馏攻击检测的博客,并补充说:"其中大部分并非新信息。"一个在推文下评论的用户 @german_who 则回忆道:"我记得年初 Anthropic 就说过,Moonshot 特别在忙着收集他们的数据,远在 K3 之前。"
不需要真实 trace,也能偷走推理能力
传闻的真假尚无定论,但 Morris 的论文揭示了一个更根本的问题:即使前沿模型厂商完美隐藏了所有内部推理链,也未必能阻止能力被蒸馏。
Morris 与 Tingwei Zhang、Vitaly Shmatikov 合著的这篇论文提出了 Trace Inversion 框架。其核心思路是:训练一个专门的逆向模型,仅凭目标模型对外暴露的输入(用户问题)、输出(最终答案)和压缩后的推理摘要,就能合成出详细的、逐步的推理链。这些合成 trace 虽然并非原模型的"真实思维",但作为学生模型的训练数据时,效果惊人。
论文中的数据很具体:用从 GPT-5 mini 的输出中逆向合成的推理 trace 微调 Qwen-2.5-7B-Instruct,MATH500 得分从 56.8% 跃升至 77.6%,JEEBench 从 11.7% 升至 42.3%,远优于仅用答案和摘要微调的对照组。针对 DeepSeek-R1 的逆向 trace,与真实推理链的 token 重叠 F1 分数达到 52.79,token 恢复率 81%。
换句话说,隐藏思维链这个策略存在一个根本性的漏洞:只要模型还在输出答案和摘要,这些输出本身就携带了足够的信号,让一个训练有素的逆向模型去"猜"出背后的推理过程。而猜出来的推理,用于训练学生模型时,效果出奇地好。
Morris 在推文中特别指出,这个发现与蒸馏传闻之间存在一种张力。传闻暗示中国实验室通过某种"越狱"拿到了真实推理链,这才是他们蒸馏成功的关键。但他的研究表明,拿到真实 trace 可能根本就不是必要条件。
社区已经在逆向 Claude Opus 4.7
如果说 Morris 的论文还停留在学术论证阶段,那么 HuggingFace 上的实际数据集已经证明了这个方向的可行性。
就在论文发表后不久,一个名为 的数据集出现在 HuggingFace 上。它使用一个叫 "Trace-Inverter-4B" 的定制模型,将 Claude Opus 4.7 Max 输出的压缩"推理气泡"(Reasoning Bubbles)逆向重建为 5,000 条详细的逐步推理链。数据集说明中明确将其理论基础指向 Morris 等人的论文。
这 5,000 条样本覆盖数学、物理和编程任务,每条都将原始模型输出的寥寥数句摘要扩展成了数百字的完整推演,包含假设提出、分步计算、交叉验证乃至"自我怀疑"式的中间检查。数据集页面写道,这些重建的推理链"成功为 SFT 提供了高级的逻辑级监督信号",并已被用于微调一个名为 Negentropy-claude-opus-4.7-9B 的模型。
这个案例的意义不在于它本身有多大规模:5,000 条样本比起 Anthropic 指控的工业级蒸馏(MiniMax 一家就是 1,300 万次交互)微不足道。它的意义在于证明:Trace Inversion 不是实验室里的理论玩具。一个有技术背景的个人或小团队,用公开可用的 API 输出和一个微调过的逆向模型,就能从最前沿的商业闭源模型中榨取出可用于训练的高质量推理数据。
而如果传闻属实,中国实验室已经将类似方法规模化了,那这一技术路线的有效性就得到了产业级的验证。
隐藏推理链的军备竞赛,才刚刚开始
回到 Morris 最后的判断:"搞清楚如何逼近前沿模型的推理 trace,可能会成为开源权重模型的生存级问题。"这句话的分量在于它指出了一个不对称的局面。
对前沿模型厂商而言,隐藏推理链是一个防御动作:他们投入数十亿美元训练出的推理能力,是核心竞争壁垒。对开源权重模型的开发者而言,能否获取高质量的推理链训练数据,直接决定了他们与闭源前沿之间的差距是缩小还是拉大。
Anthropic 在今年已先后指控了四家中国 AI 实验室:DeepSeek、Moonshot(Kimi)、MiniMax 和阿里巴巴(Qwen),。阿里巴巴被指控的 2,880 万次交互,仅发生在 4 月 22 日至 6 月 5 日的 44 天内,规模超过前三家之和。阿里巴巴否认了这些指控。
但 Morris 的研究指向了一个更深层的问题:如果逆向推理真的不需要获取模型内部的真实 trace,只需要公开的 API 输出加上一个足够好的逆向模型,那么无论 Anthropic 封掉多少欺诈账户、压缩推理摘要到何种程度,都无法从根本上堵住这个漏洞。
与此同时,中国开源模型与 Claude Code、Codex 的深度绑定已是公开事实。Moonshot 中,明确将模型在 "Kimi Code、Claude Code 或 Codex" 三种代理框架下的表现作为评测标准。不管蒸馏是否真的发生,这些编程代理已经深度嵌入了中国 AI 实验室的研发管线。
Morris 的推文没有给出答案,但他画出了一条清晰的逻辑链:蒸馏效果取决于推理链的质量,推理链可以被逆向重建,隐藏 CoT 不足以阻止能力被提取,开源权重模型的未来取决于这个攻防博弈的结果。Morris 的论文已经证明了其中的关键环节——隐藏推理链本身不足以阻止蒸馏,因为逆向推理模型可以从公开输出中重建推理能力。传闻无论真假,都不改变这个底层机制。