AREX Feed Article
Hugging Face 审计 ICML 2026:23% 论文至少一项声明被证伪或存争议
2026 年 8 月 13 日,Hugging Face 的 Abubakar Abid 在发表《What We Learned by Reproducing 2,200 papers from ICML》,公布 ICML 2026 Open Reproductions 挑战的完整结果:1,221 名社区成员带着自己的 coding agents,在 19 天里发布 6,816 份 Trackio logbook,尝试复现 2,226 篇被 ICML 2026 接收的论文,逐条评判 35,908 项声明。
博客给出的核心数字:51% 的被检论文(1,103 篇)至少一项声明获独立验证,其中 266 篇全部声明被复现;23%(496 篇)至少一项声明被证伪或存争议,其中 49 篇全部声明被证伪、无一可验证。被确认的证伪案例包括一篇 paging 论文的 robustness bound、一条 Frank-Wolfe attention 定理,以及一处 reverse-KL/forward-KL 失配。
35,908 项声明,GLM-5.2 逐条裁决
挑战在 2026 年 7 月 15 日至 8 月 2 日举行,由 Hugging Face 与 alphaXiv 共同组织。博客说,这场挑战要回答的问题是,按规模重审一个主要会议、尝试复现每一篇论文,会发现什么。规则分四步。选论文:组织方索引全部接收论文的摘要,抽取每篇的核心科学声明,让 agent 从一个可检验的具体目标而非 40 页 PDF 起步,多组复现同一篇论文受到鼓励。自带 agent:参与者使用 Claude Code、Codex、Cursor、OpenResearch 的 orx 等工具,组织方提供精简接口,agent 用一条命令就能拉取论文、声明和挑战说明。复现并公开:每次运行产出一份 Trackio logbook,一个静态 Hugging Face Space,内含 write-up、运行过的代码、产生的 artifacts,以及可选上传的完整 agent 执行轨迹;博客写道,审计过程本身必须可审计。裁决:运行开源权重模型 GLM-5.2 的自动 Logbook Judge 重读每份 logbook,对每条声明给出 verified、falsified、toy 或 inconclusive 四种裁决之一,并被明确指示不得采信 logbook 的自评,其中 toy 指缩小规模的证据。
博客解释为什么开放给社区而不是自己审计:参与者自带不同的 agent 框架、算力预算和科学口味。
动机是规模错配。ICML 2026 收到 23,918 份投稿、接收 6,352 篇论文,约为上一年的两倍,博客认为这一指数增长至少部分由 AI agents 驱动——它们让跑实验和写论文更快。评审产能没有同步翻倍,大多数会议的评审是志愿者。博客引用了今年一篇 spotlight 论文评审的原话:"My low confidence score is because I did not check all the proofs carefully."(我的低置信度是因为我没有仔细核对所有证明。)这篇论文拿到强分并入选 spotlight,博客预告后文会回到它。博客算了另一笔账:仔细核查一篇论文过去要花评审一个周末,agent 可以在一个下午尝试,并并行跑上几千次;推动投稿洪水的同一批技术,也能帮助评审跟上它。
规模数据:1,221 名参与者、6,816 份 logbook、2,226 篇论文(博客称占全部接收论文的 34%)、35,908 项裁决(挑战结束时全部冻结进公开数据集)、2,962 个 HF Jobs、274 份完整 agent 轨迹数据集。每位参与者获得 20 美元 Hugging Face 算力额度;当论文的数据集是专有的或 checkpoint 未发布时,参与者用模仿原论文性质的合成数据跑 toy 复现。
复现不是二元的,是对抗的
把逐条裁决按论文聚合:51% 的被检论文(1,103 篇)至少一项声明被独立验证,其中 266 篇全部声明被复现,632 篇部分复现且没有证伪项,合计 3,978 项声明经真实实验确认。23%(496 篇)至少一项声明被证伪或存争议,其中 49 篇全部声明被证伪、什么都验证不出来,另有 242 篇论文的同一项声明被独立复现团队得出相反裁决。博客的判断是:"Reproducibility is not binary; it is adversarial."(可复现性不是二元的,是对抗的。)
中间地带:502 篇只有 toy 规模的证据,280 篇两个结论都立不起来,最常见原因是 artifacts 缺失。
扛住复现的论文同样被点名。"Flat Minima and Generalization: Insights from Stochastic Convex Optimization" 被 20 个独立团队复现,其中 12 个验证了每一条声明;"A Coin Flip for Safety: LLM Judges Fail to Reliably Measure Adversarial Robustness" 的 17 份 logbook 里有 14 份验证了每一条声明。
对证伪的认定同样有防错机制:35 名参与者正式申报证伪,Hugging Face 对每一项做对抗性复核,重读论文、重读 logbook、从论文原文重新推导数学或重新实现实验。经复核被确认的证伪案例包括以下几个。
稳健界从 O(1) 变成了 Θ(log k)
前文提到的那篇被评审承认"没有仔细核对证明"的 spotlight 论文是 "Towards Optimal Robustness in Learning-Augmented Paging",论文声称其算法达到 Hk+O(1) 的稳健界。一位参与者的 logbook 测出 additive term 按 0.38 ln k 增长,并定位到证明中断掉的精确步骤。Hugging Face 自己的 re-implementation 把扫描扩展到 k=1,024,以约九倍标准差确认了增长。博客给出的结论:真实稳健界是 Hk+Θ(log k)。
博客还指出,这篇论文上多份"verified"裁决来自在 log-k 增长显现之前就停掉的检查。有限时间检查停得太早,是这场复现反复出现的陷阱。
Frank-Wolfe 定理在第 224 步倒掉
"Attention's forward pass and Frank-Wolfe" 的定理声称:只要原点初始位于 token 粒子的凸包内,粒子就会塌缩到原点。三个独立团队找到反例,违规首次出现在 t=224、约 3,800 和 6,416 步。博客解释,这正好说明为什么其他人此前都"验证"了这条定理:有限时间检查停得太早。最干净的反例用精确有理数算术表述,没有浮点误差可以躲。据博客,作者当天确认了问题,正在修复。
另一例是理论与代码错位。"Self-Distillation Enables Continual Learning" 的核心方程和整个理论部分分析的是 reverse KL 散度,但发布代码的默认设置计算的是 forward KL,而按作者的说法,论文全部结果正是由后者产生。发现问题的 logbook 还复现不出论文 headline 的 +4pp 结果,即便用作者自己的代码和数据。博客称,作者已向 arXiv 上传澄清版本。
66% 的评估位置是 EOS padding
"Do Transformers Need Three Projections?" 被参与者发现:约 66% 的被评估 label 位置是 EOS padding token,它们被训练到接近零损失,把 perplexity 压低了约三倍。摘要里"50% cache 缩减只损失 3.1% 质量"的说法,修正后约为 9.4%。
复核是双向的,复现者自己也会出错。一份 logbook 断言"论文方法比 baseline 慢 2 倍",事后查明是算术错误:把每条轨迹的时间拿去对比每批 50 条轨迹的时间。正确归一化后,该参与者自己的数据反而确认了论文声称的 8 倍加速。博客把这类案例单独标为"错误证伪"。
人类的新角色:管理智能
Hugging Face 已开始给每项确认发现的作者写信,口径是:"here is what we found, here is all the evidence, do you agree or is our analysis wrong?"(这是我们的发现和全部证据,你们同意,还是我们分析错了?)博客称早期回应很正面:作者已确认多篇论文上的发现,两项 arXiv 更正正在进行;还有一个案例,作者在挑战赛发现该问题之前一个月,已在新版 arXiv 里悄悄修掉错误,被博客计为"独立收敛"。
纯 agent 执行有真实边界:卡进本地循环、误读尺度相关的行为、把整个证伪建立在单位换算错误上。挑战中最可靠的结果来自有人类掌舵的工作流。博客举了 human-in-the-loop 冠军的例子:论文声称模型在极端量化下图像生成保持稳定,数值指标显示"没有崩溃",但图像是否真正可用是感知问题。
agent 为此建了一个专用 review UI,人类亲自评判全部 128 组图像对,把标注提交进 repo,agent 再校验标注的一致性。公开的 agent 轨迹记录了整个过程,包括参与者先问 review 工具怎么用,随后回复:"I have gone over the pairs and put the csv in the repo, please check."
博客把人类评审的角色总结为 manage intelligence effectively:像 PI 一样搭好环境、在正确时机给出反馈,然后让 agent 去跑。所有 logbook、裁决、轨迹和 artifacts 都公开,从挑战 Space 开始。博客最后认为,这是迄今对机器学习会议规模最大的一次公开逐条审计,"we would love for it not to hold that record for long"——希望这个纪录不会保持太久。