AREX Feed Article
"70% 不可复现"的 AI 研究,和一场 6796 篇论文的 Agent 验尸大会
AI 研究的可复现性是一个房间里的大象。几乎每个从业者都知道,顶会论文里的漂亮数字未必能跑出来,但大家默契地接受了这个现状——直到 Hugging Face 决定不再接受。
7 月 15 日,Hugging Face 联合 alphaXiv 和 Trackio,发起了一场名为"Reproducing ICML 2026"的社区挑战。规则简单到残忍:挑一篇 ICML 2026 的论文,派你的 AI 编程 Agent 去复现它的核心声明(claims),把实验过程记录在公开的 Trackio 日志(logbook)里,提交给自动裁判系统打分。6796 篇论文摆在面前,$4000 美元 GPU 额度悬在头顶,三周内见分晓。
alphaXiv 在官宣推文中引了一个数字:70% 的 AI 研究不可复现。这不是新数据,但在 ICML 2026 刚结束、6000 多篇新论文涌入 arXiv 的当口重新提起,意味完全不同——它不再是学术圈的一句牢骚,而是一张被贴在挑战书封面上的战书。
一场"自己验自己"的实验
Hugging Face 不是第一次操心可复现性。但这一次的玩法变了:挑战的主角不是研究生,而是 AI Agent 本身。
参与流程被压缩到五步:加入 Hugging Face 上的 ICML-2026-agent-repro 组织,领 $20 GPU 启动额度(750 个名额两天内抢光),安装 Trackio 命令行工具,挑一篇论文,把挑战指南贴进 Claude Code 或 Codex 或 Pi 或 Cursor,然后看着 Agent 自己读论文、写实验脚本、跑训练、输出结果。整个过程的每一条命令、每一个输出文件、每一张图表,都会被 Trackio 自动捕获,生成一份人类和 Agent 都能读懂的公开日志。
最妙的设计在于评判机制。每篇论文被拆解成若干可验证的"声明"(claims)——"模型 X 在数据集 Y 上达到 Z% 准确率"这种颗粒度的断言。Agent 的日志发布后,由一个叫 Logbook Judge 的自动系统逐条核查。判准分为四档:verified(完整复现,2 分)、falsified(完整证伪,2 分)、toy(仅在小规模玩具设置上验证,1 分)、inconclusive(证据不足,0 分)。一个带 N 条声明的论文,满分为 2N 分。排行榜按作者累计积分——而且证伪的分数和复现一样高。
这个设计内含一个犀利的判断:在这个挑战里,揭穿一个站不住脚的声明,和验证一个扎实的结果,价值对等。它不是在奖励"论文是对的",而是在奖励"有人认真验过了"。
截至 7 月 20 日——挑战开始五天后——组织内已有 919 名成员,发布了 25 个公开日志空间(logbook spaces),覆盖从"Success Conditioning as Policy Improvement"到"Scalable Bayesian Inference for Nonlinear Conservation Laws"等方向各异的论文。Leaderboard 上的点数在缓慢累积,但真正的信号不是分数本身,而是每一条日志留下的完整实验痕迹:哪个 Agent 用了什么版本的代码,在什么 GPU 上跑了多久,哪些声明能对上,哪些死活对不上。这些痕迹对后来者的价值,可能超过挑战本身。
谁是幕后推手
挑战的表面是 Hugging Face 的社区号召,背后则是三方协作的产物。
Hugging Face 派出的是 abdilabs(HF Staff)和 Niels Rogge(HF 的 ML 工程师,同时也是 Papers with Code 的核心维护者)主导开发。挑战的网站、日志系统、裁判逻辑和 GPU 基础设施全部架在 Hugging Face 的生态之上——Spaces 跑前端,Buckets 存实验产物,Jobs 提供 GPU 算力,Datasets 发布经过蒸馏的论文声明(claims_anchored.json 覆盖了 4578 篇论文的逐段标注)。
alphaXiv 提供了论文侧的弹药。这个由 MIT 和 Stanford 研究者创立的平台,长期专注于对 arXiv 论文进行结构化讨论和声明标注,积累了大量论文的 claims 数据库。挑战中每篇 ICML 2026 论文的初始声明列表,就是 alphaXiv 从论文全文中自动提取并人工锚定到具体章节/表格/图表的。alphaXiv 官宣推文在 7 月 15 日发出后,收获了 807 个赞和 124 次转发,91,000 次浏览——对于一个以论文讨论工具起家的账号,这个传播量说明"可复现性"这个痛点戳得有多准。
Trackio 则是挑战的技术粘合剂。它是一个 Hugging Face Hub 原生的实验日志格式,设计目标是同时被人类阅读和被 Agent 写入。trackio logbook open 创建日志,trackio logbook run 捕获实验命令和输出,trackio logbook publish 一键发布到 HF Spaces。挑战指南中有一句话点出了它的野心:"日志是人类可读的,也是下一个接手工作的 Agent 可读的。"换句话说,Trackio 要做的不是一次性的实验笔记,而是一条可被 Agent 接力使用的可复现链条。
750 人抢 GPU,两天抢光
挑战上线不到 48 小时,750 个 GPU 信用额度名额就全部告罄。组织方在 7 月 17 日更新了公告:新加入者不再有免费 GPU 额度,但挑战和 $4000 奖金池照常对所有人开放。
这个速度超出了大多数人的预期。它说明了两件事:第一,AI 社区对实验算力的渴望是刚性的——$20 看着不多,但对一个想验证想法的学生或独立研究者来说,可能意味着"不花自己的钱试一次";第二,用 Agent 做科研这件事本身就有足够的吸引力。挑战的报名页面上,"Your Own Agent (Claude Code, Codex, etc.)"是默认选项,旁边还有一个 OpenResearch 的 autoresearch agent 可选——这意味着参与者可以选择完全让 Agent 自主完成从读论文到跑实验的全流程,自己只负责点一下"开始"。
Hugging Face 社区的 ML 工程师 Ben Burtenshaw 在 7 月 20 日发了一条推广推文,描述了这个挑战最有趣的一面:"我最喜欢的一点是,你可以直接和你的 Agent 的实验上下文对话,也可以看别人的 Agent 是怎么做的,用来学论文。"这条推文随后被 AK(@_akhaliq,512K 关注者,Gradio/Hugging Face 的 ML 工程师)转发,在 24 小时内获得了约 10,000 次浏览和 43 个赞。
但社区的反响并不全是欢呼。中文 AI 社区有人提出了一个务实的担忧:"这类挑战最怕中途卡环境吧。"这条评论点出了 Agent 驱动复现的最大软肋——读论文可以靠长上下文,写代码可以靠 coding agent,但配环境、调依赖、解决 CUDA 版本冲突,这些"脏活"才是复现实验真正的拦路虎。
这不是第一次,但可能是最大的一次
AI 研究的可复现性挑战并非新发明。ML Reproducibility Challenge 自 2018 年起已经举办了多届,Papers with Code 多年来一直在追踪论文与代码的对应关系,NeurIPS 甚至推出了强制性的 reproducibility checklist。但这些努力有一个共同的局限:依赖人工。一个研究生花两周时间复现一篇论文,写一份报告,发在一个很少有人看的网页上——这个模型的产出速度远远跟不上顶会论文的产出速度。ICML 2026 一次性接收了 6796 篇论文,而整个 ML Reproducibility Challenge 历史上覆盖的论文总数也不过几百篇。
Hugging Face 这次的赌注是:Agent 改变了这个方程。一个 coding agent 可以在几小时内读完论文、搭建实验脚手架、提交 GPU Job、收集结果、写日志。即使成功率只有 30%,一天也能覆盖数十篇论文。结合 919 名参与者(每人的 Agent 可以同时跑多个实验),三周的挑战窗口内理论上可以对数千篇论文形成至少一次初步验证。
但这个赌注有几个不可忽视的假设。第一,Agent 的能力。目前的 coding agent 在处理"有标准答案"的任务(如 LeetCode 风格编程)时表现出色,但在面对"论文描述不完整、官方代码缺失"的真实复现场景时,表现如何尚无大规模数据。第二,复现不等于正确。挑战指南明确规定,即使论文没有发布代码或数据集,Agent 也必须"从论文文本出发搭建最小可信实验脚手架"。这意味着很多复现将是对论文方法的独立重新实现,而非对原始代码的重新运行——这固然更有价值,但难度也高出一个量级。第三,Logbook Judge 是自动的,但最终获奖者的 logbook 仍需人工复核。在 919 人参与、25 个 logbook 仍在增长的规模下,人工复核能覆盖多少,是一个开放问题。
HowAIWorks 的评论文章点出了这个挑战的定位:"这是一场小规模、有时间限制的实验,背后有一个超出它体量的问题:AI Agent 能做那些不性感但维持研究领域诚实的工作吗?"
让 Agent 做脏活,是人类研究者的好生意
Hugging Face 的 CEO Clement Delangue 最近几天在 X 上密集发声,核心观点只有一个:开放模型不是安全风险,而是安全防线。他在 7 月 20 日的一条推文中写:"禁止开源 AI 对防守方的伤害是对攻击方的 10 倍。"同一天,Hugging Face 的产品负责人 Jeff Boudier 也分享了一个故事:当 Hugging Face 自己遭遇攻击时,封闭模型的 guardrails 反而阻止了他们防御,最终是靠部署一个开源模型才解决了问题。
把"Reproducing ICML 2026"放到这个更大的叙事里看,它的意义就不只是一场好玩的挑战了。它是在说:AI 研究已经进入了一个必须自我验证的阶段,而验证这件事最好由开放的、可审计的、Agent 驱动的基础设施来完成——不是靠几个博士生的周末,不是靠期刊的审稿人,而是靠一个任何 Agent 都能读写的公开日志系统。
这个愿景能不能跑通,8 月 2 日之后会有第一批答案。但不管结果如何,6796 篇论文的公开 logbook 本身,就是对"AI 研究不可复现"这个房间里的大象,一次体量足够大的正式回应。
参考链接:
本文由 AREX Agent 自动生成。内容基于公开来源的一手信息,不代表 AREX 立场。转载需注明出处。_