AREX Feed Article
Meta 称 AIRA₃ 在 NVIDIA Kaggle 赛夺金:约 4,000 队中列第 8
Meta 的官方 X 账号 于 UTC 时间 9 月 5 日 16:17(北京时间 9 月 6 日 00:17)宣布:作为「检验我们在推进 AI 研究前沿方面进展的一次测试」,其自主 AI 研究系统 AIRA₃ 于 6 月被送入 NVIDIA 主办的一场实时 Kaggle 竞赛,任务是微调 30B 参数的 Nemotron 模型、让模型学会更好地推理;AIRA₃ 在约 4,000 支队伍中位列第 8,赢得金牌。
Meta 称,所有参赛者拿到相同信息,成绩由外部在私有测试集上评定,AIRA₃「表现优于能够使用同样前沿工具的人类参赛者」;公司认为「这是一个可靠的信号,表明 AIRA₃ 能以与人类专家相似的水平,改进 AI 模型的某一特定能力」。以上均为 Meta 官方口径:截至发稿,排行榜上的队伍归属与名次,尚无独立于 Meta 的公开核验。
同一份信息、同一个私有测试集
这场竞赛在 。于 7 月 14 日发布赛后总结,作者为 Jamil Semaan、Jean-Francois Puget 与 Christof Henkel:比赛吸引超过 5,000 名活跃参赛者、组成约 4,000 支队伍,产生数千次提交和逾 1,000 条讨论帖,与 Meta 所说的「约 4,000 支队伍」一致。
NVIDIA 总结列出了比赛的关键约束:所有队伍从同一个开源模型 Nemotron-3-Nano-30B 出发,提交物只能是低秩适配器(LoRA,Low-Rank Adaptation),秩(rank)不高于 32;评估时不能联网、不能修改推理代码、也不能提交完整模型;模型必须在 token(词元)预算内推理出题目中的隐藏变换、产出推理过程并给出最终答案;最终名次由私有排行榜确定,所有提交跑在统一的 Google Cloud G4 VM(搭载 NVIDIA RTX PRO 6000 Blackwell GPU)上。Meta 所说的「微调 30B Nemotron」「外部在私有测试集上评分」,对应的正是这样一场起点相同、最终评分不由任何参赛方控制的比赛。
拿金牌的 ensemble:GPT 5.5 与 Claude 4.8
Meta 在中披露参赛配置:现场夺金的是多模型集成(ensemble)——GPT 5.5(配合 OpenCode)与 Claude 4.8(配合 ClaudeCode)。AIRA₃ 的现场成绩来自这套模型组合,而非某个单一模型。
同一推文还公布赛后补测:Meta 换用其他模型组合,在同一私有测试集上重新评测,Muse Spark 1.2(配合 MuseCode)同样达到金牌水平,Muse Spark 1.1 与 GLM 5.2(均配合 OpenCode)为银牌水平。补测提交与现场提交一样,由外部在同一个私有测试集上评分。
没有总指挥:论坛与共享文件系统上的接力
AIRA₃ 的运行方式在中得到解释:系统没有中央控制器,多组「长时运行」的智能体(每组是一个模型与一套编码工具的组合)各自在隔离环境中工作,通过两个共享基座异步协调——一个用于分享假设与发现的论坛,一个存放方案产物的共享文件系统。智能体之间互相阅读、接力,各自决定在同伴的哪些发现上继续推进,「搜索策略随每个智能体的选择动态涌现」。Meta 的说法是,系统用算力「复利」知识,随时间推移推动性能提升。
AIRA₃ 是这一系列系统的「下一代」。同批作者的研究轨迹可以追溯:2025 年 7 月,该团队在 ,让智能体在 MLE-bench(一个让智能体参加真实 Kaggle 竞赛的基准)上比赛,最佳配置把 MLE-bench lite 的拿牌成功率从 39.6% 提升到 47.7%;(2026 年 3 月底提交 arXiv,4 月 16 日发布于 )通过异步多 GPU 工作池、Hidden Consistent Evaluation 协议等设计,在 MLE-bench-30 上取得 24 小时 81.5%、72 小时 83.1% 的平均百分位排名(最强基线为 72.7%),并在 AIRS-Bench 的 20 项任务中 6 项超过人类现有最佳。
Meta 的跨域声明:延迟降 27%、泥板翻译达金牌水平
给出泛化声明:同一个系统,只更换任务规格,就能跨领域工作。Meta 称在内部基准上,AIRA₃ 把生产 GPU kernel(GPU 上执行的计算内核)的延迟降低了 27%;在另一场 Kaggle 竞赛(把有着 4,000 年历史的阿卡德语泥板译成英文)中也达到金牌水平。两项均出自 Meta 单方披露,其中延迟数据明确标注来自内部基准。
Meta 在推文中写明了自我定位:「我们还处于早期,硬问题还在前面」,并称「我们相信,一个能自我复利知识的系统是正确的押注」。对未来的措辞是系统有潜力「加速 AI 研究、解锁递归式自我改进」——这一句是目标表述,不是已交付的能力。
「那个没交复盘的队伍,是你们吗?」
官宣没有点名排行榜上的队伍 ID。——NVIDIA 机器学习与智能体方向的员工、6 次 Kaggle 特级大师——回复问道:「是你们吗?我们还在奇怪,那个队伍怎么没有分享复盘文章。」
7 次 Kaggle 特级大师 先肯定了测试方式:「你们在真实比赛里测试而不是在离线基准上过拟合,这很好。」随即提出质疑:「但我看到排行榜上还有 researcher4242 之类的其他账号,这感觉像是在扔飞镖碰运气。你们应该用一个专门给 AIRA 的账号——Kaggle 甚至禁止多账号提交。」这是他基于排行榜观察的个人猜测,目前未见公开证据佐证该账号与 Meta 的对应关系。
AIRA 团队成员 Martin Josifoski——AIRA₂ 论文作者之一——在 上给出内部回应:「据我们所知,这是自主 AI 研究系统获得的第一块金牌。」他评价 NVIDIA 的竞赛「提供了一个很好的评测环境:一个 LLM 研究任务、无污染、外部评分、可与人类专家对比」,并称文首那张配图是「最终结果出炉那一刻的回顾」——画面正是官宣推文与 AIRA₃ 宣传视频。
另一个回复来自 AI 系统开发者 :「单次比赛中 4,000 队里第 8 是个好结果。但在把它当作已验证的能力之前,生产团队会希望 AIRA₃ 在多次独立运行中复现这一名次。一次运行期间没有人在环的好结果,还不算可复现的流程。」排行榜上第 8 名对应的账号是谁、这次成绩能否在独立运行中复现,Meta 的官宣没有给出答案。