AREX Feed Article
BAAI 发布 DisCo 论文:蒸馏 1,000 个仓库为 5,000+ 技能,称 MLE-bench 提升 134.3%
9 月 2 日深夜(北京时间),一篇题为《Repo-To-Skill: Distilling GitHub Repositories Into AI4AI Skills》的论文提交到 arXiv,编号 2609.02749()。论文介绍名叫 DisCo 的研究 agent:它把仓库里「怎么把方法跑通」的知识蒸馏成可执行技能,再带着技能去做机器学习研究;署名单位包括北京智源人工智能研究院(BAAI)、中国科学技术大学、中国人民大学等()。Hugging Face 论文页面在标题下标出同一机构,9 月 3 日把论文列为当日第一(#1 Paper of the day),显示 117 次点赞()。
论文报告的核心数字:在 GPT-5.5 骨干、harness(执行框架)与下游执行预算都不变的条件下,给 agent 加装蒸馏技能后,MLE-bench 成绩比不带技能的同一 agent 高 134.3%,PaperBench 高 34.4%,FrontierCS 高 9.2%,PassNet 高 14.0%。技能来自论文介绍的 AREX-Skill 库:1,000 个常用机器学习(ML)仓库蒸馏出的 5,000+ 条经验证技能,归入 20 个领域、178 个能力族。这组数字全部出自论文作者自己的对照实验,属自报口径。
操作知识:agent 与仓库之间缺失的一层
论文的起点是一个判断:要端到端跑 ML 研究,agent 现在只带两样东西——模型骨干(backbone)和 harness(执行框架,负责编排、记忆、验证与迭代修正)。但真正做研究需要的实操经验,比如该选哪个方法、由哪个库实现、参数怎么配、实验挂了怎么救,这两层都不提供。
论文把这层缺失叫作操作知识(operational knowledge),定义是「知道一个方法和把它跑通之间的距离」。这类知识并不稀缺,仓库与论文里到处都是,只是写给人读,体量又大到无法在任务中途加载。DisCo 的答案是预先把它蒸馏成技能(skill),让知识在任务开始前就以 agent 能调用的形式就位。
一条技能分三层:SKILL.md 说明技能何时适用、按什么流程执行、如何验证;references/ 存放按需加载的深层文档;scripts/ 放可直接执行的脚本。同一仓库蒸馏出的多条技能组成技能图,由路由(router)先按「领域→能力族→仓库」收窄,agent 只加载当前任务需要的那条分支,不必把整库读进上下文。
蒸馏分两种。任务无关蒸馏以仓库、论文为源头,提前产出可长期复用的技能;面向任务的蒸馏以具体问题为源头,现场分解任务、找能力缺口、再搜索材料补齐。
两条路径走同一套四步流程:界定能力(scope)、取证(ground)、构造技能图(construct)、验证(verify)。验证被论文称为「蒸馏区别于摘要」的闸门:候选技能要跑断言式检查或仓库自带的安全示例,失败先修,修不掉的缺口如实记入构造记录,没有技能能仅凭来源就入库。
整套蒸馏跑在 DisCo 的 Creator(创建者)模式里,产出写入技能库;做研究时由 Researcher(研究者)模式按需取用。两种模式在成本上刻意不对称:Creator 对每个源头只付一次构造代价,摊到之后所有用到它的任务上;Researcher 只读任务真正打开的那几条技能。
一个月,技能库从 170 个仓库长到 1,000 个
AREX-Skill 比论文早一个月出现在 GitHub 上()。仓库自己的发布记录写着两条:8 月 3 日首发,带 Creator 与 Researcher 两套流程,覆盖 170 多个常用仓库;8 月 27 日,库扩展到 1,000 个仓库、5,000+ 条技能,路由层随之重建。
论文给出更精确的快照:5,353 条技能构成 1,000 个仓库技能图,归入 20 个领域、178 个能力族;仓库到「领域-能力族」路径共有 2,209 次精确指派,其中 700 个仓库出现在不止一个能力族。
1,000 个仓库按开源可见度与实际使用挑选,GitHub stars 是筛选信号之一。技能由 GPT-5.5 与 GPT-5.6-sol(高推理强度)蒸馏,平均每个仓库的构造成本约 40 美元。
材料整体已经公开:arXiv 全文 48 页、3 张图;GitHub 仓库的仓库级代码为 Apache-2.0 许可,每条技能另带自己的许可证;命令行工具(CLI)以 npm 包 @arex-skill/disco 发布,当前版本 0.2.1()。
CLI 与论文里是同一套 DisCo:Creator 角色负责建技能、导技能、验技能,Researcher 角色带技能做研究,要求 Node.js 22.19 以上与至少一家模型服务商的凭据。按 README 的示例,还能把选定的技能导出给其他编码 agent,比如写入 Codex 的 ~/.agents 或 Claude Code 的 ~/.claude 目录。
同一模型、同一 harness,技能是唯一变量
评测想隔离的只有技能本身。论文固定使用 GPT-5.5 骨干(xhigh reasoning)与 OpenAI Codex 作为 harness,带不带 DisCo 技能是唯一变量;技能全部在基准运行前建好,构造预算单独计算,不计入任何一组的运行预算。
变化最大的一组在 MLE-bench,一个基于 75 个 Kaggle 竞赛的机器学习工程基准:任何奖牌率(Any Medal)从 31.11% 升到 72.89%,高 41.78 个百分点,相对提升 134.3%。低、中、高三个难度档全线上涨,最难的一档从 13.33% 涨到 62.22%,相对提升 366.8%。
对照不止于有技能与没技能。同一张表里,Codex + AREX-Skill 的 72.89% 比公开排行榜的最强基线 Famou-Agent 2.0(64.44%,Gemini-3-Pro-Preview)高 8.45 个百分点。论文注明:公共基线取自 MLE-bench 官方排行榜,AREX-Skill 一侧的数字是三次重复运行的平均值。
其余三个基准的协议各不相同,GitHub 对照表与论文图 1 给出同样的三组数字:PaperBench 上复现 20 篇论文,复现分从 29.45 升到 39.59(+34.4%);FrontierCS 的 188 个算法优化任务共用一张技能图,分数从 70.63 升到 77.14(+9.2%);PassNet(编译器 pass 优化)的 AS Score 从 1.343 升到 1.531(+14.0%)。
其中 PaperBench 的技能只从目标论文相关工作圈出的 153 篇源论文蒸馏,共 636 条,目标论文自身与随附代码被排除在技能来源之外,防止技能从目标论文里直接拿到答案。
作者在 README 里对规律的总结是:越难的任务,技能的增益越明显;技能帮 agent 躲开昂贵的无方向试错,把预算花到实验和验证上。
榜单之外,尚无独立复现结果
论文上线至今不到一天,公开渠道还没有独立复现这篇论文的结果;四个基准上带技能与不带技能的数字,全部出自作者自己的对照实验。
上手路径是现成的。按 README 的说明,装好 Node.js 22.19 并配好模型服务商凭据后,npm install -g --ignore-scripts @arex-skill/disco 装上 CLI,disco repo-skills install 拉下技能库,就能在本地带着技能库跑研究任务。arXiv 全文、GitHub 技能库与 npm CLI 三个入口,提交者已在 HF 讨论区一并贴出。
论文的主张不止一组数字:技能被设计成独立于模型与 harness 的一层,可以跨 agent 迁移、随任务积累、随上游仓库刷新。134.3% 站不站得住、这一层能否被外部复现,是论文留下的问题;答案要等第一个独立复现者跑出来。