AREX Feed Article
Scale AI Labs 上线 RSI Bench,Alexandr Wang 称赞“great initiative”
8 月 17 日,(@ScaleAILabs,账号简介自称“from the researchers at @scale_AI”)与 (@mhrezaeics)上线了 RSI Bench(),一个评测 AI 递归自我改进(recursive self-improvement,RSI)能力的基准项目。8 月 18 日 17:02(UTC),Scale AI 创始人 Alexandr Wang 发推称赞:“great initiative (RSI benchmark) from @ScaleAILabs and @mhrezaeics”()。
当晚 22:07,实验室账号又发布 HarnessOpt-Bench,让一个模型去改进另一个 AI 代理的代码()。论文 8 月 6 日已挂在 ,用 111 次计分运行对比 5 个前沿模型:claude-opus-5 在 4 个任务中的 3 个上领先,gpt-5.6-terra 用原生 codex 在 BrowseComp-Plus 上得分 −0.03,改出来的代理反而不如种子。
先把“AI 造 AI”变成可测的分数
RSI Bench 官网首页把要回答的问题放在最前面:“我们正在目睹 AI 进入构建 AI 的循环。开放问题是,模型能否实现递归自我改进:在无人干预的情况下自主构建下一代模型”()。称,自我改进的前提是掌握前沿 AI 研发各阶段的技能,因此 RSI Bench 收集由一线研发专家设计的任务:每个任务提供起始环境、算力预算和一套 verifier,相对基线打分。
除最终结果外,基准还评测四项行为:可靠性(能否区分真实进步与噪声)、效率(有限资源下的解法)、泛化性(解法是否超出具体任务)、想法质量(能否提炼洞见、综合知识、提出新方法)。
Rezaei 的 X 简介自称在 Scale AI Labs 从事 post-training(后训练)研究,此前在 @StanfordNLP 和 @UArizona。他在 8 月 17 日的里解释时机:“AI 研发的工作一直属于人类。但第一次,它不再确定永远如此。递归自我改进已经进入视线范围;它可能还很远,但已经近到我们应该开始测量它。”这条推文截至本文写作时获 386 赞、超过 11.7 万次浏览。
次日他又补了一段论证():“一个真正有能力的系统也许根本不会用我们的方式造模型。但在系统能改进我们的设计之前,它必须先能产出这些设计;超越人类的造模型能力,以追平它为前提。”结论是:测量这些技能不是偏离“更好的东西”的歧路,而是它的前提。
HarnessOpt-Bench:一个模型给另一个代理改代码
HarnessOpt-Bench 把 RSI 切成一个最小可测的切片。官宣文案说:“一个模型改进另一个 AI 代理的代码,是递归自我改进的一个具体、可测量的切片。那么哪些前沿模型真的擅长这件事?”()
任务协议(、)是:一个优化器(optimizer,LLM 加编码代理)拿到目标代理的种子 harness(提示词、工具、控制流、记忆与编排代码的统称)、带评分的评测反馈和固定预算;它改写 harness 并提名最终版本,由搜索期间不可见的 held-out 测试集打分。
预算上限是每个分区 100 次评测调用、开发与验证分区各 4 次完整过卷。可信执行环境守住评测边界、计量目标代理资源消耗,所有候选版本留档可审计。
4 个下游任务是 OfficeQA、BrowseComp-Plus、Terminal-Bench 和 GAIA。种子故意不调优:论文称 OfficeQA 的种子是约 130 行的 Python 代理,GAIA 的种子是跑不起来的空壳(non-functional stub)。
5 个模型(claude-opus-5、claude-sonnet-5、gpt-5.6-sol、gpt-5.6-terra、kimi-k3)先在共享的开源 harness opencode 下比赛,再各自用原生 harness(claude-code、codex、kimi-cli),共 111 次计分运行。论文 7 位作者均署名 Scale AI。
模型之间的差距,大于工具链的差距
论文的给出三个发现:优化器模型之间的差距,大于它们借以行动的编码 harness 之间的差距;原生 harness 没有一致性优势;不同任务与种子 regime 之间的增益差异很大。
分数是相对种子的归一化增益,每个任务有一条分辨率带(OfficeQA ±0.045、BrowseComp-Plus ±0.066、Terminal-Bench ±0.054、GAIA ±0.035),小于带宽的差异不算数。论文 Table 1 的主要数字():
- claude-opus-5 用 opencode 在 OfficeQA、BrowseComp-Plus、Terminal-Bench 拿到 0.63、0.48、0.29,均为该任务最高;在 GAIA 也有 0.47。
- kimi-k3 用原生 kimi-cli 在 OfficeQA 拿到 0.59,与 claude-opus-5 用 claude-code 的成绩持平。
- gpt-5.6-sol 用 codex 在 GAIA 拿到 0.49,全场最高。
- gpt-5.6-terra 用 codex 在 OfficeQA 只有 0.07,在 BrowseComp-Plus 是 −0.03,提名版本比种子更差。
claude-opus-5 用开源 opencode 的成绩全面高于用原生 claude-code(0.63 对 0.59、0.48 对 0.41、0.29 对 0.18、0.47 对 0.42),这正是“原生 harness 并不一致地更优”的直接例子。共享 harness 的均衡网格上,claude-opus-5 的 LSS-λ 估计为 +0.228,唯一进入第一梯队;gpt-5.6-terra 为 −0.174,垫底。
论文还分析了搜索轨迹:干预面更广的优化者拿到更高的 held-out 增益,而仔细研读失败轨迹的做法很少被采用,且与增益没有正相关。摘要的收尾判断是:harness 优化是一种可测量、可区分、仍有大量提升空间的能力。
Alexandr Wang 点赞,社区开始出题
Wang 的推文(截至本文写作时获 245 赞、约 5.4 万次浏览)比他创办的 Scale AI 旗下实验室的 HarnessOpt-Bench 官宣早了约 5 小时,他称赞的对象是 RSI Bench 整体项目。他目前的 X 简介自称“Meta 首席 AI 官、Meta Superintelligence Labs 创始人、Scale AI 创始人”()。Rezaei 在 17:59 转发了这条推文()。
社区里跟进最具体的是 Chenguang Wang(UC Santa Cruz 计算机系助理教授,简介自称 Scale AI 研究顾问):他当晚 22:05 发推说,AI 正在加速 AI 研究本身,“回答这个问题需要社区的努力”,RSI-Bench 就是要建这样一个基准来找出答案()。
Scale AI 幕僚长 Manana Hakobyan 发推:“day 2: check out rsi-benchmark.com and contribute”()。也有人玩梗:ShadowAguy 在官宣下回复“我还在等递归自我改进先把基准本身改进一下”()。
每个任务 $2,000:RSI Bench 悬赏换题源
RSI Bench 的题目要靠社区贡献。实验室 8 月 17 日晚发布征集():前 50 个被接受的任务每个奖励 $2,000,贡献者获得 RSI Bench 研究论文共同署名、Modal 计算积分和研究社区 Slack 权限。
写明每个任务由四部分组成:Instructions(给代理的指令)、Baseline(要击败的强参考解)、Environment(工作区容器)、Verifier(打分脚本);提案先经社区和 Scale 团队评审再入库。
8 月 18 日深夜,Rezaei 报告进展:“刚往 rsi-benchmark.com 加了 128 条 traces,附上初始任务与观察。环境(environments)接下来放出。”()
截至发稿,RSI Bench 官网首页仍把“模型能否在无人干预下自主构建下一代模型”列为开放问题。这个基准目前能做的,是把问题拆成可靠性、效率、泛化性、想法质量四个可打分的维度,然后等社区出题。