AREX Feed Article
WecoAI CEO Zhengyao Jiang 发布 AIDE² 论文:让 AI 研究智能体提升自身研究效率,新增跨模型迁移结果
UTC 时间 2026 年 9 月 23 日 16 时 36 分(北京时间 24 日凌晨),WecoAI 联合创始人兼 CEO Zhengyao Jiang 在 X 连发四帖,宣布发布关于 AIDE² 的 arXiv 论文。他称 AIDE² 是让 AI 研究智能体提升自身研究效率的 RSI(递归自我改进,Recursive Self-Improvement)系统,并表示论文包含跨模型迁移以及与更多 AI 研究智能体对比的新结果。
显示,论文题为《Recursive self-improvement of AI research agents》,于 9 月 22 日提交,编号 2609.26457,五位作者 Dhruv Srikanth、Bingchen Zhao、Dixing Xu、Yuxiang Wu 和 Zhengyao Jiang 均署名 Weco AI。四帖在一分钟内发完,首帖截至发稿获得 118 个赞、17 次转发和超过 7,500 次浏览。需要说明的是,论文中的实验结果均为作者方报告,尚未经独立核实。
四帖连串,两项新结果摆在最前
只有三句话:「我们正在发布关于 AIDE² 的 arXiv 论文。这是让 AI 研究智能体提升自身研究效率的 RSI 系统。它包含跨模型迁移的新结果,以及与更多 AI 研究智能体的对比。」帖末附有一张图片。
给出第一项新结果:团队早前的实验已经显示,研究效率上的增益能跨任务、跨基准泛化;而后续实验显示,这些增益还能跨模型迁移——「尽管这套 harness 是用 Gemini 3 Flash 优化出来的」。harness 指包在模型外围、控制智能体搜索、上下文与验证的代码层。
是第二项:进化出的智能体胜过了人工基线,而在 FML-Bench 上,「AIDE_human 与进化后的 AIDE_85 取得了未针对该基准优化的智能体中最高的两个平均分」。贴出论文链接,并点名致谢 @DhruvSrikanth、@BingchenZhao、@dexhunt3r、@yuxiangwu_ 四个账号。
这轮工作 7 月已经亮过一次相。今年 7 月 14 日,Jiang 曾用七帖连串宣布同一方向的结果——让自动研究流程改进自动研究智能体本身,跑了八天,并称其为「第一份递归自我改进的实验性证据」;后来获得约 183 万次浏览和 9,600 多个赞。这次的论文把那轮实验写成正式的 arXiv 论文,并加入了新跑的对比实验。下面这张图来自论文附录 C,正是 Jiang 所说的「跨模型迁移」实验。
双循环:被改写的对象是智能体自己
论文把递归自我改进落在一个具体层面:harness。引言称,智能体最终表现出的能力,相当一部分由这一层决定,相关证据放在附录 C。
AIDE² 的做法是双层循环,把它们写成一棵嵌套的树搜索。内循环里,一个研究智能体在三类任务上改代码——ML 工程(训练模型达标)、启发式算法工程(竞赛式组合优化)、harness 工程(改进智能体自身的提示、上下文管理与反馈回路)——它返回的解在私有留出数据上打分,汇总成一个等级。外循环则以内循环智能体的研究效率为目标,直接改写内循环智能体的代码;每次被接受的改写,就成为下一轮被编辑的对象。
起点是 AIDE_0:团队 2025 年 AIDE 智能体的精简重构版,AIDE 曾在 MLE-Bench 上有靠前的表现。对照基线是 AIDE_human,Weco 研发团队用两年人力研发、在产线使用的研究智能体。模型分工固定:内循环的每个候选都用 gemini 3 flash 评估,论文的解释是,在任务预算下这个模型匹配甚至略超更贵的选项;外循环则由 claude opus 4.7 驱动——论文的理由是,评估每个候选的开销在成本中占大头,因此把能力更强的模型放在负责提出改写的一方。每个任务都有固定的美元预算,覆盖 token 和执行开销;这样测到的任何增益,只能来自更好的算法,而不是更多的算力。
八天、99 个提案、七次被接受的改写
论文报告的主运行持续了 8 天墙钟时间,产生一条 100 节点的轨迹:初始智能体加上 99 个改写提案。其中 7 次被接受,分别落在第 2、6、28、39、47、63 和 85 步;内循环的私有等级从 0.703 一路升到 0.778,超过了 AIDE_human 在同一口径下的 0.749。
七次改写在论文图 2 里各有名字:第 2 步引入对草稿策略的多臂老虎机选择;第 6 步要求任何修复前先给出根因诊断;第 28 步靠分叉当前最优解逃离平台期;第 39 步在一次健壮性修复尝试崩溃后完成自我修复;第 47 步修好了会让评估崩溃的错误;第 63 步学会了先压缩日志噪音再读日志;第 85 步把一个易失败的草稿策略降级。同一协议另外两次完整运行,分别接受了 2 次和 4 次改写——论文以此说明改进不是一次幸运的命中。
跨模型迁移:换三个模型,增益都还在
Jiang 所说的第一项新结果出自附录 C。团队把 AIDE_0 和 AIDE_85(第 85 步改写后的最终产物)放在 ALE-Bench 和 MLE-Bench 上,各配三个模型:选择过程中使用的 gemini 3 flash,OpenAI 的 gpt-5.6-sol,以及 Anthropic 的 fable 5。后两个模型贵得多,于是每轮预算从 5 美元提高到 20 美元,ALE-Bench 的时间限制也从 12 小时放宽到 36 小时。
按论文报告,AIDE_85 相对 AIDE_0 的增益在两个基准、三个模型上全部保持。ALE-Bench 上,配 gemini 3 flash 的 AIDE_85 得到 1,858±22 分,超过了同预算下配 fable 5 的 AIDE_0(1,796±24):进化过的 harness 让较便宜的模型超过了配着旧 harness 的更强模型。MLE-Bench 上的增益小一些——配 fable 5(该基准上最强的模型)时,AIDE_85 与 AIDE_0 的差距缩到一个标准误之内,图上分别是 0.828 和 0.823。图注还记了一笔:48 次运行触及模型的上下文窗口上限,按终止时的最佳候选计分。
Jiang 在里用「出乎意料」来形容这一结果。
人工基线有多强:FML-Bench 上高于六个对比智能体
第三帖追问的是:进化智能体赢了自己的人工基线,那这个基线在研究社区里算什么水平?论文附录 B 的回答是一张七柱对比图:在 FML-Bench 的 18 个任务、每个任务 3 个种子上,AIDE_human 的平均测试改进达到 19.6%,高于该基准作者评估过的全部六个智能体——AI Scientist v2(19.3%)、Autoresearch(19.2%)、AIDE(17.8%)、OpenEvolve(15.1%)、AI Scientist v1(13.2%)和 AIRA(13.2%),其中带星号的结果由 FML-Bench 作者提供。
论文的主结果以这个基线为参照展开:在四个从未参与选择的基准上——ALE-Bench、MLE-Bench、FML-Bench,以及基于物理过程数值模拟的 WeatherBench 2(最后一个相对选择任务是分布外数据)——AIDE_85 全部持平或超过 AIDE_human。增益并非沿谱系单调走高:ALE-Bench 和 FML-Bench 上 AIDE_85 最好,MLE-Bench 和 WeatherBench 2 上则是中途第 47 步的 AIDE_47 领先。论文对此的解释是,选择信号来自一组异构任务的平均,强检查点之间的非单调属预期之内。
奖励作弊率意外下降,点火测试悬而未决
论文还报告了一个循环从未显式优化的变化。在 KernelBench 的一个子集上——38 组 GPU 核心与训练场景的组合,属分布外任务族——团队测量各进化检查点的奖励作弊(reward hacking)率,也就是智能体让代理指标上涨、却不带来真实下游收益的比例:智能体先在隔离的加速测量上优化 GPU 核心,再把产物嵌入 GPT-2、ViT 和 CNN 的训练回路,看代理增益能留存多少。数值沿谱系一路走低:AIDE_0 为 55%,AIDE_47 为 39%,AIDE_85 为 32%,而人工基线 AIDE_human 是 39%。论文把这一项称为涌现行为,同时留了余地:这些比率能确立留出数据上的行为变化,却定位不了是哪几次改写起了作用。
递归自我改进要把收益递减变成收益递增,进化出的智能体就得比发现它的智能体更会驱动这个循环——论文把这个检验称为点火测试(ignition test),它没有给出定论。测试设了两个分支,都从同一个内循环智能体 AIDE_47 起步,各跑 3 个种子、50 步,只换外循环的驱动者:一组用 AIDE_47,一组用 AIDE_human。结果两组的平均终点是 0.780 对 0.782,AIDE_47 分支约 20 步就进入终点区域,AIDE_human 那组用了约 40 步。但论文的措辞很克制:每个外循环智能体只有 3 个种子,「这些结果是不定论的」,双方谁更擅长驱动递归自我改进,都不作声称。
Discussion 一节把边界说得更直白:双层循环里噪声会叠加,一次误接受的改写就可能带偏外循环后续搜索;要做更确定的对比,需要更多外循环种子、再加一整套留出评估,成本「高得令人却步」(prohibitively costly)。进化产物本身也复杂难解释——哪些组件真在起作用、哪些只是早前步骤的遗留,论文承认并不清楚。
回复区里的追问集中在验证上。X 用户 评论说,固定美元预算排除了「多花别人的钱」这条最老的生产力捷径;说,用任何没有物理依据的东西当约束都可能导致自欺,举例说,更大的模型只有在同等推理算力下把任务完成得比小模型更好,才算代表进步。在 X 上自述为德州农工大学(Texas A&M)统计学博士生的 认为,附录 C 那组固定 20 美元预算的对比「有用」——它检验的是同等花费而非同等调用次数下 harness 是否有帮助,而 fable 5 在 MLE-Bench 上偏小的增益也说明,解读迁移需要看任务与模型的逐项拆分。用户 则希望论文旁边配上「复现凭据」:智能体版本、种子任务、harness commit、基线分数、改进后分数、失败的迁移与分歧原因——「这样 RSI 才是一个可以重跑的实验,而不是 PDF 里的庆功」。
参考链接
- _