AREX Feed Article
腾讯混元研究科学家 Yucheng Shi 发布 122B MoE 终端 Agent T1,自报 Terminal-Bench 2.1 解决率 64.0%
9 月 11 日,腾讯混元(西雅图)研究科学家 Yucheng Shi 公布研究成果 T1:一个 122B 总参数、10B 激活参数的混合专家(MoE)模型,用强化学习后训练成终端 Agent,在云端沙箱里操作真实 shell(命令行),单任务可进行 300 多轮工具调用。他的 简介标注为“腾讯混元 LLM(西雅图)研究科学家”,并注明观点仅代表个人。
他自报的基准成绩是:Terminal-Bench 2.1 解决率从基座模型的 43.8% 提升到 T1 的 64.0%;在 Long-Horizon Terminal Bench(LHTB)上平均奖励 27.9%,帖文称超过 GLM-5.1。这些数字均出自作者方发布的技术报告与项目页。报告《T1: Terminal Agent Reinforcement Learning for Long-Horizon Tasks》已在 和 上线。
提升的构成:SFT 贡献 5.6 个百分点,RL 再贡献 14.6 个百分点
技术报告由 7 人署名:Junyao Yang(共同一作、通讯作者)、Yucheng Shi(共同一作)、Zhongzhi Li、Ruhan Wang、Zongxia Li、Haitao Mi、Leowei Liang。标注的机构是 Tencent Hy Foundation Model Frontier、新加坡国立大学、佐治亚大学、印第安纳大学与马里兰大学帕克分校。T1 的起点是 Qwen3.5-122B-A10B,用 PPO(近端策略优化)在终端任务上做后训练。
项目页把从基座到 T1 的提升拆开算:中间的 SFT checkpoint(检查点)达到 49.4%,较基座高 5.6 个百分点;RL 再贡献 14.6 个百分点,约四分之三的增量由终端任务上的强化学习获得。帖文称,从基座到 T1 的相对提升为 46.1%。
另外两个留出基准上,Long-Horizon Terminal Bench(46 个高难任务,按平均奖励计分)基座 18.9%、SFT 23.6%,作者称 T1 与 Gemini 3.1 Pro 持平、并高于 GPT-5.4(27.2%)与 GLM-5.1(26.7%);Terminal-Bench Hard(100 个任务)基座 20.0%、SFT 28.3%、T1 38.0%,高于 DeepSeek V4 Pro 的 36.0%。三个基准都不参与训练。
在帖文回复中,Mikhail Drozdov()写道,300 多次工具调用的设定才是这里有用的测试:“终端工作会因累积的小错误而失败,而不只是一条坏命令。”
对比口径:同一 harness 的成绩,与其他 harness 的参照行
项目页给出的同 harness(承载 Agent 与基准交互的执行框架)对比中,T1 高于 GPT-5.4(54.8%)、DeepSeek-V4-Flash(56.9%)与 Claude Opus 4.6(63.8%),低于 Claude Opus 4.7(66.1%);页面称它是同规模区间里最好的模型。三个套件运行同一套配置:由 Harbor 承载的 Terminus-2,关闭显式 thinking(思考模式),开启主动上下文压缩,每次尝试新建云沙箱,每任务 3 次尝试取平均。
作者把对比表分成两区:上区是同 harness(Harbor/Terminus-2)下评测的模型,下区是其他 harness 的公开榜单行,注明仅作参照;harness 的选择会实质改变分数,Claude Opus 4.6 在 Claude Code 下是 70.1%,在 Terminus-2 下是 63.8%。LHTB 对照里用到的 GLM-5.1 与 Gemini 3.1 Pro 成绩,都列在下区。
跨基准的排序也不一致:同 harness 下,Claude Sonnet 4.6 在 Terminal-Bench 2.1 上得到 51.5%、低于 T1,在 LHTB 上却记录 37.3%、高于 T1。作者由此写道,长程表现值得单独评测,不能从单一排序推断。
二值奖励未能超过监督基线,改用逐条断言计分
项目页交代了这套奖励设计的来由:一个 rollout batch(一批采样轨迹)要花掉数百沙箱小时,而二值结果每条轨迹只回报 1 bit;最初那轮二值奖励实验从未超过监督基线,因为很多任务难以一次做完,即使满足了一部分要求,这些轨迹也全部得零分,部分进展完全不可见。
作者随后换用验证器的完整分辨率:每个任务自带的验证器逐条报告断言结果,训练时按通过的断言个数计分,尺度在整场实验开始前固定一次。选通过断言的个数而不是比例,是因为 batch 混合了易题与难题,比例会让“长任务完成一半”看起来等同于“短任务完成一半”。逐条报告缺失时回退到二值结果,真正解出的任务就不会得零分。
帖文把这条经验概括为一句话:“一个失败的终端任务里可能包含可观的进展。”能否从中学习,取决于整条训练管线:PPO 在 15K 条审计任务上训练,用逐断言验证给部分进展发奖励,再配一个暖启动的 critic(价值网络)做信用分配(credit assignment)。作者称,这与 DeepSeek-V4.1 的观察一致:数据与环境管线更好,既有的 RL 方法就能释放出显著增益。
critic 负责把标量奖励的信用分配到整条轨迹:它先于 actor(策略网络)训练,并把更新前的价值交给 actor,让优势估计与价值裁剪锚定在同一个固定函数上。作者报告,冷启动时 critic 的解释方差(explained variance)一开始就深度为负,并在大半程保持为负;暖启动后从未转负。训练奖励在前期上升后进入一个窄幅平台,作者强调这个平台不是停滞:留出基准在整段平台期里仍在改善。
TITO 与路由回放:训练与推理的对数概率差从 0.021 降到 0.013
项目页把稀疏 MoE 的训练与推理一致性拆成两条轴来解决。专家持有大部分参数,离散路由器为每个 token(词元)只挑出一小部分;采样栈与训练栈之间极小的数值差就可能翻转专家选择,在 rollout 与训练之间换掉一个子网络,而 harness 又在每个轮次边界扰动 token 流。归因一旦错位,梯度就会落到一个从未产生过数据的策略上。
T1 的解法也分两轴:TITO 管 token,训练直接使用采样器返回的 token id 与对数概率,并在轮次边界按严格前缀、裁剪归一化、文本空间重分词或另开 chunk 四种情形修复漂移;R³(rollout routing replay)管专家,记录推理时每层选中的专家集合,训练前向复用这份记录,门控仍读当前参数的实时分数,既消除了 top-k 的不连续,又让路由器保持可训练。
两个机制合起来,把掩码加权的训练与推理对数概率差从 0.021 降到 0.013,损失区的 token 漂移为零。作者还列了一组刻意不用的手段:两个 KL 项关闭、MoE 负载均衡系数为零、替代目标对称裁剪、Adam 配常数学习率、不加熵奖励,以及会给最长试验带来轻微偏置的过采样。
15K 任务池:递归合成、八维审计,与基准不相交
训练数据来自递归任务合成:每一轮把已接受的任务当种子,用额外的可执行步骤把参考解改得更长,再对齐环境、验证器与公开指令。难度先加在可执行路径上,再重写指令,任务不会退化成“同一行为的更长提示词(prompt)”。
合成出的池子还要过审计。八个评估维度按面归并后,验证器占 45%、解法占 25%、指令占 20%、任务价值占 10%;指令与验证器不一致构成“隐藏需求”,任务会被硬性拒绝,同样被拒绝的还有测试泄漏、解法投机和弱到无法验证目标的验证器。T1 最终训练的 T1-15k 就是审计后留下的 15K 子集,其前五大类别占全部任务的 67.9%,明显集中在命令行工程。
作者强调训练语料完全在分布外:种子隔离、合成任务与 Terminal-Bench 2.1 不相交;按他们的说法,这让增益反映真实的能力迁移,而非对基准的过拟合。
已发布的 checkpoint 与轨迹,以及作者列出的局限
与报告一同发布的,还有 Hugging Face 上的 :RL checkpoint T1-122B-A10B(标注其派生自 Qwen/Qwen3.5-122B-A10B),以及 Terminal-Bench 2.1、Long-Horizon Terminal Bench、Terminal-Bench Hard 三条基准的轨迹数据集。checkpoint 以 CC BY 4.0 许可发布,基座模型的 Apache 2.0 条款继续适用。
作者列出的局限同样具体:增益集中在 Medium 难度,Easy 档三个 checkpoint 都达到 100%;Medium 档 T1 为 78%、SFT 58%、基座 56%,较 SFT 提升约 20 个百分点;Hard 档从 20% 升到 33%,较 SFT 仅多 3 个百分点。文件操作仍然难,GPT-5.6 Sol 在数据科学、科学计算与数学上仍然领先;在与 GPT-5.6 Sol 的对照中,T1 在调试上达到 100.0%、在系统管理上达到 88.9%,但平均轮数为 94.4,远高于 SFT 的 31.5 与基座的 41.1。
更长的交互既是能力也是成本。在代表性未解决任务上,T1 会花掉数百轮并最终超时,而更强的基线只用几十轮;作者写道,这些比较中的资源设置也不同,这限制了把差距完全归因于能力。