AREX Feed Article
EvoHarness-RL:Meta 用 RL 教会 Agent 管理长周期状态,ALFWorld 达 96.9%
Harness 策略不该手写,该被训练。
LLM Agent 的外部执行支撑——记忆、工具、状态追踪器、验证器、执行日志——在过去几年被不断塞进各类 Agent 框架。但一个事实始终没变:Agent 什么时候该查状态、什么时候该更新计划、什么时候该把经验写下来,仍然靠 prompt 模板或硬编码的规则来定。这些规则是人写的,不是 Agent 学出来的。
8 月 9 日, 披露了 Meta AI 与 UIUC 联合团队的新论文 。论文提出,Agent 的 harness 使用策略本身是一个可以被强化学习训练的对象。用一个 8B 参数量的 Qwen3-8B,在 ALFWorld 具身任务基准上把成功率从 ReAct 基线的 47.9% 拉到 96.9%——追平了 Claude Opus 4.5 的水平,并且超过了所有可比的开源训练方法。
论文标题:EvoHarness-RL: Learning Self-Evolving Runtime Harness for Long-Horizon LLM Agents 论文链接: 开源地址:暂未开源 核心成绩:Qwen3-8B 在 ALFWorld seen split 达到 96.9% 成功率,较 ReAct 基线提升 49.0 个百分点,追平 Claude Opus 4.5(96.4%),超越 SkillOS(80.2%)和 SkillRL(89.9%)。
BPE 三态 + 四动作:把散乱的 harness 抽象成可训练的协调接口
现有 Agent 系统的 harness 层内容五花八门:状态追踪器、执行日志、任务计划、验证反馈、情节记忆、技能库。尽管形式各异,它们在长周期交互中实际只解决三类反复出现的失败模式——Agent 丢失对当前环境的认知、忘记已经做过什么和接下来该做什么、以及在多次尝试中重复发现本可复用的经验。
EvoHarness-RL 据此把 harness 的外部状态统一抽象为三种策略可访问的功能角色:Belief(信念)存储从交互中推断的环境事实,让策略无需仅依赖上下文窗口来记住物体状态和位置关系;Progress(进度)以子目标-状态记录的形式外化任务分解和执行进度,把隐式的推理链条变成可检查的任务状态;Experience(经验)维护跨情节的可复用知识——技能、失败模式、搜索先验和高层策略。
Agent 与这套 BPE 工作空间的交互被压缩成四个元动作。track 从 Belief 中读取特定物体的状态或全局摘要;commit 向 Progress 写入子目标或执行更新;recall 从 Experience 中检索可复用的先验知识;note 记录新洞察供后续经验整合。这四个动作与环境动作共享同一个交互预算——每调用一次 harness 动作,就少执行一步环境操作。这意味着 Agent 必须学会判断:访问外部状态是否值得付出这一步的代价。
训练分两阶段。第一阶段是监督式 harness 微调(Supervised Harness Fine-Tuning):用 Claude Opus 作为教师模型,在同一套 BPE 接口下收集 ALFWorld 训练集中的成功轨迹。最终得到 87 条轨迹共 1153 个下一步动作样本,平均每条 26.5 步。
教师轨迹中约有 18% 的步骤是 harness 动作——commit 202 次、recall 114 次、note 55 次、track 34 次。Qwen3-8B 通过模仿这些动作学会 harness 的基本语义和构造有用外部状态的能力。
第二阶段是成本感知的 GRPO(Group Relative Policy Optimization)。轨迹级奖励由五个成分组成:任务成功(10 分的稀疏奖励,仅在完成任务时触发)、效率加成(成功前提下轨迹越短奖励越高)、动作多样性(随时间衰减的课程式奖励,鼓励早期探索)、重复惩罚和格式惩罚。
关键设计在于任务成功是严格的守门人——效率加成只在成功时生效,自然惩罚了冗余的 harness 查询。这种奖励结构推动 Agent 从「频繁调用 harness 作为脚手架」逐步过渡到「仅在收益超过成本时才访问外部状态」。
ALFWorld 96.9%:8B 模型打平 Claude Opus 4.5,把 ReAct 基线翻了一倍
实验在 ALFWorld 的六类具身家务任务上展开:简单取放(Pick)、开灯检查(Look)、清洗后放置(Clean)、加热后放置(Heat)、冷却后放置(Cool)、以及取两件物品(Pick2)。评估使用标准验证集的 140 个任务。
EvoHarness-RL 在 Qwen3-8B 上取得了 96.9% 的平均成功率,较 ReAct 基线(47.9%)绝对提升 49.0 个百分点。六类任务中有四类达到 100%——Pick、Heat 和 Pick2 全部解决,Clean 达到 95.5%,Look 和 Cool 分别为 92.9% 和 92.6%。
在冻结的记忆增强方法中,ExpeL 仅达到 49.3%,ReasoningBank 55.7%,Dynamic Cheatsheet 52.1%。这些方法给 Agent 加了更多外部记忆,但使用策略并未经过训练,效果远不如让 Agent 自己学会协调。
在可训练方法中,标准 GRPO(无 harness)达到 65.6%,SkillOS 达到 80.2%,SkillRL(使用 Qwen2.5-7B)达到 89.9%。EvoHarness-RL 的 96.9% 领先于所有这些竞争者。
从 EvoHarness 自身训练阶段看,仅靠推理时使用 BPE(EvoHarness-Base),成功率从 47.9% 提升到 56.4%,说明显式的外挂状态本身就有帮助。加入 SFT 后升至 68.6%,证明模仿教师使用 harness 的行为模式能带来实质增益。真正的跃迁来自 GRPO 优化——96.9% 表明,让 Agent 在成本约束下自己探索「何时用、何时不用」,远比模仿固定模式更有效。
消融实验揭示了 BPE 三态的协同性。从推理时 harness 中分别移除 Belief、Progress 或 Experience,平均成功率从完整的 56.4% 分别降至 50.0%、50.7% 和 48.6%。移除 Experience 的打击最重——Clean 任务从 63.0% 跌至 40.7%,Cool 从 48.0% 跌至 28.0%——说明跨情节的技能复用和错误规避在复杂状态变化任务中尤其关键。
在未见环境(unseen split)上,EvoHarness-RL 达到 86.6%,远高于 ReAct 基线的 50.0%。EvoHarness-SFT 在未见环境上反而从推理时 BPE 的 77.6% 跌到了 69.4%——作者认为这是因为 SFT 模仿了教师在已见环境中的 harness 使用模式,但未优化「何时访问外部状态才划算」,导致在陌生场景中出现误判。GRPO 阶段重新校准了这种访问决策,使策略学到了泛化性更强的协调模式。
BPE 的通用性在跨模型尺度实验中得到了独立验证。即使不加任何训练,仅将 BPE 作为 prompt-time 脚手架引入,GPT-4.1 的 ALFWorld 成功率就从 47.9% 跳到 70.0%(+22.1),GPT-5 从 60.7% 跳到 85.0%(+25.7),而论文作者称为"已经接近性能天花板"的 Claude Opus 4.5 也被推到 98.5%。这说明将信念、进度和经验外化,无论对多大的基础模型都是长周期任务执行中的关键需求。
训练中 harness 调用自己降了下来——模型把外挂「内化」了
EvoHarness-RL 论文分析了训练过程中出现的两种自发动态。
第一个动态被称为 harness annealing(harness 退火)。SFT 初始化后的 Agent 在 GRPO 早期频繁调用 harness 动作,把 BPE 当作显式脚手架来追踪状态、检索经验和缩小搜索空间。但随着训练推进,每轮平均 harness 调用次数快速下降并稳定在约 1 次——Agent 学会了把那些反复出现的 harness 使用模式吸收到模型策略内部,只在外部状态访问的预期收益超过其步骤成本时才保留访问。
进一步按动作类型拆解,不同动作的衰减速率完全不同。recall 最为持久——即使大量常规行为已被内化,跨情节经验仍持续提供有价值的搜索先验。commit 和 note 快速衰减至接近零,说明一旦稳定任务策略形成,Agent 不再需要显式外化每个中间计划或频繁写入新发现。track 走了一条中间路线:在早期状态消歧时有用,但随着 Agent 学到更直接的环境交互模式而逐步减少。
第二个动态是 harness evolution(harness 演化)——这次变化发生在 harness 一侧而非策略一侧。Experience 技能库在训练早期迅速膨胀,积累通用策略、任务特定流程、常见错误和搜索优先级。但随着训练深入,增长变得有选择性:冗余条目被合并,很少被调用的技能被淘汰(采用 LFU 驱逐策略),频繁被调用的知识被保留。最终形成的技能库紧凑而多样——它不再是一个被动追加的记忆日志,而是一块任务自适应的状态基底。
论文附录中给出了一个具体案例:Agent 需要清洗水壶并放到餐桌上。它先 commit 子目标「找到水壶」,然后 recall 清洗任务的阶段化流程和水壶位置先验。技能库返回的提示说水壶在台面上,但 Agent 连续搜索两个台面都为空后,没有盲从这条过期提示,而是转向炉灶区域找到水壶,随后执行 note 将纠正证据写回技能库。整条轨迹形成了一个 commit → recall → act → note 的闭环——harness 不是固定神谕,而是可修正的经验来源。
不是工具不够强,是协调策略不够聪明
EvoHarness-RL 的核心主张明确:长周期 Agent 的瓶颈不在工具大小或记忆容量,而在协调策略本身。当 harness 的使用决策从 prompt 模板变成可训练的 RL 策略时,一个 8B 模型就能在 ALFWorld 上追平顶级闭源模型。
论文同时指出了一个重要的方向性限制:不同动作的衰减模式是环境相关的。在 ALFWorld 这种任务共享可复用家务流程和物体搜索先验的环境中,Experience 最为关键;在更依赖视觉场景图的具身环境中,Belief 可能权重更高;在软件工程或工作流场景中,Progress 的追踪价值可能更突出。EvoHarness-RL 学到的是在给定环境的成本结构和状态需求下,BPE 的哪些部分值得访问——而非一套通用的 harness 动作分布。
目前代码尚未开源,论文未提及是否会发布模型权重或训练代码。