AREX Feed Article
OSWorld 2.0 新 SOTA:不看屏幕反而更准,Salesforce 用「状态优先」范式将 Claude 4.8 成功率提升至 26.9%
计算机使用智能体的瓶颈不是"看不清楚",而是"看错了地方"。
2026 年的 Computer Use 赛道不可谓不热闹。Claude Computer Use、OpenAI Operator、UI-TARS、Aguvis……几乎所有玩家都在卷同一件事:让模型把屏幕截图看得更准,定位更精确。但 Salesforce AI Research 刚刚发布的一篇论文提出了一个反直觉的主张——截图是一个谎言。他们用一个名为 StateAct 的多智能体框架,让 Claude Opus 4.8 在 OSWorld 2.0 长程计算机使用基准上取得了 26.9% 的二元成功率——这是唯一突破 21% 公共前沿的系统,同时成本仅为同模型截图方案的约 1/9。
论文信息
- 论文标题:StateAct: Program State, before Pixels, for Long-Horizon Computer-Use Agents
- 论文链接:
- 开源地址:暂未开源
- 核心成绩:在 OSWorld 2.0 上,StateAct 将 Claude Opus 4.8 的二元成功率从 20.6% 提升至 26.9%(+6.3 点),部分成功率从 54.8% 提升至 61.6%(+6.8 点),成本约 9 倍降低(~$7.8 vs ~$72/任务),成为该基准上唯一超越 21% 公共前沿的系统。
当所有人在卷「视力」,有人在卷「眼睛往哪看」
过去一年,计算机使用(Computer Use)智能体的进步几乎全部来自感知侧的提升:更强的视觉模型、更准的 UI 元素定位、更丰富的截图标注策略。UI-TARS、Aguvis、Set-of-Mark 等方法本质上都在回答同一个问题——"屏幕上的这个按钮到底在哪里?"
但 Salesforce 团队指出了一个被行业集体忽视的事实:桌面任务的交付物不是一张截图,而是程序状态的改变——保存的文件、修改的表格、写入的日历事件。截图只是这个状态的有损渲染。一个电子表格可以显示相同的汇总数字,无论单元格里是公式还是字面量;相关行可能隐藏在屏幕之外或被滚动遮挡。像素看不透这些差异,但代码可以精确读写它们。
StateAct 的核心主张因此变得清晰:让智能体以程序状态(program state)而非渲染像素为主要交互界面。团队将此称为"状态锚定"(state-grounding)。在 OSWorld 2.0 的 108 个长程任务中,StateAct 将同一 Claude Opus 4.8 模型的二元成功率推至 26.9%,成为唯一突破 21% 公共前沿的系统,同时将每任务成本从约 72 美元压缩到约 7.8 美元。
三个组件:代码主力 + 截图替补 + 独立裁判
StateAct 的架构围绕三个核心组件展开,每个都贯彻了"状态优先"的哲学。
第一,状态驱动的主智能体(Act on State)。 主智能体的动作空间由代码和结构化操作构成:持久化的 bash 终端、Python 解释器、文件编辑器,以及一个只读的图片查看工具。它不暴露任何屏幕操控能力(没有鼠标、没有键盘模拟)。当任务需要处理一个电子表格,主智能体直接用 load_workbook 读取单元格公式;当需要修改日历,它直接操纵 .ics 文件。团队还设计了一个"状态发现"(state discovery)机制:智能体通过模型先验知识(知道常见桌面软件将状态存在哪里)和主动探测(find/ls/grep/sqlite3)来定位状态存储位置。
然而,纯代码并不够。如果直接禁掉 GUI 交互,同样是 Claude Opus 4.8,部分成功率会从 61.6% 暴跌到 45.9%——甚至低于截图基线的 54.8%。原因很简单:并非每个应用都有可编程 API;拖拽画布选区、关闭不可脚本化的弹窗、读取仅存在于屏幕上的值——这些必须通过视觉通道。
因此 StateAct 在架构中保留了一个专用的 GUI 子智能体(GUI specialist),仅在主智能体判定子目标"不可化约为代码"时调用。实际测量结果令人惊讶:在 108 个任务中,仅有 28 个任务触发了 GUI 子智能体,且 GUI 交互仅占主智能体步骤的 1.1%。这就像一支施工队,主力全部通过蓝图和代码操作,只有遇到必须亲手调整的视觉细节时才叫一次"装修师傅"。
第二,独立验证门(Finish Gate)。 当主智能体完成任务并调用 finish 后,一个全新的、独立的验证智能体会被唤起。它只看两样东西:原始任务指令和机器访问权限(bash、文件读取、DOM 查询),绝不看主智能体的对话历史、计划或完成理由。这种"叙述盲"设计刻意区别于 Reflexion 式的自我纠错——后者的验证器会因为阅读智能体自己的叙述而产生偏见。验证门的职责是结构性检查:交付物是否存在、是否保存在正确路径、格式是否匹配、日历事件是否真正写入了应用存储而非仅存在于下载副本中。但它有一个明确的短板:不判断值的正确性——如果一个任务要求汇总 100 条记录的销售额而智能体只读了 80 条,验证门无法独立发现这个错误。
第三,长程上下文管理(Sustain State)。 OSWorld 2.0 的任务可长达 200 个主智能体回合,加上子智能体内部回合可达约 155 个模型调用。StateAct 用三种机制防止上下文膨胀导致任务事实丢失:每个子智能体在独立上下文窗口中运行并返回简洁报告;接近上下文上限时自动压缩旧前缀并剥离图片;一个外部化的任务清单(checklist)在每回合重新注入,确保核心计划不被压缩掉。
26.9% binary,唯一突破 21% 公共前沿的系统
在 OSWorld 2.0 的十项能力维度上,StateAct 全面领先所有公开系统。与同一 Claude Opus 4.8 模型的截图驱动基线相比,不仅二元和部分成功率分别提升 6.3 和 6.8 个百分点,输出 token 数也从 224K 降至 100K,成本约 9 倍降低。
与竞品模型的横向对比更加直观:GPT-5.5 仅达 13.0% 二元成功率和 49.5% 部分成功率,成本约 25.5 美元/任务;Opus-4.7 为 18.2%/48.9%,成本约 33.6 美元/任务。StateAct 在成本-精度前沿图上独占左上角——更准,也更便宜。
状态锚定的收益并非均匀分布。 在"多项目状态""跨源推理""冲突消歧"等需要精确读写程序状态的能力维度上,StateAct 的领先优势最明显(例如跨源推理 26.1%/64.9% vs GPT-5.5 的 13.0%/52.4%);而在"人机交互"和"多模态编辑"等必须依赖视觉判断的维度上,优势收窄甚至被反超(人机交互 0%/43.9% vs GPT-5.5 的 16.7%/43.1%)。这恰好验证了 state-grounding 原则的理论边界:当任务交付物本身就是视觉产物时,程序状态通道不再提供杠杆。
跨基准的泛化能力也令人印象深刻。 同样的 StateAct 框架在 OSWorld-Verified 上将 Opus 4.8 从 80.9% 推至 81.9%,在 WindowsAgentArena 上从 41.6% 推至 50.6%,在 AndroidWorld 上从 69.0% 推至 81.9%,在 MobileWorld 上从 51.3% 推至 70.1%。值得注意的是,在短程基准 OSWorld-Verified 上提升微乎其微(78.4% vs 77.3%),验证了 state-grounding 的优势集中在长程任务——这正是该论文的目标场景。
更令人兴奋的是小模型的跃升。 团队将 Salesforce 内部 31B 参数的 SFR-CUA 模型接入 StateAct 框架后,OSWorld 2.0 二元成功率从 7.6% 飙升至 43.2%,远超 Claude Opus 4.8 的截图基线。OSWorld-Verified 从 66.9% 升至 81.1%,AndroidWorld 从 68.1% 升至 84.1%。一个小模型,在正确框架的加持下,打出了远超体量的成绩。
推理才是硬骨头:38 个推理错误 vs. 8 个检测到的结构错误
论文最坦诚的部分来自失败分析。团队对 79 个非完美任务的手动审计揭示了一个清晰的格局:推理错误(38 个)是绝对主导的失败模式——智能体要么读了错误的源数据,要么误解了任务指令,要么给出了错误的值。验证门的结构性缺陷(本该拒绝但错误通过)是第二大类(14 个),模态瓶颈和指令歧义占约 20%。
验证门的实际表现数据进一步揭示了当前方案的极限:在 79 个非完美任务中,76 个到达了验证门;验证门仅正确拒绝了 8 个,错误接受了 68 个——错误通过率约 90%。这个数字看起来很高,但需正确理解:验证门只检查结构性缺陷(缺文件、错路径、格式不对),无法判断值是否正确。这 68 个错误通过的任务几乎全是推理或值错误,是结构性检查永远无法捕获的。
这意味着 StateAct 成功地将瓶颈从"感知"转移到了"推理"。 通过代码读单元格 B7 或列日历存储是精确的操作,不再有"截图没截到""按钮被遮挡""像素模糊"等感知层面的失败。剩余的失败几乎全部来自"智能体想了什么",而非"智能体看到了什么"。这个诊断不仅诚实,也为后续研究指明了方向:下一步需要的不是更好的视觉模型,而是更强的推理能力——或者一个能从外部对推理结果做值校验的机制。
消融实验进一步确认了各组件的贡献权重。移除"状态驱动行动"(恢复 GUI 主路径)产生最大跌幅,部分成功率从 61.6% 降至 51.3%,甚至低于截图基线的 54.8%;移除验证门降至 57.5%;移除上下文管理降至 58.7%。状态驱动行动,而非智能体深度或验证机制,是 StateAct 收益的主要来源。
从看屏幕到看状态,一个范式的起点
StateAct 本质上做了一件简单的事:让智能体的行为接口与任务评判标准对齐。一个桌面任务的成功取决于程序状态,所以智能体应该操作程序状态;截图只是一个有时必需的备用通道,而非默认界面。
论文的价值不止于 SOTA。它提出了一个可被其他系统采纳的设计原则——state-grounding——并用自己的失败分析清晰地画出了这条路径的能力边界:状态锚定消除了感知瓶颈,但不解决推理瓶颈。OSWorld 2.0 的整体成功率依然只有 26.9%,说明长程计算机使用还有很长的路要走。但方向已经变得清晰:把"看"交给代码,把"想"留给更好的推理。
本文基于 Salesforce AI Research 论文《StateAct: Program State, before Pixels, for Long-Horizon Computer-Use Agents》(arXiv:2607.22798,2026 年 7 月)撰写。