AREX Feed Article
NVIDIA AVO 在 ARC-AGI-3 公开集拿下 100.00 RHAE,183 关全通
8 月 21 日,宣布其 Agentic Variation Operators(AVO)智能体架构在 ARC-AGI-3 公开集取得 100.00 RHAE 分数:使用 Claude Opus 5 完成全部 25 个环境、183 个关卡,共消耗 6,624 次环境动作。博客给出的参照是 :后者用 Claude Opus 5 完成同样的 183 个公开关卡,报告了 7,542 次环境动作,AVO 少用约 12%。
博客用这组数字支撑一个主张:模型能力不等于智能体表现。它援引 称,该模型在 ARC-AGI-3 上只有约 30% 的成绩,而同一模型装进 AVO 系统后拿到满分。持久记忆、监督、工具使用这类系统级设计,才是把前沿模型转成长时程自主性能的关键。这些成绩全部出自 NVIDIA 官方博客,目前可核实的口径只有这一份。
6,624 次动作通关 183 关,比 VISTA 少 12%
ARC-AGI-3 是交互式推理基准:智能体进入陌生的游戏环境,没有指令、没有明示规则、没有陈述目标,只能通过互动推断环境机制、发现目标,并在越来越难的关卡中保持效率。公开 Demo 集共 25 个环境,如此划分。计分采用 RHAE(Relative Human Action Efficiency,相对人类动作效率),按,该指标把任务完成度与逐关动作效率结合起来,相对首次游玩的人类基线计分,再跨关卡、跨环境汇总:未完成的关卡得 0 分,完成但动作不够省的关卡只得部分分。
博客对成绩的表述有明确边界:100.00 RHAE 是 25 环境公开集、官方记分卡与 RHAE 指标下的结果,不是 semi-private 或 fully private 竞赛集上的结果。博客的编辑注还说明,团队更新了措辞,以便更精确地区分公开集与半私有、私有竞赛集。
对 12% 的效率差,博客自己也划了线:这不应被解读为受控消融实验,两套系统在智能体后端、观察表征、记忆、上下文管理等方面都不同。另一个背景是,VISTA 的项目页面同样报告 Claude Opus 5.0 以 100% 胜率完成全部 25 个公开游戏、拿到完美的 100 RHAE,且比首次游玩的人类玩家少用 56.0% 的动作。满分本身并非新纪录;NVIDIA 声称的新东西,是更省的动作数和同一架构跨领域迁移这件事。
持久记忆与监督者:长时程运行的两根支柱
AVO 是 NVIDIA 开发的通用编码智能体系统,能检查、编辑代码,运行命令,查阅文档,并通过执行验证自己的工作。博客强调,它的区别性设计是跨长时程的持续自主运行,其中两个机制最关键。
持久记忆把先前的实现、评测结果、编译器与 profiler 输出、累积的推理过程保留下来,让智能体从当前状态继续推进,而不是反复重建搜索。监督者则监控整体搜索轨迹,当进展停滞或陷入重复无效循环时介入,把主智能体引向替代策略。
这套设计在 ARC-AGI-3 上的适配方式是:同一个智能体换一个任务接口,底层 agent 不变,只换环境专用工具与评测。与 VISTA 接收 512×512 PNG 渲染图不同,AVO 配置下模型只处理文本:每帧观察是精确的 64×64 文本网格,不发送任何图像或图像 token;智能体只拿到可用动作,没有规则或目标的描述。博客称,AVO 没有像 Tycho 那样构建显式可执行的世界模型,而是采纳 VISTA 描述的 direct-interaction 设计原则、独立重实现了任务接口;agent 后端与 VISTA 根本不同,后者通过 Claude Code 或 Codex 实例化 harness。
从 GPU 内核优化到交互推理:同一套循环
ARC-AGI-3 不是 AVO 的第一个任务。博客介绍,AVO 最早在困难的软件工程与 GPU 内核优化任务上验证:在注意力内核研究中,系统连续运行七天,探索超过 500 个优化方向,提交了 40 个内核版本;在 NVIDIA DGX B200 上,最终的多头注意力内核在评测配置中最高比 cuDNN 快 3.5%、比 FlashAttention-4 快 10.5%。之后,智能体又花了约 30 分钟,把进化出的内核适配到 grouped-query attention。
博客把两个任务摆在一起,是为了说明迁移的到底是什么:GPU 优化的反馈来自编译器、测试、profiler 和性能基准,ARC-AGI-3 的反馈来自环境状态转移与动作结果,接口不同,但核心循环相同——从残缺证据形成假设、通过外部接口行动、观察后果、保留有用状态、修正对问题的理解、从错误假设中恢复、在长时程里持续推进。迁移的不是领域知识,而是让推理与反馈随时间累积的那套机制。
模型 30% 与系统 100% 之间隔着什么
ARC Prize 的评测页面显示,Claude Opus 5 在 High 推理档位下 ARC-AGI-3 得分 30.16%,是截至 2026 年 7 月 24 日 ARC-AGI-3 上得分最高的模型;由于测试窗口短,ARC-AGI-3 只评估了 High 档位。NVIDIA 博客的解读是,同一个模型家族放进 AVO 系统后拿到 100.00 RHAE,说明评估模型不等于评估智能体。
博客同时声明,这两组数字不应被解读为对 AVO 性能贡献的直接测量。NVIDIA 的运行用了不同的推理设置、完全不同的智能体系统和评测设置。它还做了跨模型的初步配对:在挑战性子集上把 AVO 与 GPT-5.6 Sol 组合,多个关卡中 Sol 的墙钟时间更快,而匹配关卡对比中 Opus 的环境动作更少;博客称这显示出互补的运行特征,系统性对比留待未来工作。
183 关之外:这份成绩只覆盖公开集
成绩单的边界在博客里写得很清楚:结果只覆盖 25 环境公开集,半私有与私有竞赛集不在其中;AVO 记忆系统在长时程上的单独贡献,也没有被这个实验隔离出来。博客还附上了配套论文《AVO: Agentic Variation Operators for Autonomous Evolutionary Search》()。
至此,可核实的事实止步于 NVIDIA 的自报口径:公开集 183 关、6,624 次动作、100.00 RHAE。公开集之外的两套非公开关卡、记忆组件贡献的隔离、跨系统对比的受控验证,博客都没有给出答案。