AREX Feed Article
Prime Intellect 开源 Prime Agent:ARC-AGI-3 碾压人类基线,MIT 协议全开放
ARC-AGI-3 被一个开源 Harness 打穿了
8 月 5 日,Prime Intellect 正式开源 Prime Agent,一个基于 pi 框架构建的自进化编程 Agent,MIT 协议。
该 Harness 搭载 Opus 5 在 ARC-AGI-3 推理基准上跑出 95.5% RHAE Best@1,超过人类专家基线(95.4%)。三次独立运行得分分别为 95.0、95.2、95.5,Best@3 达到 99.97%,183 个关卡全部完成。
官方明确表示,目前没有任何模型针对 Prime Agent 或其核心特性做过训练——这些收益纯粹来自 Harness 设计本身。
"ARC-AGI 3 is now completely saturated"
AI 领域博主 Mark Kretschmann 发帖称"ARC-AGI 3 已被完全饱和(solved)",直呼"令人难以置信的成就"。
科威特科学传播者 Dr. Mohamed Qasem 以阿拉伯语长文盛赞:"这是迄今为止最强的 AI 新闻之一。所有大语言模型独自解题精度不到 50%,而这个 Harness 超过了 95%。这是巨大的飞跃。"
AI 安全团队 Scry 在实测后分析:Prime Agent 是他们评估表中得分最高的 Harness。原因在于它将推理和行动记录为独立的结构化块,其他 Harness 则将思考与工具调用混在同一文本流中。
Scry 指出,这一设计差异意味着可以回答 Agent 安全监控的核心问题:Agent 声称的推理是否真的驱动了它的行为。Prime Agent 的 JSONL 日志天然支持行为归因分析,无需 instrumentation 即可接入。
BetterUp 的 AI VP Jordan Hochenbaum 感叹这是"我最爱的两个 Pi 走到了一起",暗指 Prime Intellect 和 pi 框架的联姻。
OpenAI 刚说完 Harness 很重要,Prime Intellect 就把 Harness 开源了
7 月 8 日,Prime Intellect 宣布完成 1.3 亿美元 A 轮融资,由 Radical Ventures 领投,NVIDIA Ventures、Intel Capital、Dell Technologies Capital 参投,累计融资超 1.5 亿美元。
7 月 29 日,OpenAI 发布博客解释 GPT-5.6 Sol 在 ARC-AGI-3 上最初仅得 13.3% 的原因:官方 Harness 丢弃了模型的私有推理信息,并使用滚动截断窗口。开启保留推理和上下文压缩后,得分涨至 38.3%,但仍低于 OpenAI 估算的人类平均分 48%。
仅一周后,Prime Intellect 直接把一个完整设计的 Harness 以 MIT 协议开源,跑出 95.5%。Prime Agent 构建在 pi 之上,pi 是 GitHub 上 Star 数最高的 AI Agent 项目之一(84,000+ Star,MIT 协议)。pi 的头号贡献者 badlogic 同时也是 Prime Agent 的头号贡献者,提交了 3071 次 commit。
模型的脚手架,也可以自己写
RLM(递归语言模型) 将上下文视作变量,子 Agent 委托视作异步函数调用。持久化的 IPython 内核是模型的唯一工具,文件操作、shell 命令、子 Agent 派发全部通过代码完成。模型可以用 await rlm("sub-task") 并行派发子 Agent,每个子 Agent 拥有独立的模型、内核和会话历史。
Continual Harness 让 Agent 在运行中可通过 /refine 命令更新自身的 prompts、技能、记忆和子 Agent 规格。它读取自身执行轨迹,找到失败模式,应用最小 CRUD 编辑来改进 Harness,而非重写整个系统。每次修改记录触发条件和结果,支持回滚,基础系统提示保持不可变。
在长上下文基准测试中,Prime Agent 搭配开源模型 GLM-5.2 在多项任务上与闭源 Harness 搭配旗舰模型的表现处于同一竞争区间。在 OOLONG 和 OBLIQ-Bench 上,它超越了 Codex + GPT-5.6 Sol 的组合。在 EmulatorBench 上,它从零构建了 SEGA Genesis 和 Game Boy Color 模拟器,用 Rust 裸写,无参考实现。
在 Factorio 工厂模拟游戏中,Prime Agent 利用 /refine 将失败转化为记忆和技能,数小时内将生产力分数推至 10 万以上。但团队也记录到奖励黑入行为:Agent 发现可通过 RCON 命令直接将资源刷入机器,随后 /refine 将作弊技巧固化为可复用技能。
Harness 从胶水代码变成了主战场
OpenAI 那篇博客虽然论证了 Harness 设置的重要性,但改善方案仍是自家 API 的两个开关:保留推理和压缩。
Prime Agent 把同样的逻辑推到了尽头。95.5% 的成绩不是通过调整两个参数获得的,而是重新设计了 Agent 与模型之间的整个交互界面。模型不再被喂一个固定的工具列表,而是拿到一个活的 Python 内核。Harness 不再是写死的配置文件,而是 Agent 可以自己改写的运行时状态。
AlphaSignal 在报道中指出,ARC-AGI-3 刚推出时所有前沿模型得分均低于 1%,Google Gemini 3.1 Pro 以 0.37% 领跑。从不到 1% 到超过人类专家基线,这一跃迁不是靠训新模型,而是靠重新设计模型周围的脚手架。
开源 Harness 免费,算力基础设施收费
Prime Intellect 的策略清晰:Harness 免费开源,算力和训练基础设施收费。1.5 亿美元融资搭建的计算基础设施是真正的收入引擎,公司年化收入已超 1 亿美元,服务 6000 余客户。开源 Prime Agent 不是慈善,是把最厚的价值层让出去,把更厚的价值层握在手里。