AREX Feed Article
GPT-6 Astra 自主通关《Portal》:全程约 24 小时,token 成本估算 571 美元
OpenAI 旗舰模型 GPT-6 Astra 自主打完了 Valve 的 3D 解谜游戏《Portal》:3,336 次工具调用,按 API(应用程序接口)计价估算的成本 571.18 美元,游戏一路推进到制作人员名单。宣布结果的是实验发起人 CozyBlaze(X 账号 @cozyblazex)。他在 UTC 时间 9 月 5 日深夜(北京时间 9 月 6 日早上 7 点 40 分)称,GPT-6 Astra「已经自主通关 Portal」,「我没想到这一天来得这么快,但很高兴我们取得了这么大的进展」,随即把这次通关与 OpenAI 在 2016 年提出的技术目标联系到一起:「用单一智能体解决各种各样的游戏」。
于 9 月 7 日报道此事:OpenAI 的 GPT-6 Astra 自主通关《Portal》、24 小时完成、token(词元)花费约 571 美元。该媒体把 CozyBlaze 描述为一位热衷 AI 与 LLM(大语言模型)的爱好者。通关结果、时长与成本数字均出自 CozyBlaze 在 X 帖文与 公布的数据,Tom's Hardware 的报道即以此为口径。他公开了控制代码、游戏配置和脱敏后的会话日志。
模型思考时,游戏一直暂停着
模型的「手」与「眼」都经过一层工具封装。据 Tom's Hardware 引述,CozyBlaze 的解释是:模型通过 MCP(Model Context Protocol,模型上下文协议)加一个改造过的 SourcePauseTool 控制游戏,「模型思考时游戏保持暂停;一旦模型发出输入序列,SPT 就取消暂停并执行」。思考期间,模型收到游戏截图和玩家角色的位置信息,随后游戏恢复,Astra 执行计划好的输入。这也是为什么剪掉停顿的版本只有约 2 小时,而完整录像(VOD)合计约 24 小时。
他在 里写得更细:每轮循环都是先看截图、玩家位置与视角,再决定镜头转向、按键与每个动作的持续时间,执行输入后暂停检查结果。可控制的动作包括行走、跳跃、下蹲、使用物体和发射传送门。Codex 把 JavaScript 计划发给本地 MCP 服务,服务只被允许通过 127.0.0.1:27182 与游戏进程内的 SPT 通信;一份计划最多包含 1,000 步、6,600 个 tick(约 99 秒),自动截图会压缩到 360 像素高。
文档也公开了几个容易被当成「作弊」的设置:游戏以 sv_cheats 1 启动,以便调用调试与测试命令;滑动相关参数被调低,理由是让操控更精确;游戏以约 67 tick/秒运行。仓库主页面写明,实验期间 Web 搜索和通用 shell/浏览器工具均被禁用,模型无法现场检索攻略。
游戏内 1 小时 53 分,实际跑了 23 小时 38 分
通关帖画面里有两个计时器,CozyBlaze 后来在里说明:左下角的 1:53:37 是游戏内计时,不包含暂停;右上角的 23:38:19 才是实际耗时。Astra 真正执行操作的时间不到两小时。
仓库附带的给出了完整时间线:会话开始于旧金山时间 9 月 4 日 17:00:35(北京时间 9 月 5 日早上 8 点),完成事件发生在 9 月 5 日 16:43:09(北京时间 9 月 6 日早上 7 点 43 分),全程约 23 小时 43 分,其中包含容量错误导致的中断与等待。CozyBlaze 说明,遇到容量错误后他恢复了会话并切换到 Fast 模式;除最初的指令外,他对模型的唯一额外要求是「让制作人员名单放完」。
通关过程在他的 X 时间线上留有一串节点:北京时间 9 月 5 日上午,他称 Astra 不到两小时就通过了 chamber 10、刷新先前纪录;当晚,;9 月 6 日清晨,他发出题为「Astra vs. GLaDOS showdown」的,约 40 分钟后宣布通关。在测试室之外,模型还要打完与 GLaDOS 的尾声交手,才看到制作人员名单。
571 美元只是估算:真实账单是 200 美元月费
571.18 美元不是一笔真实的 API 扣款。CozyBlaze 在澄清帖里说明,这个数字来自 ccusage 的估算,他实际支付的是每月 200 美元的 Codex Pro 订阅费;所谓 token 成本,是按单价换算出来的按量付费标价,实验本身消耗的是订阅额度。
在转述时把它概括为「一次令人印象深刻但昂贵的进步证明」,并调侃以 571.18 美元通关一款游戏,大概不是最有性价比的打法。Tom's Hardware 文章评论区,署名 usertests 的读者以养孩子作比:「把一个孩子养到成年要花好几万美元(取决于生活水平),所以这个结果还不错。」
2016 年目标与「最差模型」的调侃
宣布帖开头提到的 2016 年技术目标,在 Tom's Hardware 的表述里是 OpenAI 在 2016 年就立下的原始愿景。CozyBlaze 承认这次通关远不是终点:紧接着的里写道,「还有很多问题要解决,严格说它并不算一个基准测试,但看着一个通用智能体自主导航、一路走完整个游戏,感觉像是那个原始愿景开始变成现实的一瞥」。
他还自我调侃:「这是我们能拿到的『最差』模型了,也许一切真的都能塞进 transformer 这个洞里」,并会把去掉思考段的通关画面传到 YouTube。Tom's Hardware 报道称,GPT-6 Astra 本月初刚成为 OpenAI 的旗舰模型;OpenAI 声称它提供「新一代的智能」,并在计算机使用、浏览、软件工程、网络安全、科学和专业工作方面达到最先进水平。
训练数据之问,与下一场测试
对这次成绩的质疑集中在训练数据上:模型会不会只是「背过」《Portal》的攻略?Tom's Hardware 文章下方的读者评论里,署名 killerbishop 的用户直接发问:「模型是否接触过《Portal》的攻略、解谜图片或其他此前训练用过的数据?如果有,说它纯粹靠观察解开谜题就不那么有说服力了。MCP 命令也许能帮它知道该输入什么,但如果它只是把这些映射到 GameFAQs 的攻略上,我不确定这在新型学习能力上算多大的飞跃。」
同样的问题出现在 X 的引用转发里。用户 写道:「不错,但我们说的『自主』到底有多自主?它是不是查了一堆攻略?训练数据里已经有多少遍通关录像?它能解决一个它第一次见到、完全陌生的 Portal 吗?」
CozyBlaze 在里给出了直白的回答:Web 搜索确实被禁用了,「但在我的测试里,它仍能非常详细地回忆起解法」。
更技术化的批评来自开发者 Ricquert(据其 X 账号简介,自称前资深软件工程师、现从事主机游戏移植与优化)。他在里列出四点:用 dll 注入暂停游戏、开着作弊开关改游戏物理、直接读取游戏内存、模型会说出训练集里才有的事情。其中「改物理」一条与 CozyBlaze 自己公开的文档部分吻合:文档写明游戏以 sv_cheats 1 运行、调低了滑动参数,目的是让操控更精确。「注入与读内存」则是 Ricquert 对 SourcePauseTool 实现方式的判断。
Founders Fund 合伙人 (据其 X 账号简介)也在这条通关帖的引用区晒出另一段演示:他让 Astra 玩通了 Atari 老游戏《Montezuma's Revenge》的前三关,「为了控制 token 用量只玩到第三关」,并认为这「已经足够让我认为它基本上是 AGI 级别的计算机使用了」。被问到接下来让 Astra 玩什么时,CozyBlaze 回答:,但他觉得在自定义的新关卡上测试会更有意思。