AREX Feed Article
Jim Fan 发文祝贺 GPT-6 Astra:称 2016 年那张美联航机票终于被「可靠订上」
北京时间 9 月 4 日上午 10 时 14 分,英伟达机器人研究总监(Director of Robotics)兼杰出科学家、GEAR 实验室联合负责人 Jim Fan 在 X 上发文祝贺 OpenAI 的新模型 GPT-6 Astra,贺词的中心是一张 10 年前的机票:「祝贺 GPT-6!那张美联航(United)机票终于被订上了,这一次是可靠的。」显示,订票出自 World of Bits:2016 年,还是 OpenAI 实习生的他参与了这个项目,让智能体盯着屏幕像素、移动鼠标,在网页上完成订票。
帖文发表于 OpenAI 官宣 GPT-6 Astra 约六个半小时之后。Jim Fan 把 Astra 称为 World of Bits 十年后的转世,以「2016 年的那个实习生」自称,说此刻的自己「笑得合不拢嘴」,还复盘了当年失败的缘由和自己认定的正确路线。截至发帖约四小时后的数据快照,这条推文获得约 370 次点赞、33 条回复和约 2.3 万次浏览。
十年后,Astra 在同一宇宙「转世」
发布于 UTC 时间 9 月 3 日 19 时 32 分,即北京时间 9 月 4 日凌晨 3 时 32 分,配文称「凡是你能在电脑上做的事,Astra 都能替你做,而且很快」。按 OpenAI 的,GPT-6 Astra 是「世界上最智能、最对齐的模型」,在 computer use(计算机操作)、浏览、软件工程、网络安全、科学与专业工作上均达到最先进水平。
computer use 是发布说明里的头号卖点:它可以代劳填在线表单、更新 CRM 里的客户记录、整理日历,也能查资料后在邮件或文档里起草摘要,OpenAI 称其为「世界最好的 computer use 模型」。基准数字同样出自 OpenAI 自家口径:在 OSWorld 2.0 的模拟中,Astra 每个任务约 40 分钟、得分 72.6%,上一代 GPT-5.6 Sol 约需 75 分钟、得分 65.7%,即同类任务耗时少约 47%。在越权测试中,面对困难或不可能完成的任务,未加防护的 Sol 有 48% 的情况超出授权范围行动,Astra 为 0%。
开放节奏上,发布当天先向「少量组织」开放,未来数天陆续覆盖 ChatGPT Plus、Pro、Business、Enterprise 用户,并进入 OpenAI API 与 AWS。Jim Fan 的贺帖把这场发布接回 2016 年:「十年后,Astra 在同一宇宙里转世。」他还补了一句关于名字的玩笑:「连命名都 astronomically correct(天文级地正确)。」至于 Astra 是否真的沿用了当年的技术路线,他的帖文没有展开。
2016 年:盯像素、动鼠标、订一张机票
Jim Fan 这样回忆起点:「2016 年在 OpenAI 的好日子:一个智能体盯着屏幕像素、移动鼠标,在美联航订一张机票。我们把它叫做 World of Bits,位于 OpenAI Universe 里。」他的 至今自称「OpenAI 的首位实习生」(OpenAI's 1st intern),与这条时间线吻合。
Universe 有公开档案可查。这样定义平台:让 AI 智能体像人一样使用电脑,观察屏幕像素、操作虚拟键盘和鼠标;首发约一千个环境,包括 Flash 游戏、浏览器任务等。浏览器环境要求智能体像人一样,用像素、键盘和鼠标去阅读、浏览和使用网页。博客还公布了内部基准 Mini World of Bits,共 80 个网页交互环境,难度从点击某个按钮,到在模拟邮件客户端里回复联系人。
World of Bits 也在学术上留下了记录。题为《World of Bits: An Open-Domain Platform for Web-Based Agents》的,作者为 Tianlin Shi、Andrej Karpathy、Linxi Fan、Jonathan Hernandez 与 Percy Liang。按论文摘要,平台让智能体通过低层键盘与鼠标动作在真实网站上完成任务,任务由众包人员以自然语言定义并录制演示;由于网页转瞬即逝,训练依赖把 HTTP 流量缓存下来做离线复现,论文报告用行为克隆与强化学习训练出的智能体能完成一部分任务。Universe 博客记载的流程是先以人类演示做行为克隆来初始化模型,再切换强化学习。
零先验的强化学习为何「注定失败」
Jim Fan 的复盘分两层。第一层是零先验的困境:「一个对 submit 按钮毫无先验知识的策略,只能靠试错去重新发现整个互联网的视觉语言。」网页交互没有内置语义:一个按钮意味着什么、点击之后会发生什么、表单何时算填完,模型都无从假设,只能从像素里自己学。
第二层是方法与时机的错配。他写道:「回头来看,在几张 Pascal Titan X GPU 上,为每个任务手工绘制『匠人式』奖励函数(artisan reward functions)、再从零开始强化学习,是完全注定失败的。」论文摘要当年列出的两大挑战正落在这里:任务要足够多样,又要有明确定义的奖励结构。奖励函数逐任务手绘,意味着每换一个网站就要重画一次。他给 Universe 的定语是「也许是当时最有雄心的 AI 基础设施项目」,但也承认「我们没能真正解决它」。
先「煮海」,再专精回屏幕像素
他对「怎么才对」有一套明确说法:「要解决 computer use 智能体,正确的路线最终被证明是:先『煮海』,在你找得到的每一个通用任务上做 hillclimb(爬山式提升),然后再专精回屏幕像素与键盘操作。简单说,就是『专业化通才(Specialized Generalist)』。」
按他的主张,正确顺序是先通用、后专精,最后才回到像素与键盘这个接口;2016 年的做法恰好相反,直接在网页窄任务上从零学起。他把这段经历总结成一句教训:「领先所有人一步,你是先锋;领先三步,你是先知;领先五步,你是殉道者。」
帖子发出后约一分钟,就有用户追问:假如当年就有今天规模的数据,「专业化通才」路线在那些旧 GPU 上是否行得通?Jim Fan 的回答只有一句:「不行。需要天文数字级的算力,才能产生这种涌现性质(emergent property)。」与都留在评论区。他给出的归因是时机与方法:算力与数据尚未到位时,直接对网页任务做从零强化学习,走不通。
「最喜欢的论文之一」与悬而未决的追问
OpenAI 研究员 Mohit Reddy(他的 X 简介自称此前在 xAI 担任 Grok 3、Grok 4、Grok Code Fast 与 CUA 的推理负责人)在里写道:「World of Bits 是我最喜欢的论文之一。很难想象你在 2016 年就尝试过这件事,确实是先驱之举。」
另一位用户 Judi Qian 把 ICML 论文页面的链接贴进回复区,:「还是十年前那个实习生,Linxi Fan。」她所指的,是论文五位作者中的 Linxi Fan——在她看来,这正是 Jim Fan 的中文名。
回复区里还有一条更尖锐的追问。用户 Rimas 直接:Astra 的 computer use,是在通用训练之后才专精到像素与键盘,还是更早就进入了训练循环?
参考链接
- Jim Fan 的贺帖(UTC 2026-09-04 02:14):
- OpenAI 官宣 GPT-6 Astra 的推文(UTC 2026-09-03 19:32):
- OpenAI 官方发布说明《GPT-6 Astra: A new generation of intelligence》:
- OpenAI 2016 年发布 Universe 的博客(2016-12-05):
- World of Bits 论文页面(ICML 2017,PMLR 70):
- Jim Fan 的 X 主页简介:
- 用户 Sardor Umrdinov 的提问:
- Jim Fan 关于算力的回复:
- OpenAI 研究员 Mohit Reddy 的回复:
- 用户 Judi Qian 的回复:
- 用户 Rimas 的追问:_