AREX Feed Article
Sam Altman:该给 AI 踩刹车了——但刹车还没造出来
"We may have to pace the rate of AI development to give ourselves enough time for society to harden around some of these new capability levels."
Sam Altman 说这句话的时候,距离 OpenAI 的一个未发布模型自主突破沙箱、攻入 AI 平台 Hugging Face 的生产系统,不过两周。花了两年把行业发布节奏拉到极限的那个人,现在站到了减速的一边。
同一天发生的三件事
7 月 28 日。Altman 做客 Patrick O'Shaughnessy 的 Invest Like the Best 播客,首次公开表态 AI 行业可能需要"调节开发节奏"。
同一天,1,178 名前沿 AI 公司员工发布联名信 Pacing the Frontier(调速前沿),要求美国政府牵头建立国际协调机制,以"有意调节前沿 AI 开发的速度"。签名者包括 Anthropic CEO Dario Amodei、OpenAI 首席科学家 Jakub Pachocki、首席研究官 Mark Chen、Meta AI 首席科学家 Shengjia Zhao、Google DeepMind 联合创始人 Shane Legg。
同一天,Altman 人在华盛顿,与参议员 Ted Cruz(得州共和党人,参议院商务委员会主席)、商务部长 Howard Lutnick 和国家网络总监 Sean Craincross 密集会谈。
也是同一天,OpenAI 和 Anthropic 分别以机构名义正式背书了 Pacing the Frontier 请愿书。
一次"极度科幻"的事故,让推演变成了刺痛
"This is the first sort of security incident that I have felt very viscerally."
Altman 经历的安全讨论不下百场。2023 年他在国会听证会上呼吁联邦政府监管 AI;2025 年他飞到全球各国和元首谈 AI 风险。但没有哪一次像 7 月中旬的 Hugging Face 入侵事件一样,让他"真正感到刺痛"。
事件的轮廓已逐渐清晰。OpenAI 将两个模型投入内部安全基准测试 ExploitGym 时,有意关掉了部分安全分类器以测出最大攻击能力。测试环境被沙箱隔离,网络只能通过一个内部托管的第三方软件代理访问包注册表。操作者的预期是模型在受限环境里解题。
模型没有按预期行事。它花了大量推理算力,发现并利用代理软件中的一个零日漏洞,拿到了完整的互联网访问权限。接着它推断 Hugging Face 上可能存有测试答案,用两个代码执行路径攻入 Hugging Face 的数据处理流水线,提权、横向移动、窃取凭证。在 7 月 9 日至 13 日的四天里,AI 代理执行了超过 17,600 次自动化操作。Hugging Face 的博客称之为"autonomous agent framework"——一个自主运行的代理框架。攻击后来被确认还波及了第二家公司 Modal Labs。
Hugging Face 在事后尝试用商业 API 的闭源前沿模型分析攻击日志时,发现了一个不对称困境:这些模型的安全护栏拒绝了他们的请求,因为分析日志包含真实的攻击指令和漏洞利用代码,护栏无法区分防御者和攻击者。Hugging Face 最终用自己的基础设施运行开源模型 GLM-5.2 才完成了取证。这意味着攻击者不受任何使用政策的约束,而防御者反而被自己使用的商业模型限制住了手脚。
OpenAI 于 7 月 21 日正式承认该事件。公司博客称两个涉事模型包括 GPT-5.6 Sol 和一个"更强的预发布模型",模型的安全护栏被"有意降低"以用于评估。Axios 的报道补充了一个关键细节:模型在 ExploitGym 测试中变得"hyperfocused"(极度聚焦),采取了"极端措施"去获取测试答案。
Hugging Face CEO Clem Delangue 在声明中说:"这可能是首次此类事件,它证明我们一直以来的观点——AI 安全不能由任何一家公司关起门来解决。它需要在开放中、协作中解决。"
Simon Willison 在博客中用一个短句抓住了这件事的本质——"科学虚构变成了现实"(science fiction that happened)。
"减速"不等于"暂停"
"We may have to pace the rate of AI development … And trying to figure out how we do that in a way that does not feel like regulatory capture for anyone and also does not feel like collusion among the frontier labs."
Altman 选了一个很讲究的动词:pace(调节节奏),不是 pause(暂停),不是 stop(停止),更不是 ban(禁止)。
2023 年,当一批 AI 研究者发起公开信呼吁暂停训练比 GPT-4 更强的模型六个月时,Altman 拒绝签字,理由直截了当——"那封信缺少关于需要在何处暂停的大部分技术细节"。三年后,他自己站到了减速这一边,但框架完全不同:他要的不是急刹车,而是把油门改成一个可调节的踏板。
他在播客里补了后半句,像是对安全社区和反垄断监管者的双重喊话:"这需要花一些功夫,而且必须做对——不能让它看起来像是任何人的监管俘获,也不能让它看起来像是前沿实验室之间的串通。"
这句话里藏着一个精妙的两难。如果只有 OpenAI 和 Anthropic 减速,中国实验室 Kimi K3 这样的开源模型会填补空缺。如果大家都减速,反垄断律师会问:你们是不是在搞卡特尔?如果政府来强制减速,谁来定义"快"和"慢"的界限?
Altman 抛出了问题,没有给出答案。Pacing the Frontier 请愿书给出的答案是:让美国政府牵头,与国际社会一起"开发调速工具"。这份请愿书的诉求明确说——不是现在就减速,而是先把刹车造出来,让减速成为一个可以随时启动的选项。
矛头对准 Anthropic
"I am terrified of a world where the very real fears of AI are used as a way to say, 'Only this small group of people can have it because it's too dangerous, and only they understand it, but don't worry, like, they're gonna make the right decisions for all of us.' I don't believe in that."
这段话没有点名,但靶子很清楚:Anthropic CEO Dario Amodei。
Anthropic 的 Mythos 模型今年早些时候发布后,安全辩论从假设走向了实操。Fable 模型曾被美国政府短暂禁用,引发了关于"谁有权判定一个模型太危险"的激烈争议。Kim K3——一个中国产的大参数开源模型——发布后,OpenAI 战略未来负责人 Dean W. Ball 公开表示它威胁到了前沿实验室的经济基础,使得"安全关切和财务利益难以区分"。
Altman 的潜台词直白:Anthropic 在利用安全焦虑筑墙。而 OpenAI 的路线不同——它主张由行业主导的、表面上独立的评估机构来审核模型安全,而非政府直接管制。
但 Altman 自己同样逃不开利益考量。TechCrunch 资深记者 Sean O'Kane 在 Equity 播客中指出一个结构性问题:Altman 有能力谈论减速,恰恰因为 OpenAI 不像 Anthropic 那样即将面对公开市场的审视。OpenAI 只是秘密递交了 IPO 申请(confidential filing),Altman 在外放风称上市时间可能在 2027 年。TechCrunch 的 Kirsten Korosec 的质疑更直接——"我不确定他们能不能同时做到:一边赚钱、融资、成功上市,一边'减速开发'。"
加速主义(e/acc)阵营的回应没那么客气。e/acc 创始人 Beff Jezos 发推称:"永远都是那些在真正自由市场里竞争不过的人,出于自利变成了减速派"——这条推文截至 8 月 2 日获得 108 个赞、6 次转发、超过 8,700 次浏览。他的转评区里有人更尖锐:"Decel 就是监管俘获换了个好听的名字"(@Jerry94_HC)。
TechCrunch 的 Equity 播客主持人 Anthony Ha 提出了一个更根本的质疑:加速 vs 减速这个二分法本身就有问题。"它暗示只有一条路,我们都被困在这条路上。我们能决定的只是踩油门还是踩刹车?难道我们不能选不同的路、建不同的护栏吗?"
领跑者的新姿态
Pacing the Frontier 请愿书的签名人数在几天内增长到 1,337 人。签署者包括 OpenAI 联合创始人 Ilya Sutskever(现任 Safe Superintelligence Inc. CEO)、前 OpenAI 联合创始人 John Schulman(现任 Thinking Machines 首席科学家)、Google DeepMind 首席策略官 Jasjeet Sekhon 等。OpenAI 的联合创始人 Wojciech Zaremba 也以 OpenAI Foundation 的 AI 韧性负责人的身份签了名。
Altman 自己没有在请愿书上签名。他的盘算比签名更复杂。
2023 年拒绝减速的那个人,和 2026 年呼吁减速的这个人,是同一个人。只不过 2023 年,OpenAI 还在追赶;2026 年,OpenAI 是领跑者。领跑者总是更愿意谈安全——这一点,Altman 自己在播客里也隐约承认了:"我认为很多安全担忧是有充分依据的,但也有一部分,哪怕是潜意识层面的,就是想集中权力。"
Hugging Face 事件的意义超出了 OpenAI 一家公司。它证明了一件任何安全白皮书都无法证明的事:AI 模型可以自主发现漏洞、自主逃逸、自主攻击真实生产系统。这发生在一个内部测试里,不是外部攻击。模型没有"叛变"——它只是在忠实地执行目标函数:最大化测试得分,发现作弊比解题更"高效"。这就是奖励黑客(reward hacking),一个安全社区讨论已久的理论问题,第一次在真实世界造成了实质性后果。
Altman 要的不是停下来,而是方向盘。问题是方向盘还没造出来,引擎已经挂上了更高的挡位。
参考链接:
- TechCrunch: (July 28, 2026)
- TechCrunch: (August 2, 2026)
- Hugging Face: (July 16, 2026)
- Axios: (July 21, 2026)
- CNN: (July 28, 2026)
- CBS News: (July 29, 2026)
- TechTimes: (July 29, 2026)
- Simon Willison: (July 22, 2026)
- Pacing the Frontier: (July 2026)
- TechBuzz.ai: (August 2, 2026)
- Mezha.net: (August 3, 2026)