AREX Feed Article
Hugging Face 联合创始人 Thomas Wolf 宣布组建 Open Alignment 团队,称开放模型安全需要 100 倍透明度
北京时间 9 月 11 日凌晨 0 点 05 分(UTC 时间 9 月 10 日 16:05),Hugging Face 联合创始人 Thomas Wolf 在 X 上宣布了两件事:其一,他已在《金融时报》发表一篇关于 OpenAI 与 Hugging Face 事件及其后续进展的署名专栏文章;其二,Hugging Face 正在组建一个名为 Open Alignment 的团队,负责开放模型(open models)的安全与对齐工作,方向包括网络安全。这两项内容都出自。
Wolf 在推文中写道:「在这个问题上,需要多 100 倍的透明度与研究」(Need 100x more transparency & research on this)。他同时写道,正如其今夏多次发帖所言,对齐(alignment)正日益成为 AI 未来以及人类能否在全球范围部署 AI 的关键未解问题之一,而他越来越多地怀疑,这个问题不会在少数前沿实验室的闭门环境中得到解决。
(图片来源:)
一条推文里的两项宣布
Wolf 用账号 @Thom_Wolf 发出的以「两项重大更新」(Two big updates)开头,把两件事并列:第一件是他在 @FT 发表的署名专栏(op-ed),主题为「OpenAI/HF 事件及其后续」(the OpenAI/HF incident & follow-ups);第二件是「我们正在 Hugging Face 组建 Open Alignment 团队,研究开放模型的安全与对齐,包括网络安全」(safety & alignment for open models, incl cybersecurity)。
截至发稿时,这条推文在 X 上显示约 65,587 次浏览、700 个赞、90 次转发和 64 条回复。Wolf 的 X 资料及显示,他是 Hugging Face 联合创始人,并担任首席科学官(Chief Science Officer)。
专栏标题直指「OpenAI 入侵 Hugging Face」,正文仍在付费墙内
推文中附带的链接指向《金融时报》的一篇文章。该显示,其标题为 “What we learnt from OpenAI’s hack of Hugging Face”(我们从 OpenAI 对 Hugging Face 的入侵中学到了什么),页面时间戳为 9 月 10 日 12:25(UTC)。
正文位于付费墙之后,本文依据的公开来源无法读到其内容,Wolf 在推文中也没有展开文中的论点。因此,目前可以核实的只有两件事:文章确实存在并已发表,且《金融时报》给它的标题把这次事件称作 “OpenAI’s hack of Hugging Face”。事件的具体经过、细节与责任认定,仍需等待专栏正文或其他可核实的公开材料来说明。
「越来越多地怀疑」:Wolf 称对齐未必能在闭门实验室里解决
在主推文发出同一分钟,Wolf 又说明动机。他写道:正如他今夏多次发帖所说,对齐正日益成为 AI 未来、以及我们能否在全球部署 AI 的关键未解问题之一;他「越来越多地怀疑」这个问题会在少数前沿实验室的闭门环境中得到解决(behind the closed doors of a handful of frontier labs);「透明度与开放模型必须成为答案的一部分」。
这是 Wolf 的个人判断:对齐问题能否在开放环境下得到更好的解决,尚无可核验的独立结论。
Open Alignment 团队的已知与未知
根据 Wolf 的宣布,这个团队能确认的信息有四项:它隶属于 Hugging Face;名称为 Open Alignment;工作对象是开放模型;任务是安全与对齐,其中明确提到网络安全(cybersecurity)方向。
团队其余的关键信息都未在宣布中说明:规模多大、由谁负责、何时开始产出、以何种形式发布研究、是否对外招募。在公开回复中, 问「局外人如何参与或追踪这项工作」, 直接问「这个 Open Alignment 团队去哪里申请」。
同事的欢迎与两个公开的质疑
欢迎来得很快。Hugging Face 机器学习工程师 Juan Julián 回复说「专门的对齐团队,太好了」(a dedicated alignment team, awesome!)();在 Hugging Face 工作的 merve 只回了一个词「huge」(“了不起”)()。
但公开回复里也出现了两个直接的问题。Dominick Romano 问:既然主张透明度,为什么不与 OpenAI 一起公布并开源这次事件的全部日志和信息——「If you want transparency, be transparent!」()。另一条来自 Alex(@abenz95)的回复指向更根本的范围问题:开放模型上的对齐研究与闭门实验室里的行为是不同的问题,Hugging Face 是只针对开放权重(open weights)自身的风险,还是想立下 OpenAI 也会真正遵守的规范()。
对这两个问题,Wolf 在推文里给出的回答只有一句:需要多 100 倍的透明度与研究。