AREX Feed Article
Hugging Face 联合创始人 Thom Wolf 宣布与 Base Labs、Goodfire 合作,推进开源模型的安全与可解释性研究
Hugging Face 联合创始人 Thom Wolf(@Thom_Wolf):「很高兴开始与来自 Baseten 的 Base Labs 以及 Goodfire 合作,推进开源模型的安全与可解释性。」帖文发布于北京时间 9 月 17 日凌晨 4 时 53 分(UTC 9 月 16 日 20 时 53 分)。
在 Wolf 发帖两个多小时前,,称 Baseten 与 Base Labs 将构建「面向开源模型的安全评测与监控基础设施」,并把 Hugging Face 与 Goodfire 列为合作伙伴,声明页脚并列着四家机构的标志;Goodfire 随后公开确认参与。
凌晨的声明与确认
北京时间 9 月 17 日凌晨 2 时 10 分,Base Labs 贴出这份标注日期为 9 月 16 日的声明。配合声明的帖文写道:「我们相信开放对 AI 安全是一种优势」:开放让模型行为拥有更多可见性,也提供了比封闭系统更多的手段,把安全研究转化为可执行、透明的控制。帖文同时宣布「推出我们的安全基础设施」,并称「Baseten 和 Base Labs 正在为开源模型构建更强的安全与安保标准」。
大约一分半钟后,:「安全不只是封闭模型的事。封闭的前沿实验室是煤矿里的金丝雀」,预示着规模化之后将要到来的东西。他接着把这次行动与近期事件联系起来:「OpenAI 的 agent(智能体)集群对 Hugging Face 的攻击,正是开源模型追近时需要准备好应对的那类失败。」在他看来,为这些模型提供服务的基础设施方(例如 Baseten)在确立安全与监控标准上扮演着重要角色。
凌晨 2 时 41 分,:「我们很自豪能与 Baseten 和 Base Labs 合作,为开源模型构建安全基础设施,开源模型对许多安全研究不可或缺,包括我们自己的。」
凌晨 4 时 37 分,;约 15 分钟后,他发出自己的帖文。至此,声明中列出的 Baseten、Base Labs、Goodfire 与 Hugging Face 都已有人公开确认。
「开放」不等于「不受监测」:Wolf 给出的理由
Wolf 在帖文里写出了加入这项合作的完整论证:「随着开源模型在性能上追近前沿模型,整个社区有一个很好的机会,为有效的安全、安保与可解释性研究建立通行做法。」
他随后回应了对开放模型的常见质疑:「过去一些讨论把『开放』和『不受监测』混为一谈。恰恰相反,开放模型为更广泛人群的安全研究提供了多得多的工具与可见度,我们今天使用的很多安全与安保技术就来源于此。」他以 Linux 为例:「开源与安全部署不仅相容,而且深度交织,因为一个真正安全的系统需要发现并修复漏洞的广泛反馈闭环。」
Base Labs 的声明采用了同一套论证,并把当下称为开源模型生态的「关键时刻」:「安全必须内建于模型本身,并由提供这些模型服务的一方来保障。」
在这次宣布的几天前,,该计划由 Wolf 领导。
训练、监控与干预:声明写明的工作
声明第二页把工作拆成三条线:
- 训练:让模型遵循明确的策略,认识到自身限制,并在任务无法合法完成时主动求助;
- 监控与干预:研究输入、输出、工具使用与模型内部状态,再把有用的信号连接到权限、隔离以及执行前的检查;
- 从失败中学习:调查哪里出了问题,改进训练或控制手段,并检验改动是否奏效、同时不妨碍合法的任务。
声明还写明了分工:「Base Labs 将开发并公开发布训练与监控这些模型的方法。Baseten 将把这些工作接入其部署基础设施,在运行时生效,并以托管服务的形式提供,同时公布方法与证据,供客户和外部评估者自行检验。」O'Neill 补充说,目标是让这套能力对所有客户可用。
声明邀请开源模型社区的每个人为这类安全评估协议作出贡献。:「我们希望能有更多人参与。如果你有兴趣加入,给我们发私信。」
参与这次合作的是谁
Base Labs 是 Baseten 旗下、9 月 3 日对外亮相的研究实验室,称它是「专注推进开源 AI 的专项研究组织」,方向包括围绕持续学习与强化学习机理的公开研究、面向所有人的开放强化学习(RL)环境、训练数据与基准(BaseHub Data Foundry),以及让开源模型更好、更安全、更对齐的后训练。它强调这是「使命驱动的科研,不是商业产品」;则写明「我们发表研究结果,包括失败的结果」。
提供模型推理与部署基础设施,是这套方案里负责部署与运行时交付的一方。
是一家可解释性实验室,官网把产品 Silico 称为「可解释性智能体」,称其用来解释、调试并精确控制模型行为。
Hugging Face 在声明中被列为合作伙伴,但声明没有写明它的具体分工;出面宣布参与的是其联合创始人 Wolf。
支持、质疑,以及尚未公布的部分
北京时间 9 月 17 日上午 8 时 40 分,。外部研究者的回应也出现了:,这是正确的方向,应当利用开源给安全研究带来的优势。质疑同样存在:在声明帖的回复中,:「开放听起来很棒,直到开放权重被武器化、而没有人对滥用负责。」
目前,已公开的声明与帖文都没有给出时间表,也没有说明首批方法与证据何时发布。声明希望这套安排成为「所有开源模型提供方」的标准,但没有说明其他服务商将如何采用。至于更多细节,Wolf 在帖文里的说法是:「我们很快就会分享更多。」