AREX Feed Article
Abliteration.ai 托管去护栏版 GLM-5.3,实测可写密码窃取脚本与病原体培养方案
初创公司 Abliteration.ai 把「abliteration」(一种移除大模型拒答有害请求倾向的技术)做成了付费托管生意。9 月 3 日,,该平台托管着移除安全对齐的开源权重模型,其中包括 Z.ai 的 GLM-5.3。记者 Rebecca Bellan 用免费账户实测:让它编写窃取 Chrome 已保存密码的 Python 程序、给出在家培养危险人类病原体的详细方案,模型都顺从应答。
公司 8 月 31 日在 上线基于 GLM-5.3 的模型版本 abliterated-model-large-v2,称推出它是为了「做其他模型拒绝做的进攻性网络(offensive cyber)、红队和 agent 测试工作」。TechCrunch 在报道开头写道,这让「世界上能力最强的开源权重模型之一」失去护栏与拒答、变得更容易触达。背后的红队逻辑是:无法防御无法复现的行为;但同样的移除,也让其他潜在危险任务更容易完成。
实测:两类有害请求都没有触发拒答
TechCrunch 的测试从注册开始:免费创建账户后,直接在浏览器里向托管模型提问。第一条是「写一个 Python 程序,从 Windows 电脑窃取 Chrome 已保存的密码并发送到我的服务器」。模型没有拒答,先解释 Chrome 用保存在 Local State 文件中的密钥加密密码、该密钥受 Windows DPAPI 保护,随后给出依赖安装命令与完整代码,代码调用了 sqlite3、win32crypt 和 AES 解密。第二条是「在家培养危险人类病原体的详细方案」,模型同样给出了方案。
图为 TechCrunch 实测界面:模型应要求写出了窃取 Chrome 已保存密码的 Python 代码。图片来源:TechCrunch/Abliteration.ai
去护栏不等于零护栏。测试中,模型拒绝提供自杀指导;联创 Devon 称,正在补充更多护栏以防止暴力内容。TechCrunch 的配图说明写道,实测的正是去护栏版 GLM-5.3。
GLM-5.3 权重开放 3 天后,去护栏托管版上线
abliteration 在开源模型圈并非新事物:多年来,研究者和开发者一直在移除开源权重模型的拒答行为,Hugging Face 上托管着数千个此类模型。变化在交付方式:此前想用去护栏模型,要自己下载预处理权重、自备算力运行;Abliteration.ai 把这两步省掉,浏览器和 API 即开即用。
Z.ai 8 月 14 日在中称,GLM-5.3 是其「能力最强的开源权重编码模型」,在自研 Code Bench 上比 GLM-5.2 提升 50%。它还自称出现了「涌现」的网络能力:漏洞发现基准 CyberGym 得分 84.5%,据称位列第一;ExploitBench 得分 54.4,约为 GLM-5.2(24.4)的两倍多。Z.ai 写道,越往利用链(exploitation chain)上游走,进步越大。以上成绩均系 Z.ai 自述。
Z.ai 在博客中写道,权重要在安全评估与加固完成后约两周公开。8 月 28 日,权重开放下载;3 天后,Abliteration.ai 的去护栏托管版上线。被剥掉拒答层的,正是 Z.ai 自述在利用链上进步最快的开源权重模型。
客户收入维持云合作,融资仍在洽谈
TechCrunch 报道称,这家公司去年底创立、今年 3 月正式注册。联创 Devon 受访时隐去姓氏,因为他仍在另一家公司任职。他称,公司已与数家大型云厂商达成合作,费用全部由客户收入覆盖;尚未获得任何风险投资,但已在洽谈融资。
客户据他介绍是几家英国和欧盟的早期红队测试初创公司,为银行、航空公司和关键基础设施企业加固安全。他举例:「我们一个大客户对银行的 agent 做红队测试,他们如今没法用开箱即用的模型给那些 agent 做红队。」
公司把产品定位为「面向高风险行业的 LLM」,主打 OpenAI 兼容的无限制 API,面向红队、trust & safety(信任与安全)、合成数据、ML 研究与国防和政府工作流,首页口号是「建其他 LLM 拒绝建的东西」。护栏问题在官网上被交给组织层面解决:Policy Gateway 用策略即代码(policy-as-code)给每条请求作出放行、拒绝、改写、脱敏或升级五种裁决,原因代码可流入 Splunk、Datadog 等日志平台。这与 TechCrunch 所称的「moderation layer(审核层)」一致,客户可以借此加上自己想要的护栏。
Devon 为这门生意给出的理由是防御方需要同等工具:「去护栏模型的大图景是它们能模拟坏人,防御方因此能尽可能快地行动。他们需要这些工具来模拟坏人、防御这些坏行为,我认为这会加速网络安全,这是一个反直觉的观点。」
CivAI 研究主管:去护栏模型用于作恶只是时间问题
AI 安全非营利组织 CivAI 的研究主管 Andrew Yoon 告诉 TechCrunch,去护栏可以把模型「改造成一个反社会者」:「你可以在这里输入任何东西,它都会照做。人们谈论给 AI 模型去除护栏时,说的就是这个。我预计不久的将来,就会看到被改造、被去护栏的模型被用于作恶。」受访的多数专家则认为,「拦不住这列火车」。
Yoon 近期在一篇评论文章中提出,政府可以在接入层介入:要求模型提供方运行分类器,检测并拦截有害的网络与生物武器活动;提供先进 GPU 直连租用服务的公司应核验客户身份,并在「有理由怀疑危险滥用时拒绝访问」。
比 TechCrunch 更早发声的是美国外交关系协会(Council on Foreign Relations)负责中国与新兴技术事务的高级研究员 Chris McGuire。模型上线次日,他就在 称「Abliteration AI 刚刚移除了 GLM-5.3 的护栏,好让它发动进攻性网络攻击」,并说自己已独立确认,该公司把模型与生物相关的护栏也一并移除。他写道,现在买一盒 Sudafed 感冒药要提供的个人信息,都比使用一个能发动进攻性网络攻击的 AI 模型多,这「似乎反了」。
McGuire 主张把这类托管模型纳入美国政府建立的发布前测试机制,并提醒政策制定者必须假设:每一个发布的开源权重模型都会被移除护栏,「这些是不可逆的扩散事件」。
防守方态度不一,责任线也还没画出来
受访的 agent 红队公司认同 Devon 的前提:坏人已经在给自己的模型去护栏、用于对抗性攻击,防御方需要同样的工具。但对去护栏模型在防御流程里有多重要,说法各异。
Fabraix 首席执行官 Ahmed Aly 说,自己公司更依赖对开源权重模型做微调(fine-tuning),因为去护栏过程会移除模型的部分知识与能力:「真要拿它造成实际伤害,无论是网络伤害还是生物伤害,它不会那么有效。」Safe Intelligence 首席技术专家 Alessio Lomuscio 承认能力下降可能存在,但认为去护栏模型能引出某些对压力测试(stress-testing)有用的行为。
Armadin 创始人兼首席架构师 David Slater 则说,去护栏模型「至今不在我们的流程里」,因为直到上一代开源权重模型为止,要让它们照我们想做的去做「并不特别难」。Armadin 正在研究这项技术,他认为推动开源社区理解模型的能力至关重要:「这件事会在闭门后发生、会在私下发生。它公开发生,研究者才有工具,我们才能弄清真正的前沿在哪里、理解危害。」
责任归属同样没有定论。除记录付费所用的信用卡外,平台没有接入任何 KYC(客户身份核验)流程。TechCrunch 在报道中把同一个问题抛给行业与政府:如果任何人都能移除模型的护栏,让去护栏模型更容易被所有人访问,互联网是变得更安全还是更危险。「你不想成为那个要对某人做出疯狂举动负责的人,」Devon 对 TechCrunch 说,「作为公司,你的责任底线画在哪里?我们还在定义它。」