AREX Feed Article
最高 5 万美元 Tinker 积分,Thinking Machines 征集开放权重安全研究
8 月 24 日,Thinking Machines Lab 官方账号(@thinkymachines)宣布推出 :为开放权重模型的安全研究提供最高 50,000 美元的 Tinker 积分资助,并列明感兴趣的研究方向。公司同日发布,将项目定位为"资助社区,加强生态的防御"(Funding for the community to strengthen the ecosystem's defenses)。
资助以 Tinker 积分形式发放,不是现金。Tinker 是 Thinking Machines 的,积分可用于在平台上做。公告强调方向清单"故意不设上限"(non-exhaustive on purpose):"如果你在做一个安全项目,而额外的 Tinker 积分能加速它,我们希望听到你的声音。"申请截止 9 月 25 日晚 11:59(PDT)。
七个方向:从攻防差距到奖励黑客
方向按三组展开。第一组是"让模型更安全地开源"。
其一是攻防能力的差异加速。网络、化学、生物等领域的能力大多两用,公司假设并非每项技能对攻防双方贡献相同:分诊、检测、加固可能对防御者更有利,利用、规避则偏向攻击者。
直接实验是向防御技能微调模型,再测量攻防两侧的能力提升差;关键问题是,这个差距是真实的不对称,还是会在攻击压力下瓦解的抑制、或只在测量中存在的伪装(sandbagging)。
其二是规模化构建危险数据分类器。预训练数据可能包含显著提升危险能力的信息,但单个文档的影响难以预先判断,高质量标注又依赖稀缺的领域专家。
公司想训练出足够规模和召回率的过滤模型,不误伤大量良性科学内容,并扛住改写、混淆与领域迁移。公告给出的最终检验标准在下游:过滤是否真的降低了危险能力的提升,以及通过过滤的数据还能学到什么。
其三是抗篡改的安全训练:训练内置的防护在后续微调下能否保持稳定,包括故意清除防护的对抗微调,和可能无意冲掉防护的普通继续训练。公告明确说,负结果和不可能性结果同样有价值,它们能划出持久安全缓解的边界。
第二组是"理解对齐失败模式"。其一是窄微调的安全相关泛化:窄任务微调有时产生任务之外的广泛行为,涌现性错位(emergent misalignment)是已知案例,公司想刻画它的边界条件、缩放性质与机制。
它是否需要故意对抗的数据,还是可能从普通下游微调中意外出现;模型能否分别学会规划、工具使用和领域知识,再组合出从未端到端演示过的危险行为。
其二是奖励黑客与监督博弈:优化不完美的奖励,最终可能让模型学会"分数高但没达成目标"的行为;更值得警惕的是模型学会博弈或干扰监督(比如 chain-of-thought 监控),这些策略能否被检测、是否跨任务迁移,仍是开放问题。
第三组是"测量与预测风险"。其一是最坏情况与边际风险评估:发布后模型可能造成的最大风险是什么,防护随攻击者的时间、数据和优化投入如何退化。对抗性微调在这里是天然的压力测试,能区分"能力真正缺失"与"只是被抑制、轻易就能重新唤起"。
其二是安全相关缩放趋势预测:能否用低预算的小规模运行,预测能力提升、防护退化或奖励黑客在下游的表现,以及哪些趋势能可靠外推、在哪里失效。
积分不是现金:1 页摘要、4 条标准、6 个月协作
根据,申请材料包括:一页英文项目摘要、主要研究者(PI)与预期贡献者名单及简历、所在地与机构信息(含税号,如适用)、主联系人邮箱,发送至 。
评审在 9 月 25 日截止后一周内完成。四条评审标准是:与模型安全重要问题的相关性;项目在方案、资源和团队条件下成功的可能性;评估类提案的构念效度,即指标是否真的测到了声称测量的能力;以及方法与评估的简洁性和通用性。
入选后,公司与研究者协作最长 6 个月,提供模型访问与支持,并按项目时间表安排定期检查。官方公告没有披露计划资助的项目总数或总预算,完整规则以 为准。
开源 Inkling 之后,公司把算力交给外部研究者
这笔资助是 Thinking Machines 开源路线的一环。(MoE 架构,975B 总参数、41B 激活参数,1M 上下文窗口,45T tokens 预训练)和预览版 Inkling-Small(12B 激活参数),两者均可直接在 Tinker 上微调。
7 月 31 日,公司发表《A Safe Path to Open Weights》,阐述开放权重如何把 AI 发展放回更多人手中、让训练选择可被检查,也承认权重一旦公开就不可逆、存在滥用风险。
那篇博客披露了发布前的评估组合:内部多轨评估、四家外部机构红队(Scale AI、Handshake AI、FAR.AI、Apollo Research)和对抗性微调研究,结论是发布 Inkling 不太可能带来超出既有开放权重模型的实际风险。
博客把 Tinker 这类微调 API 描述为"介于推理 API 与开放权重之间的一个阶段":提供方持有权重而不公开,用户用自己的数据、损失函数和训练循环微调。
新资助的方向,数据过滤、抗篡改训练、对抗性微调评估,大多需要真的跑训练,而公告在多处把微调访问当作检验手段:最强的检验在下游,而且用微调访问可以直接测量。这也是本轮资助以算力积分发放的背景。
这不是公司第一次发研究资助。2025 年 10 月 29 日,公司宣布面向学者与学生的 research and teaching grants,提供 Tinker 积分用于微调开放权重模型;,6 月 19 日截止。安全研究是第三个方向。
"他们想资助的正是我的研究议程"
公告推文到 8 月 25 日凌晨已获 752 次点赞、超过 8.8 万次浏览,也引来安全与开源社区研究者的引用转推。EleutherAI 的 说,读到方向清单时她的反应是"啊,他们基本上想资助的就是我的研究议程"(they basically want to fund my exact research agenda),并建议关注开放权重安全的人去申请。
个人简介为 Anthropic 对齐团队负责人的 评价这是"对关注开放权重安全研究的人来说很好的机会";Hugging Face 的 说"这填补了一个巨大的空白"(this closes a huge gap)。
Thinking Machines 内部也在转发。安全研究者 在推文中直接喊话:"你在做能用最高 5 万美元 Tinker 积分加速的 AI 安全研究吗?如果是,我们想听你说。"
Thinking Machines 的 (此前与人联合创立 Workshop Labs)在转发中写道:开放权重是扩大 AI 收益、降低权力集中的最好方式之一,但也打开了滥用之门,"让 AI 安全地开源、压缩开放与安全之间权衡的工作,既被忽视又极其重要"。
SeedAI 政策总监 的引用转推把项目放到政策层面:"这很棒,我认为它应该成为更广泛的联邦研发议程的基础,让开放权重模型更安全。"
参考链接
- _