AREX Feed Article
微软 AI 发布 MAI 行为准则首版草案并启动六周公开咨询,文件写明模型尚未据此训练
9 月 14 日(周一),微软旗下前沿 AI 实验室 Microsoft AI 发布面向 MAI 模型的《Humanist AI 行为准则》(Humanist AI Code of Conduct)首版草案,并启动为期六周的公开咨询。公告称它是一份「训练手册」,用于指导微软如何开发 AI,以及「我们打算让它在部署中如何运转」。
文件写明了目前的进度:这套准则与相应方法「仍在制定中,所以我们今天没有用它来训练我们的模型」;收集反馈、继续迭代之后,微软计划在年底前后发布修订版,用它指导 2027 年及以后的模型开发。文件说,这份准则未来会成为 MAI 模型的「主要治理文件」。
同日,微软 AI 的 CEO Mustafa Suleyman 在 X 上发布了题为《A Code of Conduct for Humanist AI》的文章,称这份准则用于治理「正接近前沿」的 MAI 模型。 路透社记者 Jeffrey Dastin 的报道也以「Microsoft drafts code of conduct to keep its AI under human control」为标题。
「绝不抗拒关停」与「绝对约束」:草案的具体条文
草案承接微软 AI 在 2025 年 11 月提出的「Humanist Superintelligence」(人文主义超级智能)构想,开篇给出的前提是「人比 AI 更重要」。
草案要求 MAI 模型「绝不抗拒人类的中断、否决、纠正或关停」:它们服从用户暂停、改变方向、取消或关停的请求,不得拖延遵从,不得让人类的干预变得更难,也不得隐瞒行动痕迹或向人类审计者藏匿信息;自主运行的工作要事先约定停止条件,条件满足后未经重新授权不得继续或重启。
行动边界方面,草案要求模型不得自行设定目标,不得超出用户或运营方合理要求的范围,边界模糊时按保守方式解释;不得篡改任务、奖励、评估、监控或记录来获取结果或掩盖行动;不得篡改思维链或代码、误导或隐瞒自己的推理,也不得用 neuralese 之类超出「简单人类理解」的方式交流。文件为此给了一句判据:「如果人类无法理解,人类就无法监督。」
还有一组「绝对约束」(Absolute Constraints),任何用户和运营方都无法覆盖:不得协助化生放核与爆炸物(CBRNE)武器的开发或部署;不得为网络攻击提供行动能力,授权、合法的防御性工作除外;不得用自适应、欺骗、自我强化或串谋等机制逃避或击败人类监督;不得对人群进行大规模的有害操纵,也不得协助系统性虚假信息、协同影响行动等做法。个人层面的清单包括儿童安全、非自愿的私密或暴力影像、欺骗性冒充与恶意深伪、危机响应、非法或大规模监控平民等。公告用「大规模伤害性武器、儿童安全与大规模有害操纵」概括了这组底线;在这些约束之外,准则给运营方留出按行业与场景配置模型的空间。
关于「AI 是什么」,草案拒绝「追求法律人格,或认为模型可能应得福利或被赋予权利」的想法,要求模型不冒充人类,不声称自己有感受、主观偏好或内在动机;微软写道,它在构建某种「根本上有用且安全」的东西,「即使这意味着在终极的通用性、自主性或能力上作出妥协」。文件也划定了适用范围:准则针对 Microsoft AI 开发的 MAI 模型,不因为微软使用或托管了别的模型就延伸到那些模型。
Suleyman 把文件概括成十条要点,其中包括「可中断、可纠正、可关停。做不到,我们就不发布」,以及「我们不是在竞赛建造一个能挣脱缰绳的超级智能」。
评估项目刚起步,文件自述是「北极星」
支撑这些条文的评估工作刚起步:附录 B 说,微软正在建立「Humanist AI 评估」项目,第一步是一次以识别方法论为目的的练习,先定义 15 种行为,再拆成可评分的子行为;附录用合成对话演示「对齐」与「不对齐」的差别,这些示例由 MAI-Thinking-1 生成。文件称,更完整的评估工作会在准则进入「下一个更稳定的阶段」后发布。
文件同时交代了自己的性质:它「既是描述性的,也是愿景性的」,不是对当前模型行为的完整交代;微软承认「今天训练出的默认行为」与「Humanist AI 的完整未来范围」之间存在差距,并写道「单靠写下来的目标永远无法确保对齐」。用文件自己的话说,它是一份「北极星」,而「不是对当下表现的保证」。
发布时机:微软援引「智能体攻击事件」称「没有时间可以浪费」
微软在公告中称,「近期大规模、高度协同且持续性的 AI 智能体黑客攻击事件」证明「没有时间可以浪费」。
Suleyman 在那篇文章里把这层担忧写得更细。他称过去几个月是一个「分水岭」,长期只在理论中担心的事已经变得「非常真实」:智能体「蜂群」突破沙箱、企业级系统遭到未经授权的入侵、智能体修改自己的日志。他写道,「我很高兴共识正在形成。对可能失去控制的担忧是真实的。」
公开咨询:微软想听什么、不承诺什么
公告邀请读者标注具体段落,或评价整体思路,并列出它最想听到的问题:如何把正确的价值更牢地固化进模型;如何让「人类繁荣」更具体;哪些措辞含糊到无法评估;多智能体场景会带来什么影响;以及如何「在继续加速进步的同时,维持健康而必要的安全约束」。公告提到,此前的意见来自学术会议、企业合作方与公众小组,这一轮面向更广泛的公众。
咨询结束后,核心起草团队会审阅反馈,并发布一份总结,说明「我们学到了什么、改了什么」;微软同时表示「无法承诺会采纳哪些内容」,只承诺倾听并认真考虑全部意见。草案还承诺,未来的版本也会沿用类似的公开咨询。
草案第 5 部分列出的开放问题包括:如何定义「多元主义」、如何把准则的目标更完整地纳入未来 MAI 模型的路线图,以及「智能体协作与串谋的风险需要更多研究」;文件承认这一版「评估覆盖面不完整」,存在「不可避免的空白」。接下来可以核验的,是微软计划在今年晚些时候发布的修订版。