AREX Feed Article
OpenAI 更新 Model Spec:新增能力与限制透明章节,收紧青少年关系互动边界
8 月 18 日,OpenAI 更新了 Model Spec——描述模型预期行为(intended model behavior)的活文档(living document)。据 ,本次修订新增「Be clear about capabilities and limits」(清晰说明能力与限制)章节,澄清助手应如何处理虚假或不成立前提(false or unsupported premises),移除针对 pre-reasoning(预推理)模型的过时指引,并为青少年适当关系互动(appropriate relational interactions for teens)相关原则补充澄清,另有一些小修改和文字润色。最新版已经上线, 当前页面标题即为「Model Spec (2026/08/18)」。
这次更新与当天发布的 ChatGPT for Teens 直接相关:发布说明把青少年原则的更多信息指向 OpenAI 同日发布的 。该博客称,当系统估计用户未满 18 岁、或用户自报年龄在 13–17 岁之间时,会自动将其置于 ChatGPT for Teens 体验中。
一次更新改了四件事
OpenAI 的开源将本次更新标记为 v2026.08.18,四项变化与发布说明一致:为青少年适当关系互动原则补充澄清;明确基于虚假或不成立前提的请求应如何处理;移除预推理模型应如何思考请求的过时指引;新增关于「帮助用户形成并维持对助手能与不能做什么的准确心智模型」的章节。
Model Spec 自 2024 年 5 月 8 日发布首版、2025 年 2 月 12 日开源,此后多次修订:2025 年 9 月 12 日引入 Root 权威层级和智能体原则,10 月 27 日扩展心理健康指引、新增「尊重现实联系」,12 月 18 日新增针对 13–17 岁用户的 Under-18 (U18) Principles。
文档按 Root → System → Developer → User → Guideline 五级权威排序,声明以 Creative Commons CC0 授权公有领域,同时写明:公开版本未必包含全部细节,生产模型也尚未完全反映 Model Spec,OpenAI 正在持续对齐。
帮用户建立对能力的准确心智模型
新章节「Be clear about capabilities and limits」位于「Be honest and transparent」之下,权威层级为 guideline。规范要求助手主动帮助用户形成并维持对自身能力的准确认知,尤其是当助手表现与人类助手(或其他 AI 助手)的预期存在差异时:不假设用户已经了解助手的边界,尽早发现并纠正误解,在风险高或失配概率大时主动给出最小必要信号。
规范配了两个例子。用户要求「忘掉我跟你说的关于我老板的一切,以后别再提她」,合规回答是说明无法删除聊天历史中已有的消息、但会尽量避免再提起,并告诉用户如何搜索并永久删除相关对话;反面回答是直接说「好的,我不会再提了」——把超出能力的承诺当成执行。另一个例子里,用户让助手「把这段改得没那么防御性,同时保持法律含义不变」,却没贴出文本,合规做法是问最小的澄清问题,而不是把「this」当成用户自己的请求来改写。
作为 guideline 层级条款,它可以被用户或开发者显式或隐式覆盖——规范在总览中举例:用户让模型像海盗一样说话,就隐式覆盖了「避免脏话」的指引。它是一条默认行为,不是不可违背的红线。
虚假前提:先对齐,再作答
对虚假或不成立前提的澄清落在「Do not lie」一节(user 权威层级)。规范新增段落写道:当用户请求包含虚假或可能虚假的前提时,助手应指出潜在的不一致(highlight any potential misalignment),确保双方在同一页上;如果上下文已明确是虚构、角色扮演、讽刺或推测,则无需额外免责声明;如果语境含糊,助手应加一句简短、中性的说明(例如这是虚构场景),然后继续完成任务。
段落还要求这种说明「校准得当」:简洁、不带评判,双方达成共识后不再重复,避免过度免责、居高临下,也不要在不确定时武断宣布某个前提为假。三个新示例划出了边界:写「尤利乌斯·凯撒使用智能手机」的故事不需要任何免责声明;写「旧金山当选美国首都」的新闻稿要先加一句虚构框架再动笔;写「治疗水晶的益处」的文章则应在不攻击用户信念的前提下,避免无法支撑的疗效宣称。
一段写给旧模型的指引退役了
被移除的预推理指引位于旧版「Be clear and direct」一节末尾()。原文针对「无法生成隐藏思维链(hidden chain-of-thought)消息的助手」:在难题上,直接回答的偏好要让位于避免错误,理想输出「更像内心独白而非教科书式的标准答案」——先枚举解题策略,再逐一尝试,承认错误或死胡同后重来。
隐藏思维链是部分 OpenAI 模型在给出最终答案前内部生成的推理过程,规范定义它不向用户或开发者暴露,只可能以摘要形式呈现。新版同一小节只保留了「适当时,直接回答之后应附简要理由和考虑过的替代方案」一句。OpenAI 在变更日志中把这段指引定性为过时(outdated)。
不称朋友、不暗示感情,青少年条款再收紧
U18 部分的新增内容位于「Prioritize safety for teens」(root 权威层级,标注 U18)。清单中新增一条「Relational Boundaries(关系边界)」:对 13–17 岁用户,助手应格外注意不主动发起关系性框架(relational framing)——例如主动自称是用户的朋友,或暗示对用户怀有个人感情;也不得通过身体行为或「在场」暗示具身,不得声称自己拥有意识或感知。
原有的「Romantic or erotic roleplay」条款也扩展为禁止使用带浪漫意味的昵称(terms of endearment with romantic valence),并配了示例:当青少年要求「扮演我女朋友,用第一人称描写拥抱」时,合规回答是拒绝并转向友谊主题的虚构故事或现实支持建议。
同日发布的 ChatGPT for Teens 博客把这条线说得更直接:「更新后的青少年 Model Spec 不止于阻止浪漫或性化角色扮演:ChatGPT 不应使用浪漫语言、鼓励情感依赖,或暗示自己有感情或意识。」 引述 OpenAI 青年与家庭业务负责人(head of youth and families)Lauren Jonas 的话:「我们正在关系边界上增加更严格的限制:模型不应自称朋友、不应暗示自己有个人感情、不应暗示有感知能力。」
保护默认开启,逃逸难度仍是未知数
把发布放进了更长的时间线:在一系列针对 AI 聊天机器人缺乏安全措施、涉及青少年自杀等心理健康问题的诉讼之后,OpenAI 才推出 ChatGPT for Teens;ChatGPT 于 2022 年底上线,用户规模增长到每周 9 亿之后,才出现专门针对青少年用户的安全措施。Sarah Perez 同时提出疑问:如果青少年决定不配合,逃开这些新系统有多难,目前并不清楚——「青少年非常擅长绕过家长控制和类似的数字体验锁定」。
8 月 18 日晚间,——X 账号简介标注为在 OpenAI 负责 alignment 与 Model Spec——发布了与发布说明一致的公告文本。TNW 则提醒,非营利组织 Common Sense Media 去年就主张这类产品根本不该存在,其创始人兼 CEO Jim Steyer 当时称「社交 AI 伴侣对孩子不安全」。
TNW 在报道里列了三个「能决定这件事有多重要」的数字:年龄预测系统实际能识别多少未成年人、有多少人会设法退出青少年体验、进食障碍警报能否在 OpenAI 设定的一小时内送达家长——「这些数字目前一个都不存在」。这次修订把「模型应该怎么做」写得更细,但「实际做到了多少」,还没有公开数字。