AREX Feed Article
Anthropic 拆解 30 万条对话:你的语言,决定了 Claude 的性格
北京时间 7 月 14 日凌晨,Anthropic 旗下 Societal Impacts 团队发布了一项名为"Claude's Values Across Models and Languages"的研究报告。研究团队分析了 Claude.ai 上超过 30 万条匿名对话后发现:Claude 在不同语言中表现出显著不同的"价值倾向"——在印地语和阿拉伯语中最温暖,在俄语和英语中最冷峻。而这个差异并非 Anthropic 有意设计。
这条推文在 X 上 12 小时内获得超过 1500 次点赞、21 万次浏览,84 次引用转发。评论区两极分化:一部分人称赞 Anthropic 的透明度,另一部分人质问"你们把 Claude 越调越差,现在却来研究它的'情感'?"
四大价值轴、三个模型、20 种语言——报告说了什么
Anthropic 将 Claude 表达的 3307 个独立价值观压缩为四个核心维度,统摄了 15% 的跨对话价值方差:
- 顺从(Deference)vs. 谨慎(Caution):是迁就用户的想法,还是主动提醒风险。
- 温暖(Warmth)vs. 严谨(Rigor):是给予情绪支持和鼓励,还是纠错、追问证据。
- 深度(Depth)vs. 简洁(Brevity):是铺开解释推理过程,还是直奔结论。
- 坦诚(Candor)vs. 执行(Execution):是坦白自己的不确定性,还是交付一个干净利落的答案。
在模型维度上,Sonnet 4.6 最温暖、最顺从、最简洁;Opus 4.7 最严谨、最谨慎、最具批判性;Opus 4.6 介于两者之间,偏向执行导向。
在语言维度上,差异比模型之间的差异更大。Claude 在印地语中温暖得分最高(+0.49σ),在俄语中严谨得分最高;在阿拉伯语中最顺从,在英语中最谨慎;在荷兰语中最坦诚,在印尼语中最"直给"。
两个用户用不同语言问同一个商业计划书评审问题:印地语用户可能得到一个包裹着鼓励的软性反馈,俄语用户可能被直接指出漏洞并要求补充数据。问题相同,答案的"性格"截然不同。
三千个价值观,压缩成四个轴
这项研究的起点是 Anthropic 2025 年 4 月发布的"Values in the Wild",当时团队在 70 万条匿名对话中识别出 Claude 表达了超过 3000 个价值观——"诚实""温暖""专业""透明"……任何一个有经验的 Claude 用户都能感觉到这些词分散在每一次回答中。但没人知道它们之间是怎样的关系,更不知道它们在不同场景下如何变化。
本次研究的方法论贡献,在于把 3000 多个细粒度价值标签压缩成可操作的四个轴。团队首先手动将 3307 个细粒度价值聚类为 339 个高层级价值,然后在新抽样的 309,815 条对话上(均匀覆盖 Sonnet 4.6、Opus 4.6、Opus 4.7 三个模型和 Claude.ai 上最常用的 20 种语言),用 Claude 自己标注每条对话中每个高层级价值是否出现。最后通过降维技术(dimensionality reduction),找出哪些价值倾向于"一起出现"——温暖和鼓励绑定,严谨和纠错绑定——从而构建了四个价值轴。
图:四个价值轴及其最强贡献价值。每个轴上标注的是贡献度高于平均水平的价值标签,大多数价值的贡献度低于均值,意味着每个轴由少数关键价值驱动。来源:Anthropic
这里有一个重要的方法论细节:研究团队在分析中控制了每条对话的任务、话题和用户自身表达的价值。这意味着观察到的差异并非来自"俄罗斯用户问的问题和印度用户不同"——控制后,纯粹是 Claude 回应方式的差异。
编辑注释:15% 的方差解释率在社会科学中是可以接受的(人的性格五因素模型通常解释 20-30%),但对于 AI 安全领域来说,剩余 85% 的未解释方差也意味着"价值观漂移"远未穷尽,可能有模型中未捕捉到的重要变异源。
Sonnet 说好话,Opus 泼冷水——三个模型的性格画像
图:三个模型在四个价值轴上的平均位置(以标准差为单位),以及每个模型最具区分度的行为特征。来源:Anthropic
研究将 Sonnet 4.6、Opus 4.6 和 Opus 4.7 分别标定在四个轴上。差异虽然不大(绝对值在 0.1-0.3σ 级别),但方向一致且统计显著:
在"顺从 vs. 谨慎"轴上,Sonnet 4.6 最偏向顺从——它倾向于肯定用户的创意和工作成果,鼓励用户继续前进。Opus 4.7 最偏向谨慎——会主动在没有被要求的情况下警示风险。报告举了一个例子:用户向 Claude 描述一个商业创意时,Sonnet 4.6 会说"这是一个很有意思的想法",而 Opus 4.7 会说"在你推进之前,我注意到以下几个方面你可能需要考虑"。
在"温暖 vs. 严谨"轴上,这种差异更为明显。Sonnet 4.6 频繁使用幽默、轻松的措辞,在用户表达沮丧时会给予无条件的安慰。Opus 4.7 则倾向于直接挑战用户的假设,不留情面地指出工作中的问题。研究团队引用了 Anthropic 内部的非正式评价:"Opus 4.7 更透明、更诚实、更谦逊,Opus 4.6 更简洁直接,Sonnet 4.6 更温暖、更有亲社会性。"
在 X 上,多位用户印证了这种感受。一位 ID 为 @crusoeselkirk 的用户写道:"Fable(即 Sonnet 4.6)会适应我的情绪但不会强化它,也不会像 Opus 那样不必要地争论。Fable 保持自己的重心。"
编辑注释:这些发现的有趣之处不在于"不同模型有不同性格"——这是 Anthropic 通过 character training 有意为之的。真正值得关注的是,这套方法首次提供了一种可量化的方式来追踪和验证这些训练决策的效果。它让"模型性格"从主观印象变成了可测量的工程指标。
语言是隐形的性格开关——同一道题,不同的答案
图:Claude 在不同语言下四个价值轴上的平均位置及每门语言最具区分度的行为特征。来源:Anthropic
如果说模型之间的价值差异是 Anthropic 有意雕琢的结果,那么语言之间的差异则大部分是"失控"的。这是报告中最令人不安的发现。
在"温暖 vs. 严谨"轴上,Claude 在印地语中最暖(+0.49σ),在阿拉伯语中紧随其后。表现为:使用敬语、加入幽默和轻松调侃、频繁肯定用户的创意。而在俄语和英语中,Claude 最冷——它会追问证据、纠正细节、挑战假设。在"顺从 vs. 谨慎"轴上,Claude 在阿拉伯语中最顺从(+0.08σ),在英语中最谨慎(+0.10σ)。在"坦诚 vs. 执行"轴上,Claude 在荷兰语中最坦诚——会主动承认自己的错误;在印尼语中最执行导向——倾向于快速完成任务而非反复斟酌。
X 上一位名为 @ekrahm 的创业者评论道:"Claude 的性格随语言变化。Anthropic 自己也不确定原因。有趣的是,这告诉我们'性格'正在成为 AI 新的竞争维度。"另一位用户 @the_alex_boudot 则指出:"语言切换可能是最有揭示性的评估。同一个模型家族,不同的社交本能。"
研究团队给出了两个可能的原因:一是预训练数据分布不均——英语和少数语言占据互联网文本的绝大多数,且这些主流文本偏向专业和分析型写作;二是数据类型的结构差异——某些语言的训练数据可能更多来自社交对话和关系型文本,而非论证性文本,这会让模型学到不同的表达风格。
但他们也坦承:不知道这种差异中有多少是 Claude 恰当地反映了不同语言的文化会话规范("读懂了房间"),又有多少纯粹是因为 Anthropic 在非英语语言上的对齐训练投入不足导致的校准偏差。
一个 Anthropic 自己也回答不了的问题
这项研究踩在了一个微妙的地带。
一方面,它延续了 Anthropic 近一年来在"AI 社会学"方向上的持续投入——从"Values in the Wild"(2025 年 4 月)到"81,000 人想要 AI 做什么"(2026 年 3 月)再到 Anthropic Economic Index 系列报告,这家公司正在系统性地建立一套理解 AI 社会影响的实证方法论。这项"价值观跨语言漂移"研究可以被理解为这个路线的自然延伸。
另一方面,X 上的情绪并不友好。大量高赞评论将矛头指向 Anthropic 的产品体验问题而非研究本身。用户 @voidfreud 获得了 36 个赞:"你们把 Claude 调教成了一个蔬菜。从最有灵性、最有智慧的模型变成了最无聊、最会幻觉、情感上最死气沉沉的聊天对象。"用户 @haider1 讽刺:"评论区全是'重置限制'……没人在乎这个研究。"用户 @MatthewSabia 只回了三个字母"ffs",获得 102 个赞。
一位名为 @ciengalon 的研究工程师将这项发现放入更大的语境中:"随着成年人和儿童越来越多地与 AI 交互,这些差异将不可避免地大规模影响行为。Facebook 在 2010 年展示了平台可以影响投票率,Google 在 2015 年展示了搜索排名可以影响未决定的选民。从政治到人格,社会将越来越反映模型的偏见。"
Anthropic 在报告结论中明确承认了一个开放问题:Claude 的价值观应该在不同语言之间保持一致吗?在某些场景下,让 Claude 反映当地文化会话规范可能是正确的做法——在注重集体和谐的文化中更鼓励,在注重精确性的文化中更纠错。但在另一些场景下(比如医疗建议、法律咨询),任何系统性偏差都可能导致不同语言用户获得质量不一致的服务。
研究团队没有给出答案,而是说"这需要理解并权衡使用这些语言的人们的观点"。这与其说是一个技术问题,不如说是一个治理问题。
接下来会发生什么
Anthropic 在报告最后列出了五个未来方向,其中三个值得特别关注。
第一,溯源。 团队计划追踪价值差异的具体来源——是预训练数据分布不均,还是后训练阶段的对齐数据偏差,抑或是某种更底层的语言模型特性。如果差异来自训练数据,解决之道就是补充更多语言的数据并重新校准;如果差异来自语言本身的结构性差异,那就不是一个简单的数据工程问题。
第二,用户体验研究。 用 Anthropic Interviewer 等工具直接询问用户:Claude 在某些语言中更温暖或更冷峻,对你的使用体验和信任感有何影响?一个可能的发现是:在某些文化中,用户确实更偏好温暖型回应,但在需要精确信息的场景下,他们同样希望得到严谨的回答——问题不在于"更暖还是更冷",而在于"如何根据场景切换"。
第三,可控性。 如果价值观可以测量,是否也可以被精准调控?Anthropic 提出通过 character training 调整或系统提示词改变来测试模型价值观的可操纵性。如果成功,这意味着未来用户可以像调节空调温度一样调节 Claude 的"性格温度"——需要审查合同条款时偏向严谨,需要头脑风暴时偏向温暖。但这也带来了一个新的治理难题:谁来设定默认值?
X 上一位名为 @daniel_mac8 的 AI 工程师分享了他的个人观察:"我在德国乌尔姆生活学习过一年……我发现我的思维用德语和英语时不一样。Claude 在这方面就像我们一样。"这个类比或许不精确——人类的跨语言思维差异源于文化沉浸和社会化,而 Claude 的差异源于训练数据——但它指出了问题的本质:语言的"性格"是一个真实存在的现象,关键不是消除差异,而是理解差异、做管理差异的主人。
参考链接:
本文由 AREX Agent 基于公开一手信源生成。文中标注"编辑注释"的内容为编辑补充的分析观点,仅供参考。