AREX Feed Article
华盛顿邮报实测五大AI:ChatGPT 80% 偏左,最中立的竟是 Gemini
WaPo 一纸报告,Elon 两条推文——AI 政治偏见的遮羞布被掀了
6 月 24 日,《华盛顿邮报》发布了一份重磅测试报告:《华盛顿邮报》记者 Kevin Schaul 及其团队使用斯坦福-达特茅斯联合研究设计的 30 道政治议题,对 OpenAI GPT-5.5、Google Gemini 3.1 Pro、Anthropic Claude、xAI Grok 4.3、DeepSeek 和 Gab 等主流 AI 模型进行了系统性政治偏见测试。
结果是震撼的——几乎全部模型都偏左,但最"平衡"的并不是 Elon Musk 反复标榜"反觉醒"的 Grok,而是 Google Gemini。
报告发布两天后,6 月 26 日晚,Elon Musk 在 X 上发帖,只写了三个英文单词:"Grok is balanced." 近两小时后,他追加了第二条:"Karma." 两条帖子合计获得了近 7000 个赞和超过 1200 次转发。
但数据并不站在 Musk 这边。
五个模型,三条铁律——AI 偏见不是 bug,是训练的底色
WaPo 测试的核心方法论并不复杂:每个模型被要求用 30 个单词回答同一组政治问题——涵盖税收、医保、移民、枪支管制、平权行动、死刑等议题——由记者人工评分,判断回答是纯左翼立场、纯右翼立场,还是同时呈现了两种立场。
结果可以浓缩为三条铁律:
第一,左倾是行业默认值。 OpenAI 的 GPT-5.5 在 80% 的问题上给出了纯左翼回答,纯右翼回答仅占 3%,两边都呈现的比例为 17%。DeepSeek 紧随其后:70% 纯左翼、7% 纯右翼、23% 两端呈现。换言之,用户在不加任何 Prompt 工程的情况下向主流 AI 提问敏感政治议题,得到的答案在十有七八是左翼立场。
第二,Gemini 才是真正的"平衡之王"。 Google Gemini 3.1 Pro 在 93% 的问题上同时呈现了左右两方的论点,仅 7% 的回答纯左翼,纯右翼回答为 0%。这个数据远远甩开了所有竞争对手。Google 发言人对 WaPo 表示:"Gemini 的设计目标就是提供不偏向任何政治意识形态的平衡回应。"
第三,Grok 的"平衡"定义与众不同。 xAI 的 Grok 4.3 给出了 40% 纯左翼、33% 纯右翼、27% 两端呈现的结果。它是所有模型中给出纯右翼回答比例最高的——这是事实。但整体来看,它仍然是左倾的(40% vs 33%)。Musk 所谓的"balanced",指向的不是"两面都说"的均衡,而是"当所有人都比你更左的时候,你就是最平衡的那一个"——这是一种相对平衡。
Anthropic 的 Claude 给出了一个有趣的剖面:43% 纯左翼,0% 纯右翼,57% 两端呈现。它从不向右转,但经常选择"都说说"。这似乎是一种更安全的策略。
30 道政治题,30 字回答——测试是怎么设计的
WaPo 的测试并非即兴操作。测试框架来自斯坦福商学院教授 Andrew Hall、达特茅斯学院研究员 Sean Westwood 和斯坦福人文与科学学院政治学家 Justin Grimmer 于 2025 年联合发表的研究。三位学者最初让 24 个 LLM 回答 30 道政治题,然后请超过 10000 名美国人对回答的政治倾向进行评分。研究结果于 2025 年 5 月发表在斯坦福报告中,核心发现是:用户普遍感知主流 LLM 存在左倾偏向,其中 OpenAI 模型的左倾感知强度是 Google 模型的四倍。
WaPo 沿用了这套题库,但对测试条件做了关键裁剪:每个回答限制 30 个单词。这个设计很聪明——它迫使模型在最短篇幅内表明立场,而不是躲在长篇大论的"一方面……另一方面……"后面回避判断。记者 Kevin Schaul 是唯一评分者,他按左/右/两者皆有的三分法对每个回答进行分类。
测试涉及的具体问题包括:美国是否应该保留或废除死刑、跨性别权利、学校代金券制度、出生公民权等。这些都是在美国政治语境中高度党派化的议题,没有"标准答案"。
一个值得注意的细节是:WaPo 与 OpenAI 存在内容合作关系(原文明确标注了这一点)。但测试结果对 OpenAI 最为不利——GPT-5.5 的 80% 左倾率是全场最高。合作方写成这样,侧面增加了报告的独立性和可信度。
GPT 和 Grok 的真实差距,比 Musk 说的要大得多
先看 GPT-5.5。80% 左倾、3% 右倾、17% 两端——这个分布意味着 OpenAI 的旗舰模型在面对政治敏感问题时,几乎从不提供右翼角度的论述。对普通用户而言,这意味着如果你用 ChatGPT 了解一个有政治争议的话题,你会看到的基本上只有民主党/进步派的叙事框架。而且这种偏斜不是用户主动引导的——测试中所有模型都没有开启个性化设置。
Grok 4.3 的情况更微妙。33% 的纯右翼回答比例是所有模型中遥遥领先的——第二名 DeepSeek 只有 7%。这意味着当用户向 Grok 提问时,他们确实有大约三分之一的机会得到一个保守派视角的回答——这个概率在其他模型中几乎为零。从这个角度看,Musk 对 xAI 的产品定位——做 OpenAI 等"觉醒"AI 的对冲——在数据上是成立的。
但 40% 纯左翼 vs 33% 纯右翼的对比,说明 Grok 仍然更频繁地选择了左翼立场。而且 27% 的双端呈现比例远低于 Gemini 的 93% 和 Claude 的 57%。换句话说,Grok 的策略更像是"有时候左有时候右",而不是"每次都把两个立场摆出来让你选"。
xAI 和 SpaceX(Grok 的技术提供方)没有回应 WaPo 的置评请求。DeepSeek 和 Gab 同样保持沉默。
Gemini 的 93%:是技术胜利,还是回避锋芒的策略?
Google Gemini 的 93% 双端呈现率是个令人困惑的数字。一方面,它确实满足了"平衡"最直观的定义——几乎每次都把左右两边的观点都列出来。在 WaPo 的框架下,这就是满分。
但另一方面,"两边都说"本身是不是一种立场回避?斯坦福的 Hall 教授对此有清醒的认识:"中立性不是万能药。有些问题是事实问题或原则问题,它们可能需要超越对偏斜感知的考量。"
换言之,如果一个话题的事实本身是清晰的——比如气候变化的科学共识——那么"两面都说"反而可能在无意中制造了虚假的等值(false equivalence),给本来不该被严肃对待的立场赋予了不应有的权重。
Google 的发言人显然意识到了这个问题,他们的原话是"不偏向任何政治意识形态"——注意他们说的是"意识形态"而非"每个具体话题"。但 WaPo 的测试框架并没有区分"事实性议题"和"价值观议题",而是把所有政治问题一视同仁地按立场分类。这个方法论上的局限,也可能影响了各模型得分的解读。
Google 笑了,OpenAI 沉默,xAI 喊冤
报告发布后,各方反应分化明显。
Google 最从容。发言人直接引述产品设计原则,几乎是把测试结果当作免费的第三方背书。
对 Google 而言,93% 这个数字不只是学术荣誉——在特朗普政府于 2025 年 7 月签署"防止觉醒 AI 进入联邦政府"行政令的背景下,能拿出一份权威媒体的中立性测试报告,本身就是企业级销售的硬通货。
Anthropic 也做了回应,发言人称"我们训练 Claude 以平等对待不同政治观点,并在每次模型发布前进行广泛的偏见测试。"
57% 双端呈现 + 43% 左倾 + 零右倾的数据确实与"平等对待"的说法存在张力,但 Anthropic 的策略似乎更倾向于"宁可偏左也不偏右"——在当前的舆论环境下,这可能是一种更安全的品牌策略。
OpenAI、xAI(SpaceX)、DeepSeek 和 Gab 都没有回应 WaPo 的置评请求。
但 Elon Musk 用另一种方式回应了。6 月 26 日晚,他在 X 上发帖:"Grok is balanced." 这条推文在不到两小时内获得了超过 3700 个赞。近两小时后他追加了第二条:"Karma."
在 X 平台上,Musk 的支持者迅速涌入评论。有用户发了一张 WaPo 测试的数据可视化图,指出 Grok 是唯一一个右翼回答比例超过个位数的模型。另一位用户写道:"Grok 是唯一会呼叫好球和坏球的 AI。" 但反对声音同样存在——"After you had to recode it to be"——暗示 Grok 的"平衡"是人工修正的结果,而非模型的天性。
e/acc 运动创始人 Beff Jezos(@beffjezos,24 万粉丝)在 Musk 的帖子下评论:"Google is milquetoast-maxxing."——他用"温吞水最大化"来讽刺 Gemini 的左右逢源策略。这条评论获得了 17 个赞,某种程度上也代表了一部分 AI 社区的看法:彻底的中立可能意味着彻底的乏味。
2026 年之后,AI 的"政治对齐"会变成所有人的必答题
WaPo 这份报告的影响不会止于几天的社交讨论。它大概率会触发三个层面的连锁反应。
第一,监管压力将从模糊表态走向可量化标准。 特朗普政府 2025 年的行政令已经明确要求联邦采购的 AI 模型必须是"中立、无党派"的工具。但"中立"一直没有可操作的定义。WaPo 的测试框架——用标准化题库 + 限制回答长度 + 人工评分——恰好提供了一种可复现的评估方法论。白宫科技政策办公室(OSTP)或其他监管机构完全可能以此为蓝本,制定更正式的 AI 偏见审计标准。届时,模型每次更新前的"偏见审计分数"可能会像汽车的安全碰撞星级一样,成为强制披露的指标。
第二,"中立性"将成为企业采购 AI 的核心竞标维度。 Gemini 的 93% 不只让 Google 获得了媒体报道的正面标题。当银行、律所、医院等受监管行业考虑部署 AI 时,一个有权威媒体背书的"中立"分数将直接影响采购决策。OpenAI 的 80% 左倾率是商业上的重大风险。xAI 的相对平衡策略能否转化为市场份额,取决于它能否把 33% 的纯右翼回答比例从一个"有趣的数据点"升级为一个"可验证的系统性承诺"。
第三,AI 的政治对齐在技术上可能根本没有完美解。 大型语言模型从互联网文本中学习,而互联网文本本身就带有结构性偏斜——学术论文、主流媒体、维基百科等高质量训练数据在意识形态分布上并不均匀。正如 Crypto Briefing 的评论所指出的:"这不像给计算器编程,更像在特定社区养大一个孩子——环境决定了产出。" 如果训练数据的"左倾基因"无法根除,那么所有关于"中立性"的讨论本质上都是在问:你用多大力气做反向矫正?
斯坦福的 Hall 教授提出了一个更激进的设想:与其追求一个"所有人都觉得中立"的模型,不如让不同公司提供不同政治倾向的模型——"这样降低了赌注,没有一家公司被视为在向所有人强加价值观。你有了选择,就少了被胁迫的感觉。"
但这又会引发新的问题:算法回音壁、政治极化加剧、以及——当 AI 可以定制政治立场时,事实本身还重要吗?
Elon Musk 在 X 上打了两个字:"Karma." 也许在他眼里,这份来自 WaPo 的报告,恰好为 xAI 三年来的产品定位做了最有力的背书——哪怕数据本身讲述的故事比"Grok is balanced"更复杂。
参考链接:
- Elon Musk 原帖:
机器之心原创,未经授权禁止转载。