AREX Feed Article
中国大模型吃掉美企30% Token,Coinbase全员默认Kimi和GLM
2026年2月8日之后,美国企业在OpenRouter平台上调用中国大模型的Token占比,每一周都稳定在30%以上,峰值冲到46%。而18个月前,这个数字是4.5%。
同一时间线上,Coinbase CEO布莱恩·阿姆斯特朗(Brian Armstrong)把月之暗面的Kimi和智谱GLM设为了全体工程师的默认模型;DoorDash联合创始人方安迪(Andy Fang)将Kimi K2.6嵌入了公司的代码审查流程;AI创业公司Lindy把100%的业务流量从Anthropic Claude迁到了DeepSeek V4,推理成本直接下降约90%。
硅谷公司正在集体"换底座"。推动这场迁移的,是同一个算式:性能差距不到3%,调用成本却只有美国闭源模型的几十分之一。
图片来源:,中美模型周Token量对比
八周五模型:供给端的"闪电战"
截至2026年8月5日,短短八周内,五款中国大模型密集发布:阿里巴巴Qwen3.8-Max、月之暗面Kimi K3、DeepSeek V4 Flash、智谱GLM-5.2、字节跳动Seedance 2.5。这批模型的共同特征是:开放权重,性能追平甚至部分超越美国闭源旗舰,而调用成本仅为后者的几分之一到几十分之一。
放在两年前,一款旗舰大模型从训练到发布动辄数月甚至跨年。OpenAI和Anthropic的产品更新节奏至今仍以年为单位。中国厂商在两个多月内连发五款,且款款达到全球前沿水平。大模型竞争已经进入高频迭代阶段。
这轮密集输出并非靠堆算力堆出来的。在8月8日的梳理中指出,国内厂商普遍走开放权重路线,依托MoE混合专家架构和推理侧深度优化,在控制训练成本的前提下快速迭代多版本模型,形成覆盖高端推理到海量客服吞吐的完整矩阵。
性能数据也佐证了这一判断。智谱GLM-5.2在SWE-bench Pro编程基准测试中跻身全球第一梯队;Kimi K3的长文本处理能力在海外开发者中广泛验证;阿里Qwen3.8-Max多项指标对标Anthropic旗舰。斯坦福《2026人工智能指数报告》的结论更直接:中美顶尖模型的综合性能差距仅剩2.7%。
更关键的是价差。第三方平台OpenRouter的数据分析师Justin Summerville,中国开源模型比Anthropic和OpenAI的旗舰产品"便宜60%到90%"。同等业务负载下,部分国产模型的调用成本仅为美国闭源旗舰的1%。
4.5% → 46%:Token迁移的真实规模
OpenRouter是一个统一的AI推理路由平台,47%的用户来自美国开发者,中国用户仅占6%。这个用户结构基本排除了"国内刷量"的干扰,使它的数据成为观察美国企业模型选型偏好的一个有效窗口。
CNBC在7月7日的调查报道中引用了OpenRouter提供的长期趋势数据:2025年上半年,美国企业调用中国大模型的Token占比只有4.5%。此后12个月的平均值是11%。2026年2月8日是一个分水岭。从那周开始,中国模型的Token占比稳定超过30%,此后峰值一度达到46%。
OpenRouter自身的数据也揭示了更大的背景。该平台周Token处理量从2025年4月的约5万亿增长到2026年4月的超过20万亿。总量暴涨的同时,中国模型的份额还在同步扩张。绝对调用量的增长比份额数字本身更加惊人。
到2026年6月初,中国模型在OpenRouter上的Token总量已经超过了美国模型。DeepSeek一家就吃下了约18%的份额,是平台上最大的单一模型供应商;阿里巴巴Qwen紧随其后,约占14%。Anthropic作为最大的美国供应商,仅占约15%。
Coinbase的默认选项:Kimi和GLM
6月27日,Coinbase CEO阿姆斯特朗,列出了公司控制AI开支的五条策略。第一条就是更换默认模型。
"我们正在通过内部LLM网关,将开放权重模型设为默认选项,比如GLM 5.2和Kimi 2.7,同时仍然鼓励工程师选择他们认为最好的模型,"阿姆斯特朗写道。他补充了一个关键数据:Coinbase内部调研显示,91%的工程师日常工作并不需要GPT或Claude的极限性能。
效果立竿见影。阿姆斯特朗透露,在Token用量持续攀升的同时,Coinbase的AI总开支反而减半。工程师仍然可以手动选择任何模型,但默认选项的改变本身就改变了大部分流量的去向。
Coinbase是全球最大的加密货币交易所之一,其工程师日常任务覆盖代码补全、文档生成、内部知识检索、数据分析等绝大多数企业AI用例。默认模型从美国闭源旗舰换为中国开源模型,意味着大部分常规AI负载不再经过OpenAI或Anthropic的账单系统。
DoorDash、Airbnb、Lindy:同一种账
Coinbase不是孤例。7月初,美国外卖平台DoorDash联合创始人方安迪在社交平台上公开了公司的分层模型策略:让Anthropic的前沿模型处理最难的工作,把"较低层级的工作"交给月之暗面的Kimi K2.6。目标是在不降低代码质量的前提下压低综合成本。
这一披露随后引发了美国国会的关注。7月31日,称美国议员已致函DoorDash,要求其说明使用中国AI模型的具体情况,8月14日为回复截止日期。
Airbnb则行动得更早。2025年10月,CEO布莱恩·切斯基(Brian Chesky),公司"大量依赖"阿里巴巴的通义千问(Qwen)系列模型来驱动其AI客服系统。"它非常好,又快又便宜,"切斯基说。2026年5月,面对美国国会的质询,切斯基再次为这一决策辩护,称美国对中国开源模型的担忧存在"误解"。
规模最小的案例来自Lindy,一家仅有25人的AI代理平台创业公司。6月,Lindy CEO弗洛·克里维洛(Flo Crivello)宣布已将公司100%的业务流量从Anthropic Claude迁移至DeepSeek V4。他写道,迁移后的推理成本下降了约90%,而且在许多核心场景中性能反而有所提升。"我们做了,然后你就能看到成本曲线直接砸到地上,"克里维洛对CNBC说。他预计这一决策将在数月内为公司节省数百万美元。
百倍价差怎么来的
百倍价差源于两条技术路线带来的结构性成本差异。
美国闭源模型的商业逻辑是:投入数亿美元训练一款旗舰模型,通过高昂的API定价在12到24个月内回收成本。OpenAI的GPT-5.5定价为每百万输入Token 5美元、输出30美元。Anthropic的旗舰模型价格与之相当。
中国厂商走的是另一条路。由于普遍采用开放权重策略,研发投入被海量开发者和规模化落地持续摊薄。DeepSeek V4 Flash的定价为每百万输入Token 0.09美元、输出0.18美元,不到GPT-5.5输入价格的五十分之一。
Brookings学会中国中心研究员Kyle Chan对CNBC的判断是:中国模型目前落后美国顶尖前沿模型"六到九个月",但成本仅为后者"几分之一"。"以前美国公司做AI部署时不计模型成本,现在它们越来越在意性价比了,"Chan说。
Hugging Face机器学习负责人Yacine Jernite在接受CNBC采访时指出了一个更大的隐忧:市场正在被推向一个两难选择。要么接受美国闭源模型的高昂价格和随时可能变动的使用条款,要么转向中国开源模型作为唯一可行的替代。中间地带正在消失。
省钱逻辑撞上监管围墙
商业市场的选择与美国监管层的态度正在迎头相撞。
2026年6月,Anthropic的Fable 5和Mythos 5模型一度因美国出口管制指令被强制下线,7月1日才恢复。这是已知首例政府强制叫停全球模型服务的事件。同月,OpenAI表示应政府要求限制了一组新模型的发布范围。最前沿的美国模型正在被装进监管栅栏里,而栅栏之外的市场缺口,正在由中国模型填补。
Vercel的agentic基础设施负责人Harpreet Arora对CNBC描述了这个动态:"GLM 5.2上线第一周,日Token量增长了约27倍,使用客户数增长了约80倍。当一项任务不需要最好的模型时,团队开始把它路由到最便宜且够用的模型上。而最近这波中国模型正在赢下这笔账。"
不少美国初创企业已经公开表态:如果强制禁止使用中国开源模型,大量中小AI项目将面临生存危机。Lindy的克里维洛说得更直白:迁移到DeepSeek不是意识形态选择,"这是一道非常非常简单的商业算术题。"
OpenRouter的数据、Coinbase的默认设置、DoorDash的分层策略、Lindy的100%迁移。这些不是孤立的先锋实验,它们共同指向一个正在成型的产业现实:当性能差距收窄到个位数百分点,而成本差距拉到百倍,企业的模型选型正在从"追前沿"变成"算总账"。