AREX Feed Article
彭博:中国8周连推5款AI模型,推理成本仅为美国1%,已形成可复制体系
8周5模型,成本仅为美国1%
8月4日,彭博社发布行业分析指出,中国科技企业在过去约8周内密集推出5款AI大模型,性能已逼近美国前沿水平,且部分产品的推理成本仅为美国同级模型的1%。彭博判断,中国AI产业已从单一公司的突破演进为可复制的系统性能力。
这一判断基于一项关键数据:独立评测机构Artificial Analysis的基准测试显示,DeepSeek V4 Flash完成复杂任务的成本为0.03美元,而Anthropic的Claude Fable 5完成同等任务需3.15美元——前者仅为后者的约1%。 在Artificial Analysis的公开对比页面上,两款模型的Intelligence Index分别为50和60,成本差距超过100倍。
从DeepSeek时刻到系统性追赶
Hello China Tech创始人、科技分析师Poe Zhao在接受彭博采访时表示:"自2025年1月以来最重要的变化是,中国的进步不再像是单一公司的突破,现在中国已经拥有一套可复制的体系来生产接近全球前沿的模型。" 他在LinkedIn进一步说明:GLM-5.2、Kimi K3、DeepSeek V4 Flash和Qwen3.8-Max在数周内接连发布,"美国实验室仍在顶端领先,但差距已变得更窄且更不均匀,因编码、推理、多模态能力和成本而异"。
成本端的差距尤为突出。Artificial Analysis的综合定价数据显示,DeepSeek V4 Flash的混合token均价为每百万0.06美元,而Claude Fable 5为7.70美元,差距超过120倍。
亚洲集团合伙人兼数字业务主席George Chen对彭博表示:"许多国家都在关注中美之间的竞争,它们现在不想选边站,因为竞争才刚开始。"他补充说,用美国总统特朗普的话来说,中方从这些新模型上"绝对会感到有更多的牌可以打"。
五张牌逐一拆解:性能追到哪里了
从6月中旬到8月初,五款模型在五个不同方向上展示了中国AI产业的宽度。
智谱GLM-5.2(6月13日发布):智谱AI的最新旗舰模型,以MIT开源许可证发布。核心卖点是100万token的上下文窗口和长周期任务能力。在衡量超长周期编码能力的FrontierSWE基准上,GLM-5.2仅落后Anthropic的Opus 4.8一个百分点,同时领先GPT-5.5一个百分点,是排名最高的开源模型。
月之暗面Kimi K3(7月16日发布):2.8万亿参数,月之暗面宣称是目前全球最大的开源权重模型。 在Artificial Analysis的GDPval-AA v2综合评测中排名第三,仅次于Claude Fable 5 Max和GPT-5.6 Sol Max。在编码测试Frontend Code Arena上排名第一,超越Fable 5和GPT-5.6 Sol。 彭博评价称,Kimi K3"以远低于美国对手的预算展现出相近性能"。
字节跳动Seedance 2.5(7月31日发布):专注于AI视频生成,可一次性生成最长30秒的连续视频,支持4K输出和最多50个多模态参考素材输入。 彭博报道称其在视频生成领域"横扫所有竞争对手"。
DeepSeek V4 Flash(7月31日正式公测):284B参数的开放权重模型,专注于智能体任务。在Artificial Analysis的Intelligence Index上得分50,与Google Gemini 3.6 Flash持平。据Artificial Analysis测试,其每任务成本约0.03美元,土耳其媒体Türkiye Today援引分析称其可能属于全球大规模运行成本最低的前沿模型之列。 DeepSeek官方宣称,该模型在Terminal Bench 2.1上得分82.7,超过了其自家更昂贵的V4-Pro预览版。
阿里千问3.8-Max(8月3日发布):2.4万亿参数的混合专家模型,支持100万token上下文窗口。作为阿里迄今最强的模型,它具备原生多模态能力,可处理从长文档到直播流的多种数据类型,还能将截图还原为软件应用、将平面图转为3D可视化。阿里宣布将于下周开放模型权重。
独立评测与业内怎么看
Artificial Analysis的对比数据为彭博的判断提供了第三方参照。在其Intelligence Index vs. Cost per Task的二维图谱上,DeepSeek V4 Flash与Claude Fable 5之间的位置关系呈现为一个清晰的帕累托前沿:Flash以大约50 vs 60的智能得分差距换取了超过100倍的成本优势。
据南华早报报道,阿里千问3.8-Max发布后迅速冲上多项AI文本和视觉模型排行榜榜首,阿里港股当日上涨7%,收报125.20港元。 路透社同日指出,阿里发布了其"最大且最具能力的AI模型"。
Poe Zhao在LinkedIn上补充了一个关键观察:Artificial Analysis的图表中已出现了一片"DeepSeek Zone"——在这个价格区间内,无差异化的通用模型"几乎不可能以溢价出售"。能够在其中生存的模型,必须靠速度、私有化部署、企业集成或分发渠道来解释自己的价值,而非仅靠基准分数。"一张基准图表无法衡量一个模型的全部价值。"
以美分计价的模型,正在改写规则
彭博的报道以一句判断收束:"曾经单一的冲击波,如今已演变为一股意想不到的强大力量。"
当中国模型以美分计价、美国模型以美元计费时,两国在客户间的竞争已开始发生实质变化。 George Chen的判断指向一种正在成型的国际格局:多数国家仍在观望中美之间的AI竞争,它们不愿过早选边——但价格这张牌,正在给天平的一侧持续加重砝码。
参考链接: