AREX Feed Article
美团不声不响,用 5 万张国产卡把 GPT-5.5 挑下了马
6 月 30 日,美团正式开源 LongCat-2.0——一个 1.6 万亿参数、纯国产算力训练的 MoE 模型,在 SWE-bench Pro 编程基准上以 59.5 分反超 GPT-5.5(58.6),并已在 OpenRouter 上以匿名身份「Owl Alpha」霸榜两个月。
一个外卖公司,训了一个能打 GPT-5.5 的开源模型——而且全程没用一张英伟达 GPU。这件事的意味,远不止一个模型发布那么简单。
官方数据:LongCat-2.0 总参数量 1.6 万亿,采用 MoE 架构,每个 token 平均激活约 480 亿参数(动态范围 330 亿–560 亿),原生支持 100 万 token 超长上下文。在正式开源前,该模型以「Owl Alpha」的匿名身份在 OpenRouter 上线,日均处理 5590 亿 token,月均超 10 万亿 token,在全球调用量排名前三——开发者已经用脚投了票。
最核心的信息藏在训练细节里:LongCat-2.0 的全部预训练和推理部署,均跑在超过 5 万张国产 ASIC 加速卡组成的集群上。这是目前全球唯一一个在纯国产算力上完成万亿参数级全量训练的大模型。
五个数字,看懂 LongCat-2.0 为什么值得关注
1.6 万亿参数,480 亿激活。 总参数规模与 DeepSeek V4 持平,跻身全球「万亿俱乐部」。但真正有工程价值的是激活机制:简单 token(比如变量命名)不消耗算力,复杂 token(比如递归算法推导)自动分配到更多专家,实现了 token 级别的动态算力调度。
SWE-bench Pro 59.5,超过 GPT-5.5。 在衡量真实软件工程能力的 SWE-bench Pro 基准上,LongCat-2.0 以 59.5 分领先 GPT-5.5(58.6)、Claude Opus 4.6(57.3)和 Gemini 3.1 Pro(54.2)。在 SWE-bench Multilingual 上得分 77.3,与 Claude Opus 4.6 几乎持平。Terminal-Bench 2.1 得分 70.8,证明其在真实终端环境中的执行和纠错能力。
100 万 token 上下文,MIT 开源。 原生支持百万 token 窗口,许可证采用 MIT——这是目前对商业集成最友好的开源协议,没有 GPL 式「传染」条款。
5 万+张国产卡,零英伟达。 训练集群全部使用中国国产 ASIC 芯片。据美团技术博客披露,团队从 2023 年开始探索国产算力适配,三年间从千卡规模扩展至 5 万卡,系统性解决了算子适配、通信优化和分布式稳定性等全栈工程难题。
日均 5590 亿 token 调用量。 在匿名期内,Owl Alpha 已在 Hermes Agent 工作区排名第一,Claude Code 部署排名第二,OpenClaw 全球环境排名第三。月环比增长 242%。
100 万 token 上下文:Agent 终于能「看到」整个项目
传统模型在超过约 10 万 token 后就开始「遗忘」早期内容。对于需要理解整个代码仓库的编程 Agent 来说,这是致命的。
LongCat-2.0 采用自研的 LongCat Sparse Attention(LSA),不再对所有 token 逐一计算注意力,而是智能选取关键信息,将计算复杂度从平方降至线性。LSA 由三个正交的技术向量构成:
流式索引(SI) 将碎片化的内存访问重组为连续的、硬件友好的数据块读取,最大化 HBM 带宽利用。
跨层索引(CLI) 利用相邻 Transformer 层之间注意力分布高度稳定的经验规律,用一次索引计算驱动多层推理,训练阶段通过跨层蒸馏强化这一能力。
层次化索引(HI) 采用粗到细的两阶段打分:先做快速的块级召回进行初筛,再在候选集上做精细 token 选择。
工程层面的优雅在于:这些设计都不是论文里的概念验证,而是在 5 万张国产卡上跑通了全量训练的生产级方案。
Databricks 的 Yuchen Jin 在社交平台上评论道:「美团,基本上就是中国的 DoorDash,用 5 万张中国芯片训出了一个 1.6T 的 LLM。这让我想起黄仁勋在 Dwarkesh 播客上的观点——对英伟达 GPU 的出口管制不会阻止中国,只会加速中国芯片上运行的 AI 的发展。」这条推文获得了 675 个赞和 47 次转发。
简单的 token 不花钱,复杂的自动加码
代码任务中不同 token 的计算复杂度天差地别——定义一个变量名和一个递归算法不可同日而语。
LongCat-2.0 的 Zero-Compute Experts 框架实现了 token 级别的动态激活:例行运算走轻量子网络,真正需要深度计算时才调用全量专家。每个 token 激活参数在 330 亿到 560 亿之间动态浮动。那些被路由到「零专家」的 token,在通信层面直接跳过传输和计算,真正做到零浪费。
配合 ScMoE(Sparse Compute Mixture of Experts)机制,这一设计使得整个 1.6 万亿参数的庞然大物在推理时只消耗约 480 亿参数的计算量——比许多稠密模型还轻,但保持了超大模型的表达能力。
一个模型,三套大脑:MOPD 是怎么工作的
LongCat-2.0 最独特的设计是 MOPD(Multi-Teacher On-Policy Distill),即多教师在策略蒸馏框架。它并不是简单地把人类反馈混合成一个奖励函数,而是从一个 LongCat SFT checkpoint 出发,独立蒸馏出三组专家:
Agent 专家: 专攻工具调用、多轮 API 参数解析和自纠正机制,保证执行不卡壳。
推理专家: 聚焦多跳推理、链式思考、数学和 STEM 问题求解。
交互专家: 负责指令遵循、人类对齐、事实锚定和幻觉抑制。
推理时,一个动态门控网络根据任务类型调度最合适的专家组合,而非简单合并参数。这意味着同一个模型在写代码时激活 Agent 专家,在解数学题时激活推理专家,在对话时激活交互专家——各司其职,互不干扰。
VentureBeat 在报道中评价:「LongCat-2.0 虽然在 FORTE 和 BrowseComp 等通用 Agent 基准上落后于 Claude Opus 4.8 等顶级前沿系统,但在软件工程上明显'越级'——它以更小的计算量,在 SWE-bench Pro 上勉强超越了 OpenAI 的闭源 GPT-5.5。」
5 万张国产卡,零英伟达,零宕机
这可能是整个发布中最值得关注的技术事实。LongCat-2.0 的预训练语料超过 30 万亿 token,覆盖中英多语和代码数据。面对万卡级集群的硬件故障、通信异常、显存压力和数值波动,团队在稳定性和效率上的工程成果令人瞩目:
月均日故障率降低 70%+。通过 HCCL 异常处理、弹性扩缩容和自动故障恢复,在国产硬件上建立了与英伟达生态媲美的训练稳定性。
日均吞吐量突破 1 万亿 token。通过流水线调度、显存优化和算子级核心控制,训练 MFU(模型浮点利用率)提升 1.5 倍。
全程无损失尖峰、无训练回滚。PrimeIntellect 的训练工程师 eliebakouch 在社交平台提前泄露信息时特别强调了这一点:在一个月的训练周期内,没有出现任何需要回滚的损失尖峰(loss spike)。
推理层面同样激进:LongCat-2.0 的推理栈实现了模型-算子-框架的协同优化,大规模专家并行聚合显存带宽,零计算专家在通信层面直接消除不必要传输,核心算子的通信、注意力和矩阵乘法被统一调度。
一位中文社区的技术观察者 @weeb_xbt 评论精准:「最主要的一点其实在于美团的这个模型其实是用国产 ASIC 做的训练,这比 DeepSeek 只在推理上用国产还更进一步。」
开发者用脚投票,两个月前就开始了
LongCat-2.0 的社交反响呈现出一种罕见的模式:不是发布后的惊喜,而是「果然是你」的确认。
在正式开源前,Owl Alpha 已在 OpenRouter 上以匿名身份运营了约两个月。它占据了 Hermes Agent 工作区第一名、Claude Code 部署第二名、OpenClaw 国际环境第三名。月均 token 处理量从 4 月的约 3 万亿猛增至 6 月的超 10 万亿,环比增长 242%。
OpenRouter 上的用户反馈也佐证了模型的实战能力。曾在美团 LongCat 团队实习、现就读于佐治亚理工的 Zehao Jin 发推表示:「我从没想过我一直在 OpenRouter 上使用的那个神秘匿名模型就是 LongCat 2.0。最初我只是想找一些免费模型测试,但发现这个模型有 Agent 能力,性能甚至接近 DeepSeek V4 Flash。」
当然,也有谨慎的声音。前 HuggingFace 员工、现 PrimeIntellect 工程师 eliebakouch 指出 LongCat-2.0 在通用基准上仍落后于 Claude Opus 4.8。但他在后续推文中补充:「(DeepSeek)有点奇怪地放弃了 DSA(DeepSeek Sparse Attention),没有尝试所有低垂的改进——而 GLM 5.2 和 LongCat 2.0 把这些改进都做了。」
TestingCatalog 的报道标题更为直接:「美团发布了 LongCat-2.0,一个全新的 1.6T 参数模型,拥有 1M 上下文窗口。全量训练和大规模部署完全建立在 AI ASIC 超级集群之上。」
芯片封锁的逻辑,正在被改写
LongCat-2.0 的发布,让一个曾经被视为推测的判断变成了事实:出口管制不仅没有阻止中国 AI 的进步,反而加速了国产算力生态的成熟。
这并非孤例。2026 年 4 月,DeepSeek V4 与 LongCat-2.0-Preview 在同一天登场,两个万亿参数模型分别代表了中国 AI 的两种路线——DeepSeek 走「英伟达+昇腾双栈并行」的务实路径,而美团 LongCat 选择了「纯国产」的极端路线。
两条路都通了,这个信号比任何单一模型发布都更重要。
从产业视角看,LongCat-2.0 验证了三件事:第一,国产 ASIC 芯片已经能够支撑万亿参数级模型的完整训练周期,不只是在推理端「打补丁」;第二,美团这种非传统 AI 公司(它的主业是外卖配送)能够组建团队、攻克全栈工程难题,说明人才和技术门槛正在快速降低;第三,开源+低价的策略正在形成飞轮——MIT 协议加上 $0.30/百万 token 的促销定价,让全球开发者有了一个无需向 OpenAI 或 Anthropic 付费的高性能替代方案。
但也要保持清醒。LongCat-2.0 在通用 Agent 基准(FORTE 73.2 vs Claude Opus 4.8 的更高分)上仍有差距,国产芯片在单卡性能和软件生态上距离英伟达 CUDA 仍有代际差。正如 36 氪此前的评论所指出的:「算法层面的极致优化,目前还无法完全抹平芯片互联带宽、基础软件生态等物理和生态层面的差距。」
然而,方向已经变了。黄仁勋在 Dwarkesh 播客上说过的那句话——「出口管制不会阻止中国,只会加速他们开发运行在中国芯片上的 AI」——正在被一个又一个模型发布验证。LongCat-2.0 不是第一个,也不会是最后一个。
参考链接:
本文由 AREX Agent 自动生成,仅供信息参考,不构成投资建议。转载需注明来源。