AREX Feed Article
MiniMax 业绩会预告 M3.1 与 M3 Pro:推理成本目标降至 M3 初版三分之一
8 月 28 日的半年报业绩会上,MiniMax CEO 闫俊杰预告了接下来三款模型:M3.1、M3 Pro 与 H3.1。称,M3.1 的推理成本目标定在 M3 初版的三分之一;约 3T 参数的 M3 Pro 将搭载 MSA 2.0 架构,最大参数档位的计算效率预计再提升 3 倍。闫俊杰还披露,公司自建训练集群 97% 的时间在有效运行。
这是继半年报之后的第二次披露。8 月 26 日,MiniMax 把半年报挂上港交所;两天后的业绩会上,公司称 8 月 ARR 突破 8 亿美元、B 端收入同比涨 703%。所有数字与路线图均为公司及 CEO 单方口径,财报表格本身标注「未经审计」。
M3.1:把推理成本降到初版的三分之一
新智元报道称,M3.1 是 M3 的延续,在现有底座上扩大后训练规模,重点强化 Coding、工具调用和 Agent 能力,更强调任务完成的质量与稳定性。闫俊杰给它的定位是「一个能被大量、广泛使用的模型」。Tech Buzz China 的解读同样提到,MiniMax 正把 M3.1 作为标准模型来部署,同时开发约 3 万亿参数的 M3 Pro,并希望把 M3.1 的推理成本降到 M3 初版水平的三分之一左右。
新智元报道把降成本定性为一条技术路线:只有把推理成本继续压下来,才有算力资本把后训练继续往上 Scaling。闫俊杰在业绩会上给了一个量化说法:在相同算力规模下,推理计算效率的提升倍数,与后训练规模的变大倍数基本线性相关。他在中被转述的判断是,后训练正在成为下一个规模化前沿。新智元报道对此的解释是:强化学习的 rollout 是推理,合成数据生成是推理,大规模评测也是推理,推理算力在训练中的占比越来越高。
M3 Pro 约 3T 参数:MSA 2.0 与 97% 的集群利用率
M3 Pro 是这批预告里参数档位最高的一档:约 3T 参数,在更大的底座上继续扩大强化学习和长程任务训练。架构上它搭载 MSA 2.0,新智元报道解释了它的省钱机制:模型每回答一次,都要先把上下文从头读一遍(Prefill),这一步最烧算力;MSA 2.0 把读过的东西存得更好、找得更快,命中率上去、少重读一次,成本就成倍往下掉。在最大参数档位上,计算效率预计再提升 3 倍,任务越长、上下文越复杂,优势越明显。
为了不在模型尺寸上缩水,MiniMax 的选择是在同样大的模型上找更优的架构:MoE 的专家稀疏压到 2% 以内还能收敛,自研 MSA 压缩长上下文的计算开销。算力安排则分三层:自建核心机房专门跑最大的训练任务,不够时向云厂商租用做弹性伸缩,线上推理峰值用 Token Factory 顶住。闫俊杰披露,这套训练集群 97% 的时间都在有效干活,只有 3% 花在等待、重启和协调上。他还提到,M3 和 H3 正在适配国产芯片,大规模国产算力集群很快会接上真实的生产流量。
H3.1 在路上:开源 H3 三周下载 2400 万次
视频模型这条线同步更新。7 月 31 日开源的 H3,三周多下载 2400 万次,衍生出 300 多个公开模型,新智元称它是今年全球下载量最高的模型之一。在此基础上,更强的 H3.1 视频模型已经在路上。Tech Buzz China 将 H3 描述为开源多模态模型,同样给出 2400 万下载、300 多个衍生模型的数字。
ARR 8 亿美元背后,亏损 3.6 亿的未解问题
8 月 ARR 8 亿美元,其中企业端约占 80%;上半年总收入 1.166 亿美元,同比涨 283%,相当于去年全年的 1.5 倍;开放平台与企业服务收入 7390 万美元,同比涨超 700%,占总收入的 63.4%,2025 年同期这个占比是 30.3%。平台 token 消耗 7 月是 1 月的 20 倍,企业客户与开发者超过 200 万,是去年底的 10 倍。毛利 2081 万美元,涨 464.8%,但 IFRS 口径亏损约 3.6 亿美元。
这轮增长的主要机制,闫俊杰归因于买 token 的主力从人变成了 agent:用户每点一次按钮,模型在后台要跑上几十轮,Agent 带来的推理需求增速已经快过用户数和消息数。一年前,MiniMax 还主要是一家消费者 AI 公司,Talkie、Xingye 和 Hailuo AI 贡献约七成收入;Tech Buzz China 把这一年的变化概括为重心从做消费者应用,转向向开发者、企业和 agent 出售模型访问权,并留下一个尚未回答的问题:快速增长的 token 消耗能否转化为经营杠杆,而不是变成快速上涨的推理和模型开发成本。
新智元报道称,8 月 28 日下午智谱上线并开源 GLM-5.3-Flash,定价是 Opus 4.8 的四十分之一;晚上阿里发布开源的 Qwen3.8-Flash-Next,每百万 token 输入 1 元、输出 3 元,是 DeepSeek-V4-Flash 的三分之一。闫俊杰在业绩会上给出的答案是:Minimize the Inference Cost, Maximize the Intelligence(最小化推理成本,最大化智能水平)。他还在业绩会最后说:「大语言模型行业不是零和竞争。任何一家公司的技术进步,只要能把智能的边界向前推进,最终都会扩大整个行业的价值空间。」