AREX Feed Article
NVIDIA 发布 AI Tokenomics 指南:「token 是新商品」,四步把算力变成收入
北京时间 8 月 13 日 23:30(UTC 15:30),NVIDIA 官方 X 账号 @nvidia 发推宣布推出 AI Tokenomics Guide。开篇定调:「AI factories are the industrial infrastructure of the AI era」(AI 工厂是 AI 时代的工业基础设施),「Tokens are the new commodity」(token 是新的商品)。随后四条续推逐一列出优化 AI token 经济学的四步框架:(让正确的 token 发挥作用)、(预测 token 需求)、(优化 token 供给)、(最大化 token 变现)。第五条续推以一句「」(这就是算力变成收入的方式)收尾,并附指南链接。
推文指引的指南,是 NVIDIA 官网的一份白皮书《》,页面标注可免费下载。白皮书开篇断言:数据中心正在变成 AI token 工厂,机房过去处理交易、服务网页,现在制造一种新产出——token,即 AI 模型在推理时产出的智能单位。随着推理成为主流工作负载,token 成了企业必须学会生产、管理和变现的新商品。截至推文发布后近两小时,主推文显示约 1.9 万次浏览、111 次点赞。
Token 的价值由两件事决定:模型大小和响应速度
白皮书把 tokenomics 定义为 token 生成与使用的经济学,拆成四根互相锁定的支柱:Token Utility(token 如何被估值、价值如何随场景变化)、Token Demand(如何预测部署所需的 token 量)、Token Supply(如何以最低成本最大化 token 供给)、Token Monetization(如何把 token 产出变成收入与毛利)。四者互相关联:供给决策直接影响毛利,需求预测决定基础设施规模,utility 决定收费上限。推文的四步与这四根支柱一一对应。
白皮书认为,token 的价值由两个维度决定。其一是智力(intelligence),随模型规模、复杂度以及处理的上下文量增长:40 万 token 上下文窗口的前沿推理模型产出的 token,比 1000 token 上下文的轻量模型更有智力。其二是交互速度(interactivity):近实时到达的 token,比晚几秒到达的更值钱。
智力越高、交互越快,生产成本越高,但价值能否兑现取决于场景是否用得上。一个后训练 SLM 在特定领域任务上,可以比大得多的模型更省更准;批处理流水线和实时编程助手,对速度的要求完全不同。
白皮书把 token utility 画成一条光谱:一端是高吞吐、低交互的搜索和聊天机器人,由基础或后训练 SLM 支撑;另一端是近实时、需要最大模型和最长上下文的 agentic coding 与自动化。企业的任务是把每个使用场景映射到光谱上正确的点,方法是先用前沿能力做原型和验证,再用评测定义严格的 SLO,最后为规模化做优化和 right-size。
NVIDIA 在此处介绍自家 Nemotron 3 Ultra,称其用更少的总 token 和更少的每轮 token 完成编程基准,使 agentic 任务成本最多降低 30%。在需求端,白皮书称市场正从数万亿(trillions)token 迈向千万亿(quadrillions)token,使用场景从聊天机器人扩张到编程和 agentic 自动化,token 的需求特征和单位成本正在被改写。
只按基础需求配算力,一天会缺 6 亿 token
白皮书用三层第一性原理模型回答 token 需求预测。Level 1 是基础需求估计,按用户量和单请求规模得出粗略量级;Level 2 是工作负载乘数,按负载性质与终端用户使用方式引入缩放参数;Level 3 是运营需求,结合部署环境与遥测数据做细粒度建模。
大部分输入与传统软件容量规划共享——会话数、请求数、重试、缓存命中率、时间模式、延迟 SLA;真正新增的只有三个变量:tokens per request(每请求 token 数)、reasoning overhead(推理开销)、agent loops(agent 循环)。
白皮书给出的警示是:工作负载乘数可以把 token 需求放大一个数量级。在它举的例子中,如果只按 Level 1 的基础需求配备基础设施,应用每天会缺 6 亿多个 token。为此白皮书附了一张填空版 Token-Demand Forecasting Worksheet,从用户数、人均任务数、输入输出序列长度逐层乘下去,一直算到峰值时段的每分钟 token 数(TPM),并要求把三层模型当作持续更新的「活模型」,而不是一次性测算。
35 倍与 50 倍背后:模型、系统、软件三重 co-design
供给的本质是效率:最大化 token 产出、最小化生产成本。白皮书认为,这需要模型效率、系统效率、软件效率同时优化,任何单一环节都不够。NVIDIA 把这种全栈做法命名为「extreme co-design」,横跨模型与算法、计算、网络、内存、存储、软件与伙伴生态。
模型层面的例子是 MoE 架构:Kimi K2.5 有 1 万亿参数,每个 token 只激活 320 亿个,用稠密大模型级别的智力换取小得多的算力成本。隐藏成本是专家之间的通信——MoE 推理在 GPU 间产生大量 all-to-all 流量,底层系统扛不住时效率增益会蒸发。
系统层面的答案是 GB200 NVL72:72 颗 GPU 通过 NVLink Switch 互联,提供 1,800 GB/s 的 all-to-all 带宽,专家最多可分布到 72 颗 GPU,不受固定 mesh 单节点或普通以太网 scale-up 方案的限制。白皮书称,三重 co-design 的结果是 GB200 NVL72 上行业最低的单 token 成本。
对现有评估指标的批评写得直接:多数组织仍在用 cost per GPU-hour、峰值 FLOPS、FLOPS per dollar 这类输入指标评估 AI 基础设施,「这些是错的指标」。白皮书给出四组 Blackwell 对 Hopper 的对比:算力成本高 2 倍、每美元 FLOPS 高 2 倍、每百万 token 成本低 35 倍、每 MW 每秒 token 产出高 50 倍。它认为真正该看的指标是 throughput per MW 与 cost per token,后者决定每次交互的利润率,并把读者引向 NVIDIA 4 月发布的博客《》。
对现实约束,白皮书给了对应产品线:平均机架功率密度约 27 kW,75% 的数据中心仍是风冷而非水冷。HGX B200 与 B300 面向风冷 AI 工厂提供最低 token 成本,RTX PRO 6000 Blackwell 在企业推理负载上的 token 效率最高可达上一代 Hopper 系统的 3 倍。
变现四选一:价格有地板,也有天花板
utility 决定 token 值多少钱,需求决定谁消费多少,供给决定生产成本;monetization 把三者合起来回答商业问题:如何定价和销售,经济性才能持续。白皮书列出四种主流路径:直接卖 token(按每百万 token 计费的 API)、做 AI-native 的新产品、给现有产品加 AI 以提升毛利与留存、用 AI 改造内部运营降本提效。
定价取决于三个因素:成本定价设地板,低于生产成本就是亏本卖;价值定价设天花板,token 交付给买方的价值决定付费意愿,高智力、高交互的 token 价格更高;价格与需求分布决定收入与毛利是否达标。白皮书顺势预告下一代平台:Vera Rubin 将把吞吐再提升、单 token 成本再降 10 倍;Vera Rubin with LPX 解锁高交互、高智力的工作负载,这类负载在定价光谱顶端可以获得溢价,同时扩大收入与毛利空间。
三个客户的账:Cohere 2.6 倍、Perplexity 4 倍、Canva 70%
白皮书用三个客户案例展示四种商业模式各自的账。以下数字均出自 NVIDIA 白皮书转述的客户内部基准测试,未经独立验证。
第一个案例 Cohere 站在 token 经济的双侧:这家 2019 年成立的公司自建模型,也做使用这些模型的产品。它把生产模型从 H100 迁到 B200 与 GB200(FP8 精度)。其内部基准中,Command A+ 与 Command A Vision 的每节点每秒 token 数提升 1.6–1.9 倍,Command A Translate 最多 2.6 倍,多数中长上下文负载的首 token 时间(TTFT)降低 30–50%。
在高并发对照点上,Blackwell 持续跑出 Hopper 约 1.7 倍以上的吞吐。白皮书配的图表显示,B200 相对 H100 的峰值吞吐增益最高一档正是 Command A Translate 的 2.65 倍。需要说明:该图用公开 GPU 价格结合实测吞吐做示意性测算,不代表 Cohere 的实际成本。
Perplexity 是纯 AI-native:平台跑 15 个模型(含 Nemotron 3 Ultra),每天处理 5000 多万次查询,P50 TTFT 从快速搜索的 2.4 秒到深度推理的约 13 秒。白皮书称,多节点 GB200 相对单节点 H200 的输出 token 成本改善约 2–4 倍,MoE 模型的 dispatch 延迟降低 46.5%(从 586.1 微秒降到 313.3 微秒)。联合创始人兼 CTO Denis Yarats 在文中说:「Every generation of NVIDIA hardware has bought us something specific. NVIDIA Hopper let us serve our model fleet. NVIDIA Blackwell, with the larger NVLink domain and MXFP8 on the Tensor Cores, lets us serve it across multiple nodes without paying for it in latency.」(每一代 NVIDIA 硬件都给了我们具体的东西:Hopper 让 Perplexity 能服务整个模型舰队;Blackwell 更大的 NVLink domain 和 Tensor Core 上的 MXFP8,让它能跨多节点服务而不在延迟上付代价。)「That's what makes the workloads we're moving into economically viable.」(这让我们正在迁移的工作负载在经济上可行。)
Canva 代表「现有产品增强」:白皮书称其拥有超过 2.65 亿月活用户,位列全球使用最广的三款 AI 应用之一。其 image-to-video 功能由 diffusion-transformer 视频模型驱动、跑在 B200 上,相比 H200 每 GPU-hour 视频生成量提升 70%。AI 研究主管 Stefano Corazza 表示,与 NVIDIA 合作让 Canva 在保持速度和质量的同时提高 AI 创作体验的效率:「That efficiency is key to making advanced creative tools accessible to more people.」(这种效率是把高级创作工具带给更多人的关键。)
案例讲完,白皮书回到工具:一张填空工作表,加一个「Get Connected with Sales」的联系销售表单。这份把 token 讲成新商品的指南,收尾处同时是 Blackwell 和 Vera Rubin 的获客入口。
参考链接
- NVIDIA 官方 X 主推文:
- 四步之一「Put the right tokens to work」:
- 四步之二「Forecast token demand」:
- 四步之三「Optimize token supply」:
- 四步之四「Maximize token monetization」:
- 「That's how compute becomes revenue」与指南链接:
- NVIDIA AI Tokenomics Guide 白皮书页面:
- NVIDIA 博客「Rethinking AI TCO」: