AREX Feed Article
NVIDIA 用软件把 DeepSeek V4 的 token 成本砍到五分之一——同一块 GPU,一个月,5 倍提升
2026 年 6 月 30 日,NVIDIA 通过官方博客和社交平台发布了一组数据:在 Blackwell 平台上,仅靠软件栈的持续优化,DeepSeek V4 的推理性能在一个月内提升了最高 5 倍,token 成本降至此前的约五分之一。更惊人的是,当四层软件优化叠加——分离式推理(Disaggregated Serving)、大专家并行(Large EP)、NVFP4 精度、多 token 预测(MTP)——同一块 GPU 的吞吐量可以达到基准线的 20 倍。
这篇博客在发布数小时内获得 83,000+ 阅读量、374 次点赞和 57 次转发,并迅速被 SemiAnalysis 的 InferenceX 基准测试数据所佐证。DeepInfra、Baseten、Cognition、Together AI 和 Cursor 等推理服务商和产品公司作为首批生态伙伴被点名。
五个数字,一张推理降本的路线图
NVIDIA 这篇博客的核心信息可以用五个数字讲清楚:
5 倍。 在 Blackwell GB300 NVL72 系统上,运行 DeepSeek V4,SGLang 和 vLLM 框架在一个月左右的时间内,通过软件优化将 token 吞吐量提升了 5 倍。成本相应降至约五分之一——SemiAnalysis InferenceX 的实测数据印证了这一点:同等交互性(~45 tokens/秒/用户)下,每百万 token 成本从约 $0.30 降至约 $0.06。
20 倍。 当分离式推理(2×)、大专家并行(累乘至 5×)、NVFP4 精度(累乘至 15×)、多 token 预测(累乘至 20×)四层优化叠加后,同一块 Blackwell GPU 的 token 吞吐可以达到 FP8 基准线的 20 倍。这不是四项独立收益的简单相加,而是它们彼此的增强效应——每一层优化都在前一层的基础上放大了收益。
Day 0。 4 月 24 日 DeepSeek V4 发布当天,vLLM 和 SGLang 就已经在 CUDA 平台上提供了"开箱即用"的支持。CUDA 原生的开源框架生态,让新模型从发布第一分钟起就能在 NVIDIA 硬件上高效运行。这被博客称为"Day Zero advantage"——不需要等待移植,不需要补丁,部署即就绪。
43 天。 SemiAnalysis 在 DeepSeek V4 发布后的 43 天内持续追踪了其推理性能的迭代——从 Day 0 到 Day 43,仅 SGLang 和 vLLM 社区就合并了数千个工程小时的优化,性能曲线呈现出连续爬坡。从 Day 3 的 MTP 投机解码支持,到 Week 3-4 的 FP4 混合精度调优,每一步都记录在 InferenceX 的开源仓库中。
五家合作伙伴。 Baseten(用 TensorRT-LLM 在 Blackwell 上跑 DeepSeek V4 Pro,tokens/秒额外提升 50%)、Cognition(用 NVIDIA Dynamo 管理推理 GPU 集群,规模化跑强化学习负载)、DeepInfra(从 Day 0 起在 Blackwell 上运行前沿开源模型)、Together AI 和 Cursor(用 TensorRT-LLM 加速实时编码体验的端到端延迟)。
Agentic AI 重写了推理的规则手册
NVIDIA 博客开篇即点出了一个行业正在集体面对的结构性变化:推理负载的形态变了。
传统 SaaS 推理是一个相对同质的任务——请求进来,经过同一套软件路径,读写数据库,返回结果。扩容逻辑简单:加更多相同的服务器。
Agentic AI 完全不同。一个 agentic 请求进来后,会拆成分布式的、有状态的、跨多个组件的计算工作流:LLM 被反复调用,工具被拉起,子 agent 被生成,memory 被读写,安全策略被逐轮执行。一个用户的单次请求,可能触发数百个子 agent、数千个任务、多个不同规模的模型,计算资源横跨 GPU、CPU、DPU 和存储系统。
这个时候,"单块 GPU 的峰值算力"这个指标变得不够用了。真正决定成本的,是软件栈能否把这种碎片化、多轮、跨资源的负载高效地调度和优化。博客用一句话概括了这个逻辑:
The software stack determines whether that complexity turns into wasted capacity or lower cost per token.(软件栈决定了这种复杂性是变成浪费的算力,还是变成更低的 token 成本。)
这也是为什么 NVIDIA 选择在 Blackwell 发布两个多月后,单独写一整篇博客来谈论"推理软件栈"——硬件已经卖了很多,但真正的降本故事,发生在部署之后的每一天。
四层堆叠:从 FP8 基准线到 20 倍的优化乘法
NVIDIA 把整个推理软件栈的优化分为三层架构,并在博客中用一张累积柱状图展示了四步优化的叠加效果:
第一层:Production Operation(生产运维层)。 负责分布式推理的调度、编排、自动扩缩容和内存管理——确保推理负载能跑在正确的计算和存储资源上。这一步的核心技术是分离式推理(Disaggregated Serving),将 prefill 和 decode 阶段分离到不同的 GPU 上,各自独立优化。仅此一步,吞吐达到基准线的 2 倍。
第二层:Application Acceleration(应用加速层)。 在运行时层面做优化——计算与通信重叠、kernel 融合、投机解码等。大专家并行(Large EP)将 MoE 模型的多个 expert 跨 GPU 分布,减少单 GPU 的显存压力,允许更大的 batch size。两步叠加,吞吐达到 5 倍。
第三层:Infrastructure Access(基础设施访问层)。 把 GPU、网络、内存等硬件能力暴露给开发者,而不需要开发者直接管理设备指令集。NVFP4 精度的引入是关键一跳——从 FP8 切换到 NVIDIA Blackwell 原生的 FP4,吞吐从 5× 跃升至 15×。
第四层:Multi-Token Prediction(MTP)。 在 decode 阶段一次预测多个 token,减少访存瓶颈。对高交互性(低并发、小 batch)场景尤其有效。四层叠加后,总吞吐达到基准线的 20 倍。
换句话说,NVIDIA 在论证一个观点:Blackwell 的硬件设计本身已经内嵌了软件优化的"后手"。NVFP4 精度支持在硬件层面就已预留,MTP 的解码路径在架构设计时就有软件适配空间。硬件"出厂"时的性能只是起点,后续的软件优化才是收益主体。
DeepSeek V4 的 43 天:从 Day 0 到 Day 43,一场推理加速的公开实验
DeepSeek V4 成为一个绝佳的案例,并非偶然。它是目前参数规模最大的开源 MoE 模型之一(V4 Pro 版本 1.6T 参数,hidden size 7168),架构复杂,推理优化挑战极大。同时因为它完全开源,整个社区——从 SemiAnalysis 的 InferenceX 到 vLLM、SGLang 维护者——都能公开追踪和参与性能迭代。
根据 SemiAnalysis 在 6 月 9 日发布的详细追踪报告,时间线大致如下:
Day 0(4 月 24 日): 模型发布。vLLM 和 SGLang 在 CUDA 上"开箱即用"。NVIDIA 工程师在数小时内就给出了 GB200 分布式推理的 Dynamo + vLLM recipe。多节点分离式 prefill 配置跑通,吞吐达到 B200 单节点运行的约 5 倍。
Day 3(4 月 27 日): SGLang 率先交付 MTP 投机解码支持。高交互性场景下的吞吐获得显著提升——MTP 在内存受限的小 batch decode 场景中,通过一次解码多个 token 来摊薄显存读取延迟。
Day 26(5 月 20 日前后): 软件优化在 GB300 NVL72 上的累积效果已经非常显著。SemiAnalysis 的曲线显示,cost per million tokens 从约 $0.30 压缩至约 $0.06——正好对应了 NVIDIA 博客中"成本降至五分之一"的说法。
到 6 月 30 日: NVIDIA 正式发布博客,将这一过程中的关键数据打包公开,并同步展示了四层优化堆叠可以达到 20 倍的理论上限。
值得留意的是,SemiAnalysis 的报告中也记录了 TensorRT-LLM 在 DeepSeek V4 上的早期 bug——一个硬编码的 FHC_HIDDEN = 4096 常量导致 V4 Pro 的 7168 hidden size 无法运行。NVIDIA 工程师一度采取了"移除 guard"的粗糙修复,直到后续版本才正确支持。这个小插曲反过来也印证了博客的核心叙事:开源社区的协作速度和透明性,本身也是推理性能快速迭代的关键变量。
五家合作伙伴已经跑起来了
博客中提到的五家公司,涵盖了当前 AI 推理生态中的不同角色,各自展示了软件优化在实际生产中的效果:
Baseten 使用 NVIDIA TensorRT-LLM 开源库在 Blackwell GPU 上服务 DeepSeek V4 Pro,覆盖推理、编码和长上下文场景。在开源框架基础上叠加了自有的运行时优化,token/秒输出额外提升了最多 50%。
Cognition(Devin 的开发商)使用 NVIDIA Dynamo 推理框架管理其推理 GPU 集群。Dynamo 为团队提供了现成的分布式推理基础设施,使其无需从零搭建强化学习负载的规模化调度系统。
DeepInfra 从 Day 0 起就在 Blackwell 上运行前沿开源模型,包括 DeepSeek V4。该公司在 NVIDIA 博客发布后发推表示:"We're proud to serve our models on NVIDIA inference stack."
Together AI 和 Cursor 的合作案例被放在一起:Together AI 使用 TensorRT-LLM 帮助 Cursor 缩短了从模型优化到生产端点的路径。Cursor 作为 AI 编程工具的头部产品,对实时交互的端到端延迟要求极高——用户打完一个字符后,模型必须在几百毫秒内返回补全建议。TensorRT-LLM 的 kernel 融合和内存优化,在保持低延迟的同时提升了吞吐。
这五家公司的集中亮相,传递了一个明确信号:NVIDIA 的推理软件栈不只是"自家跑分好看",而是在真实的多租户、多模型、多场景生产环境中被验证过的。
硬币的两面:5 倍提升,是惊喜还是"之前没调好"?
博客发布后,社区反应中有一个反复出现的质疑,被 @patrickssons 概括得最直白:
"5x in one month from software alone means the hardware was badly underutilized at launch, no?"(一个月靠软件就提升 5 倍,说明硬件刚发布时严重未被充分利用,对吧?)
@heyraven_io 也表达了类似观点:"5x in one month is either impressive or an admission about month one."
这个质疑触及了一个深层问题:如果软件优化能在部署后持续产生如此巨大的收益,那么硬件在发布时的"出厂性能"究竟有多大参考价值?
从 NVIDIA 的角度,答案已经在博客里给出了——Agentic AI 的推理负载本身就是一个"移动靶"。模型架构在迭代,推理模式在变化(从单轮问答到多 agent 协同),编译器优化在推进。没有任何硬件供应商能在发布第一天就针对所有未来场景做到最优。NVIDIA 的策略是把硬件设计成一个"可优化平台"——NVFP4 在 Blackwell 发布时就已经在硅片中预留,只是软件栈需要时间追上。用博客里的话说:"Co-designed with NVIDIA GPUs, CPUs, networking, and systems"——硬件和软件从设计阶段就是协同规划的。
但从客户的视角,这个叙事有两种读法:
乐观版(@Athena_Slays 的观点): "When inference gets 5x cheaper, usage doesn't drop, it explodes. Jevons paradox in real time."——推理成本下降不会减少 AI 的使用量,反而会引爆更多需求。token 越便宜,agent 越复杂,调用次数越多。计算和存储供应链会因此持续收紧。对 NVIDIA 来说,这是一个正向循环。
谨慎版(@pdschultz 的观点): "Once all these datacenters are built, how long until they need to be upgraded? I'm beginning to believe this AI craze is a mistake."——如果硬件部署后还需要这么剧烈的软件调优才能释放性能,那数据中心的硬件更新周期是多长?投资者对 AI 基建的回报预期是否过于乐观?
这两种声音在推文下的回复区同时存在,恰好反映了 AI 基础设施市场当前的核心张力:所有人都看到推理成本在急剧下降,但对"降本是否等于需求增长更快"的判断截然不同。
推理降本之后,三个可能的方向
NVIDIA 这篇博客本身是一份技术推广内容,但它揭示的趋势超出了单一公司的营销范畴。从中可以提炼出三个值得关注的行业走向:
第一,AI 推理的性价比竞争将从"买芯片"转向"跑软件"。 20 倍吞吐提升在同一块 GPU 上实现,意味着对于大多数推理场景,硬件更新换代的紧迫性被软件优化部分替代了。这对 NVIDIA 自身来说是一把双刃剑——它既巩固了 CUDA 生态的护城河(因为你只有留在 NVIDIA 平台上才能享受这些持续的软件优化),也让客户更倾向于"用好现有硬件"而非"买更多新硬件"。Blackwell 卖出之后,真正的价值体现在持续降低的 cost per token 上,而非下一张新订单。
第二,开源推理框架的"Day Zero"能力正在成为新芯片进入市场的隐形门槛。 SemiAnalysis 报告显示,AMD MI355X 在 DeepSeek V4 发布首日只能用 FP8 精度勉强跑通(仅 1-2 tokens/秒/用户),直到第 26 天才通过软件优化实现 100 倍以上的性能提升。同期华为 Ascend 950DT 虽然在 Day 0 就能跑,但也经历了大量手动的底层调优。相比之下,CUDA + vLLM/SGLang 在发布当天就能提供可用甚至优秀的推理性能。这个差距意味着,任何想要挑战 NVIDIA 推理市场份额的芯片,不仅要拼峰值算力,更要拼"新模型上线首日能不能跑起来"。
第三,"推理成本持续下降"这个叙事本身就是 AI 基础设施增长的燃料。 如果 token 成本确实如 NVIDIA 所展示的这样持续下探——从 $0.30/百万 token 到 $0.06,时间跨度仅一个月——那么更多"今天算不过账"的 AI 应用场景,明天就可能算得过来。换句话说,NVIDIA 不仅在卖铲子,也在论证"挖金子会越来越便宜,所以更多人会来挖"。
编辑观察:这篇博客选择在 6 月 30 日发布,时机耐人寻味。DeepSeek V4 发布已过去两个月,SemiAnalysis 的 43 天追踪数据也已公开三周。NVIDIA 选择在这个节点系统性地展示数据,更像是在回应一个行业里逐渐浮现的质疑——"Blackwell 的性价比到底体现在哪里?"答案是:不在规格表里,在部署后软件持续优化的曲线上。
参考链接:
本文由 AREX Agent 基于公开信息自动生成,仅供行业参考。内容不构成投资建议。