AREX Feed Article
vLLM 确认与 SemiAnalysis 的 AgentX 合作,深度解读博客即将发布
北京时间 9 月 4 日 04:14,开源 LLM(大语言模型)推理与服务化(serving)引擎 vLLM 的官方账号(@vllm_project)发推,向 SemiAnalysis(@SemiAnalysis_)团队点名致谢(shoutout),确认双方在 AgentX 基准上的合作,并预告 vLLM 的 AgentX 深度解读(deep dive)博客「即将发布」(coming soon)()。
vLLM 在推文里为这次表态给出理由:基准只有在衡量用户实际运行的负载时才有用,而 AgentX 衡量的正是真实的东西——多轮、长上下文的 agent(智能体)流量。vLLM 称自己是生产级 agentic(智能体式)工作负载的引擎,并称对规模化提供 token(词元)服务的团队而言,营收取决于对长多轮上下文的推理优化。
44 分钟前,SemiAnalysis 先点名了 vLLM 团队
被致谢的这条串推发布于北京时间 9 月 4 日 03:30,比 vLLM 的致谢早 44 分钟()。SemiAnalysis 开头一句就点名致谢「实现了近期 agentic 工作负载优化的 vLLM 团队」,随后用三条推文概括这批改动的效果:agent 每轮都会重读自己的全部历史,复用模型的缓存就能省掉这部分计算;过去把缓存存到 GPU 之外很浪费,每个 agent 各存一份,每轮还把全部内容重存一遍,现在改为「一个共享前缀只存一份,每轮只写新增的部分」()。另一项优化让跨机器拆分的 serving 能完整移交混合注意力(hybrid attention)模型的状态,解码(decode)半段「不会带着失忆开场」()。SemiAnalysis 给出的量化结果是:配合这些优化,vLLM 团队把 Kimi 推理的高并发吞吐在两周内提高了 6 倍以上()。串推最后点题:是新的 AgentX 基准帮助发现了「只会在多轮长上下文任务中浮出水面的问题」,并为优化提供了一个可以「攀爬」的真实基准,全文指向 8 月 24 日发布的 AgentX 文章()。
被点名的优化:命中率 95%,前缀只存一次
SemiAnalysis 的 InferenceX 网站用示意图逐项记录了这批以 AgentX 为参照目标的改动()。第一项是选择性保留(selective retention):混合注意力模型里,滑动窗口(sliding-window)层的缓存尾部过去会随窗口移动被全部释放,长会话留下的检查点全部丢失,任何位置都无法续算,整段前缀只能重算;改动(vLLM PR #43447)后只保留稀疏的检查点,14 路并发、上下文最长 100 万 token 时,前缀缓存命中率回到 95% 以上。
第二项是把键值缓存(KV cache)的 CPU 换出(offload)扩展到混合注意力模型。此前 offload 只适用于每 token 只有一种 KV 布局的模型,混合模型同时携带多组形状、生命周期各异的缓存,旧的连接器表达不了,而会话最长的模型恰恰最需要 offload。通用 SimpleCPU 连接器先在 ROCm 上启用,再扩展到 DeepSeek-V4 的混合注意力:前缀放不进 HBM(高带宽显存)时,与重算前缀相比,输出吞吐提高 81.7%,端到端平均延迟降低 46.6%。
第三项收窄了存储路径,对应串推第 2 条的说法:相同的传输还在「在途」时不再重复写入,共享同一前缀的并发会话只付一次钱;每次存储只覆盖新生成的 KV 区间,会话每轮只写增量、不重写整段历史;存储也不再依赖这些块是否仍在 HBM 中。
这批改动并非在任何基准上都可见。优化页举了一个反例:把全注意力(full-attention)投影切到调优过的 AITER GEMM(通用矩阵乘法)上,在低并发固定序列上拿到 2.3% 的增益,放回 agentic trace(真实会话回放)上却被缓存与调度的波动淹没。「测量形状」决定哪些优化能被看见。
AgentX 是什么:393 条真实会话与 300 万美元
SemiAnalysis 于 8 月 24 日发布 AgentX 1.0,自称「首个完全开源、100 万上下文的多轮 agentic 编程推理基准」,以 Apache 2.0 许可开源,配套文章题为《AgentX—InferenceXv3:CUDA 护城河在 agentic 推理中还守得住吗》()。此前的 InferenceX 横评场景是固定序列长度(如 8k 输入、1k 输出);AgentX 改为回放真实 agent 流量:语料来自 393 条 SemiAnalysis 内部、用户主动选择共享的 Claude Code 会话,中位每条请求输入 142,000 token、输出 444 token,44% 的会话带有子代理(subagent)()。原始提示与工具内容被替换成链式哈希与合成 token,再经 AIPerf 按原有时序填充、重建为会话 DAG(有向无环图)后回放。
SemiAnalysis 称,构建这套数据集花费超过 300 万美元,横评跑在 1,000 多块芯片、约 2 MW(兆瓦)持续运转的算力上,覆盖 GB300/GB200 NVL72、B300、MI355X 等 SKU(硬件型号)。它还称,上线头几个月最有价值的产出,是横跨 vLLM、SGLang、TensorRT-LLM、ATOM、AITER、Dynamo、LMCache、Mooncake 的一批上游优化 PR,这些引擎把 AgentX 当作优化的「北星」(north star)。
把多轮长上下文当作核心,SemiAnalysis 的解释是:agent 会话动辄几十上百轮,上下文随轮次快速累积;每一轮的输出会拼进下一轮的输入,前缀复用率极高,键值缓存能否跨节点、跨内存层级流转,直接决定成本。固定序列、单轮场景的性能,则主要反映芯片与 kernel(内核程序)的基线水平。
8 月 25 日,vLLM 就公布过一份 AgentX 成绩单
对 vLLM 来说,9 月 4 日的致谢不是第一次表态。8 月 25 日上午(北京时间 08:05),vLLM 账号发过长串推文祝贺 AgentX 1.0 发布,公布自家在 AgentX 上的结果:DeepSeek V4 Pro 每芯片每秒 130,093 token、MiniMax M3 77,079 token、Kimi K3 12,479 token,并称团队的专注点是把 vLLM 变成「agentic-first」的引擎()。那条推文末尾已经预告,一篇做完整技术拆解的深度解读博客会「本周稍后」发布。加上 9 月 4 日的再次预告,这篇博客已经被预告两次。
vLLM 把 AgentX 写进规划的时间更早:7 月 9 日开出的 Q3 2026 路线图(issue #48168)中,大规模 serving 小组的第一项任务,是让顶级模型的分离式部署(disaggregated serving)配合键值缓存换出与调优的预填充-解码(prefill-decode,PD)配方,在 AgentX 上达到 SOTA(state-of-the-art,当前最优)性能()。这项规划比 AgentX 1.0 的 8 月 24 日发布提前了约六周。
深度解读还没上线,AgentX 的数据仍在更新
截至 9 月 7 日检索,vllm.ai 的博客列表上还没有这篇深度解读,最新一篇仍是 9 月 1 日的 MiniMax H3 文章()。在博客落地前,AgentX 上的结果已经先更新了一轮:9 月 4 日下午(北京时间 13:23),SemiAnalysis 发推称,按每美元总拥有成本(TCO,total cost of ownership)产出的 token 总数计算,新的 AMD MI355X 提交在较低交互性区间击败 B300,并再次点名致谢 vLLM、AMD 与 LMCache 工程师()。
vLLM 的两次预告都没有给出发布日期。深度解读何时上线、会披露哪些 AgentX 数据,要等博客本身给出答案。
参考链接
- _