AREX Feed Article
MLCommons 发布 MLPerf Client v2.0:AI PC 基准新增生图与 Agentic AI 类别
旧金山,8 月 18 日——,这是该开放工程联盟面向 PC 本地 AI 性能的行业标准基准的最新版本。v2.0 首次加入 Image Generation 与 Agentic AI 两个类别:前者以 Flux 2 Klein 4B 作为实验性测试;后者通过 Software Engineering (SWE) Agent 与 Data Analyst Agent 两个场景,报告端到端性能,并拆分 LLM 推理与工具执行时间。LLM 推理测试同步更新,必需工作负载中的 Phi 3.5 mini 升级为 Phi 4 Mini Instruct,另新增实验性的 Qwen 3 8B。
MLPerf Client 衡量从笔记本、台式机到工作站等 PC 在本地运行 AI 工作负载的效果,此前覆盖摘要、内容生成、代码分析等真实任务的 LLM 基准,同时报告响应性与吞吐量两类指标。v2.0 已通过 GitHub releases 向 Windows、macOS、Linux 免费开放下载,。据新闻稿,该基准由 AMD、Intel、Microsoft、NVIDIA、Qualcomm Technologies, Inc. 与主要 PC OEM 协作开发。
生图测试怎么测:四个提示词、十六张图
给出了生图测试的具体规程:使用 Flux 2 Klein 4B 模型(experimental 组件),四个不同的提示词各生成四张图,共十六张,以模拟典型真实使用;所有生成图像统一为 1024×1024 分辨率,指标是每分钟生成图像数(images per minute)。不同平台可能使用不同的推理后端,工作组在开发阶段通过评估视觉质量来保证可比性。
这是 MLPerf Client 首次设立生图类别。此前版本的测试全部围绕 LLM 任务,新类别把评测范围从文本生成扩展到生成式视觉能力。
Agentic 场景把端到端耗时拆成 LLM 与工具两笔账
Agentic AI 类别包含 Software Engineering (SWE) Agent 与 Data Analyst Agent 两个场景,衡量 AI agent 在真实任务中的表现。与单轮问答不同,agent 任务是多步工作流,LLM 推理与工具调用交替进行,因此基准报告的是端到端耗时(End to End Duration,秒),并把 LLM 推理时间与工具执行时间分开统计,从而看出瓶颈在模型还是工具调用环节。
按基准文档,该类别目前使用 Llama 3.1 8B 与实验性的 Qwen 3 8B 两个模型,Data Analyst Agent 场景同样标记为 experimental。官方介绍称,这一测试为多步工作流中 AI agent 的表现提供了全面度量。
Phi 4 Mini Instruct 转正,4K 提示词进入基础项
列出了 LLM 测试的具体变化:Llama 3.1 8B 与 Phi 4 Mini Instruct 成为必测的基础模型,Phi 3.5 被移除;Qwen 3 8B 作为实验性测试加入;Phi 4 Reasoning 14B 移到 extended 类别;基础基准强制支持 4K token 提示词长度;部分摘要任务改为结构化 JSON 输出。新闻稿补充,基础任务中新增 Intermediate Summarization 摘要任务,输入提示词约 4K token。
LLM 任务覆盖创意写作、内容生成、结构化文本、代码分析与摘要,使用 OpenOrca、GovReport 与 MLPerf Client 源码等数据集,输出质量以 MMLU/IFEval 分数把关。性能指标沿用两项:TTFT 指首个 token 出现前的等待秒数,越低越好;tokens/s 指后续 token 的平均生成速率,越高越好。
工具层面,v2.0 继续优化 Windows、macOS、Linux 的跨平台硬件加速,CLI 新增 CSV 导出便于结果分析,GUI 改进了响应速度、稳定性与内存占用跟踪。
官方得分只认 base 组件,新类别暂不计分
MLPerf Client 把测试组件分为三档。base 是基准核心,也是唯一能计入官方“tested by MLCommons”得分的部分;extended 组件(如 8K 长提示词、Phi 4 Reasoning 14B)可能因内存或算力要求无法在部分 PC 上运行,但遵循与 base 相同的精度要求;experimental 组件是开发后期加入、支持有限的新内容,随基准发布供探索,工作组尚未决定是否纳入正式测试,其输出结果会明确标注。
按这个规则,v2.0 的两个新类别目前都进不了官方成绩单:生图测试的 Flux 2 Klein 4B 是 experimental,agentic 场景中的 Data Analyst Agent 与 Qwen 3 8B 也是 experimental。任何人都可以现在跑出生图与 agent 任务的分数,但这些分数不会被标记为官方成绩。
跑这套基准的硬件门槛不低。官方列出的最低配置包括 NVIDIA GeForce RTX 2000 系列或更新的 GPU(8GB 显存,扩展提示词需 16GB)、AMD Radeon RX 7000/9000 系列、Intel Arc B 系列(10GB 显存)、AMD Ryzen AI 9/300/400 处理器、Intel Core Ultra Series 2 或更新的 CPU、Qualcomm Snapdragon X Elite 与 X2 Elite(32GB 内存)以及 Apple M 系列(16GB 内存)。系统支持 Windows 11(x86-64 或 Arm)、macOS Tahoe 26、iPadOS 26 与 Ubuntu Linux 24.04,磁盘需要 200GB 可用空间,跑全部模型建议 400GB。
数据中心之外,agentic 度量开始下沉到 PC
MLPerf Client v2.0 的 agentic 类别并非孤例。7 月 8 日,,把多轮 agentic 轨迹纳入面向数据中心推理的 MLPerf Endpoints 框架,基准数据集中包含 113 条编程 agent 轨迹与 500 条工作流 agent 轨迹,用 Kimi K2.6 与 Qwen3.6-35B-A3B 两个模型评测。不到六周后,agentic 度量进入 PC 端基准。
MLPerf Client 的更新节奏也在加快:,v2.0 在四个多月后落地。工作组在基准页面上写明意图:这个基准要驱动创新、促进竞争(drive innovation and foster competition),确保 PC 能应对快速演进的 AI 环境。
生图与 agent 类别何时从 experimental 转正、计入官方得分,是这份基准留给下一轮版本的问题。