AREX Feed Article
Artificial Analysis 上线 Optima:用自有数据自建基准,质量、成本、耗时一起比
8 月 13 日,独立评测机构 Artificial Analysis 在官网:任何人可以围绕自己的用例创建自定义基准,用自有文件、AI 智能体轨迹或编程环境生成测试,一键跑在主流模型上,同时比较质量、每任务成本与每任务耗时。同日发布的写道,平台的目标是帮用户「找到最适合任务的那个模型,或者找到性能相当、但成本或每任务耗时低 10 倍的替代方案」,截至 8 月 16 日已获得 869 次点赞。
8 月 16 日,披露了收费结构:rubric 评分每个标准每模型 0.125 美元,pairwise 对比每次 0.375 美元,底层模型 token 成本按实际用量计费、不加价。平台现已。
三种建法:数据集、agent 轨迹,或一段描述
Optima 接受三类输入。用户可以直接上传自己的评测数据集或 Hugging Face 上的数据,也可以从 Arize、Braintrust、Langfuse 等平台导入 AI 智能体的运行轨迹;开发者还能安装一个 Optima skill,让平台从编码环境和过往会话中收集上下文。没有现成数据的用户只需描述用例并提供示例输入输出,Optima 会生成建议的测试输入、评测标准和示例任务,用户通过反馈逐轮修改后再正式跑基准。任务类型包括问答、文档输入和 agent 式任务,用户也可以把自己部署的 agent 通过 HTTP 接口放进同一轮评测,与其他模型同题同判。
评分方式有两种。rubric 按客观标准逐项打分;pairwise 是 Artificial Analysis 在 GDPval-AA、AA-Briefcase 等自有基准中使用的同一套方法:用户先对一批回答对标注偏好,Optima 再据此推导出整个测试集上的完整排名。
评分怎么收费:一个标准 0.125 美元,token 不加价
Optima 的收费分三块:模型调用产生的 token 成本按实际用量结算、不加价;rubric 评测每个标准每模型收 0.125 美元;pairwise 评测每次对比收 0.375 美元。在创建基准、每次运行和每轮评测开始时,平台会按成本估算预扣一笔余额,最终按实际用量和评测费用结算。
每任务成本与耗时,被摆到与质量并列的位置
质量之外,Optima 把每任务成本与每任务耗时作为独立比较维度,并提供分类别结果和自定义指标。the-decoder 指出,在 agent 应用里 token 单价说明不了多少问题:一个更便宜的模型可能因为重试次数多、失败率高、需要额外清理工作,最终总成本反而更高,每完成一个任务的成本才是有意义的数字。
Artificial Analysis 在官宣中列了三个提前测试者构建的基准:哪款模型能让金融与会计 agent 在质量不大幅下降的前提下把成本降低 10 倍;哪个模型最贴近律师的写作风格;哪个模型在自有的图像数据集上识别元素最准。
公共基准的两处硬伤:15 个百分点与 445 篇论文
Optima 针对的是公共基准的通用性缺陷。the-decoder 引述 Epoch AI 的分析称,基准结果依赖很少被披露的实现细节,提示词措辞和 temperature 设置不同,同一个模型得分就会明显变化;在 SWE-bench 这类 agent 基准里,仅更换 scaffold(智能体的控制软件与工具环境)就能造成最多 15 个百分点的分差。
the-decoder 还引述了一项覆盖 445 篇顶会基准论文的研究:几乎所有论文都至少在一个方面存在方法缺陷,包括定义不清、样本不具代表性、缺少统计验证;只有约 10% 的基准使用了反映真实应用场景的完整任务,「推理」「对齐」等核心概念常被模糊定义,削弱了结论的可靠性。
换了自己的数据,评测的深层问题不会自动消失
Optima 能解决通用基准套不住具体用例的问题,但基准设计本身的门槛还在。the-decoder 提醒,即使测试完全围绕自己的任务,结果是否有用仍取决于目标能力定义得多精确、测试用例多有代表性、评测如何实现和记录。
另一个边界是价值问题。每任务成本与耗时再低,也测不出输出对业务到底值多少钱:一个又快又便宜的工作流,如果结果需要大量返工、对所处流程贡献有限,依然谈不上高效。Optima 把「建一个与业务相关的基准」从研究项目变成了按次计费的服务,但基准能否测出真正的业务价值,仍取决于出题的人。