AREX Feed Article
OpenRouter 升级 Ori Eval:评委同门即警告,对比提速 5 倍
8 月 12 日,OpenRouter 在 ,为其上周发布的模型评测工具 Ori Eval 上线五项改进:对比失败时写明原因并标注服务提供商、开跑前估算成本、评委与候选同门时警告换人、支持无头运行、并行对比快约 5 倍。
两项改动最抓眼:评委模型与候选模型同门时,Ori Eval 会警告并要求另选评委;模型对比改为并行执行后,普通对比快约 5 倍。OpenRouter 自称聚合 400+ 模型的统一 LLM 接口,Ori Eval 是它上周推出的评测 agent——扫描代码库、在候选模型上跑评测,再带着结论回来()。官方称发布后收到了社区的反馈、建议和 bug 报告:「great feedback, suggestions, bug reports, and more」,随后在本周上线了这五项改进。
失败原因写进报告,崩溃不再算「答错」
是:一次模型对比得分 0.82,而门槛是 0.75,报告现在会说明是什么导致它没达标。报告还标注为每个模型提供服务的 provider——官方截图里的表格有 model、score、via、result 四列,gemini-3-flash 得 0.82 被标 reject,via 一栏写着 Google,底部另有提示「judge rejected gemini-3-flash at 0.82」。
:崩溃的运行此前被当作「wrong answer」计入成绩,现在一律记为 failures,不再和答错混在一起。
开发者 AivoraLabs(@ai_vora_labs),标注 provider 是这项改动被低估的另一半:「Same model id can score differently depending on who served it」(同一个模型 ID 由谁服务,得分可能不同),一条路由上通过的 eval,可能在另一条路由上悄悄失败。
跑之前先报价:--pilot 误差压在 5% 内
ori eval --pilot 先把每个用例跑一遍,再给出完整运行的成本估算,官方称误差在 5% 以内。要对比一组模型,开发者可以先算账再付钱。
成本值得预告,是因为 eval 真的在调用付费模型。OpenRouter 在产品页 FAQ 里提醒,CI 里的 eval 任务应当设成单独的可选 job:「evals call real models and cost money」(eval 调用真实模型,是要花钱的)。
评委和候选同门,先警告、再换人
Ori Eval 用 LLM-as-a-judge 给开放式答案打分。是:评委模型如果和被评模型来自同一家族,分数就不再公平;Ori Eval 现在会警告「评委和候选有关联」,并要求另选一位评委。官方截图里,把评委选为 gpt-5.6-terra 时,界面底部弹出琥珀色警告「warn: same family as gpt-5.6-sol」。
这条规则在 thread 里引来的回复最多。AI 应用 Raven(@heyraven_io):「No judge grading its own family. Glad someone is finally tackling AI nepotism」(评委不给自己的家族打分,终于有人管 AI 裙带关系了)。开发者 Nick Prince(@Nickprince)把它接到「中立路由」论点上:「」(经纪商要与交易所分开,是同一个道理:中立赢得信任)。
登录不再需要浏览器,CI 里也能直接跑
,ori login 不再需要浏览器,也可以直接传入 API key;无头运行时,Ori Eval 把问题回传给启动它的程序,而不是自己作答。
CI 的配套细节写在 FAQ 里:用仓库 secret 设置 OPENROUTER_API_KEY,设好之后 ori eval 不再需要 ori login;把 ori eval 加进 GitHub Actions workflow,它像 bun test 一样退出,eval 失败即 build 失败。
对比从排队改并行,普通对比快 5 倍
从逐个排队改为并行执行,官方称普通对比快约 5 倍。同一轮 run 还能比较 reasoning effort,而不只是比较模型;失败的 check 也会打印确切的失败原因。
回复的焦点:最低成本,和一个没答的复现问题
建筑师 R. Spencer Steenblik(@steenblikrs):「This is a game changer helping me to get the best cost per task.. I might even cancel my @AnthropicAI subscription」(这改变游戏规则,帮我拿到每项任务的最低成本,我甚至可能取消我的 Anthropic 订阅)。BeeReach 创始人 Mykhailo Sorochuk(@sir4K_zen)看重成本预告:「」(成本预告能减少被浪费的 token)。
OpenRouter 在 把反馈通道指向 @jjacky,并附上产品页 openrouter.ai/ori/eval。
金融内容工作室 Fiducial.ai(@Fiducial_AI):CI 报告会不会保留 eval 文件、provider ID 和 run config——「that's the part needed to reproduce a pass later」(那是日后复现一次通过所必需的部分)。这条追问在 thread 里没有收到回应。