AREX Feed Article
OpenRouter 官宣基准浏览器可查图像模型:提示词可在 agent 或 Chatroom 里改
北京时间 9 月 1 日 23:43(UTC 15:43),OpenRouter 官方 X 账号以「Tip」贴士形式宣布:现在可在其基准浏览器(benchmark explorer)中浏览图像模型,并能在自己的 agent(智能体)或 Chatroom 里快速编辑提示词,配有一段演示视频。这是官方对产品功能的直接公告,推文本身未逐项列出模型或基准内容,细节都在链接页面上。
同线程里另一条推文给出「浏览图像基准」的直达链接(),指向 。页面官方题图以「Image benchmarks」为题,副题写着「对比各模型在精选提示词下的图像输出」;该页属于 OpenRouter 基准中心「Media(媒体)」分类,分类定位是「对比各媒体模型之间的生成质量」。
基准中心:6 项基准、2,458,445 次任务评估
发出这条公告的是 OpenRouter 官方账号(企业认证),简介自称「大语言模型(LLM)的统一接口」,提供 400 多个模型(含 50 多个免费)。自称提供「可独立复现的测量」,覆盖模型、供应商、搜索引擎与工具预算这些「在 OpenRouter 请求里真正能设置的旋钮」,并称「每个分数都链到其背后的配置、成本与遥测」。
截至核对时,中心共运行 6 项基准、2,458,445 次任务评估,最近一次运行就在 9 月 1 日。除图像所在的 Media 分类外,还有 Agents(τ²-Bench Airline)、Reasoning(GPQA Diamond)与 Search(BrowseComp、DeepSearchQA、HLE、WideSearch)等几组基准,另提供 Benchmarks API 供程序拉取结果与元数据。
同一提示词,39 个模型并排出图
图像基准页上展示的基准题是「Full Wine Glass」:提示词要求生成「一只装满白葡萄酒、液面与杯口齐平的酒杯,立在素木桌上,平视正面拍摄,画面中没有其他物体」。39 个图像模型在同一提示词下逐行列出,每行标出单张价格与生成耗时。
价格跨度从 $0.006(GPT-5.4 Image 2、GPT Image 2)到 $0.25(Recraft V4 Pro、Riverflow V2.5 Pro),生成耗时最短 2.7 秒(Nano Banana 2 Lite)、最长 208.2 秒(Riverflow V2 Pro)。结果可按成本或生成耗时排序,页面上还有「Select models to try in chat」(选择模型到聊天中试跑)的入口。
从浏览到试跑:提示词怎么带进对话
推文描述的路径分两步:先在基准浏览器里比较同一提示词下各模型的输出,再把改好的提示词带进自己的 agent 或 Chatroom 使用。这与 8 月 21 日的相衔接,说明结尾写道:在基准上比完模型后,「用你自己的提示词,通过图像生成 API 或 Chat 试试它们的表现」。
十一天前的铺垫:七类刁钻提示词
8 月 21 日,OpenRouter 在博客发布「Image Benchmarks: See the Capabilities of Every Model」(署名 Brian Thomas),正式上线视觉图像基准,覆盖当时全部 39 个图像模型。发布说明解释了为什么需要它:文本模型有海量基准可查,选图像模型却近乎靠感觉,「输出样张往往是精心挑选的展示图,LLM 裁判式评估还抓不住人眼一眼就能看出的细节」;竞技场分数衡量的是用户偏好,而非模型实际能做到什么。
提示词按七个家族设计:不可能场景(液面与杯口齐平的酒杯、合上的雨伞)、计数(三根手指、指定数量的牌和骰子)、文字(海报上一长串精确字符串、同框多种语言)、空间关系(遮挡与镜面倒影)、否定(没有条纹的斑马、没有广告的时代广场)、编辑(最小改动、移除物体或人物)、一致性(让产品或四个参照物在新场景中保持不变)。所有结果以网格展示,可按价格与生成耗时排序,与现在浏览器里的交互一致。
首批反应与接下来的模态扩展
公开回复中,自述为「AI Engineer | Working with Agents」的 Stats Wire 在中说:「@OpenRouter 这是个很方便拿来玩一玩的方式」。截至核对时,主推文获 34 个赞、11 次收藏。
发布说明预告,更多视觉评估与「更多模态」即将到来:工具会随新增图像模型持续更新,并计划扩展到视频与音频模型。手上有能难住下一轮模型的提示词,可以提交到 Discord 的 #feedback 频道。