AREX Feed Article
OpenRouter 开榜 Web Search Benchmarks:预算 1 轮加到 25 轮,BrowseComp 得分约翻倍
8 月 14 日,宣布推出 Web Search Benchmarks:一个挂在上的实时排行榜,把模型、搜索引擎与搜索预算的组合逐项打分,按质量、成本、速度三个维度排名,帮助开发者决定如何为自己的 agent 接入搜索(grounding)。
官方公布的最强发现是搜索预算。称,在所有测试过的因素里,加大搜索预算对结果的提升最大,预算从 1 轮加到 25 轮,BrowseComp 得分约翻倍。8 月 12 日发布的给出了具体数字:Claude Opus 5 搭配 Perplexity 跑 BrowseComp,1 轮 35.8%,5 轮 66.5%,25 轮 89.0%。
预算从 1 轮到 25 轮:得分翻倍,成本涨 2.5 到 7 倍
博客公布的 BrowseComp 首轮数据,跨三款模型一致呈现这条曲线:
| 模型 + Perplexity | 1 轮 | 5 轮 | 25 轮 |
|---|---|---|---|
| Claude Opus 5, high | 35.8%($0.14) | 66.5%($0.51) | 89.0%($0.99) |
| GPT-5.6 Sol, high | 46.3%($0.20) | 65.2%($0.29) | 82.4%($0.50) |
| GPT-5.6 Luna, extra-high | 33.7%($0.02) | 57.0%($0.04) | 74.0%($0.10) |
得分约翻倍,单题成本涨 2.5 到 7 倍。博客称,加大搜索深度是其找到的最便宜的提分方式。
预算加大不等于变慢。Luna 在 1 轮下每题耗时 140 秒,25 轮反而只要 111 秒;同时跑过 1 轮和 5 轮的 35 个配置里,超过三分之一是预算越少越慢,且全部是 OpenAI 系模型。博客的解释是这些模型靠额外推理来应对受限的搜索预算。
反过来,任务简单时深预算纯属烧钱。HLE 上,GPT-5.6 Sol 配 Perplexity 在 1 轮与 25 轮得分接近,成本却是三倍。
失败的搜索最贵:答对平均搜 10.3 次,答错搜 19.7 次
OpenRouter 统计了 25 轮预算下每题实际发起的搜索次数():
| 基准(25 轮预算) | 答对时平均搜索次数 | 答错时平均搜索次数 |
|---|---|---|
| BrowseComp | 10.3 | 19.7 |
| DeepSearchQA | 11.7 | 20.1 |
| HLE | 5.2 | 7.5 |
| WideSearch | 17.6 | 23.4 |
模型在注定答错的题目上会把预算耗尽。记录中最深的一次尝试搜了 81 次,是一道 WideSearch 表格题,评分仍判为错误。博客给出的处置办法很直接:如果预期失败率高,压缩搜索轮数就是降低成本的直接路径。
换模型约差 15 分,换引擎约差 10 分
定好预算后,下一个问题是先选模型还是先选引擎。博客公布的 BrowseComp 25 轮成绩():
| 模型 | Perplexity | Exa | Parallel |
|---|---|---|---|
| Claude Opus 5, high | 89.0%($0.99) | 82.2%($1.29) | 88.8%($2.42) |
| GPT-5.6 Sol, high | 82.4%($0.50) | 77.8%($0.54) | 76.6%($1.26) |
| DeepSeek V4 Flash, high | 77.0%($0.08) | 67.4%($0.12) | 64.6%($0.10) |
| GPT-5.6 Luna, extra-high | 74.0%($0.10) | 68.4%($0.14) | 58.0%($0.11) |
固定模型换引擎,分数平均波动约 10 分;前沿模型与高性价比模型之间的平均差距约 15 分。成本上,前沿模型对引擎最敏感:最贵引擎是最便宜的 2.5 倍,性价比模型只有 1.5 倍。
模型实验室的原生搜索也不是自动最优。举例:GPT-5.6 Sol 的原生搜索在跨基准对比中,与第三方引擎跑赢的场次五五开。博客补充,引擎之间的差距对某些模型很大、对另一些几乎可以忽略。
四个基准、四款模型、四档深度、四种引擎
评测设计写在里:选了四个基准,用四款模型在四种搜索深度下分别搭配 Exa、Parallel、Perplexity 与模型原生引擎,再把所有组合按质量、成本、速度排名。博客公布的 BrowseComp 表格里出现的四款模型是 Claude Opus 5、GPT-5.6 Sol、GPT-5.6 Luna 与 DeepSeek V4 Flash,搜索预算档位为 1、5、25 轮。
四个基准各有分工:BrowseComp 考难找的事实,DeepSearchQA 考多跳研究问题,WideSearch 考「填满整张表」的收集能力,HLE 把专家级考试题配上实时搜索。这些本就是 OpenRouter 的请求参数:engine 设 exa、parallel、perplexity 或 native,auto 先试原生、失败再回退第三方;web plugin 在模型动笔前搜一次,server tool 把搜索工具交给模型自己决定下一步;max_tool_calls 封顶搜索轮数。
由 Ayush Patel 署名的博客说明,所有运行都走公共 OpenRouter API 与生产端点,使用开源评测框架,统一每次返回 10 条结果、不抓取网页、不执行代码,答案对官方题解严格判对错,语义题用 LLM 裁判。
基准页目前收录 6 个基准、累计 2,464,345 次任务评测,最近一次运行在 8 月 14 日。截至 8 月 11 日那轮,搜索区质量榜首分别是:BrowseComp 89.0%(Perplexity + Claude Opus 5, high,单题 $0.99)、DeepSearchQA 76.5%(同配置)、HLE 77.4%(同配置)、WideSearch 84.0%(Perplexity + GPT-5.6 Sol, high)。OpenRouter 表示其他基准也都在该页提供,包括通过 API 访问。
榜单不是答案:先当短名单,再跑自己的题
开发者的反应落在「终于有了对照表」上。Edudojo.ai 独立创始人 Gargeya 在里说,web search 生态已经乱到难以判断哪种搜索工具适合哪种场景,「对任何在搭 grounded agent 的人来说都是有价值的资源」。YouDub/Claudex 开发者 Zhao Liu 则:搜索质量是模型、引擎、预算的三方权衡,「1 轮到 25 轮的跳跃提醒我们,agent 的成本控制应该写进基准,而不是脚注」。
OpenRouter 自己给的用法也更像参考系:挑与任务最接近的基准,取前几名里最便宜的配置,再拿自己的评测集对再往上的两到三档重跑对比。博客 FAQ 同时划了边界:这些分数不能直接和厂商的 agent 榜单比,后者包含整页抓取与代码工具,而这里的评测只隔离搜索环节。
榜单数据随新运行持续更新。官方在博客里写,今天的第一名不保证是明天的第一名,并在末尾请读者去 Discord 的 #feedback 频道提名下一批要测的引擎或模型。