AREX Feed Article
Perplexity Search 首秀 80 分登顶,三档包揽 Search Index 前三
独立 AI 评测机构 Artificial Analysis 于 8 月 28 日 19:58 UTC 发布其 的最新结果:Perplexity Search 首次参评即登顶,三个上下文变体以 medium=80、high=79、low=77 包揽前三,把此前并列榜首的 Parallel (advanced) 与 Brave Search (LLM context)(均 75 分)挤到身后。榜单数据截至 8 月 27 日,覆盖 18 个 Search API 产品、8 家提供商。
给出的两个核心数字:领先优势集中在 BrowseComp 子项;模型推理成本为每任务 $0.028–$0.034,是目前已测提供商中最低。medium 与 high 变体的每任务总成本约 $0.091。截至 8 月 29 日上午,这条推文已累计约 28.6 万次浏览、350 余个赞。
三个上下文档位,一次包揽前三
Perplexity Search API 提供 low、medium、high 三档上下文设置,控制每条搜索结果携带多少提取出的网页内容。Artificial Analysis 将三档全部测了一遍:medium 得 80 分,high 79 分,low 77 分。
按子项拆分,medium 在 DeepSearchQA 的 F1 为 78、BrowseComp 准确率 87、AA-Omniscience 准确率 72;high 对应 81、86、71;low 对应 76、85、70。
领先优势集中在 BrowseComp。这个子项考的是需要多跳浏览才能找到的冷门事实,Perplexity 三档分别拿到 87、86、85,而并列第二的 Parallel (advanced) 和 Brave Search (LLM context) 都是 77,相差 10 分。
AA 在推文中写明,AA-Omniscience 与 DeepSearchQA 两项与领先提供商"得分相当"。
解释了档位之间的取舍:质量在 medium 与 high 之间趋平,但每任务的搜索次数随上下文增大而下降——low 平均 15.4 次、medium 12.5 次、high 11.4 次。
low 档因为要多搜 3 到 4 次、模型推理时间更长,每任务耗时反而最长(37.0 秒,对比 medium 28.6 秒、high 29.5 秒)。
同一模型、同一框架,只换搜索提供商
这套结果来自 Artificial Analysis 8 月 18 日上线的 :候选模型固定为 GPT-5.6 Luna(medium 推理),跑在开源的 Stirrup agent harness 里,模型只带 web_search 与 web_fetch 两个工具。
每任务最多 25 轮,每轮最多返回 10 条结果并过滤已知污染源。变量只有一个——web_search 背后接哪家搜索提供商。
总分是三个子基准的等权平均:DeepSearchQA 用 900 道需要多轮搜索的研究型题目,按 F1 评分;BrowseComp 取 200 道难题子集,要求精确答案;AA-Omniscience 是 600 道覆盖 6 个领域的私有事实题。
作为对照,同一模型不带任何搜索工具跑同样的任务,Index 只有 33,其中 BrowseComp 仅 17。按榜单 FAQ 的说法,Perplexity Search (medium) 把无搜索基线抬升了 47 分,是当前榜上测量到的最大提升幅度。
上线时榜单只有 7 家提供商、11 个结果,当时的榜首是 Parallel (advanced) 75 分与 Exa Search (auto) 74 分。这次 Perplexity 加入后,榜单扩展到 8 家提供商,三个档位同时占据前三。
载荷更小,推理账单也更低
成本是这份榜单第二个值得展开的发现。三个档位共用同一搜索定价:$5.00 每千次查询,上下文更丰富不额外收费。
但由于 Perplexity 返回的搜索结果整体更紧凑,模型每任务读入的 token 更少,模型推理成本降到 $0.028–$0.034,次低的提供商为 $0.036。
下图是榜单页的 Cost per Task 图表(每任务总成本,越低越好),Perplexity 三档与 Parallel、Brave 的对比在图中可见:
(图为 Artificial Analysis Search Index 的成本图, 转载了该图。)
把搜索账单和模型 token 加在一起:medium 与 high 每任务总成本约 $0.091,low 因搜索次数多约 $0.105;对比 Parallel (advanced) 约 $0.084、Brave Search (LLM context) 约 $0.13。
时延处于中游——最快的是 Parallel Search (fast) 的 19.2 秒,最慢的是 Firecrawl Search 的 62.9 秒。
结果越聚焦,模型读得越少,这正是这套基准想展示的机制。发布说明用 Parallel 自己的两个档位举例:advanced 档搜索成本略高于 basic 档($0.048 vs $0.045),但结果质量更高,模型每任务只读约 16.9 万 token 而非 33.9 万。
总成本因此从 $0.11 降到 $0.084。Perplexity 在这条路径上走得更远:得分最高的 medium 档模型成本为 $0.029,与最低的 low 档($0.028)几乎持平,最高的 high 档也只有 $0.034。
75 分并列次席:Parallel 与 Brave 的守榜位置
被挤到第二名的两家各有各的领先项。Parallel (advanced) 在 DeepSearchQA 上仍以 81 对 78 领先 Perplexity medium,吃亏在 BrowseComp(77 对 87);它的每任务总成本 $0.084,低于 Perplexity 的 $0.091。
Brave Search (LLM context) 每任务 24.1 秒,时延比 Perplexity 三档都快,但模型 token 成本高达 $67.57/千任务,把总成本推到 $0.13。
再往下,You.com Search (highlights) 与 Exa Search (auto) 同为 74 分,Firecrawl Search 与 Parallel 的 basic、fast 档同积 73 分,Exa 的 instant、fast 档为 68 分。
若只看搜索调用本身的账单,最便宜的是 Parallel Search (fast),每千任务仅 $8.41。Perplexity medium 的搜索成本为 $62.30/千任务,属于中等水平,它的总成本优势主要来自省下的模型 token。
当事方与社区的两种读法
Perplexity 官方账号在 8 月 29 日 00:12 UTC :medium 档比前任榜首高 5 分,"以约 $0.091 每任务的成本扩展了质量-成本帕累托前沿"。
CEO Aravind Srinivas 当晚 21:26 UTC 直接放话:""(无论竞争对手用多少算力,Perplexity 在任何算力水平上都是最好的搜索)。这条推文获得 270 余个赞、16.5 万次浏览。
技术社区的解读集中在"载荷效率"上。 认为,Perplexity 的领先不只是检索质量,"而是模型只需要多小的上下文就能抵达答案,这让搜索质量与推理成本越来越分不开"。
点出 medium 击败 high 的反常之处:提取的上下文更多反而让答案略差,"瓶颈从来不是检索广度,而是模型要读多少垃圾"(译自原话)。
也有质疑。 在评论区质问为何不加入 OpenAI、Anthropic 模型加搜索的对照基线,并称 Artificial Analysis 基本是在"用虚假数字给第三方站台"(shilling random 3rd parties on bogus numbers)。
AA 的榜单本身包含"同一模型不带搜索工具"的基线(Index 33),waki 追问的是另一类对照:闭源模型配上自家搜索的跑分。
自称医生兼投资人的 注意到另一个未解问题:8 月 18 日首测拿到 66 分的 Tavily Search (basic) 在 Perplexity 加入后从可见榜单上消失,"AA 是否反映了重建后的 /search?会不会有重跑或更强档位的提交"。
AA 在发布 Search Index 时承诺"会持续扩大覆盖"。上一次更新带进了 Perplexity 的三个档位,下一次更新会带来谁,就是这份榜单的悬念。