AREX Feed Article
Perplexity 发布 Q2D-Web 检索基准与公开排行榜:1.9 亿网页文档,pplx-embed-v1-4b 两项居首
9 月 9 日,Perplexity 在 中宣布推出 Q2D-Web(Query2Doc-Web):一套面向 agentic RAG(由 AI 智能体驱动的检索增强生成)的检索评测基准,以及一个。按其的口径,这套基准由约 1.9 亿份网页文档、69,721 条由 agent 改写的搜索查询组成,组合判定集中平均每条查询有 99.6 条正向相关性判定。
博文公布的结果覆盖 13 个检索模型,主指标为 Recall@1000;其中 Perplexity 的 pplx-embed-v1-4b 在 Web Ranking(65.73)与 Combined(69.11)上得分最高,Nemotron-3-Embed-8B 在 Citation(61.68)上居首。所有成绩都由 Perplexity 用同一套流水线测出,基准数据不对外公开;配套技术报告已于 9 月 8 日提交至 ,作者均标注为 Perplexity AI。
agent 改写查询与语料里的困难干扰项
Q2D-Web 的查询全部由 agent 生成。按博文与论文的定义,一次「搜索」是 agent 为回应用户一条消息所做的一整套网页搜索调用;agent 结合用户请求、对话上下文和同一轮已检索到的文档,自行把请求改写成查询。这些查询来自 Perplexity 生产系统在 9 个月内积累的 23,000 条不含 PII(个人身份信息)的真实搜索,覆盖 10 种语言、数十个领域。
查询分两类:primary(主查询)重述用户的信息需求;support(支持查询)探索替代措辞、背景信息或相邻实体。两类查询可能指向不同文档,Q2D-Web 因此对每条查询独立评测、各自维护判定。69,721 条查询中,12,365 条是 primary(17.7%),57,356 条是 support(82.3%)。
语言上,英语占 65.8%,其后是西班牙语、俄语、德语、法语、葡萄牙语、意大利语、韩语、日语和中文。领域横跨编程、法律、健康、科学与金融,也包括消费品、旅行、娱乐和本地信息。只有来自允许其数据被使用的用户的查询才会入选,再经 PII 检测剔除含个人信息的条目;完全重复、过短以及带 site: 等搜索操作符的查询也会被删去。
语料同样不是随机抽取的网页样本:对每条查询取生产检索系统的前 5,000 条结果并求并集,再用 MinHash-LSH 去重(token 5-gram 集合的 Jaccard 相似度不低于 0.975),最终得到约 1.9 亿份文档,平均每份约 13,169 个字符。每份文档都至少曾是对某个查询而言「看似合理」的结果,其中包含大量困难干扰项:主题对得上,但缺少某个必需的日期、实体、版本、数量或方面。
三个维度:语料、查询数量、判定深度
在 agentic RAG 的流水线里,检索是第一级,它扫描整个索引、返回一批候选文档,后面的环节再对这些候选重排。第一级检索决定了 agent 最终能读到、并可能引用哪些证据;它接到的查询又是机器改写的版本,措辞、结构和具体程度都可能与人类搜索不同。
博文提出的评测框架要同时沿三个维度扩展:语料够大,能带来更多语义相近却并不相关的干扰项,评测更有区分度;被判定的查询够多,结论才不容易被采样偏差左右;每条查询的正向判定够深,才能压低压假阴性,因为未判定的文档按惯例会被当作不相关。博文援引 MS MARCO 上的历史数据佐证:人工检查过的高排名未标注段落里,70% 实际相关。
博文称,已有基准大多只能扩展其中一到两个维度:大型网页集合往往只有很少的判定查询,查询数量多的基准又普遍语料小、标注稀疏。它给出的直接对照是 MS MARCO Web Search:1.009 亿份文档、9,374 条测试查询,每条查询只有 1 条由点击导出的正样本。Q2D-Web 的判定查询规模是它的七倍以上,每条查询平均 99.6 条正向判定。论文还称,据其所知,还没有公开基准同时提供大规模语料、大规模生产采样的 agent 改写查询,以及可复用的深度判定。
三套并行判定:Citation、Web Ranking 与 Combined
在这样的规模下,给所有「查询-文档」对打标是不可能的,而每一种标注来源都带着自己的偏差。Q2D-Web 的做法是在同一批查询和同一份语料上并行维护三套相关性判定:
- Citation(引用):agent 在回答里引用了某份文档,它就标为相关。这是最接近下游实际用途的信号:文档被 agent 选作某条主张的证据;但它天然高精确、低召回,agent 拿到足够证据后,就没有理由再引用其他相关网页。
- Web Ranking(网页排名):Perplexity 内部检索栈给出的每条查询最多 50 份文档,平均 43.1 份。该栈在第一阶段用 BM25 与稠密检索,随后由 cross-encoder(交叉编码器)重排;它用来补上「有用但没被引用」的相关文档。
- Combined(组合):把 Citation 与 Web Ranking 取并集,再对从未被任何一方判定过的候选补做 LLM 判定。具体做法是把 BM25、ColBERTv2 与 7 个 2025 年 1 月 1 日前发布的稠密检索模型的结果用 RRF(reciprocal rank fusion,倒数排名融合)合并,取每条查询的前 500 份未判定文档,交给 DeepSeek-V4-Flash 做严格的二值判定。
并行维护三套判定的意义在于:不把任何单一来源当成标准答案,避免单一标注流水线的系统性偏向(比如偏向与之相似的检索器),同时依靠更深的标注压低假阴性。评测时每个模型在三套判定上分别计分,「相关性怎么定义」本身也成了被检验的变量。
用 31.7% 的语料保住全语料的模型排序
全语料评测很贵。博文给出的数字是:用 pplx-embed-v1-4b 跑一遍 Q2D-Web 需要 4,608 个 H200 GPU 小时;即便最小的 EmbeddingGemma-300M(3 亿参数)也要接近 200 个。
为让评测可行,Perplexity 构建了采样子语料:保留全部正向文档,只削减未判定文档。论文比较了三种采样策略:均匀随机采样、depth-k pooling(汇集各检索器前 k 条结果的池化策略)和按查询做 RRF 采样。在保留 31.7% 文档的规模下,RRF 子采样能保住全语料的模型排序(Kendall's τb 为 1.00,即排序与全语料完全一致),绝对分数也与全语料最接近;作为对照,同等规模的随机采样会把平均 Recall@1000 抬高 11.1 个百分点。
成本随之下降:pplx-embed-v1-4b 的评测从 4,608 降到约 1,500 个 H200 GPU 小时,EmbeddingGemma-300M 降到 70 个以下;论文称这类网页级评测由此能在单台 8 卡 H200 节点上约 8 小时内跑完。
榜首归属取决于判定集与截断深度
受测的 13 个检索模型分属三种架构:词法基线 BM25-tantivy;10 个稠密模型,参数从 3 亿到 80 亿,涵盖 EmbeddingGemma-300M、mDenseOn、Nemotron-3-Embed-1B/8B、pplx-embed-v1-0.6b/4b、Qwen3-Embedding-0.6B/4B/8B 和 voyage-4-nano;以及 2 个 late-interaction(后期交互)模型 mLateOn 与 pplx-embed-v1-late-0.6B。所有神经模型都是 2025 年 1 月 1 日及以后发布的开放权重模型,与参与基准构建的模型不重叠。
主指标 Recall@1000 衡量的是前 1,000 条结果对相关文档的覆盖。论文的解释是,Q2D-Web 评测的是多级排序流水线的第一级,它的职责是尽可能把相关文档召回进候选池,最终顺序交给后面的重排器决定。
按全语料的 Recall@1000 成绩:pplx-embed-v1-4b 三项分别为 Citation 61.22、Web Ranking 65.73、Combined 69.11;Nemotron-3-Embed-8B 为 Citation 61.68、Web Ranking 61.73、Combined 68.58。没有模型在三套判定上同时第一。口径一换,排序也会变:在 Combined 更浅的截断上,Nemotron-3-Embed-8B 的 Recall@100 与 nDCG@10 分别为 30.03 和 47.44,高于 pplx-embed-v1-4b 的 29.82 和 45.84,即前 100 条里命中更多、整体召回更少。
规模效应在家族内部成立:Qwen3-Embedding 从 0.6B 到 4B 再到 8B,Combined Recall@1000 依次为 57.89、62.01、64.53;pplx-embed-v1 从 0.6B 到 4B 是 67.02 到 69.11。1B 以下的稠密模型里,pplx-embed-v1-0.6b 在三套判定上的 Recall@1000 都最强,其后是 EmbeddingGemma-300M。
论文还报告了聚合分数之外的分化:模型的相对排序基本不受判定集选择影响,但跨领域、跨语言、跨查询类型的分化明显。所有神经检索模型在 support 查询上的召回都低于 primary 查询,BM25 则在 support 查询上略高;BM25 总分垫底(Combined 44.77),却贡献了最大一批「只有它能召回」的相关文档,14,621 条,接近贡献第二多的 EmbeddingGemma-300M(2,451 条)的六倍。
博文在结果之后附了一条自我限定:Perplexity 的模型与其他提交模型用同一套流水线评测,但 Q2D-Web 源自 Perplexity 自己的生产流量,自家模型可能存在分布内(in-distribution)优势;尽管评测查询与语料被排除在训练之外,解读结果时仍应把这层潜在优势考虑进去。
帖文回复中也有用户直接追问口径: 问 Recall@1000 是否是有用的指标,认为要衡量嵌入模型的精确度,Recall@1、10、100 可能更能说明问题; 则问,如果换一个 agent 来改写查询,这份排名是否还能保持。
私有数据与公开榜单:模型如何进入评测
要进入这份榜单,需要提交模型。Perplexity 通过评测申请表接收公开可用的 Hugging Face 检索模型:模型必须能用标准的 transformers 或 sentence-transformers API 加载;无法在 trust_remote_code=False 下运行的模型,需先对代码与提交者做人工审查,耗时明显更长;私有或需授权的仓库不在受理范围内。
评测细节同样有明确规定:推理设置以模型卡为准,包括推荐的查询与文档指令或前缀、池化方式、归一化与相似度函数;所有查询与文档都用模型自己的分词器截断到 512 token(含指令、前缀与特殊 token),模型支持更长的上下文并不占优势。提交按总参数量分成两组(不超过 10 亿、超过 10 亿),先测采样子语料;组内前十才会上全语料评测,十名开外只公布子语料的成绩。
论文解释,语料、查询与判定集保持私有是为了防止训练污染:公开基准迟早会被有意或无意地放进训练数据,分数随之虚高。因此对外公布的只有榜单上的聚合分数;这份排行榜用于持续评测新提交的模型。