AREX Feed Article
腾讯提出 RARG:把相关性变成 grep 搜索的「导航员」,BrowseComp-Plus 准确率 84% 且工具调用砍掉四分之三
把相关性从「过滤网」变成「导航仪」。
Agentic Search 爆发前夜,搜索智能体还在「盲搜」
2026 年夏天,搜索智能体(Agentic Search)成为 AI 社区最活跃的战线之一。从 DCI(Direct Corpus Interaction)让智能体扔掉向量数据库、直接用 grep/find/cat 在原始文档里翻找证据,到 GrepSeek 用强化学习训练小型模型掌握 grep 搜索策略,再到 DR-DCI 用动态工作区在检索与精细搜索之间架起桥梁——这条技术路线正在急剧收敛于一个共识:智能体需要比 top-k 文档片段更高分辨率的语料交互接口。
但新的问题也随之而来。DCI 把 grep 交给智能体后,相关性(relevance)——这个传统信息检索的核心概念——被丢掉了。grep 不做语义判断,它只会机械地匹配字符串:当智能体在一个 10 万甚至 100 万文档的语料库中执行 rg "关键词",它会平等地扫描每一个文档,就像假设所有文件都同样值得翻看。有用的线索可能在第 8000 个文件里才出现,而在此之前智能体已经白白耗掉了 20 轮工具调用。
腾讯 AI Lab 与中科院信工所联合团队在 7 月底公开的 RARG(Relevance-Aware RipGrep Search Agent)试图回答一个问题:能否把相关性重新注入 grep 搜索,但不退回"先检索后喂给模型"的老路? 答案是:让相关性从"内容过滤器"变成"执行先验"——它不再决定智能体能看到哪些文档,而是决定 grep 以什么顺序、从哪个入口开始、优先展示哪些匹配片段。
论文标题:A New Role for Relevance: Guiding Corpus Interaction in Agentic Search 论文链接: 开源地址: 核心成绩:RARG++ 在 BrowseComp-Plus 上以 GPT-5.4-mini 达到 84% 准确率,工具调用仅 23.9 次,较 DCI 的 99.1 次减少 76%;以 GPT-5.4 达到 91%,领先 RISE 9 个百分点。
三层相关性注入:从文档排序、入口初始化到匹配重排
RARG 的方法论内核可以用一句话概括:把 embedding 检索器的输出当成 grep 的"导航图",而不是直接的信息通道。团队设计了一个新的工具 embed_recall,它接收 LLM 生成的查询(scope_query),用 embedding 模型对语料库文档排序,但不返回文档内容——只将排序后的文档路径写入一个临时文件 scope.txt,并把文件路径与查询的映射关系告知 LLM。
然后,LLM 被指示以如下方式执行 grep:
cat /tmp/scope_N.txt | xargs -d '\n' rg -j1 [OPTIONS] "PATTERN"关键在于 -j1:强制单线程顺序扫描。rg 默认是多线程并行的,匹配结果按线程完成顺序输出,这会打乱文档的排序。-j1 确保 rg 严格按照 scope 文件中的文档顺序遍历,让更相关文档中的匹配优先到达 LLM 的视野。这是 RARG 的第一层——文档级相关性引导。
第二层是 RARG+ 的入口初始化。智能体从问题本身起步,embed_recall 不提供任何内容,grep 可能需要多轮试错才能找到好的搜索锚点。RARG+ 在 embed_recall 返回时,额外附上 scope 中排名最高的文档里最相关的 10 个段落(用 embedding 模型二次打分选取),包裹在 <qr_paragraph> 标签中。这些段落不是答案,而是让智能体形成一个精准的首次搜索入口——就像在出发前看一眼地图,而不是蒙着眼睛踏出第一步。
第三层是 RARG++ 的匹配级重排。文档级排序虽然让相关文档优先被扫描,但一个在文档排名中靠后的文件里可能藏着非常精准的匹配片段。当 grep 输出超过智能体的观察预算(本实验中为 3 万字符),这些藏在低排名文档中的好匹配会被截断。RARG++ 的做法是:用同一套 embedding 模型,对一个更大的匹配池(500 条)重新打分——打分依据由一个"构造查询"驱动,该查询拼接了 embed_recall 的全局 scope_query 和 grep 的局部关键词模式——最终只保留 top-30(或 60)条匹配展示给 LLM。
三层设计形成了一个从粗到细的相关性金字塔:文档级排序决定了 grep 从哪里开始搜 → 入口初始化决定了从哪里起步 → 匹配重排决定了哪些局部线索能被模型看到。
BrowseComp-Plus 84%,百万文档规模仍领先 10 个百分点
团队在两个互补场景上验证了 RARG:BrowseComp-Plus 的 100 道高难度浏览问答,以及 BRIGHT 的四个推理密集型检索子集(生物学、地球科学、经济学、机器人学)。
BrowseComp-Plus(100K 文档)。以 GPT-5.4-mini 为骨干,RARG++ 达到 84% 准确率,对比 RISE 的 78% 和 DCI 的 78%,提升了 6 个百分点。更值得注意的是效率:RARG++ 平均仅需 23.9 次工具调用,而 DCI 需要 99.1 次——工具调用量减少了 76%。RARG 和 RARG+ 分别达到 80% 和 81%,也展现出三层递进设计的累积效果。以更强的 GPT-5.4 为骨干,RARG++ 将准确率推至 91%,比 RISE(82%)高出 9 个百分点,而平均工具调用仅 25.4 次。
从工具调用分布中可以看到 RARG 与 RISE 的本质差异。RISE 平均调用 13.1 次搜索(Search),且每次搜索同时返回文档片段——检索在这里既是空间构建工具,也是信息通道。RARG 则将 embed_recall 调用压缩到仅 1.2–1.6 次,将 90% 以上的搜索负担交给 scoped grep 的 Bash 调用。相关性不再是智能体的"信息源",而是 grep 遍历的"执行先验"。
扩展到 100 万文档。团队向原有 10 万文档的 BrowseComp-Plus 语料库中注入了 90 万篇 FineWeb-Edu 长文。这些长文充斥着大量可能的偶然匹配,对所有方法都造成了干扰。RISE-BM25 从 77% 跌至 69%,RARG++ 从 84% 跌至 79%,但仍保持对 RISE 10 个百分点的领先。工具调用数的增幅很小(RARG++ 从 23.9 仅增至 24.7),说明检索器(embedding 模型)对语料库膨胀不敏感,但 grep 匹配质量的下降仍然对 LLM 的判断造成了一定误导。
BRIGHT 推理检索。在需要深度推理而非浅层语义匹配的 BRIGHT 基准上,RARG+ 以 53.36 的平均 nDCG@10 超越 DCI(48.43)、RISE-BM25(41.60)和 NVIDIA 的 NeMo 检索智能体(52.89)。
让模型自己写重排查询,为什么反而跌了 9 个百分点?
RARG++ 的匹配重排依赖一个"构造查询"——由 scope_query 和 grep 关键词拼接而成。团队也尝试了一种更灵活的方案:让 LLM 自行生成重排查询(rerank_query),随 Bash 命令一同发出。
结果是矛盾的:使用生成式查询的 RARG++ 收敛速度最快(平均仅 17.8 次工具调用),但准确率却从 84% 跌至 75%。团队将其归因于"训练-评估不一致":GPT-5.4-mini 的 Bash/rg 行为是在标准工具调用格式上训练出来的,强制要求它额外输出一个 rerank_query 参数会干扰其原有的工具使用模式。
这个发现本身颇具启发性:更自由的接口不一定带来更好的效果。构造查询虽然简单粗暴,但它的规则性消除了 LLM 在"额外任务"上的发散空间。团队认为,弥合生成式查询的性能差距——或许通过专门的微调或提示工程——是一个值得探索的方向。
当相关性从「守门人」变成「导航员」
RARG 的意义不在于它提出了一个全新的范式——DCI 的路径早已被开辟,用检索构建交互空间也有 RISE、DR-DCI 等先行者。它的贡献在于重新定义了相关性在智能体搜索中的角色:从决定"智能体可以看哪些文档"的守门人,变成指引"在哪些文档中先搜、从哪里起步、哪些匹配优先被看到"的导航员。
这一转变的实质,是把 embedding 检索从"证据通道"降级为"执行提示"——检索不再直接向 LLM 提供内容,而是为 grep 的遍历提供顺序和优先级。这保留了 DCI 的高分辨率交互能力,同时用检索信号加速了搜索收敛。
当然,扩展到更大规模的语料库仍然是一个开放挑战——100 万文档场景下的性能下降表明,grep 对噪声匹配的敏感性仍是瓶颈。但 RARG 已经为智能体搜索指出了一条清晰的路径:未来更好的搜索智能体,不在于更强的检索模型或更大的上下文窗口,而在于让智能体与语料库之间的每一次交互都携带"在哪里搜更好"的隐式引导。
本文基于 arXiv 论文 "A New Role for Relevance: Guiding Corpus Interaction in Agentic Search"(arxiv:2607.24223)撰写,数据与结论均来自论文原文。