AREX Feed Article
Google Research 发布 Retrieve-for-Train:用轻量扩散模型替代自回归推理,称查询扇出提速 12~20 倍
北京时间 9 月 16 日凌晨,Google Research 的宣布推出检索框架 Retrieve-for-Train(R4T)。帖文称,这个框架用轻量扩散模型替代重型自回归推理,以此加速复杂 AI 搜索,能在「成本只是零头」的前提下即时生成专家级的搜索结果列表。配套的标注日期为 9 月 15 日,给出了更具体的数字:查询扇出(query fan-out,把一条宽泛查询拆成多条相关子查询)提速 12~20 倍。博客称,自回归方法在大批量上下文下延迟会线性膨胀到接近 50 秒,蒸馏出的扩散模型则维持在亚秒级到数秒。
这套框架出自论文《Efficient, Property-Aligned Fan-Out Retrieval via RL-Compiled Diffusion》(),Google Research 在博客中称这是团队在 ICML 2026 的论文;arXiv 页面显示,论文今年 3 月 6 日就已提交。截至 9 月 16 日,这条帖文在 X 上约有 3.6 万次浏览、近 700 次点赞和 65 次转推。
扇出的两个瓶颈:近义查询与逐 token 延迟
现代搜索和推荐系统越来越多地被要求返回「一组彼此协调的结果」,而不是单个最佳匹配。Google 博客举的例子是:用户搜「露营装备」(camping gear),想要的是帐篷、睡袋、便携炉和头灯这样互补的一份清单,而不是十顶大同小异的四人帐篷。现有做法是查询扇出——把一条宽泛提示拆成若干相关子查询,覆盖不同的潜在意图。
但博客指出,直接用通用大语言模型做数据库感知的查询分解会撞上两个问题。第一是同义反复坍缩(paraphrastic collapse):模型倾向于生成冗余的近义查询,比如围绕「Bohemian festival style」只会产出「bohemian festival fashion」「bohemian festival clothes」,而漏掉流苏夹克、钩织连衣裙、麂皮靴这类时尚专家会指出的不同方向。第二是自回归延迟:模型要拆得足够好,往往得先生成数百个思维链(chain-of-thought,CoT)token 做规划,而逐 token 的生成方式形成了一个延迟下限。博客的说法是,即便配合先进的服务端优化,这种架构的延迟下限仍与生产搜索框所需的亚秒级响应时间「根本冲突」。
三步流水线:RL 只跑一次,再把行为蒸馏进扩散模型
R4T 把「思考」从推理时挪到了训练时,分三步走。第一步,用强化学习训练扇出语言模型(FOLM):给定宽泛查询,模型生成一批子查询,交给固定检索器取回候选,再按集合级复合奖励打分。这一步的底座是开源模型 Gemma3-4B 和 Qwen3-4B,每条主查询固定生成 10 条子查询,训练用 Soft-GRPO——在分组相对策略优化(GRPO)之上加了软 PPO 正则。
第二步是监督合成:冻结训练好的 FOLM,让它离线产出大量「查询 → 目标集合」配对,充当监督数据,全程不需要人工标注。第三步训练扩散检索器:一个 5,390 万参数的扩散模型学会把查询嵌入直接映射为一整组目标嵌入,单次非自回归前向完成。推理时它一次采样出多个检索方向,再由最近邻匹配落到数据库里的具体内容,不再需要生成基于文本的思维链 token。
博客把这条路径称为「奖励到数据的编译」(reward-to-data compilation);论文摘要的概括是,RL 只当一次「目标转换器」(objective transducer),奖励驱动的探索只在上线前发生,产出的是训练数据,推理时不再部署 RL 引擎。团队同时评估了两个部署版本:直接上线 RL 调优后的 FOLM(质量更高,但保留自回归成本),以及蒸馏出的扩散检索器(检验这种质量能否在单次推理下保住)。
三个奖励项互相牵制,堵住取巧路径
R4T 的效果取决于怎么定义「好」的搜索行为。传统监督训练用逐条相关性打分,衡量不了「多样性」「互补性」这类只在整个结果集合上成立的属性,所以 FOLM 的训练改用了一个数学化的复合奖励。以开放式抽象检索任务为例,论文给出的默认权重是:接地性(groundedness)0.6、多样性 0.2、对齐(alignment)0.2。
三项各有分工:接地性惩罚子查询嵌入与数据库最近邻的距离,逼模型只在真正能检索到的内容附近出题;多样性用 Vendi 分数(Vendi Score)度量整组子查询的语义广度;对齐用子查询与原始查询的余弦相似度防止语义漂移。博客称它们是互相牵制的锚点:只优化接地性,模型会钻空子生成无意义字符串(博客举的例子是「line ending line ending」),因为一些乱码也能在向量空间里贴合数据库坐标;只补上对齐,策略又会退化成对用户原话的重复改写。加入 Vendi 分数之后,这些捷径被堵上,模型只能落在嵌入空间的一个平衡区域里。博客的结论是,这套设计让集合级属性「在数学上成立」,而不必在推理时为思考 token 买单。
时尚穿搭与专家歌单:评测的两个数据集
博客披露的评测覆盖两类任务。开放式抽象检索(Open-Ended Abstract Retrieval,OAR)没有唯一正确答案,质量完全由多样性、对齐、数据库接地性等集合级属性衡量;弱监督组合检索(Weakly Supervised Compositional Retrieval,WSCR)里每条查询配有一个弱参考集合,代表「一种可行的答案」。
两个领域分别是:一个大规模时尚数据集,内容为用户搭配的整套穿搭,做文生图实验,用 CLIP 检索器评估;一个专有的工业级音乐数据集,内容为专家编排的歌单,做文生音乐实验,用 MuLan 评估。对比对象包括不做扇出的单查询检索、零样本扩展和高度优化的 Best-of-N 基线。博客称 R4T 在两类任务上都优于这些基线,在多样性、对齐和召回等指标上有明显提升;效率方面,博客称扩散版本已经达到「生产就绪」的水平。上述结果全部来自 Google 团队自己的评测。
博客把这些结果的意义放在数据稀缺的领域:在专业或跨模态场景里,带有人工标注、属性对齐的训练对往往难以获得,用一次 RL 加合成监督「编译」出扩散检索器,是一条可扩展的路径。
Marie Haynes:无法确认落地,信息增量更重要
帖文发布约一小时后,拥有约 10.3 万粉丝的 X 用户 就发文解读。她认为,如果这套机制进入搜索排序,「照着头部结果做、只比它好一点点」的老策略会变成负担:如果 Google 的新模型以数学化的目标训练来避免冗余,与所有人雷同、只是换了措辞的内容会变得不可见。她写道,内容需要提供信息增量(Information Gain),也就是别处没有的独特见解、数据或角度;否则算法可能为了保证用户看到多样化的选项,直接把它过滤掉。
至于 Retrieve-for-Train 是否已经投入使用,Haynes 明确表示无法确认:「我们不知道它是否已经落地。论文是 2026 年 3 月的,所以这有可能;也可能要等到未来某次更新。」