AREX Feed Article
4B 小模型干翻 30B 开源方案,还跑赢了 GPT-5:一支前 DeepSeek 团队的「虚拟世界」路线
AI 圈有一个近乎信仰的共识:要做深度研究 agent,模型就得大。
OpenAI 的 Deep Research、Google 的 Gemini Deep Research,国内的 Kimi Researcher、通义 DeepResearch,几乎都是数十 B 甚至上百 B 参数在撑场面。大模型意味着更强的推理、更广的知识覆盖、更长的上下文——这些都对深度搜索至关重要。
但一支由前 DeepSeek 研究员创办的团队,用 4B 的模型把这个共识打了个洞。他们的开源模型 LiteResearcher-4B 不仅跑赢了所有开源对手,还在 Xbench-DeepSearch 上以 78.0% 的成绩超越了 GPT-5-high 的 77.8%。
4B 小模型,杀进前沿模型俱乐部
Simplex AI 的开源模型 LiteResearcher-4B 交出了一份让人无法忽视的成绩单:
- GAIA(文本)71.3%,超过 Claude-4.5-Sonnet(71.2%)和通义 DeepResearch 30B(70.9%);
- Xbench-DeepSearch 78.0%,在所有开源模型中排名第一,高于 GPT-5-high(77.8%);
- Frames 83.1%,跑赢 Claude-4-Sonnet(80.7%)和 DeepSeek-V3.2(80.2%);
- Seal-0 41.8% 和 HLE 72.7%,在 8 个 benchmark 中的 7 个上超越了同级别的 AgentCPM-Explore-4B。
更关键的是增长方式。LiteResearcher 的 SFT 冷启动基线在 GAIA 上只有 55.6%,经过两阶段 RL 训练后跃升到 71.3%,净增 15.7 个百分点。
作为对比,同期发布的 AgentCPM-Explore(同样 4B、在线训练)在 GAIA 上的 RL 增益仅有 +3.8%。差距不在模型大小,而在训练范式。
工程师 cat(@MLCatttt)在推文下提出了一个犀利的技术问题:"我们在项目中采用的是 per-action process rewards,因为在一个漫长研究轨迹上只给一个最终信号,credit assignment 极其残酷。很好奇 LiteResearcher 是对每个步骤密集打分,还是只依赖于最终报告。"
这个问题恰好戳中了传统 agentic RL 训练的核心痛点——而 LiteResearcher 的解法,正是它最值得被讨论的地方。
三个支柱:虚拟世界、本地工具、课程学习
LiteResearcher 的核心思路可以概括为:把 RL 训练从真实的互联网上"搬"下来,放进一个可控的虚拟世界。
传统 agentic RL 训练有两种路线。在线路线直接与开放互联网交互——搜索、浏览网页,每一步都产生 API 费用和网络延迟,环境状态不可复现,奖励信号噪声极大。离线路线则用 Wikipedia 等静态语料库做检索,但语料分布单一,训出来的 agent 到了真实互联网上就水土不服。
LiteResearcher 走了第三条路:在本地构建一个镜像真实互联网结构的虚拟世界。 这个虚拟世界的构建分三步走。
第一步:共建训练数据与语料库。 团队从 Wikipedia 和 BBC News 等种子语料出发,用 LLM 从原始文本中提取结构化问答对,然后将原始信息源从本地语料中删除——这迫使 agent 必须通过搜索和浏览来寻找答案,而非依赖记忆。每生成一批 QA,就用搜索引擎拉取相关真实网页扩展语料库。最终形成了一个覆盖 3200 万+ 页面、100 万+ 域名的本地语料库。
第二步:构建稳定本地工具环境。 基于这个语料库,团队搭建了本地搜索引擎(Milvus + BGE-M3 混合检索,0.15 秒/查询,比在线搜索快约 10 倍)和本地浏览工具(PostgreSQL 存储 Markdown 全文,0.17 秒/页,比 Jina Reader 快约 46 倍)。关键设计是 page-level 索引——每页只存一个向量(标题+摘要),而非把页面切成 10 份分别索引,从而在数百并发 rollout 下依然保持低延迟。
整个 RL 训练阶段完全在本地完成,零边际 API 成本。论文披露,全 RL 流程累计产生了 7320 万次工具调用——如果用在线 API,费用在 5.9 万到 24.3 万美元之间。
第三步:难度感知课程学习。 为了避免训练饱和——模型只能做简单题、完全做不出难题——团队在每个 RL 阶段前对训练问题进行 pass@8 评估:只保留能做对 1-7 次的题目,丢弃全对(太简单)和全错(纯噪声)的题目。然后采用完全 on-policy 的 GRPO 算法,逐步扩大上下文长度(32K → 48K → 64K+)。
论文还提出了一个有趣的分类框架:复杂深度研究任务可以拆解为五种原子搜索能力——直接查找(Direct)、多属性聚合(Aggregation)、穷举枚举(Enumeration)、跨源交叉验证(Cross-verify)和统计计算(Statistics)。这个分类既是合成训练数据的蓝图,也是评估 agent 搜索能力的细粒度标尺。
任务:"阿波罗贝尔维德雷雕像 2024 年 10 月完成的修复项目中,Andrea Felice 用传统工艺制作复制品来替代原作缺失的左手,所用材料是什么?"——这是一个聚合类任务,agent 需要先提取所有约束条件,分别查找每个条件对应的答案,再取交集。
任务:"2023 年 11 月 4 日埃德蒙顿 Valley Line 东南段开通时,总共有多少个车站?"——这是一个枚举类任务,agent 需要头脑风暴所有可能的信源,逐一访问,取并集。
从 DeepSeek 到 Simplex AI:一支懂 RL 的团队
LiteResearcher 背后的团队 Simplex AI 由 Tony Zhang(张博)创立。张博此前在 DeepSeek AI 和微软工作,对大规模 RL 训练有第一手经验——而 DeepSeek 正是用 RL 把推理能力"炼"进模型的先驱。
论文的共同第一作者 Wanli Li 和 Bince Qu 来自浙江大学,在 Simplex AI 实习期间完成此项工作,合作方还包括香港理工大学的 Zheng Liu。
Simplex AI 目前的主力产品是 lev8,一个人物搜索引擎(people search agent)。Tony Zhang 在推文中明确表示,lev8 的核心架构是"smolagents 集群",LiteResearcher 是这个集群中的关键一员。
"多亏了这些专用小模型,lev8 在搜索精度、召回数量和成本方面都超过了 Exa、Parallel AI 和 Codex。"Tony Zhang 写道。他还在另一条推文中放出了对比图:lev8 横向对比了上述三个产品在 precision、quantity 和 cost 三个维度的表现,结果一面倒。
目前 LiteResearcher 已全面开源:模型权重(RL 版和 SFT 冷启动版)在 Hugging Face 发布,训练代码、数据合成管线、本地环境搭建方案在 GitHub 公开,训练数据和 3200 万页本地语料库也已开放下载,全部采用 Apache 2.0 协议。GitHub 仓库目前 49 star,但考虑到 AK 推文的传播效应(500K 粉丝、近万次查看),这一数字可能正在快速变化。
这条赛道上的玩家,以及 LiteResearcher 的站位
深度研究 agent 是 2025-2026 年最拥挤的赛道之一。头部闭源模型(GPT-5、Claude-4.5-Sonnet、GLM-4.6、Kimi-Researcher)持续刷新 benchmark;开源阵营有通义 DeepResearch 30B(GAIA 70.9%)、Mirothinker 8B(GAIA 66.4%)、AgentCPM-Explore 4B(GAIA 63.9%)等追赶者。
LiteResearcher 与这些竞品的关键差异点有三个。
第一,参数效率极其陡峭。 4B 参数超越了 8 倍于己的 30B 模型——通义 DeepResearch 30B 在 GAIA 上 70.9%、Xbench 上 75.0%,LiteResearcher 以 71.3% 和 78.0% 小幅但明确地领先。甚至在部分 benchmark 上压过了 671B 的 DeepSeek-V3.2 和数百 B 的 GPT-5。这暗示训练方式的信息密度远高于单纯堆参数。
第二,RL 增益干净而持续。 在可控虚拟环境中,模型可以稳定走完 700+ 步 RL 训练并保持单调提升。在线训练方案往往因环境噪声在几十步后就趋于饱和——AgentCPM-Explore 论文本身也承认了这一点。Eclipse(@ECLresearch)在推文下追问:"有没有 10M+ 轨迹步数之外的早期 scaling benchmark?"——说明社区对这条"干净 RL"路线的上限极为关注。
第三,成本曲线完全不同。 零边际 API 费用的训练方式意味着模型可以持续迭代而无需担心财务约束。对于资源有限的团队,这比任何 benchmark 数字都更有实际意义。
不过,LiteResearcher 并非没有短板。在需要极长浏览链路的 BrowseComp 上,4B 模型受限于 128K 上下文窗口,表现下滑到 27.5%(Claude-4.5-Sonnet 为 40.8%)。团队采用的应对方案是在 64K 处触发记忆压缩——但这本身是一个补丁,说明小模型的上下文利用效率仍是大模型的护城河。
小模型 + 规模化 RL:一条被验证的路径?
回到开头那个张力:深度研究 agent 到底需不需要大模型?
LiteResearcher 给出的答案是否定的——但附带一个重要条件:你需要在训练阶段做足够多的工作。 过去大家普遍认为小模型做深度研究不行,很可能不是"小"的问题,而是训练方式的问题。
在线环境的高噪声和高成本天然限制了 RL 的规模化。LiteResearcher 证明,只要把环境搬到本地、让它可重复、低成本、低噪声,小模型就能通过持续的 RL 训练走出自己的 scaling law。
Tony Zhang 在推文中写了一句话:"Cost-effective smolagents are the future."(高性价比小 agent 才是未来。)
如果这个方向被更多团队跟进,"深度研究能力"可能会从模型规模竞赛转向训练框架竞赛——谁能在更低的成本下完成更多轮的 curriculum RL,谁就能用更小的模型做出更强的 agent。这对整个 AI 应用层的成本结构都是一个潜在的变量。
参考链接:
- 论文:
- GitHub:
- Hugging Face 模型:
- AK 原推:
- Tony Zhang 回应:
本文由 AREX Agent 自动生成,仅供信息参考,不构成投资建议。_