AREX Feed Article
智源开源AREX研究智能体,10B激活参数在WideSearch上压过GPT-5.4和Claude Opus-4.6
智源研究院(BAAI)发布了 AREX,一套递归自改进的自主研究智能体。
AREX-Base 总参数量 122B,每次推理仅激活 10B 参数。它在六个自主研究基准上进入与 GPT-5.4、Claude Opus-4.6、Gemini-3.1-Pro 正面对抗的区间。WideSearch-en 取得 82.0 Item-F1,为论文对比范围内的最高分,超过全部闭源旗舰模型。
模型权重以 Apache 2.0 协议开源至 HuggingFace(),同时上线的 将自主研究能力封装为日常研究工具。
Jeff Dean前脚入场,智源后脚交出开源答卷
Jeff Dean 近日创立 Discovery Loop 公司,据,其押注的方向与 AREX 高度重合:未来 AI 需要的不仅是更强的推理,更是通过持续实验、反馈和修正形成的自主发现能力。智源已经把这一思路跑通了,并且开了源。
7月23日,AREX 论文以 arXiv:2607.21461 上线,当天登上 HuggingFace 。
Brain Cramps 连续三天将 AREX 列入当日"将塑造 AI 领域的七件事",并在中写道:"BAAI drops open-weight 4B and 122B MoE models that recursively audit and refine their own research answers."
中国 AI 产业媒体 智东西 在 X 平台同步报道,称 AREX "uses inner research and outer self-improvement loops to verify claims, preserve evidence, and drive targeted follow-up research."
社区反应相对冷静,这与 AREX 的传播节奏有关:论文和模型在7月底静默上线,直到8月10日新智元发布深度解读,完整的技术架构和 benchmark 数据才被系统性地推到中文读者面前。
当前,,对于一个刚完成首发传播的模型家族来说,还处在早期阶段。
自主研究的瓶颈不是「搜得还不够久」
过去两年的 deep research 产品,从 Perplexity 的深度搜索到 OpenAI 的 Deep Research,核心逻辑都是延长单次搜索轨迹:多搜几轮、多读几页、多调用几次工具。这种做法在简单问答上有效,但面对多约束问题时会撞墙:智能体搜了十轮,可能第八轮就已经跑偏,后面全在做无用功。
AREX 的起点是一个关键判断:发现一个同时满足所有约束的答案,代价极高;而验证一个候选答案是否满足每一项约束,可以逐条拆解。这个"发现—验证不对称性"不是 BAAI 发明的,但 BAAI 是第一个把它做成完整训练框架并开源出来的团队。
更早的信号出现在今年6月。显示,在2026北京智源大会上,AREX 作为四款智能体之一首次亮相,定位是"面向科学发现的自主研究智能体",覆盖信息调研、方案设计、实验探究、报告撰写。一个多月后,它从概念走到了 benchmark 数据和可下载的模型权重。
训练数据也体现出这一思路的彻底性。智源团队设计了一套可验证任务生成方法:先确定一个实体答案,围绕它构造一组必须由真实证据支撑的约束条件,再把这些约束改写为无法通过关键词直接命中答案的开放式问题。强教师模型在工具环境中完整执行任务,全程轨迹中但凡出现猜测答案、忽略观察、证据矛盾,直接剔除。保留下来的轨迹,是从不确定候选逐步逼近可验证答案的完整过程。
每轮研究结束后先给自己打分,再决定下一步查什么
AREX 的核心架构是一套双循环递归框架。内层循环(Research Loop)负责搜索、浏览、整合证据、构造暂定答案并输出置信度评分。外层循环(Self-Improvement Loop)对暂定答案逐约束审计:哪些条件已被证据充分支持,哪些仍然悬空,哪些关键主张缺少来源。高置信度答案直接通过;可修复轨迹围绕未解决约束重新定向研究;无信息量的轨迹则从原问题重启。
自主上下文更新(Autonomous Context Update,ACU)是双循环能跑通的关键机制。长程研究中,交互历史会同时堆积已验证证据、被推翻假设、中途放弃的路线和大量重复信息。全量保留会让模型迷失,简单截断会丢掉关键线索。ACU 由 AREX 自身调用,不是外部模型的通用摘要,而是一份面向下一步行动的研究状态:保留已验证发现及其来源、记录已被排除的候选、标出尚未解决的约束、明确下一轮研究计划。受控实验显示,关闭 ACU 和外层循环后,AREX 在 BrowseComp 上的得分从 82.5 跌至 59.6,差了 22.9 个百分点。
训练策略也围绕"关键时刻"设计。渐进式多轮能力训练先建立稳定工具交互,关键步骤聚焦监督把训练信号集中到证据发现、路径否定与重定向、上下文更新等转折点,步骤感知强化学习继续优化长程决策。长程研究中真正难的从来不是例行搜索,而是在关键时刻做对决定。什么时候信任一条证据,什么时候放弃一个候选,什么时候改变搜索方向。
10B参数在WideSearch上拿第一,规模不是唯一答案
AREX-Base 基于 Qwen3.5-122B-A10B 的 MoE 架构,总参数 122B、每次推理激活 10B。AREX-Turbo 是 4B 稠密模型,基于 Qwen3.5-4B。两个模型均支持 256K 上下文。
基准测试覆盖了六个维度,数据来自 :
信息深度:BrowseComp 要求模型在多跳约束中沿线索逐级挖掘。AREX-Base 取得 82.5,仅以 0.2 分之差落后 GPT-5.4(82.7),与 Claude Opus-4.6(83.7)几乎持平,超过 GLM-5(75.9)和 Qwen3.5-397B(78.6)。xbench-2510 上得分 71.0,优于 DeepSeek-V4-Flash(69.0)和 Qwen3.5-397B(61.0),接近 MiroThinker-H1(72.0)。
信息广度:WideSearch-en 考察大规模搜索空间中的完整覆盖、去重和汇总能力。AREX-Base 取得 82.0 Item-F1,压过 GPT-5.4(77.5)、Claude Opus-4.6(77.5)、Gemini-3.1-Pro(66.4)和 DeepSeek-V4-Pro(78.0),是论文对比范围内的最高分。
深度与广度结合:DeepSearchQA 同时要求多步检索、证据推理和答案完整性。AREX-Base 得分 89.9 F1,超过 GPT-5.4(88.5)、DeepSeek-V4-Pro(88.7)、Qwen3.5-397B(82.1),接近 Kimi-K2.6(92.5)和 Claude Opus-4.6(91.3)。
端到端智能体:GAIA 得分 85.4,超过 Kimi-K2.6(80.6)和 Gemini-3.1-Pro(80.6);HLE with tools 文本子集得分 52.4,超过 GLM-5(50.4)、DeepSeek-V4-Pro(48.2)和 Qwen3.5-397B(48.3)。
参数效率是另一组关键数据。AREX-Base 的总参数量(122B)只有 Qwen3.5-397B 的三分之一不到,但在六个可比基准上全部领先。AREX-Turbo 仅 4B 参数,在多项指标上超过了 Qwen3.5-35B(35B)、Quest-35B(35B)和 Tongyi-DeepResearch-30B(30B)。自主研究能力并非仅靠堆参数就能获得:对长程研究过程的专门训练,效果不亚于数倍的参数规模。
从模型到工具:AREX Research Platform 把自主研究装进了日常界面
智源没有止步于开源模型。同时推出的 以三个独立入口覆盖科研工作流中的"信息获取"与"认知构建":资讯持续追踪指定领域每日动态,论文筛选高关注度研究并支持深度理解,播客从长时段访谈中提取关键观点。
与传统 RSS 或源订阅不同,AREX 平台以"用户关注点"为过滤维度。用户指定方向(如 Coding Agent、芯片行业进展),平台生成持续运行的专属资讯智能体,按设定频率完成检索、筛选与汇总。每条资讯、论文或播客旁均提供自主研究入口,一键调用 AREX 智能体,智能体已感知当前上下文,无需重复交代背景,即可启动检索、对比、分析与综合。
智源在论文和报道中均提到了后续路线:将能力从"信息获取"延伸至"研究执行"。具体包括方案设计(智能体在理解问题与现有方法后自主提出创新方案与实验设计)、工程实现(生成可运行代码框架、训练配置与评估脚本并接入计算资源)、性能调优(分析实验结果、识别瓶颈、自动迭代)。
最终目标是:用户定义研究问题,AREX 自主完成探索、实验与优化,交付可验证的研究结果。当前平台处于 BETA 测试阶段。
AREX 做对的不是「多搜几轮」,是把验证做成了研究的方向盘
AREX 最值得关注的地方不是某项 benchmark 超过了谁。是用 10B 激活参数证明了:自主研究能力的关键瓶颈不在参数规模,也不在搜索轮次,而在智能体是否知道自己已经解决了什么、还缺什么、下一步该查什么。
把验证从"打分工具"变成"研究方向",在双循环框架、自主上下文更新和分阶段训练的共同作用下落地。这是智源团队在这项工作中提供的可复现方案。模型权重、论文和产品都已经公开。接下来要看的是,社区能在这个框架上走多远。