AREX Feed Article
open_deep_research 冲进全球第六,LangChain 把多智能体研报引擎彻底开源
是一个基于 LangGraph 构建、MIT 协议开源的深度研报生成引擎。项目自 2024 年 11 月在 GitHub 创建以来已获 12,526 颗 Star,并在 100 道博士级研究任务构成的 榜单上排名第六。2025 年 7 月 16 日,LangChain 在正式发文详解其架构。
Harrison Chase 亲自下场,Lance Martin 去了 Anthropic 还在维护
LangChain 联合创始人 在 2025 年 8 月 7 日转发榜单结果时写道:open_deep_research 在 Deep Research Bench 上拿到了 44.97 分,"是排行榜上排名最高的开源 deep research 实现(总排名第六)。"
项目的主要作者 在六天后补充了更多细节。彼时他已加入 Anthropic,仍称该项目是"在 100 道博士级研究任务、横跨 22 个领域上表现最好的完全开源 deep research agent。"Martin 至今仍是该仓库贡献量最高的开发者,累计 132 次 commit。
在中国技术社区,2026 年 8 月 9 日 AI 工具测评博主 发布了一篇中文深度拆解,称该项目"完全开源复刻了顶尖 AI 机构的深度研报生成引擎",并逐一拆解了需求主动澄清、任务并行拆解、上下文防暴击和模型自由切换四项机制。该推文在发布当日获得 13 次书签和 550 次浏览。
更早的 2025 年 9 月,北京开发者 实测后建议:"至少它没严重 bug,默认配置就能跑通",并指出该项目"本质是一个循环工作流,效果相对就比较稳定。"
从 2024 年的固定工作流到多智能体架构:一次开源项目自己吃到的「苦涩教训」
open_deep_research 并不是一次性设计出来的。Lance Martin 在 2025 年 7 月 30 日的博客文章《》中详细复盘了该项目经历的三次架构迭代。
2024 年末,Martin 发布了一个 orchestrator-worker 工作流:用一次 LLM 调用将用户请求拆成若干报告章节,再由多个 worker 并行完成研究和撰写,最后拼接输出。这个版本不使用 tool calling,依赖预定义的代码路径驱动 LLM 调用,以此来规避当时 tool calling 不够可靠的问题。
进入 2025 年初,MCP 生态迅速壮大,tool calling 可靠性大幅改善。固定工作流的结构开始变成瓶颈:它总是强制把请求分解为报告章节,无法根据任务类型灵活调整研究策略。
并行写出的章节之间经常脱节。Martin 将系统迁移为多智能体架构,允许使用工具并灵活规划研究策略,但最初仍让每个子 agent 各自撰写报告段落——结果报告依然割裂。
直到 Martin 把撰写环节从子 agent 手中剥离、挪到最后一步由一次 LLM 调用统一完成。只用多智能体做信息采集,用单次调用来合成报告。系统这才在 Deep Research Bench 上拿到 43.5 分,进入前十。Martin 在博客中总结道:AI 工程和 AI 研究一样,应当"为当前算力水平添加必要结构,并在模型能力提升后移除它们"。
三段式管线:先问清需求、再拆分并行、最后一次性写出报告
open_deep_research 的核心架构分为三个阶段,所有逻辑以 LangGraph 图结构编排。
第一阶段:Scope(需求澄清)。系统先判断用户提问是否足够明确,不够就追问。澄清对话完成后,系统将整段对话压缩为一份研究简报(research brief),作为后续所有工作的北极星指标。特别提到,OpenAI 曾指出用户在 research 类请求中极少提供充分上下文,这一步就是为此而设。
第二阶段:Research(多智能体并行调研)。Supervisor agent 判断简报能否拆分为独立子课题,能拆则向多个子 agent 分派任务。每个子 agent 拥有独立上下文窗口,各自调用搜索工具或 MCP 服务器抓取资料。
子 agent 完成任务后,会额外做一次 LLM 调用清洗搜索结果,过滤垃圾网页和无关工具反馈,只向上汇报高密度结论。这一设计直接针对 Anthropic 报告中指出的问题:多主题并发调研时,单一上下文窗口容易发生上下文冲突(context clash),且 token 消耗可达常规聊天应用的 15 倍。
第三阶段:Write(一次性报告生成)。Supervisor 判定收集到的材料足够覆盖简报要求后,由一次 LLM 调用根据简报和全部调研结果直接生成最终报告。LangChain 团队坦言早期版本曾尝试让子 agent 并行撰写报告章节,速度快但章节之间缺乏协调,最终改为一刀切:多智能体只做调研,撰写统一收口。
系统默认使用 Tavily 搜索 API,同时支持 OpenAI 和 Anthropic 的原生网页搜索以及完整的 MCP 兼容。模型层面通过 init_chat_model() API 接入,摘要、调研、压缩、最终报告四个环节各自可配置不同模型,默认组合为 GPT-4.1-mini(摘要)+ GPT-4.1(其余三个环节)。Deep Research Bench 的评测结果显示,将调研模型从 GPT-4.1 换为 GPT-5 后,RACE 得分从 0.4309 提升至 0.4943,提升了约 15%。
GPT-5 跑出 0.4943:模型能力和编排架构,哪个才是研报质量的真正变量
Deep Research Bench 包含 100 道博士级研究任务(50 道英文、50 道中文),覆盖 22 个领域,以 Gemini 作为 LLM-as-judge 计算 RACE 分数来评估研报质量。
open_deep_research 的默认 GPT-4.1 配置拿到 0.4309,换用 Claude Sonnet 4 后升至 0.4401,换用 GPT-5 后达到 0.4943。
这组数据表明:编排架构和模型选择对最终质量的影响是分开的。只换模型不换架构,RACE 分就能涨 0.063 分(约 15% 相对提升)。Digital Applied 在 2026 年 8 月的中写道,大多数同类项目的公开跑分由维护者自行提交,且横向对比时往往不说明是否控制了模型变量。"这意味着你在比较两个项目时,可能是在比较它们的模型预算,而不是它们的架构水平。"
与其它开源 deep research 项目相比,open_deep_research 的定位也不同。Digital Applied 将四个主流项目做了区分:GPT-Researcher 是报告生成的基础构件,STORM 是预写作系统(产出大纲而非答案),Local Deep Research 追求完全本地运行。
open_deep_research 则被描述为"一张你需要自行重新配置的编排图"——它不是即装即用的产品,而是一个可以替换模型、搜索后端和 MCP 工具的可配置引擎。
Deep Research Bench 自身也在持续迭代。2026 年 2 月,该基准发布了 ,引入 9,430 条细粒度二元评分标准;2026 年 5 月,官方评估模型从即将退役的 Gemini-2.5-Pro 切换为 GPT-5.5,人工标注一致性基线为 68.78%。
能换模型、能改搜索、能接 MCP——开源研报 Agent 的胜负不在一次跑分
open_deep_research 的项目维护者不避讳它的定位:一个"简单、可配置、完全开源"的研究 agent。12,526 颗 Star 和 1,774 次 Fork 的背后,是一个允许开发者把 OpenAI、Claude、DeepSeek 或本地模型任意接入的研报管线。Lance Martin 在代码仓库中同时保留了 workflow 版和旧版 multi-agent 版两个早期实现作为参考,供后来者看清每一次架构决策的代价和收益。