AREX Feed Article
黑鲸出水:DeepSeek Harness 独立公众号上线,712 个开源项目冲进内测
一个黑色鲸鱼头像的微信公众号在 7 月 6 日完成注册,第二天通过认证,名称是「DeepSeek Harness 团队」,认证主体为北京深度求索人工智能基础技术研究有限公司,IP 归属地显示北京。8 月 11 日,披露了上述账号信息,DeepSeek 为 Harness 业务线单独开设官方发布阵地的事实进入公众视野。
该账号独立于 DeepSeek 集团主号运营,是 DeepSeek 首次为旗下单一业务线单独开设的官方发布阵地。此前该公司的模型发布与招聘公告全部通过 DeepSeek 主公众号对外。
一条内测帖,炸出了整个开源 Agent 生态
公众号曝光之前,Harness 团队已经用一条推特点燃了开发者社区。
8 月 1 日晚间,Harness 团队负责人:「如果你是 Agent Harness 相关开源项目的开发者,希望参加 DeepSeek Harness 的内测,可以回复或私信联系我。请附上 GitHub id 以及开源代表作。」截至 8 月 2 日上午,这条帖子获得 47.6 万次查看、697 条回复、1986 次点赞和 873 次收藏。根据开发者 zensh 对全部回复的,425 条可检索回复中,291 条为有效内测申请,其中 61 个是自研 Agent Harness 或 Coding Agent 项目。
到 8 月 4 日,,覆盖智能体框架(135 个)、编程智能体(107 个)、记忆与上下文(56 个)等赛道。报名者中出现了 LLaMA-Factory(7 万星)作者 Yaowei Zheng、Understand-Anything(7.7 万星)作者 Yuxiang Lin、知名技术作家 phodal、字节跳动 deer-flow 团队、以及来自 elizaOS 的核心开发者 odi 等名字。
被问到有没有报名时,对 712 个项目做了统合分析的开发者 baboonAI4S 回了一句:「没有 agent 作品啊所以我围观,因为围观也是一种力量。」
五个月,从一条招聘帖到一个独立部门
Harness 团队此前的所有信号都散落在招聘帖和个人账号里,直到公众号上线才被串成一条完整线索。
今年 3 月,崔添翼加入 DeepSeek。他本科毕业于浙江大学计算机系,在校期间六次获得 ACM 亚洲区域赛金牌,2013 年起在量化交易机构 Jane Street 工作九年,业务覆盖交易系统、固定收益和股票,2022 年联合创办量化交易公司 TSY Capital。他不是从语言模型论文或对齐算法实验室进入 AI 领域的——此前九年的工作全在真实的高频交易系统里。
5 月 20 日, DeepSeek 正在内部组建 Harness 团队,方向是代码智能体产品,内部对标 Anthropic 的 Claude Code。DeepSeek 资深研究员陈德里随后在社交媒体发帖招人,标题直接写「来 DeepSeek 从零做 Code Harness」,正文称「简单来说就是对标 Claude Code,做 DeepSeek Code Harness」。同期,DeepSeek 在招聘平台 Moka 上放出 Agent Harness 产品经理和研发工程师两个岗位,工作地点均为北京。
官方招聘信息里给出了一个公式:Model + Harness = Agent。对此的解释是:「我们正在把 DeepSeek 的前沿模型能力,转化为领先的 Agent 产品。这其中除模型本身以外的所有工作,都属于 Harness 的范畴。」
6 月,自己「每天都在面试、在各个渠道发布招聘小广告」,部门目标「非常远大」,但人手仍然紧缺。
紧接着,7 月 31 日 DeepSeek-V4-Flash 正式版 API 开启公测。在官方发布的中,DeepSeek 明确写道:公开基准测试中的 Code Agent 任务,使用 DeepSeek Harness 极简模式作为测试框架——这个 Harness 被标注为「即将发布」。V4-Flash 正式版在 Terminal Bench 2.1 上跑出 82.7 分、DeepSWE 上跑出 54.4 分,两项均超过了 V4-Pro 预览版。
模型负责想,Harness 负责做
Harness 是一套环绕在大模型周围的完整控制与编排系统。模型负责理解需求、推理和生成方案;Harness 负责在模型之外调度上下文、调用工具、管理任务状态、处理错误反馈,把模型能力落到真实环境中,完成从理解需求到交付代码的完整闭环。
新加坡无限对齐创始人、Codex 生态合作伙伴宋斐向 指出,Harness 对外开放意味着第三方进入同一环境后,官方分数与外部复现之间的落差可以直接核对。如果第三方真的用起这套脚手架,官方分数就会变成可迁移的指标。他补充:「再往前一步,如果 Harness 真的开源,行业统一脚手架这个位置,它就有机会先占住。」
V4-Flash 的定价——输入每百万 token 0.14 美元、缓存命中 0.0028 美元、输出 0.28 美元——意味着如果 DeepSeek 自研的 Harness 落地,市场上最便宜的模型将不再只是别人产品里的一层。X 平台用户 ,V4-Flash 已是 OpenRouter 上排名第一的模型,大量开发者正通过 Codex CLI、OpenCode 和 Claude Code 这些竞品 Harness 来调用它。
Claude Code 惹了众怒,DeepSeek 选了另一条路
在 Harness 赛道上,最为知名的两款产品是 OpenAI 的 Codex 和 Anthropic 的 Claude Code。Anthropic 在今年 2 月完成 300 亿美元 G 轮融资时透露,Claude Code 年化收入已达 25 亿美元,占公司当时整体年化收入 140 亿美元的约 18%。海外分析机构 TickerTrends 估计,Anthropic 的整体年化收入到 7 月底已来到 741 亿美元。
但 Claude Code 的封闭策略引发了连锁反弹。该工具一般情况下只允许接入 Anthropic 官方模型。当逆向工程师通过修改令牌的方式使 Claude Code 能够调用其他模型后,Anthropic 开始对相关行为集中限制——今年 6 月,部分 AI 社区用户发现,当用户指向非官方端点时,客户端会把代理域名、系统时区等信息通过修改系统提示词中的日期字符串隐写回传给 Anthropic 服务器,并对相关账号的使用权限予以限制。
随后,,确定 Claude Code 2.1.91 至 2.1.196 版本存在安全后门隐患,危害严重。阿里、腾讯、美团、京东等企业纷纷对 Claude Code 的使用进行排查管控,并逐渐要求团队转向自研 Harness 工具。
DeepSeek 的选择相反。崔添翼在招募中明确将组建多个模型接口方向的工程师团队,Harness 大概率不限于接入自家模型。深度求索将模型团队与 Harness 团队做组织切割,也意味着 Harness 可能以独立于大模型的业务形态运作。
中信证券在研报中指出,具备成熟 Harness 的厂商同时握有两项稀缺资产:从统一入口、任务执行到结果交付的商业模式闭环,以及长程任务轨迹与纠错反馈这类难以从外部获取的高质量数据,且二者互为强化。
这是两条产品线,不再是一个模型
Harness 独立公众号的落地,确认了一件比「DeepSeek 也要做代码智能体」更重要的事:DeepSeek 正在把模型和 Agent 拆成两条产品线。
这个拆分在招聘阶段已经埋下伏笔——崔添翼要的不是模型研究员,而是做过真实系统、有开源 Agent 工程经验的开发者。V4-Flash 发布时,API 文档将 Harness 标注为独立模块而非模型附属功能。如今独立公众号上线,组织的边界被公开钉死。
判断,模型竞争正从参数规模转向后训练与系统工程,未来模型实际效果将越来越取决于「模型+Harness+工具+数据」的整体组合,单纯依靠基础模型能力建立壁垒的难度继续上升。开源证券则在点评报告中将 Harness 框架的亮相定义为「承载 Agent 运行时与持续学习能力,推动 Agent 应用从原型验证阶段走向规模化商用落地」。
712 个项目的报名名单已经给出了比任何研报都具体的信号:内测尚未开始,门槛最高的那批开源开发者已经在排队了。崔添翼在 6 月说自己「人手仍然紧缺」——现在他要筛的不是简历,是七百多个已经跑起来的 Agent 项目。