AREX Feed Article
Cohere Labs 发布 ATE 数据集,称 69.6 万工具中仅 2.6% 能端到端完成职业任务
Cohere 旗下机器学习研究实验室 Cohere Labs 9 月 3 日发布博客《》,宣布开放 Agentic Task Ecosystem(ATE,智能体任务生态)数据集:2026 年 5 月从七个公开目录聚合约 69.6 万个工具、12.3 万个公共 MCP(Model Context Protocol,模型上下文协议)服务器,并称其为同类中规模最大的开放数据集。
研究团队把每个工具匹配到最接近的 ONET(美国职业任务数据库)任务陈述上,再由语言模型判定该工具是否真的执行这项任务,结果显示只有 2.6% 的工具能端到端完成一项记录在案的职业任务;ONET 收录的 923 个美国职业里,419 个没有任何 agentic(智能体式)工具活动。以上数字与结论均出自 Cohere Labs 自己的发布口径;作者提醒,2.6% 应读作下限,因为企业自建自用、从不对外发布的 MCP 服务器没有被计入。数据集已以 的名义发布到 Hugging Face。
图:博客原图。语料聚类后的流向为:既有工作占大头,其中拆成细颗粒的 subatomic 类 151,597 个工具(693 组)、跨任务打包的 composite 类 108,854 个(411 组);支撑 agent 运行的基础设施 67,893 个(336 组);职业记录中找不到对应物的新工作仅 8,388 个工具(35 组)。
先匹配 O*NET 任务,再问模型是否在执行
近两年 AI 系统从生成文本转向自主行动:模型可以查数据库、改文件、开 pull request、约会议。MCP 是连接 AI 系统与外部软件、数据的开放标准,一个服务器让模型操作 GitHub,另一个开放日历、电子表格或公司内部文档;开发者写一个 MCP 服务器,等于发布一组工具,每个工具带一句简短的功能描述。
ATE 的建法是从七个公开目录抓取服务器列表,记录每个服务器列出的工具名称与描述;同一服务器在多个地方重复发布只计一次,最终得到 123,069 个服务器、696,291 个工具。
Cohere Labs 把每一条已发布的 MCP 工具看作一条带日期的公开记录:某个开发者判断这项任务足够具体、可靠,可以交给机器调用。这不代表工具被广泛使用、能自动化长程任务或可靠到适用于每个职场;ATE 衡量的是「已经做出什么」,而非「正在用什么」。
对每个工具,团队先找最接近的既有 O*NET 任务陈述,再问语言模型:该工具是否执行这项任务。判定协议刻意滤掉两类工具:只向用户提供信息的,以及只处理流程中某一步、仍需人统筹的。留下来的,是执行任务陈述所命名的工作、而不是帮别人完成它的工具。按这个标准,约每 40 个工具中有 1 个(2.6%)能把一项记录在案的工作从头做到尾。
遗漏只会少算、不会多算。Cohere Labs 指出,企业自建自用的 MCP 服务器从不对外发布,缺失的这一层很可能恰恰偏向职业数据库描述的那类后台流程;厂商公开发布的企业级服务器已计入,缺的是定制的内部层,因此 2.6% 应视为下限。
此前最大的公开 MCP 语料 MCPZoo 收录 56,053 个不同服务器,新语料覆盖其中 85%,另有约 66,000 个是 MCPZoo 没有的。
最接近本题的 Stein(2026)分析 GitHub 与 Smithery 注册表上的 19,388 个服务器、177,436 个工具,报告 67% 的工具与 90% 的下载量属于软件与 IT 工作。ATE 语料中能匹配到职业的工具,同样以计算机类占多数。
覆盖最深的职业,工作早已跑在软件里
能匹配上的工具挂在 1,380 条不同的任务陈述上,约占 O*NET 记录的全部「软件可执行工作」的 15%。覆盖最深的职业,是那些大量工作已经在软件里完成的职业:平面设计师(Graphic Designers)的 15 个软件可执行任务里有 11 个匹配到工具。
匹配还向职业内部集中。挂在平面设计名下的一千多个工具,大部分指向同一条写得很宽的任务陈述:「使用计算机软件生成新图像」。这类表述让大量通用工具都能真正执行。
图:博客原图。横轴为任务覆盖广度(有匹配的任务占比),纵轴为匹配工具数量(深度),气泡大小代表 2025 年 5 月美国就业规模。图注显示,44% 的严格匹配工具集中在十个职业,居首的 Word Processors & Typists(文字处理与打字员)有 1,245 个匹配工具。
放大看是集中,缩小看是空白:923 个职业中 419 个没有任何 agentic 工具活动。「对任何一个问『agentic AI 会来抢哪些职业』的人来说,来自供给侧的诚实回答是:对其中相当多的职业,还没有人在建任何东西。」博客写道。
没匹配上的工具:旧活拆碎、agent 基建与新工种
未匹配的工具按相似度聚类,得到 1,136 个「描述了某种工作」的类别,对应前文桑基图的三大流向。
第一类占多数,是既有工作、只是颗粒度不对。693 个类别被称作 subatomic(亚原子):可识别的工作被拆成比职业数据库更小的单元,任务陈述写「维护配置控制」,ATE 里能找到几十个针对该任务单个组件的工具。
另有 411 个类别是 composite(复合型):横跨几条记录在案的任务,或打包成职业数据库没有命名的工作流,比如会议记录管理把收集、整理、分析转录稿这些 O*NET 分列的任务串在一起。两类都没有超出已识别工作的边界。
第二类是运行 agent 的基础设施,占比可观:注册 agent、发现其他 agent、管理会话、处理 agent 之间的身份。博客称之为史无前例的工作,但更接近自动化的运行开销,而不是新产出。
第三类才是真正的新工作,只有 35 个类别(约 3%),且大多围绕管理 agent 展开:挑选合成语音、开发与切换 AI 人设、评估某个 agent 能否被信任。研究者还盲标了 120 个类别的样本(不参考模型答案),人工标签指向一致,找到的「真正新」类别甚至略少。
暴露度预测得了数量,预测不了位置
Cohere Labs 把最常用的暴露度评分拿来与实际建成的工具对照。该评分来自 Eloundou 等人,逐条给 O*NET 任务陈述打分:语言模型配合补充软件,能否在不损失质量的前提下把完成时间至少砍掉一半。
在 178 个职业上,理论暴露度与实际 MCP 覆盖的相关性是 0.54。对两个证据来源完全不同的指标而言,这个数字相当强;就「一个职业有多少工作够得着」这一点,暴露度评分站得住。
但它回答不了工具触及职业的哪一端:暴露度与「匹配任务落在该职业自身工作分布中的位置」的相关性,与零无法区分。覆盖深度同理,一个职业工具再多,也说明不了工具打在常规边缘还是专精核心,两者统计上相互独立。
工人自己的偏好更不顶用。WORKBank 对 65 个职业同时调查过「工人希望自动化哪些任务」和「专家判断 AI 能胜任哪些任务」:实际建成的东西跟随专家判断,与工人真正想被自动化的任务类型没有关系。
伸向专精端的是医疗与计算机职业
自动化落在职业的哪一端,历史上后果不同。计算机化时代,会计文员与库存文员的暴露比例几乎相同,会计文员的工资涨了、库存文员跌了,差别不在技术够到多少工作,而在暴露之后剩下的是哪种任务。
若常规任务交给 AI、专精工作留给人,经济学家称之为 expertise-raising(提升专精度)自动化;AI 做掉区分专家与他人的专精任务,则方向相反。
图:博客原图。上排是提升专精度的情形:被匹配的任务集中在常规端(均值左侧),剩余工作的平均专精度上移;下排相反,被匹配的任务落在专精端,剩余工作的均值下移。
在 ATE 覆盖足够深的 178 个职业里,工具平均几乎正好落在每个职业任务分布的中点。平均值之下是两组相反的模式:医疗保健与计算机类职业的工具伸向专精端,把更常规的剩余留给人类(expertise-lowering)。
生产与法律类职业的工具停留在常规边缘,专精核心留给人、抬高了入行门槛,博客的要点总结把销售职业也归入这一组。为量化这种差别,团队计算了 ΔExpertise:若匹配任务交给 AI 工具,职业剩余工作的平均专精度会怎么变,正值意味着对留下的人要求更高。
图:博客原图。横轴为职业匹配到的工具数量(对数刻度),纵轴为 ΔExpertise。图上标注的四组:Legal(4 个职业,+0.24)与 Production(12 个职业,+0.16)抬升剩余工作;Computer & Mathematical(30 个职业,-0.15)与 Healthcare Practitioners(5 个职业,-0.23)压低剩余工作。
横轴方向的平坦本身是发现:一个职业吸引多少工具,与工具触及哪一端无关。工具在最专精端也先够到的,是那些核心职能为结构化、分析、管理信息的职业:Clinical Data Managers(临床数据管理员)匹配到 143 个工具、Biostatisticians(生物统计学家)82 个,是样本中最清楚的两例。
团队的解读是,专精工作并非普遍难自动化:涉及体力或人际的难,已经跑在软件里的相对容易。医疗与计算机恰好都是大量专家判断在软件内完成的领域,「开发者先给自己造工具」只能解释一部分。
供给先行,但新人如何成为专家仍无答案
ATE 只测供给,不测采用与经济效益:工具存在,只说明有开发者判断这项任务足够具体、可以交给机器;工具缺席,说明还没有人做过这个判断。博客认为供给处在链条更前端,可以在就业与工资数据显现之前被监测,因此那些零覆盖的职业,与拥有几百个工具的职业同样值得注意。
结合近期企业语境下 agentic 使用量上升的证据,博客判断:与 AI 共事将越来越多地意味着部署 agentic 能力。
方向看清了,后果却不是单向的好与坏:提升专精度的自动化可能抬高留下者的工资,同时收窄合格申请者的池子;降低门槛可被看作专精的民主化,却没有算上经验如何塑造技能。
初级员工常常经由前辈交出的常规任务学习。博客援引已有观察称,高 AI 暴露职业中年轻初级员工的招聘已明显落后于同龄人,且差距在过去一年还在扩大。
常规任务若越来越多由机器完成,入门者靠什么路径成为专家,Cohere Labs 把它列为 AI 与工作议题中最重要的开放问题之一。ATE 的发布就是为了让其他人也能对同一批记录提出自己的问题。