AREX Feed Article
Xiaoyin Qu 上线 AgentSky:同任务 $150 对 $2
8 月 24 日,连续创业者 Xiaoyin Qu 在 X 上宣布上线 AgentSky(),一个自称「Agent 界的 OpenRouter」的云端 agent 聚合平台:单个 API 调度 Claude Code、Codex、DeepSeek、Kimi、OpenCode 等云端 agent,另配一个浏览器版 Agent Playground,让不同 agent 在同一任务上并排跑。她的 X 简介显示,她是 AgentSky 与 TycoonAI 的创始人、天使投资人,此前是 a16z 背书的 Run The World 的退出创始人。
发布推文的钩子是一组成本对比:同一任务,Claude Code 花了约 150 美元,DeepSeek 的新 agent harness 只花了约 2 美元。发布后约 9 小时,已有约 140 万次浏览、151 条引述和 158 次转发。两个数字是创始人自报,未附完整复现细节,这正是随后评论区争论的起点。
「Agents as an API」很妙,唱反调的人也不少
DAIR.AI 创始人 Elvis Saravia 在里说,他很喜欢 Agent Playground 这个想法,「对用 agent 构建的 AI 开发者是非常实用的工具」。前 Streamlit、Snowflake 开发者布道师 Charly Wargnier 则:「看到 DeepSeek 以完全相同的中位耗时跑出比 GPT-5.6 Sol 便宜 3.6 倍的价格,挺疯狂的。」
最成体系的反驳来自 AI 产品经理 Paweł Huryn,他的通讯订阅者超过 13 万。他在时写道:"Agents as an API is a great idea. But it charges API prices."(「把 agent 做成 API 是个好主意,但它按 API 价格收费。」)他的替代方案是留在本地:在 IDE 里并排使用 Grok Build、Codex 和 Claude Code,「用你已经付费的订阅」。他称自己的免费扩展已有 8.5 万次安装,并预告「带上你的订阅和仓库的云托管也快来了」。回复区还有人提醒:。
对 $150 与 $2 的质疑集中在口径上。自称每月在 Anthropic 花约 840 美元的开发者 jsv 在里说,他真正跟踪的数字是「有多少次运行需要重做」:"cheap output i don't trust is the most expensive thing in the stack"(「我不信任的廉价输出,才是整个技术栈里最贵的东西」)。Web3 基础设施公司 OnFinality 在里问了一个工程问题:任务中途从 Claude Code 切到 DeepSeek,会话上下文怎么处理?Qu 的是:"We are an infra company disguised as a routing one."(「我们是一家伪装成路由公司的基建公司」,工具状态和工具兼容性由平台处理。)
Qu 当天还有两条跟进。傍晚她发推称;晚间:不学 OpenRouter 对用量抽成 5.5%,只按模型标价收费;自带 Codex 或 Claude 订阅的用户不收任何模型费,只付云 CPU。
发布前两周,她先给 DeepSeek 站了台
发布前两周,Qu 一直在公开为 DeepSeek harness 造势。她说 DeepSeek harness 很「dev friendly」,会有很多创业公司选它做底层;称它「最适合一次性开出 20 多个子 agent 做调查任务,超快、更便宜、极其强大」;还放话「DeepSeek v4 pro 会进一步碾压 Anthropic 的 API 收入」。,她给 Anthropic CEO Dario Amodei 发了一条公开信式的长推,逐条质疑其安全政策与数据留存策略,那条推文获得 6087 个赞。她转发了自己参与的一期播客,讨论「中国模型为什么追得这么快」。
这些立场最终落成了产品:AgentSky 把 Claude Code 和 DeepSeek Harness 放进同一个 API,让用户自己比较。她自己的账单也在其中。Qu 在回复区提到,她最近一次失控的 agent 循环花掉了。
一个 API key 调八个 agent,状态由云端兜底
官网把用法概括为三步:注册(不要信用卡,送 3 美元额度)、拿一个 AGENTSKY_API_KEY、在请求里指定 agent 和模型,例如 "agent": "claude-code"、"model": "claude-fable-5"。平台列出 8 个 agent:Claude Code、Codex、Hermes、pi、DeepSeek Harness、Kimi Code、opencode、OpenClaw;模型路由覆盖 GPT-5.6 Sol 与 Terra、Claude Opus 5、Fable 5、Sonnet 5、Gemini 3.7 Flash、DeepSeek V4 Pro 与 Flash、Kimi K3、GLM-5.3、Grok 4.6 共 11 个模型。
与模型 API 的关键区别在状态管理。官网称「崩溃、重连和会话状态都不是你的问题」,agent 在云端持续运行;计费按 agent 运行分钟加模型 token 用量。自带 Claude Pro/Max 或 ChatGPT 订阅的用户,可以用 sky clone 命令把本地 agent(指令、模型和 MCP 服务器)克隆上云,合格 agent 的模型费为 0,只付云 CPU。
比较是产品的另一条腿。Agent Playground 让用户给 agent 接上真实工具(GitHub、Gmail、上传文件),在浏览器里并排跑同一任务,对比时间、成本和 token 消耗,发布推文附带一段演示视频。官网还挂出 Agent Arena:基于 2026 年 5 月 6 日至 8 月 6 日间 40,835 个真实任务的捉对厮杀,按 Elo 给「harness × 模型」组合排名,横轴是单任务成本中位数,纵轴是质量分,并标出效率前沿。
回复区有人引用这组数据。IA Proactiv 联创 Adam 在中称,Claude Code × Fable 5 的单任务 p90 成本是 16.54 美元,Hermes × DeepSeek V4 Pro 是 1.79 美元;另一位回复者 Olivia Reed 给出:Claude Code × Fable 5 每任务 7.91 美元,Codex × GPT-5.6 Sol 为 2.91 美元,完成率 98.3% 对 97.4%。
官网还挂了三个客户案例,宣称这些团队「不跑任何 agent 基础设施」:Tycoon 已启动 15 万次 agent,HeyBoss AI 25 万次,WebJourney 5 万次以上。其中 Tycoon 对应的正是 Qu 简介里的另一家公司 TycoonAI。
40,835 个任务之后,agent 有了价格标签
模型 API 层早就有 OpenRouter 这类聚合器,按 Qu 的说法,它对用量抽成 5.5%。agent 层一直没有对应的标准入口:每个 agent 绑定自己的 CLI、订阅和运行环境,想比较只能自己搭台子。AgentSky 把「选哪个 agent」变成一次 API 参数,再把成本差异做成公开榜单和并排实验。40,835 个真实任务的对决数据,是这次发布里唯一公开的量化数据集。
这踩中了过去几周 X 上反复出现的问题:高端 agent 的账单与开源 agent 之间的差距到底有多大。AgentSky 的立场并不中立:创始人过去两周的推文,几乎都在论证 DeepSeek harness 更便宜、更该被选用。产品本身把选择权交给用户,Playground 和 Arena 都指向同一个动作:自己跑一遍。
竞争路线也已经浮现。Huryn 主张留在本地 IDE,用已有订阅并行跑多个 agent;LiteLLM 走开源免费。AgentSky 的差异化在托管与状态兼容:跨 agent 切换时的工具状态,是回复区被追问得最具体的技术细节。
$150 与 $2 之间,还缺一份复现报告
截至发稿,那组 150 美元对 2 美元的数字仍是创始人自报,发布推文没有给出复现细节。Qu 在里只回了一句「Race them yourself」,把验证工具直接交到用户手里。这组数字能不能立住,要看用户在 Playground 上自己跑出来的账单,而不是发布推文的浏览数。
回复区有人把这件事总结得更直接:(「我们争论 agent 争论了两年,因为争论比测试便宜;现在反过来了。」)AgentSky 的赌注是:把测试成本降到免费额度就能跑,争论就会被账单取代。
参考链接
_