AREX Feed Article
Baseten 杀入 HF 推理网,Kimi K3 等模型页一键直达
8 月 6 日,AI 推理平台 Baseten 宣布成为 Hugging Face 官方推理提供商(Inference Provider)。用户现在可以直接从 Hugging Face 任意模型页面调用 Baseten 托管的 Kimi K3、DeepSeek V4 Flash 和 GLM-5.2 等前沿开源模型,只需一个 Hugging Face Token 即可完成认证与计费。当天获得超过 1.3 万次浏览和 120 余次点赞。
这是 Baseten 在今年 6 月完成 15 亿美元 Series F 融资、估值达到 130 亿美元之后的首个平台级分发动作。同步发文确认了此次合作,Baseten 由此成为 HF 推理网络接入的第 18 家推理提供商。
"DeepSeek V4 Flash 我们最快"——联创隔空放话
Baseten 联合创始人 Amir Haghighat 在 X 平台转发公告时放话:"我们是 Hugging Face 上 DeepSeek V4 Flash 和 Kimi K3 最快的提供商,这个速度基于真实生产流量测量,不是测试数据。"该推文附了一张性能对比图,获 20 次点赞和 3 次书签。
Hugging Face 官方账号在 Baseten 公告下回复"🤗💚"。 Hugging Face 机器学习工程师 Aritra(@ariG23498)也以 emoji 表达了欢迎。
Baseten 团队成员 Alex Ker 在转发中表示,此次接入让 DeepSeek V4 可以通过 Hugging Face 路由器直接在 Pi、OpenCode、Hermes 等 AI 编程助手框架中运行。
社区用户 @vsaietta 指出了此次发布被低估的一面:"更大的事是认证——一个 HF Token 现在通吃所有提供商,不用为每个推理服务单独注册和管 API key。"另一位用户 @physicsbyelena 则评论道:"他们说开源模型推理会一直碎片化。"
18 家 Provider 挤进一张 HF 路由表,Baseten 估值最高
Hugging Face 于 2025 年 1 月 28 日首次推出 Inference Providers 体系,首批接入 fal、Replicate、Sambanova 和 Together AI 四家推理服务商。此后一年半内,Groq(2025 年 6 月)、Featherless AI(2025 年 6 月)、DeepInfra(2026 年 4 月)等陆续加入。截至 Baseten 本次接入,该网络已扩展至 18 家提供商,覆盖从 LLM 对话、VLM 到文生图、文生视频、语音转文本等任务类型。
Baseten 此时入场的背景是一份高速增长曲线。2026 年 6 月 22 日,这家总部位于旧金山的公司宣布完成由 Altimeter Capital、Conviction Partners 和 Spark Capital 领投的 15 亿美元 Series F,估值达 130 亿美元——这是其 18 个月内的第四轮融资。同期,Baseten 收入增长 20 倍,推理量增长 40 倍。其客户名单包括 Cursor、Notion、Lovable、Harvey、HubSpot 等。
Baseten 在 Series F 公告中写道:"开源权重模型已经强到企业可以将其视为闭源 API 的严肃替代方案。"此次接入 HF Inference Providers,是将这一判断转化为分发行动。
两套计费零加价,Agent 框架开箱即用
Baseten 在 HF 上的推理支持两种调用模式。第一种是直接模式:用户使用自己的 Baseten API Key,请求直达 Baseten,由 Baseten 直接计费。第二种是路由模式:用户仅使用 HF Token 认证,请求经由 router.huggingface.co 转发至 Baseten,费用计入 HF 账户,HF 不加收任何溢价。"PRO 用户每月还可获得 2 美元推理额度,可跨提供商使用。"
首批上线的模型覆盖对话补全和文本生成任务。核心模型包括 Kimi K3、DeepSeek V4 Flash(0731 版本)以及 GLM-5.2。调用方式为 OpenAI 兼容 API,模型 ID 格式为 deepseek-ai/DeepSeek-V4-Flash-0731:baseten,Python 和 JavaScript SDK 均有示例代码。后续将扩展至更多任务类型。
此次集成已与主流 AI Agent 编程框架完成适配。Pi、OpenCode、Hermes Agents、OpenClaw 等框架可以直接调用 Baseten 托管的模型,Hugging Face 官方博客称"无需额外胶水代码"。对开发者而言,在 HF 模型页上点选 Baseten 即可将同一个模型接入自己的 Agent 工作流。
推理层的战场从芯片转向渠道
Hugging Face Inference Providers 推出之前,开发者如果想试用不同推理服务商托管的同一个开源模型,需要分别注册账号、管理多套 API Key、对比各家的定价和延迟。每一家提供商都是一个独立的信息孤岛。
2025 年 1 月 HF 推出统一推理层后,这个格局开始瓦解。一张 HF Token 即可路由到多家提供商,计费统一,认证统一,API 格式统一。模型页上直接展示可用的提供商列表,用户按偏好排序,HF 自动选择最快或最便宜的路径。推理本身正在从差异化服务变成可替换的基础设施层。
Baseten 的加入标志着推理分发竞争进入新阶段。在 18 家提供商中,Baseten 是少数同时具备三个条件的独立推理平台:百亿美元级估值、已验证的收入增长飞轮,以及 Kimi K3、DeepSeek V4 Flash 等级别的模型阵容。当推理性能在提供商之间趋同,谁占据了开发者的第一入口——HF 模型页上的下拉菜单——谁就占据了分发优势。
Hugging Face CEO Clement Delangue 在 Baseten 公告发布前数小时发推透露,HF 上周新增了近 4 PB 的私有与公开训练数据集、模型和 Agent 追踪数据,创下历史纪录。在这个加速增长的分发网络上,入口位置的价值只会继续上升。
开源模型的推理入口正在标准化
一年半前,在开源模型上跑推理还需要自己部署、自己调优、自己管运维。如今,开发者打开一个 HF 模型页,选一家 Provider,粘贴 HF Token,模型就已经在生产环境中运行。Baseten 带着 15 亿美元新资金和 20 倍收入增速挤进这个网络,争夺的不是"能不能做推理",而是谁来定义开源模型的分发标准。