AREX Feed Article
Baseten 杀入 Hugging Face 推理提供商,DeepSeek V4 Flash 速度宣称全场最快
开源模型的推理服务正在经历一场静默的整合。 Hugging Face 的 Inference Providers 计划已经将 Cerebras、Groq、Together AI、Fireworks 等 18 家推理厂商接入同一个 API 层,开发者用一个 HF Token 就能调用任意一家。8 月 6 日,Baseten 正式加入这个阵营——带着 Kimi K3、DeepSeek V4 Flash 和 GLM-5.2 三款前沿开源模型,以及"全场最快"的速度宣言。
推理不再是一场 API Key 管理噩梦
在过去两年里,开源模型生态的繁荣带来了一个尴尬的副产品:开发者要追最好的模型,就得在每家推理厂商分别注册、绑卡、管理 API Key。DeepSeek V4 Flash 出来了,哪家跑得最快?Kimi K3 的 token 价格哪家最低?每次切换都意味着重新集成、重新测试、重新监控。
Hugging Face 的 Inference Providers 计划试图终结这个局面。它把所有合作厂商接入统一的 router.huggingface.co 端点,开发者只需一个 HF Token。模型页面直接展示可用提供商,用户按偏好排序,请求自动路由。
Baseten 联合创始人 Amir Haghighat 在转发公告时直接亮出竞争姿态:"我们是 Hugging Face 上 DeepSeek V4 Flash 和 Kimi K3 最快的提供商,这个结论基于真实生产流量而非测试数据。"
这句话的信息量不小。HF 的 Inference Providers 页面上,Baseten 目前是第 18 家入驻的合作伙伴。在一个所有玩家都声称自己"最快""最便宜"的市场里,Baseten 选择用一个可验证的声明开局:不是 benchmark 跑分,而是生产流量实测。
Kimi K3、DeepSeek V4 Flash、GLM-5.2 全线就位
Baseten 此次上线的是三款当前最受关注的开源大模型:
- Kimi K3:Moonshot AI 的 2.8 万亿参数 MoE 模型,目前最大的开源模型之一。社区对它最大的需求不是"能不能跑",而是"能以多快的速度跑"。Baseten 把它放在首发阵容里,显然瞄准的是对吞吐量有要求的开发者。
- DeepSeek V4 Flash:DeepSeek 最新一代的轻量推理模型,主打性价比。在 HF 平台上,DeepSeek V4 Flash 被 DeepInfra、Together AI 等多家同时提供,Baseten 需要在速度和价格上找到自己的位置。
- GLM-5.2:智谱的最新一代开源模型,在 Agent 和工具调用场景表现突出。Baseten 支持其 vision 能力,是目前 HF 上少数为 GLM 系列提供完整多模态推理的提供商之一。
从接入方式看,Baseten 给出了两条路径。最简单的:在 HF 模型页面上直接选择 Baseten 作为推理提供方,点开即用。进阶的:在任意支持 OpenAI 兼容 API 的 harness 中,把 base_url 设为 https://router.huggingface.co/v1,model 字段写成 deepseek-ai/DeepSeek-V4-Flash-0731:baseten,认证只用一个 HF Token。
这意味着 Pi、OpenCode、Hermes Agents、OpenClaw 等目前最活跃的 Agent 框架全都开箱可用。Baseten 工程师 Alex Ker 在转发中特别强调了这个点:"你可以用 Pi、OpenCode、Hermes 等 harness 直接跑我们托管的 DeepSeek V4,不需要额外胶水代码。"
计费也有两种模式。用自己的 Baseten API Key 直连,费用走 Baseten 账单;通过 HF 路由,费用走 HF 账户,HF 不加价,只透传提供商的 API 费率。HF PRO 用户每月还有 2 美元推理额度,可以跨提供商使用。
一家估值 21.5 亿美元的推理基建公司
Baseten 这个名字在中文圈认知度不算高,但在硅谷 AI 基础设施赛道,它已是头部玩家。
公司由 Tuhin Srivastava(CEO)、Amir Haghighat 和 Philip Kiely 联合创立,总部在旧金山和纽约。核心定位是"推理即一切"(Inference is everything),覆盖无服务器推理、模型训练等场景。
融资节奏相当激进:2025 年 9 月完成 1.5 亿美元 D 轮,由 BOND 领投,估值 21.5 亿美元,比半年前的 C 轮翻了近三倍。更惊人的是,2026 年 6 月 TechCrunch 报道 Baseten 正在敲定一笔 15 亿美元的新融资,估值可能跳到 110-130 亿美元,Altimeter Capital 领投。三个月估值翻五倍。这个速度在 AI 赛道里,也只有推理层能做到。
Baseten 的差异化在于对推理性能的极致追求。Google Cloud 的案例研究显示,Baseten 在成本性能比上比行业均值高出 225%。公司还出版了免费的《Inference Engineering》一书,由联合创始人 Philip Kiely 撰写,在开发者社区中口碑不错。
Philip Kiely 在最近一次与 Latent Space 播客的对谈中提到,推理优化仍存在大量未被挖掘的空间。Baseten 的策略不是自研芯片或模型,而是在现有硬件和开源模型之上,通过工程手段压榨出更好的延迟、吞吐和成本。
18 家提供商同台,Baseten 的位置在哪
HF Inference Providers 现在有 18 家合作伙伴。Chat Completion(即 LLM 对话)是竞争最激烈的赛道,几乎每家都支持。Baseten 目前只提供 Chat Completion 和 Chat Completion (VLM) 两项,不做文生图、文生视频和语音——这意味着它选择了在 LLM 推理上做深度,而不是铺广度。
横向比较几个关键对手:
- Together AI:HF 上的老资格提供商,模型覆盖最广,从 LLM 到文生图全栈。Baseten 在模型数量上无法正面比拼,但它的 Kimi K3 + DeepSeek V4 Flash + GLM-5.2 组合正好是 Together 也在力推的三款,竞争直接。
- DeepInfra:同样是今年 4 月才入驻的新玩家,主打极致性价比。DeepInfra 的博客明确说"业内最低每 token 价格"。Baseten 的回应是速度——"最快提供商"的声明是对着 DeepInfra 的性价比打差异化。
- Groq / Cerebras:硬件玩家,用自研芯片做推理,延迟优势明显。Baseten 无法在硬件层面竞争,它的武器是工程优化和在开源模型上的深度调优。
Amir Haghighat 的推文中附带了一张 HF 平台测速对比图,标注 Baseten 在 DeepSeek V4 Flash 和 Kimi K3 上的"Time to First Token"和"Tokens per Second"双项领先。不过 HF 的公开排名基于实际生产流量动态更新,今天的"第一"明天可能就被另一家刷新——这才是 Inference Providers 设计中最聪明的地方:竞争被实时化、透明化了。
推理层的整合不会停在一纸合作上
Hugging Face 官方账号在 Baseten 公告下回了一个"🤗💚",HF 的 MLE Aritra 和 Suvaditya Mukherjee 也分别转发互动。社区的反应集中在两个点上。
一个是对认证简化的认可。AI 开发者 @vsaietta 评论:"更大的事是认证——一个 HF Token 现在能跨提供商使用,不需要每家单独注册和拿 API Key。"这正是 Inference Providers 的核心卖点。
另一个是对模型切换成本降低的期待。技术博主 @AshishSukralia 写道:"部署摩擦往往是团队死守一个模型的真正原因。如果切换提供商变得简单,人们可以按任务选模型,而不是重建整个技术栈。"
同时也有人关注价格——用户 @moazam107 直接问"免费还是付费?"HF 的答案是混合模式:免费用户有少量配额,PRO 用户每月 2 美元额度,企业用户按用量走提供商费率。
Baseten 此次入驻 HF,短期看是一场速度竞赛的宣言,长期看是整个开源推理生态走向标准化的一个节点。当开发者不再需要为每家提供商单独集成,竞争就会从"谁的 API 文档更好写"变成"谁的模型跑得确实更快、更便宜"。在这个透明竞技场里,Baseten 选择用"全场最快"开局。后面就看它能不能守住了。
参考链接: