AREX Feed Article
HuggingFace 产品负责人自建 DeepSeek V4 Flash 0731 免费端点:零注册、零密钥、OpenAI 兼容
8 月 1 日,HuggingFace 产品负责人 Victor Mustar(@victormustar)在 HF Spaces 上线了一个完全免费的 DeepSeek V4 Flash 0731 公开 API 端点。无需账号、无需信用卡、无需 API 密钥,任意 OpenAI 兼容客户端填入任意字符串即可调用。该端点部署于 AWS us-east-2,社区实测为 4×H100-80GB 运行 vLLM 0.26.0,专家权重 FP4 / 非专家 FP8 / KV cache FP8。
端点详情与限制
发现者 @_0xpainn 的推文 24 小时内获得 650 点赞、55 次转推、约 5.3 万次浏览。配置方式极为简单:
- Base URL:
https://q5dh1rfszfym23hj.us-east-2.aws.endpoints.huggingface.cloud/v1 - Model ID:
deepseek-ai/DeepSeek-V4-Flash-0731 - API Key:任意字符串
端点宣称支持 100 万 token 上下文、thinking 模式和 tool calling,兼容 Hermes、Cursor、OpenCode、Aider、Cline、Claude Code(通过代理)等主流工具。
实际限制显著:速率上限约 12 req/min/IP,共享资源,且社区实测发现实际上下文窗口仅约 393K token(max_model_len: 393216),并非宣称的 1M。部分用户在高峰时段仅获得 1 tok/s 的解码速度。Victor Mustar 本人在约 12 小时后确认端点「still up 🫶」,暗示该服务为个人维护的非正式资源。
与此前报道的关系
此前三篇报道分别覆盖了 V4 Flash 0731 的公测发布、MIT 权重开源与 Codex 生态接入、vLLM 官方支持与成本碾压。本次更新补充了一个全新的零门槛接入渠道:DeepSeek 官方 API 定价为 $0.14/$0.28 每百万 token(输入/输出),而该 HF 端点做到了完全免费——甚至免去了注册流程。这是此前报道未涉及的传播维度。
此前报道中 Unsloth GGUF 量化版允许本地运行,但需要 96–168GB 统一内存;该免费端点则完全消除了硬件门槛,开发者仅需一个 HTTP 客户端即可体验 Terminal-Bench 82.7 分的前沿编码代理模型。
待观察
- 该端点为 Victor Mustar 个人维护,非 HuggingFace 官方服务,持续性和 SLA 无保证
- 速率限制和共享资源使其不适合生产环境,社区评论指出「$0 的价格也是零可靠性」
- 实测上下文窗口(393K)与官方标称(1M)存在显著差距,原因未明
本次更新来源
- _