AREX Feed Article
DeepSeek 开放 V4 首个多模态模型权重:305B 参数、MIT 许可
8 月 31 日 10 时 17 分(UTC,北京时间 18 时 17 分),DeepSeek 在 Hugging Face 上线 ,放出完整权重。
模型卡称这是 DeepSeek-V4 家族第一个实验性多模态模型:在 V4-Flash 架构上加入视觉模块并继续训练,Hugging Face 页面标注 305B 参数,采用 MIT 许可,随仓库提供 tokenizer、prompt 编码参考实现与最小 PyTorch 推理实现。
权重上架后的一个多小时内,两方先后确认。10 时 53 分,开源推理引擎 SGLang 官方账号并确认仓库链接,称支持与更新版 cookbook「coming ASAP」;11 时 26 分, 发帖「Weights open」并附上同一仓库链接。
「Weights open」:研究员发帖,SGLang 说支持在路上
Zizheng Pan 的 X 简介写的是「Researcher @deepseek_ai. Words are my own.」——DeepSeek 研究员,发言仅代表个人。11 时 26 分,他发了一条只有两个词的推文:「Weights open」,附上 Hugging Face 仓库链接。
这条推文在核验时已获得 207 个赞、16 次转发和 1 万余次浏览。
比它早约 33 分钟,SGLang 官方账号(项目简介「Run LLMs fast at any scale」,位于 Palo Alto)先发了祝贺:「恭喜 @deepseek_ai 放出 DeepSeek-V4-Flash-Vision-Exp 的权重」,并确认 Hugging Face 链接。推文写道:「我们正在开发支持,更新版 cookbook 即将推出(We're working on support now, with an updated cookbook coming ASAP!)」;结尾是「欢迎来到 DeepSeek 原生视觉的新时代」。
ApexBench 从 26.2 到 36.5,涨幅背后有个脚注
模型卡把多模态智能体能力列为这次升级的重点。按 DeepSeek 公布的数字,与 V4-Flash-0731 相比:ApexBench(Pass@1)从 26.2 升至 36.5,Agents' Last Exam 从 25.2 升至 27.3,另有新增的 Chartography 64.3、ZeroBench(Pass@5)35.0。
与 Opus-4.8 同列对比:ApexBench 36.5 对 39.4(落后),Agents' Last Exam 27.3 对 25.7(反超),Chartography 64.3 对 65.0(接近),ZeroBench 35.0 对 34.0(反超)。
文本智能体方面,模型卡称与 V4-Flash-0731「保持可比水平」:7 项文本基准里 6 项小幅上升(DeepSWE 59.3 对 54.4,Toolathlon-Verified 75.9 对 70.3),仅 Cybergym 略降(75.3 对 76.7)。
看这两栏数字要带上模型卡的脚注:在 ApexBench 与 Agents' Last Exam 上,作为对照的 V4-Flash-0731 会忽略输入中的多模态元素;Chartography 与 ZeroBench 两栏,0731 直接是空值。ApexBench 上 10.3 分的差距,至少有一部分来自基线模型此前「看不见」输入,不能全部算作智能体能力的提升。
这些数字均为 DeepSeek 自述口径。模型卡注明,文本基准用 DeepSeek Harness 的 minimal 模式评测(max reasoning effort,temperature 1.0,top_p 0.95);DeepSeek Harness 是该公司 的智能体 harness 框架。
仓库里有什么:tokenizer、编码参考与最小推理
Hugging Face 仓库与权重一起提供了完整的最小运行材料。encoding/ 是 OpenAI 风格消息到模型 prompt 的编码参考实现;inference/ 是最小 PyTorch 推理实现,覆盖 vision encoder 与 aligner、DFlash attention、MoE、Hyper-Connections 以及 DSpark forward path,并附依赖安装、权重转换与 TXT/JSON 两种推理命令(见 inference/README.md)。
模型卡特意说明,<image>path</image> 的 TXT 简写与 JSON 内容块两种写法会编码出完全相同的 prompt 与 token ID;encoding 与 inference 两个目录刻意分离,prompt 格式化不依赖 PyTorch,也不需要符号链接。
权重本体以 safetensors 分片存放,由 model.safetensors.index.json 描述,tensor 类型包括 BF16、F32、F8_E4M3、I8 与 I64;模型页显示已挂出 2 个量化版本。整个仓库采用 MIT 许可,自托管不必等第三方服务栈,官方参考实现就提供了从权重转换到推理命令的完整路径。
十天前它还只有一个 API
开放权重之前,同一模型已经以 API 形式运行了十天。8 月 21 日,,当时的口径与今天的模型卡一致:文本能力(智能体、推理、世界知识)与 V4-Flash 持平,多模态智能体基准「大幅跃升」、接近 Opus-4.8,同日发布的 DeepSeek Harness 0.1.1 开箱即支持新模型。评论区里, 在发布约一分钟后追问「Are we gonna get the weights?!?」。
V4 家族本身从开源起步:4 月 24 日,,其中 V4-Flash 为 284B 总参数、13B 激活参数,定位快速与经济。8 月 31 日放出的视觉版,模型卡标注 305B 参数。从 API 到权重,相隔十天。
支持在路上,分数待复现
对自托管用户,MIT 许可加参考推理实现已经把门槛压到「能下载就能跑」;但要在社区推理栈上规模化部署,还得等 SGLang 的支持落地,它目前只预告了「coming ASAP」,没有给出具体日期。模型卡上的基准数字同样是 DeepSeek 自述口径。权重已经在 Hugging Face 上,305B 的模型能不能跑出模型卡上的分数,要看支持落地和社区跑分的结果。