AREX Feed Article
DeepSeek 悄然内测 V4.1-Flash:官方称新结构、原生多模态,9 月 10 日自动过期
9 月 8 日,DeepSeek 悄然开启 V4.1-Flash 中间版本内测。报道,开发者保持 base_url(API 基础地址)不变,把模型名设置为 deepseek-v4.1-flash-expires-on-0910 即可调用,当前计费与 deepseek-v4-flash 相同。(新浪财经转载)则点出了这个模型名的另一层含义:根据名称中的 expires-on-0910,此次内测将于 9 月 10 日自动过期下线,每账号限流 20 并发。
DeepSeek 给新版本的说法是:采用新的模型结构,原生支持多模态,能力更强、速度更快、成本更低。两家报道中都没有出现官方基准数据,目前能看到的验证,主要来自开发者在社交平台上的自发实测。
有效期被写进了模型名
内测价目分闲时与高峰两档:闲时每百万 tokens(词元)输入(缓存命中)¥0.05、输入(缓存未命中)¥1.5、输出 ¥4.5;高峰时段翻倍为 ¥0.1、¥3、¥9。
智东西报道配图中的内测通知由 DeepSeek 官方小助手发出,写明接入方式与限流规则,末尾附了一个反馈问卷链接。从 9 月 8 日宣布到 9 月 10 日下线,留给开发者的测试窗口只有两天左右。
39 天里四个接口先后登场
这次内测嵌在一条密集的发布线上。按智东西梳理的时间线:7 月 31 日,V4 Flash 正式版 API(应用程序接口)率先上线公测;8 月 13 日,V4 Pro 正式版 API 发布,DeepSeek 同一天宣布 API 价格上调并采用峰谷分时定价。
同一天,DeepSeek Harness v0.1 开发者预览版公测并以 MIT 协议公开源代码,澎湃新闻称它发布不到 24 小时就在 GitHub 拿到超过 7 万颗星;8 月 19 日,Harness 迭代到 v0.1.0-rc.8。
8 月 21 日,DeepSeek 上线实验性质的视觉理解模型 V4-Flash-Vision-Exp,开启多模态 API 服务。澎湃新闻指出,多模态能力一直是 DeepSeek 比较欠缺的板块;按 DeepSeek 当时的介绍,该模型纯文本能力与 V4-Flash 正式版持平,在需要视觉理解的 Agent(智能体)基准上相比 V4-Flash 大幅跃升,多模态 Agent 能力接近 Opus-4.8。
智东西报道称,该模型于 8 月 31 日正式开源。从实验版上线到 V4.1-Flash 宣称原生多模态,中间相隔 18 天。
算上 V4.1-Flash,39 天里 DeepSeek 共放出四个模型接口。智东西在报道结尾的判断是:V4.1-Flash 开启内测,或意味着 DeepSeek 将开启新一轮模型更新周期。
快约 3 倍、峰值 507 tokens/s 的开发者实测
最先给出速度判断的是长期追踪 DeepSeek 的 X 用户。(账号简介自称自 2023 年起是 DeepSeek 铁粉,约 7.3 万粉丝)发布于 9 月 8 日晚,称 V4.1-Flash 比 V4-Flash 大约快 3 倍,每个 token 看起来也更聪明,而且乐于接收大量图片、认真思考图片内容。
智东西汇总了更多开发者样本:X 上晒出的体验中,最高输出速度达到 507 tokens/s;一位开发者让模型创建 HTML,内容是 SVG(可缩放矢量图形)绘制一个鹈鹕骑自行车的 2D 动画,输出速度达 328 tokens/s。
另一位开发者做了同类测试,平均输出速度超过 300 tokens/s;还有网友称手动添加模型后发现“速度非常非常快”。澎湃新闻也转述外界反馈称,此次 Flash 版本的最大特点是速度极快。
这些数字来自开发者个人工具上的读数与主观体验,不是统一基准下的对比测试。“快约 3 倍”是个人对比口径,507 tokens/s 是峰值样本,能否代表真实场景,还需要官方基准或可复现的第三方测试来验证。
正式版时间表没有随内测公布
澎湃新闻与智东西的报道、官方小助手的内测通知里,都没有 V4.1-Flash 正式版的上线时间,也没有说明内测结束后接口是否会转正。