AREX Feed Article
DeepSeek 网页端被曝灰测新模型:思维链重现「I'm doing...」指纹
8 月 19 日北京时间下午 2 点之后,部分账号的 DeepSeek 网页端 Chat 输出行为突然变了。发布 AI 相关内容的博主 Max For AI(@MaxForAI,约 2.9 万粉丝,个人简介自称 LobeHub 增长负责人)当晚在 X 上:最明显的信号是部分账号的思维链里重新出现「I'm doing...」,这个表达此前被不少测试者当作 DeepSeek 最强灰测版本的模型指纹;同一天,B 站、L 站出现录屏实测,社区测试称这一版在前端、3D、SVG 任务上变化明显,有人拿同类任务与 Fable 5、Opus 5 对比,认为灰测版本完成度相当高。
推文发布于 UTC 时间 8 月 19 日 12:25:22(北京时间 20:25),截至 8 月 20 日核验时已有约 7.3 万次查看、315 个点赞。发布者把整件事标为社区探测信号:DeepSeek 官方没有针对这次变化发布公告,灰测并非所有账号可见,他推断这是 DeepSeek 在已全面上线的 V4-Pro-0813 之上,小范围 A/B 测试一套新的模型或后端。
「I'm doing...」重回思维链,写法与节奏也变了
在无法直接看到模型版本号的网页端,测试者习惯靠思维链里的习惯用语辨认背后模型,这类特征被社区称为「模型指纹」。Max 在推文里列出的信号不止一个:除了「I'm doing...」重现,还有用户反馈模型指纹发生变化,思维链的写法和思考节奏与线上版本明显不同。
他配发的三张截图里,一张是社区帖子截图,称「DeepSeek v4pro 现在开始输出『I'm doing』风格思维链」,内嵌一段英文推理式输出;另外两张分别对应 B 站录屏页面和任务对比图。变化的起点被指向 8 月 19 日下午 2 点之后,「国内社区陆续有人发现」输出突变,且并非所有账号可见。
灰测传闻在更早的时候已经出现。主推文发出约 3 小时前(UTC 09:17),Max 发过一条「你看,我昨天跟你说了 deepseek 正在灰测新模型」的,8 月 18 日前后社区里已有「DeepSeek 在灰测」的说法。
前端、3D、SVG 任务对标 Fable 5 与 Opus 5
这次信号里更具体的部分是任务表现。Max 说,B 站已经有人开始连续录屏实测,L 站也出现了相关测试;从流出的测试看,这一版在前端、3D、SVG 等任务上的表现「似乎也有明显变化」,有人把同类任务直接拿去和 Fable 5、Opus 5 对比,「灰测版本的完成度相当高」。
他附上的 B 站视频页截图显示,录屏视频的标题为「deepseek v4 pro max 双臂臂演示」,页面另带有「疑似灰测复活」等字样。对比图则是三格竖排的小屋与森林场景,分别标注 Fable5、Opus5、DS灰测。
这些录屏和对比都出自社区自测,没有官方基准或统一测试集背书,完成度高低也只能算社区的主观判断。
V4-Pro-0813 上线六天后,又来一轮 A/B 测试?
Max 推断的逻辑线是:DeepSeek V4-Pro-0813 此前已经在网页端、App 和 API 全面上线,所以 8 月 19 日这波变化「很可能是 DeepSeek 正在现有 V4 Pro 之上,小范围 A/B 测试一套新的模型/后端」。
V4 Pro 正式版的上线时间可以核实。8 月 13 日,DeepSeek 在中宣布 V4 Pro 正式版同步在 App、网页端和 API 更新上线,用户可以在 App 或网页端选择「专家模式」使用新模型;当天也发布了同样的消息,并说明 API 模型名不变。从 8 月 13 日到 8 月 19 日,相隔 6 天。
官方没有公告,社区先吵起来了
截至 8 月 20 日核验时,DeepSeek 官方 X 账号的推文仍停在 8 月 13 日(V4 Pro 发布公告与 ),没有针对 8 月 19 日变化的任何说明。自称硅谷 AI 架构师的山景城小路(@Zen_with_AI,2,655 粉丝)在 8 月 19 日晚间的中把这件事列为第 7 条,特意标注没有找到 DeepSeek 官方对「网页端灰测新模型」的正式确认,建议先当作社区观察。
信号本身扩散得很快。Max 发推约 23 分钟后,自称 AI 工程专业学生的 hakmgpt 用英文了同一内容,把「I'm doing...」指纹、前端/3D/SVG 任务变化和「部分结果据称可与 Fable 5、Opus 5 一较高下」翻译成英文版本。日本开发者 AM09:21 在中给出使用观感:这个模型角色扮演稍弱,但「能感受到较高的情商」,聊天场景的体验大致「在 Luna 以上、Fable 以下」。
也有明确的质疑声。账号 dummerspast39 直接说:「又是 B 站随机用户。假的。Fable 5.1 暗测。」("Always some random bilibili users. Fake. Fable 5.1 shadow launch")——把这次变化解释成另一个模型的灰测,而不是 DeepSeek 新版本。情绪化的反应同样存在:用户 Ankith 在里写「我受够了这玩意,别玩弄我的感情」,这条推文获得 81 个赞。
Max 自己当天 UTC 17:23 又:「说实话我有点对于 DeepSeek 这样的操作感到厌倦了……每次都是『悄悄』(但大家都知道)的去进行新模型的灰测。」主推文里他的结语是:「熟悉的剧情又来了。模型还没发布,社区已经先把模型的指纹摸透了。」
灰测覆盖哪些账号、触发条件是什么、思维链指纹背后是哪一套模型,目前都没有官方答案。社区手里只有三类证据:思维链截图、B 站录屏和任务对比图。按社区目前的报告,8 月 19 日下午 2 点后部分账号的网页端输出确实变了,但版本归属和发布计划,要等 DeepSeek 开口。