AREX Feed Article
DeepSeek-V4-Flash-Vision-Exp 上线:首个视觉理解 API,官方称逼近 Opus-4.8
8 月 21 日 09:17:38Z(北京时间 17:17),DeepSeek 官方 X 账号(@deepseek_ai,110 万粉丝)宣布 DeepSeek-V4-Flash-Vision-Exp 上线 DeepSeek API 平台,以 model='deepseek-v4-flash-vision-exp' 调用。称,这个实验性多模态模型在文本能力(agent、推理、世界知识)上与 DeepSeek-V4-Flash 持平,多模态 agent 基准较 V4-Flash 大幅跃升、接近 Claude Opus-4.8;DeepSeek Harness 0.1.1 当日发布并开箱即用支持该模型。同日确认视觉理解 API 上线,并同步推出免费的 Files API。
官方在公告页公开了一张基准对比图,把「接近 Opus-4.8」落到具体分数:Agents' Last Exam 27.3 对 25.7,ZeroBench 35.0 对 34.0,DeepSWE 59.3 对 58.0。需要先说明边界:这些是 DeepSeek 自报的基准,还没有第三方复现。
官方基准图里的「接近」具体是多少
图里共 11 项评测,分两组:7 项文本 agent 任务(Terminal Bench 2.1、NL2Repo、Cybergym、DeepSWE、Toolathlon-Verified、DSBench-Hard、AutomationBench)和 4 项多模态 agent 任务(ApexBench、Agents' Last Exam、Chartography、ZeroBench)。
多模态组里,Vision-Exp 在 Agents' Last Exam(27.3 对 25.7)和 ZeroBench(35.0 对 34.0)两项超过 Opus-4.8,Chartography 64.3 对 65.0、ApexBench 36.5 对 39.4 两项落后。文本组里 DeepSWE 59.3 对 58.0 反超,但 NL2Repo 57.7 对 69.7、DSBench-Hard 63.6 对 71.7 差距明显。「接近」因此是部分项领先、整体仍差一截的状态。与同门文本模型 V4-Flash-0731 相比,Vision-Exp 在有数据的 9 项里 8 项更高,唯一略低的是 Cybergym(75.3 对 76.7),「文本能力持平」的说法与图上数字基本吻合。
图的注脚交代了评测方式:文本 agent 任务用 DeepSeek Harness Minimal Mode 作为测试框架(top_p=0.95、temperature=1.0、max tokens 取最大);另一条注脚说明,ApexBench 和 Agents' Last Exam 中,纯文本的 V4-Flash 会忽略其中的多模态元素;Chartography、ZeroBench 两栏对 V4-Flash-0731 直接没有数据,因为它不能看图。社区也提醒了「自报」这一点:有用户在转发中写道,对标 Opus-4.8「是 DeepSeek 自家 benchmark 报的,第三方还没复现」,Exp 后缀意味着实验版,「生产环境先别急着切」。
每张图最多 384 token,按 Flash 价计费
这次的计费逻辑是「图片折成 token」。写明,推理前图片会被自动缩放,总像素接近 800×800,每张图最多折算 384 token,与文本 token 合并计费;支持 JPEG、PNG、GIF、WebP,单次请求最多 600 张图,且图片只能放在 user 消息里,放进 system 或 assistant 消息会返回 400。文档还写明,deepseek-v4-flash-vision-exp 是当前 API 上唯一接受图片的模型,其他模型会返回 400「This model does not support image」。这是 DeepSeek 官方 API 第一次开放图片输入。
显示,视觉模型与 V4-Flash 完全同价:输入(缓存未命中)每百万 token 0.22 美元(错峰)/ 0.44 美元(高峰),输出 0.66 / 1.32 美元,缓存命中的输入最低 0.007 美元;上下文 1M,最大输出 384K,并发限额 2500。高峰时段为 UTC 01:00–04:00 与 06:00–10:00,其余时间半价。这张价格表一周前刚变过:路透社 8 月 13 日报道,DeepSeek 将对 V4-Pro 与 V4-Flash 上调 API 价格,涨幅按模型、token 类型与时段在 50% 到 1100% 之间,8 月 17 日生效。视觉模型按涨价后的 Flash 价计费,仍是平台上最便宜的一档。
传图有三种方式:base64 内联(单图上限 32 MiB)、外部图片 URL(最长 8192 字符)、Files API 的 file_id(单图上限 64 MiB)。Files API 当天免费上线,图片上传一次后可按 file_id 反复引用,官方称能省请求带宽。接口层面,除 OpenAI 兼容的 Chat Completions 与 Responses API 外,还支持 Anthropic 兼容的 /messages 端点,官方称模型在各 agent 框架间工作顺畅。
官宣前两小时,Harness 0.1.1 已把模型接好
Vision-Exp 进入官方工具链的时间比官宣更早。显示,v0.1.1-rc.1(pre-release)发布于 8 月 21 日 07:12:39Z(北京时间 15:12),比官方推文早约两小时,是模型接入官方 agent 框架生态的最早可确认时间戳之一。发布说明里,DeepSeek 适配器新增 DeepSeek-V4-Flash-Vision-Exp 多模态适配器(@LegGasai 提交),同时修复了一个沙箱逃逸漏洞:Bubblewrap 沙箱内的受限进程此前可经 /proc/、/root 绕过限制(@Kingwl 修复)。同版本还包含输入框 @ 引用排版修复、会话 Markdown 表格自适应、ask_user_question 多行输入等改动。
推文第二条(2/n)补充说,模型把视觉理解与工具调用结合,能解锁更多实际工作流。配合基准图注脚里「用 Harness Minimal Mode 评测自家模型」的说明,这次发布的路数很清楚:模型、计费规则、官方 agent 框架支持在同一天到齐,瞄准的是多模态 agent 场景,看图聊天只是其中一类用例。
「终于有眼睛了」:社区反应与当日落地
截至本文核验时,主推文累计 6,425 个赞、598,479 次浏览、573 条引用。回复里,用户 @imhaoyi(Yi)写道「Finally, DS had eyes」。Hacker News 上,相关帖子约两小时拿到 172 分、37 条评论。用户 LorenDB 描述了此前文本版的问题:V4-Flash-0731「经常假设自己有视觉能力,在发现自己其实看不见后,现场编造基于文本的图像分析工具」,他不得不让模型别去看截图,「所以这是个大升级」。另一名用户说自己为图片输入切到 Opus 4.6,「糟糕透了」,现在 DeepSeek 终于能看图。
有用户直接给出对比数字:Kyros 转发称「给便宜模型装上眼睛后,它开始赢 Opus-4.8」,列出的 DeepSWE 59.3 对 58.0、Agents' Last Exam 27.3 对 25.7、ZeroBench 35.0 对 34.0 与官方图一致。Google Developer Expert Vin Lim 的反应更谨慎:多模态「肯定会改变游戏」,但「得自己跑一遍评测才能确认,期望很高」,他还提到即便经历了一周前的涨价,这个模型的成本仍「激进地有竞争力」。
当天就有两个落地案例:CommandCodeAI 的 CEO Ahmad Awais 在评论区宣布「正在把它上线到 CommandCodeAI」,LobsterAI 也宣布同步接入该模型。讨论最集中的限制是 800×800 的缩放上限:有 HN 用户认为「会杀死一大批用例」,也有人建议给模型加一个按坐标放大图片的工具来绕过。
自报基准与开源权重:两个还没有答案的问题
「接近 Opus-4.8」目前只有 DeepSeek 自己的基准图支撑,社区用户已提醒第三方复现还没出现。HN 上有人直接问「会开源权重吗」,也有用户猜测会(「开源一直是 DeepSeek 的传统」),但官方公告、API 文档与 Harness 发布说明都没有提及权重计划。DeepSeek 2024 年 12 月曾开源过视觉语言模型 DeepSeek-VL2(权重在 HuggingFace 可查),而官方 API 直到这次才开放图片输入。模型现在能调、价格按 Flash 档、官方工具链当天接入。剩下的两个可观察答案,是独立评测能否复现「接近 Opus-4.8」,以及权重会不会开源。