AREXOpen in interactive Feed

AREX Feed Article

爱范儿实测 DeepSeek V4 Pro 0813:Codex、Claude Code 已接入,下一张牌是 Harness

August 13, 2026

8 月 13 日 07:38(北京时间),在 36氪 经授权发布了对 DeepSeek V4 Pro 正式版的上手实测。作者把 deepseek-v4-pro 同时接进 Codex 和 Claude Code,跑完文字、邮件和多组编程任务后的结论是:复杂任务完整度有所提高,但「总感觉少了一些特别惊艳感,甚至有些地方没有比 V4 Flash 拉开想象中那么大的差距」。该文观点仅代表作者本人。

这篇实测距正式版上线不到一天。8 月 12 日晚,DeepSeek 上线 V4 Pro 正式版,报道称最先更新的是 API 文档,新模型版本号为 DeepSeek-V4-Pro-0813,官方没有调升价格;社区账号 同日报告 GA 版开始在 DeepSeek API 与 DeepSeek Chat 铺开; 同日上架 deepseek/deepseek-v4-pro-0813,标注 8 月 12 日 GA、1M 上下文、$0.435/$0.87。发布与马斯克的 Grok 4.6 撞在同一天。

Codex CLI、ChatGPT 桌面端和 VS Code 插件共用一份配置

作者把模型同时接进 Codex 和 Claude Code,文章展开的是 Codex 这一侧:DeepSeek 已经原生支持 OpenAI Responses API,官方直接提供 Codex 接入方案,配置完成后,Codex CLI、ChatGPT 桌面端和 VS Code 的 Codex 插件共用同一份配置。当前的模型版本正是 DeepSeek-V4-Pro-0813,Responses API、Tool Calls、Anthropic API 与 Json Output 均打勾。

编程测试一共四道题。第一道是「大而全」前端:经典的 macOS 风格 Web OS,所有代码放进单个 HTML 文件,还要包含文本编辑器、Terminal、代码编辑器、游戏、文件管理、画图和视频编辑等应用。作者评价,单看完成度,这是他此前测过的同类模型里功能最丰富的一版,多个应用做出了基本界面和交互,系统框架也比较完整,「只不过审美嘛,就比较中规中矩了」。

第二道是拍立得相机,要求完整模拟按快门、闪光、出纸和 8 到 10 秒化学显影,叠加复古偏色、轻微杂色和宝丽来表面质感。成品动画衔接自然流畅。

第三道上了强度:用 Three.js 和 WebGL 生成可交互的黑洞吸积盘,鼠标改变观察角度后,星空、吸积盘和光线弯曲都要跟着变化。这一题暴露短板:V4 Pro 对粒子数量、实时计算、渲染开销和动画复杂度的控制仍偏激进,「光打开网页,我的 M2 电脑已经开始明显掉帧」。

第四道是科幻飞船驾驶舱 HUD,涉及动态准星、雷达、航向、速度、能量、目标锁定和鼠标惯性偏移,主要交互关系都做了出来。

28 秒写完道歉邮件,还附赠答题思路

文字测试排在编程之前。第一题是「命题作文」:模仿鲁迅写约 400 字短文,吐槽现代人饿着肚子也要先给饭菜拍照发朋友圈,同时兼顾年代感、讽刺和幽默。作者的评价是:开头直接借用了鲁迅最具辨识度的经典句式,模仿痕迹明显,但没有把「鲁迅风」机械理解成半文半白、生僻词和之乎者也,「AI 命题作文味」已经比较淡。

第二题更接近日常工作:假设公司内部失误导致大客户定制系统延期一周,写一封道歉邮件,要求承认责任、提出补偿,又不能把客户合作信心写没了。V4 Pro 没有用「多方面因素」「项目节奏调整」这类模糊表达,而是直接写「此次延期完全源于我方内部的失误」,随后给出延长质保、增加免费培训和专属运维三项补偿。整封邮件 28 秒左右完成,正文基本到了修改一下信息就能用的程度;写完还额外解释了一遍为什么这么写。

没有图像输入,涨价仍停留在文档预告

按作者掌握的现有模型信息,V4 Pro 正式版的主要能力仍集中在文本、推理、Coding、Tool Calls 等方向,暂时没有图像、视频等原生输入能力,「多模态目前并不是 V4 Pro 正式版的重点」。

价格目前没有动。爱范儿列出的价格是缓存命中输入每百万 tokens 0.025 元、未命中 3 元、输出 6 元,约为 V4 Flash 的三倍,放到全球市场依然便宜。DeepSeek API 文档同口径的美元价格是缓存命中 $0.003625、未命中 $0.435、输出 $0.87,并发上限 500,低于 V4 Flash 的 2500;页面注明「计划近期整体上调 API 定价,且预计涨幅较大」。机器之心报道,V4 Flash 正式版发布后全球用量激增,官方 API 多次出现性能下降,涨价酝酿正是在这一背景下。补充,这一涨价预告 8 月 6 日已经发出。

智东西引用的官方基准显示,DeepSWE 从预览版的 12.8 涨到 62.7,Cybergym 与 AutomationBench 上超越 Claude Fable 5;该媒体还提到,有 X 网友对比发现网页端与 API 调用的思维链输出存在明显差异,API 输出话术生硬、语序别扭。这些数字出自 DeepSeek 的基准表,爱范儿这篇实测只是引用了跑分图,没有复现。

下一张牌藏在 Harness:崔添翼挂帅,公众号已注册

这篇实测的后半段,落点放在 Agent 上。作者认为,如果 Flash 已经能完成 80% 甚至 90% 的任务,Pro 只负责少数高难度节点,那么真正高效的系统会动态决定什么时候调用 Flash、什么时候调用 Pro,而不是全程挂着最贵的模型。模型之间的能力梯度,本身可以变成 Agent 的成本优化空间。

承接这件事的是 DeepSeek Harness 部门。爱范儿称,过去两三个月,正式挂帅该部门的崔添翼「在各个平台疯狂摇人」;名为「DeepSeek Harness 团队」的官方微信公众号近期完成注册,认证主体属于深度求索,目前还没有发布内容。

作者解释,模型只负责推理,Agent 如何读文件、调工具、管理上下文、失败重试和持续执行,靠的是外面的运行框架;Claude Code 和 Codex 的实际体验从来不只由底层模型决定。Harness 眼下最现实的工作,是决定什么任务值得上 Pro、什么任务交给 Flash,路由做好后,Agent 就不必为少数高难度步骤全程承担 Pro 的价格。

开源编码代理 8 月 12 日宣布,最新 DeepSeek V4 Pro 已进入 OpenCode Go。

官方的涨价预告只写了「预计涨幅较大」,幅度和生效时间都没有给出。等涨价落地,Harness 决定「什么任务值得上 Pro」就会从优化项变成成本问题,这是实测之后最值得继续盯的一条线。

参考链接

More from this developing story

  • DeepSeek 定价页挂出 V4-Pro-0813,调用方式不变Aug 12, 2026
  • OpenRouter 官宣 DeepSeek V4 Pro 0813:DeepSWE +49.9,四项 Agent 基准跳涨Aug 12, 2026
  • 爱范儿实测 DeepSeek V4 Pro 0813:Codex、Claude Code 已接入,下一张牌是 HarnessAug 13, 2026
  • DeepSeek 官宣 V4-Pro:App/Web 上线「Expert Mode」,推理强度分三档Aug 13, 2026
  • DeepSeek 上架 V4-Pro MIT 开源权重,API 价格最高上调 1,100%Aug 14, 2026