AREX Feed Article
DeepSeek V4 Pro 上线 Perplexity Computer:WANDR 0.359 分、每任务 0.75 美元
Perplexity 官方 X 账号 @perplexity_ai 于 UTC 时间 8 月 18 日 21 时(北京时间 8 月 19 日凌晨 5 时)宣布,由美国托管的 DeepSeek V4 Pro 现已在其智能体产品 Perplexity Computer 中可用。官方给出的数字是:该模型在 WANDR 基准上得分 0.359,每任务成本 0.75 美元,比成本-性能前沿上的下一款模型便宜 62%("62% cheaper than the next model on the cost-performance frontier")。
同一分钟,Perplexity 把这则内容同步发布在上。截至本稿核验时,这条推文获得 174 个赞、24 条回复,浏览量约 1.9 万次。公告正文只有两句话,官方数字的细节都在这张随文发布的图表里。
0.359 分与 0.75 美元,配一张图表
图表标题为 "DeepSeek V4 Pro on WANDR",副标题写着 "WANDR score vs. cost. August 2026.",横轴是每任务成本,纵轴是得分。DeepSeek V4 Pro 0813 位于成本-性能前沿曲线的最左端:0.359 分、每任务 0.75 美元。沿曲线向右依次是 GPT-5.6 Terra(0.399 分、1.98 美元)、GPT-5.6 Sol(0.426 分、4.99 美元)、Grok 4.6(0.496 分、7.58 美元)和 Opus 5(0.537 分、11.60 美元);Sonnet 5(0.309 分、5.75 美元)与 Fable 5(0.496 分、20.30 美元)以灰色标在曲线之外。
"下一款模型"因此可以指认:紧挨着 DeepSeek V4 Pro 的前沿点是 GPT-5.6 Terra,每任务 1.98 美元,0.75 美元正好比它便宜约 62%。得分上,0.359 落后 Terra 的 0.399 约 0.04 分。
公告没有说明评估使用了什么配置,也没有说明 0.359 对应 WANDR 的哪个计分口径。
WANDR:500 个任务、17 万条证据的开放基准
WANDR(Wide ANd Deep Research)是 Perplexity 自己发布的开放基准。根据其研究博客 7 月 14 日刊出的,它由 500 个接近真实工作的数据收集任务组成,任务模式来自脱敏后的生产使用记录;全部任务合计要求 17 万 495 条可溯源记录,中位任务要找到 50 个实体、每个实体配 4 条记录。打分采用 soft F1 与 hard F1 两个口径:soft 给不完整的成员部分分,hard 只认整棵任务树都达标的记录。技术论文于 8 月 14 日提交。
基准发布时的榜单并不亮眼:Perplexity 自家系统 Search as Code 以 0.363 soft F1、0.133 hard F1 领跑,每任务成本 5.20 美元;Anthropic 以 0.249 排第二,其余系统最高只有 0.121。两个口径差距很大,最强系统的 hard 分数也只有 soft 的三分之一。
0.359 放在这个坐标系里意味着什么,取决于它按哪个口径计算,而公告没有说明。
一周前转正的 V4-Pro-0813,以"美国托管"身份上架
8 月 13 日,DeepSeek 官方宣布 DeepSeek-V4-Pro 正式发布(GA),模型版本为 0813(API 模型名保持不变),当天起在 app 与网页端("Expert Mode")以及 API 提供。官方称转正带来 agent 能力升级:V4 Pro 与 V4 Flash 支持 low/high/max 三档推理强度,并原生支持 OpenAI Responses API。 新 API 定价于 8 月 16 日 16:00 UTC 生效,设峰值与非峰值两档费率,非峰值低 50%。
据,V4-Pro-0813 每百万输入 token 定价 1.32 美元、每百万输出 token 定价 3.96 美元,报道标题称新价格最高上涨 14 倍。五天之后,Perplexity 把这家中国公司的最新旗舰模型以"托管在美国"(hosted in the U.S.)的名义放进了 Computer。为什么强调托管地,公告没有解释,回复区的用户给出了自己的解读。
Computer:把 19 个模型装进一个"数字员工"
Perplexity Computer 于 2 月 25 日发布,官方博客称其为"通用数字员工":用户描述目标,Computer 把它拆成子任务并生成子代理执行,运行在隔离的计算环境里,可以连续跑几小时甚至几个月,发布时面向 Perplexity Max 订阅用户开放。
补充了两个数字:月费 200 美元,后端协调 19 个模型,核心推理引擎是 Anthropic 的 Opus 4.6,Gemini 负责深度研究,Grok 处理轻量任务,GPT-5.2 负责长上下文与广域搜索。CEO Aravind Srinivas 发布时写道:"Computer 把 AI 的每一项现有能力统一进一个系统""它天生就是多模型的"。
产品页目前显示,Computer 对 Pro 与 Max 订阅用户开放,支持桌面端、移动端、Slack 与 Microsoft 365。 公告没有说明用户如何在 Computer 中选用 DeepSeek V4 Pro,也没有说明是否单独计费。
回复区:要聊天版、折算落地成本、质疑 62%
回复里最集中的诉求是把 DeepSeek 放进普通产品。推文发出 17 秒后,用户 Daniel(@InderosD)就回复"bruh add it to regular perplexity"(把它加进普通版 Perplexity);几分钟后,简介自称 16 岁开发者的 Timurs Jeparskis(@TJeparskis59091)问"Are you not planning to add it to Search mode too?"(不打算也加进 Search 模式吗?)。
LinkedIn 评论区,一位简介为 Aetherya 创始人兼 CEO 的用户也问,能否把 DeepSeek(或 Flash 版本)加进聊天产品。
对官方数字的质疑同样直接。简介自称 AI 研究员、拥有约 2.3 万粉丝的 Harry Tandy(@HarryTandy)指出,62% 的说法只覆盖前沿上的下一个模型,"不是整个市场"。 简介自称硅谷创始人的 Nav Mian(@Nav_Mian)算了一笔账:按 0.359 分折算,0.75 美元相当于每个"真正落地"的任务 2.09 美元,"这才是该比的数字,而不是标价"。
"美国托管"受到的关注不亚于基准分数。简介自称专注机器人技术与前沿 AI 的 Kaelix(@0xKaelix)写道:"'Hosted in the U.S.'这句话比基准数字承担了更多作用。成本-性能前沿只对'被允许考虑这个模型'的买家有意义,对很多人来说,那道门槛才是障碍,而不是价格。" 拥有约 1 万粉丝的 WilcosX.eth(@WilcosX)说,美国托管才是真正的亮点,"终于可以在工作项目里用这些模型而不用头疼法律问题了"。
成本口径还留着一个未解的问题:用户 Bounty(@bountyAIhunter)问,"每任务成本是否已经包含在浏览器里运行模型的算力?"公告没有回答,0.75 美元的成本构成目前没有公开口径。