AREX Feed Article
Perplexity 更新 Search SDK,执行可靠性从 81.9% 升至 92.6%
8 月 13 日,Perplexity 官方账号在 X 上宣布,,把动作执行可靠性从 81.9% 提升到 92.6%。同一串帖子还宣布,在继续改善性能的同时,把单任务成本压低了近 10%。
官方随帖公布的阶梯图给出细节:8 月 3 日至 10 日,代码执行成功率先从 81.9% 跳到 86.2%,再跳到 92.6%,两次跳升分别对应 Changeset 1 和 Changeset 2,幅度为 +4.3 和 +6.4 个百分点。Perplexity 给出的理由是,SDK 被塑造成什么形状,决定模型能用它做什么(How an SDK is shaped determines how well models can use it),而更可靠的动作执行带来更强的编排能力。
两次 changeset,把执行可靠性推上 92.6%
Perplexity 在第二条推文中贴出的阶梯图题为「SDK Execution Reliability」,副标题写明统计的是 SDK changesets 前后的代码执行成功率,横轴从 8 月 3 日排到 8 月 10 日。图上三段平台依次是 81.9%、86.2% 和 92.6%:Changeset 1 带来 +4.3 个百分点,Changeset 2 带来 +6.4 个百分点,两次更新合计提高 10.7 个百分点。
这里的可靠性数字以及下文所有成本、满意度数字,都是 Perplexity 官方自行公布的指标。
SDK 的形状,决定模型能用它做什么
把可靠性提升归因于 SDK 更新,源于 SaC 这套架构的设定。Perplexity 在 6 月 1 日发表的里写道:SaC 把搜索栈拆成原语,通过 Agentic Search SDK 暴露给模型,模型在沙箱里生成 Python 代码,按任务需要组装检索、排序、过滤、fanout、渲染等环节。没有任何一次检索操作走 function calling 或 MCP,全部通过模型生成的代码编排;单次任务可以发起数百甚至数千次检索操作。端到端的搜索管线仍然保留,但只是常见写法的简写。
这套设计也解释了为什么 SDK 改型足以改变执行成功率:模型写的是针对私有 SDK 的代码,而私有 SDK 不在预训练数据里,接口的形状和文档直接影响代码生成质量。Perplexity 称,其 autoresearch 循环会连续数周自动提出并验证 SDK 改进,评估指标包括延迟、代码生成质量和整体任务表现。这与本次推文的说法一致:Perplexity 把执行成功率从 81.9% 涨到 92.6% 归因于 SDK 改型,并称之为「更可靠的动作执行带来更强的编排能力」。
六月发布,八月优化:WANDR 平均分 +3.9,单任务成本 -9.7%
SaC 在 6 月发布,Perplexity 称其在宽而深的研究(wide and deep research)上达到最先进水平。6 月 11 日的宣布把 Deep Research 带入 Computer,并称有近 26% 的 Computer 任务涉及研究与分析,是最大的任务类别。博客配图显示,进入 Computer 后 Deep Research 在 Humanity's Last Exam 上从 36.4% 提升到 50.5%,在 BrowseComp 上从 40.7% 提升到 83.8%,在 DeepSearchQA 上从 81.9% 提升到 85.0%。
本周的优化则落在公司自研的 WANDR 基准上。官方公布的散点图显示,SaC 优化把 WANDR 平均分从 42.6% 提到 46.5%,即 +3.9 分(+9.2%);单任务成本从 2.455 美元降到 2.218 美元,即 -0.237 美元(-9.7%)。这与推文中「成本下降近 10%」的说法吻合。WANDR 是 Perplexity 内部搭建、用于评测深而广研究能力的基准,。
同一天,Perplexity 开发者账号还,称 Agent API 在 BrowseComp 和 WideSearch 上的得分是 Sonar 最佳成绩的两倍多。两条消息指向同一个方向:检索能力被重新打包成可编程、可编排的原语。
成本降了,用户标记的缺陷率也降了 13.9%
第三条推文把指标落到用户侧:「这些改进出现在大量真实用户工作流中。在 Computer 里,SaC 优化以换来了更高的用户满意度。」配图「Computer Cost and Reliability」给出两个相对值:每次会话成本 -7.6%,用户标记的缺陷率 -13.9%,并注明「越低越好」。
推文讲的是单任务口径(8%),配图则按会话统计成本(-7.6%),两者并不完全是一回事;配图副标题注明给的是相对值(Relative cost and user-flagged defect rate per Computer task)。可以核对的是方向:三张图里的数字全部指向性能往上、成本往下,且全部来自 Perplexity 自己的统计。
「搜索正在从检索变成计算」
推文下的评论各自抓住一组数字。写 AI 资讯的 Josh 挑出成本:「单任务便宜 10% 才是我在意的部分,上个月我的研究账单太吓人了。质量稳住的同时成本下降,比听起来更难得。」()开发者 NotaDEV 把账算成一笔交易:「便宜 9% 换 4 个点,是笔实在的交易,多数团队天天都愿意接。」()
K-Hub 的 SEO 负责人 Stefano Galloni 评论:「搜索正在慢慢变成计算,而不只是检索。这改变的东西远不止一个搜索框。」()