AREX Feed Article
Perplexity 推出 hybrid compute:Mac 本地模型处理私密文件,PII 分类器同日开源
北京时间 9 月 1 日 23:04,Perplexity 官方 X 账号宣布在 Perplexity Computer 中推出 hybrid compute(混合计算):任务先在云端启动,涉及私密文件或敏感数据的步骤,改由运行在用户 Mac 上的本地模型处理,云端与本地模型的工作合并为单一输出,官方称敏感数据全程不会上传到服务器。
功能即日起向 Perplexity Pro、Max 与 Enterprise 订阅用户开放,适用于 macOS 15+ 的 Perplexity Mac 应用;同一时间,Perplexity 还宣布开源设备端 PII(个人身份信息,personally identifiable information)检测分类器,并附上研究博客与 Hugging Face 模型页链接。以上功能描述均出自 Perplexity 官方口径。
搜索规划在云端,私密文件不出 Mac
分工方式是:云端模型负责搜索、规划与推理,Mac 上的本地模型处理私密文件、敏感信息与设备端操作,Perplexity Computer 负责编排整条流程,用户不需要把任务拆成多次提问,也不必在工具之间搬运数据。
博客进一步说明,隐私门(privacy gate)在 Mac 上控制什么可以离开设备:在受保护文件的信息到达云端之前,它可以打码敏感细节、把内容留在本地、拒绝动作,或请求用户同意。
产品页演示了一个具体场景:任务读取 Meridian_notes.pdf 后,隐私门发现文件中包含 1 个姓名、1 个电子邮件地址和 1 个电话号码,用户可以选择「在我的 Mac 上处理」、「仍然上传」或「仅发送替代值」;选择替代值时,姓名、地址和账号会先被替换成占位值,答案返回后再还原。
任务还可以从 iPhone 触发,Mac 在本地执行敏感步骤;9to5Mac 引用产品页称,本地模型承担的工作不消耗云端额度,也不需要 API key。博客称,希望随时随地访问本地推理的用户,可以专门用一台常开的 Mac mini 运行 Perplexity Computer,并从 iPhone 远程控制。
隐私门在敏感内容离机前拦截 PII
官方推文的口径是:Mac 上的隐私门会在 PII 离开设备之前检测到它,用户可以选择本地运行该步骤、把文件发送到云端,或者完全跳过。
支撑这套拦截的是设备端分类器。博客称它能识别姓名、地址、账号与密钥等敏感细节;凭证、支付卡号和政府证件号受到最严格的保护,隐私门可将其留在本地、拒绝动作,或改写请求,让云端模型在缺失这些信息的情况下继续工作。 产品页显示,该分类器与 Perplexity 安全智能研究院(Secure Intelligence Institute)合作训练,并已开源。
开源落地在 Hugging Face。模型页 perplexity-ai/pplx-pii-masking 显示,这是一个约 6 亿参数、基于 Qwen3 的双向编码器,带两个输出头:一个 37 类 BIOES(序列标注方案)标签头,覆盖 9 类 PII(人名、账号、地址、邮箱、电话等);一个对话级敏感度头。解码用受限 Viterbi(维特比)算法输出字符级 span(文本片段),最长支持 4,096 个 token(词元)的上下文。 权重公开后,外界可以自行检查它如何判定敏感内容,而不必只依赖 Perplexity 的自述。
重复出现的姓名,才是检测的难点
与分类器一同发布的是研究博客 PII-TRACE: Detecting Personal Data Before It Leaves a Device。Perplexity 研究团队称,在长对话中同一个标识符可能多次出现,「漏掉一次提及,就可能让系统本想保护的信息泄露出去」;而且一个名字在某个对话里指用户本人,在另一个对话里可能只是公众人物,单看字符串本身无法判断该不该拦截。
为了测出这种能力,团队构建了 PII-TRACE 基准:13,148 段合成人机对话,覆盖 13 种语言、10 种书写系统,共 37,431 处标识符提及、9 类 PII;在 5,645 段含标注 PII 的对话中,63.8% 包含出现多次的标识符,28.7% 的标识符跨轮次出现。
配套的 PII-Tracer 是 0.6B 参数的双向编码器,在约 71.4 万个训练样本上训练 3 轮。按 Perplexity 研究团队自报的评测:它在 12 个被测系统中字符级 F1 最高(0.629),能完整找到 79.4% 的重复标识符的全部提及,而云端前沿模型 GPT-5.6-sol 只有 57.0%;在 ai4privacy、Nemotron-PII、SPY、Gretel PII 与 TAB 五个外部基准上,字符级 F1 均高于 OpenAI 开源的 Privacy Filter,ai4privacy 上 0.950 对 0.907,TAB 上 0.594 对 0.350。
这些数字全部来自 Perplexity 自己的评测口径,不属于独立第三方的验证结果。研究博客文末还写道,PII-TRACE 基准与 PII-Tracer 模型「将很快发布」;推文与产品页则称分类器当日开源,目前 Hugging Face 上可下载的是这套权重。
24GB 内存起步,三款本地模型可选
运行 hybrid compute 的门槛是:任意 Apple silicon Mac、macOS 15+、至少 24GB 统一内存。 9to5Mac 引用产品页补充说,32GB 内存体验更佳,本地模型一键下载,不需要 Ollama 或手动配置运行时。
首发三款本地模型:Gemma 4 E4B、Qwen3.6 35B-A3B 和一款 Perplexity 自研模型,产品页演示中出现的本地模型是 PPLX Qwen 3.8 27B。 设置流程为:安装最新版 Mac 应用,一键下载本地模型,在模型选择器里选 Hybrid,再为任务指定本地与云端模型。
企业版提供组织级控制。Perplexity 称,Enterprise 订阅的管理员可以设置组织级规则,规定哪些内容必须留在 Mac、哪些可以在打码后进入云端、哪些需要用户批准才能上传,并审计信息何时离开设备,面向法务、医疗、金融等团队。 博客给出了三个行业场景:投资团队在云端汇总公开申报材料与可比交易数据,本地模型交叉核对机密交易文件,提取关键条款与财务假设,并标记与网络研究不一致之处;律师在网上检索判例,本地模型从特权文件中提取事实、转成匿名化研究问题、更新草稿;广告公司用本地模型比对草稿创意与云端调研到的受众趋势。
博客还提到,苹果上周发布的新款 Mac mini 与 Mac Studio 是运行 hybrid compute 的理想平台;9to5Mac 报道称,苹果在 M6 Mac mini 发布会上把 Perplexity Personal Computer 列为生产力用例。
8 月 Portable Computer 已经走通全本地路线
hybrid compute 不是 Perplexity 第一次把计算放到用户设备上。Perplexity Computer 于 2026 年 2 月 25 日发布;4 月公司宣布 Personal Computer,让 Computer 直接在 Mac 上操作本地文件与工具,5 月 7 日向所有 Mac 用户开放。
8 月 25 日,Perplexity 又在 NVIDIA DGX Spark 上发布了 Portable Computer,这是一个完全本地版运行时,编排模型、子代理模型与智能体框架全部跑在本地硬件上,不依赖云端;同日发布的研究称,设备端 27B 模型在真实知识工作评测中拿到 82.6%,后训练的 PPLX 27B 达到 85.4%。
9to5Mac 指出,Perplexity 早在 6 月就预告过把 AI 任务拆分到本地与云端模型的工作。 hybrid compute 与 Portable Computer 的区别在于:它不要求任务整体本地化,而是按步骤路由,哪些步骤碰私密文件就留在 Mac,其余交给云端前沿模型。
质疑集中在一点:谁来判定「敏感」
主推文发布 22 秒后,Perplexity 联合创始人兼 CEO Aravind Srinivas 发出同题推文:「为所有 Perplexity Mac 应用用户推出 hybrid compute,让 Computer 能够编排在 Mac 上本地运行的模型,尤其是涉及敏感与私密文件(比如体检报告、纳税申报、诉讼材料)的智能体(agent)步骤。」 截至北京时间 9 月 2 日凌晨检索时,CEO 这条推文已有约 15.5 万次浏览,官方主推文约 7.2 万次浏览、700 余次点赞。
评论区里,质疑集中在「什么算敏感」的判定上。自称从事科技与金融内容创作的 X 用户 Ricci Research(@ricci_nov)写道:「隐私承诺成败在路由器,而不是本地模型。云端必须在看到数据之前决定『这一步是否触及敏感数据』。分类器只要错一次,整个架构就只是一次带营销包装的普通 API 调用。」
中文开发者圈同样把注意力放在分类器上。自称每天用 AI 写代码、深度使用 Claude Code 与 Codex 的工程师 lifcc(@mylifcc)评论说,开源这个 0.6B 的「闸门」是正确做法,他最担心的是长任务里重复出现的标识符:同一个客户端,8 轮之后,换了个说法的同一串信息,还能不能被抓住。
还有用户把问题推得更远:即使模型不接收 PII,支撑任务的底层工具会不会把数据送到云端? 官方当天发布的内容没有正面回答这个问题。分类器开源让这场争论变得可以检验,任何人都能下载权重,用自己的数据实测它的判定边界。在独立第三方评测出现之前,hybrid compute 的隐私承诺,取决于这枚 0.6B 分类器在每次路由前的判定。