AREX Feed Article
Perplexity 为 Computer 推出 Brain 记忆系统:会话编成链接式 Markdown 维基,评测正确率 +9.3
8 月 26 日,Perplexity 发布官方博客《》,官方 ,公开 Computer 记忆系统 Brain 的完整设计:把用户跨数月、数百次会话积累的上下文,编成一套链接式 Markdown 知识维基,由名为 Dream 的后台 agent 持续整理更新。
按官方口径,Brain 在过去 30 天的线上配对评测中,让答案正确率提高 9.3 分、时效性提高 8.0 分、召回提高 8.9 分,同时 token 用量减少约 15%、成本降低 10%、生成速度快 10%。这些数字全部出自 Perplexity 内部评测,且这是一次产品能力更新,不是新模型发布。
Brain 把记忆做成文件系统:cat、grep 就能翻的 Markdown 维基
博客开头给了一个具体场景:用户解释过一次工作流后,Computer 再被要求画图时,应当自动回忆细节、按用户偏好的格式输出,不用重新解释一遍,也不该忘记用户喜欢 PDF 而不是 PNG。要做到这一点,记忆必须结构化、可追溯、可更新,而不是每次会话都从零开始。
Brain 的答案是把记忆做成文件系统。Computer 的持久上下文以文件形式落在沙箱的 memory/ 目录里,分三层:knowledge/ 是 Brain 本体,一个连接实体、概念、活跃项目和过往经验的知识维基;notes/ 存放蒸馏后的片段;sessions/ 保存索引、摘要和完整转写。agent 处理记忆用的就是它平时处理其他一切内容的同一套工具:cat、grep、读链接、比对 Git 历史。
Brain 的 Markdown 页面里有两类链接:[[wikilinks]] 是上下文边,横向连接相关主题,回答"我还需要知道什么";[cite:N] 是证据边,把每条断言向下连到支撑它的原始会话或连接器来源,回答"我怎么知道这是真的"。整个维基由 Git 托管,保留版本历史,agent 可以检查过往版本和差异。博客用合成人物、无障碍研究员 Nadia 举例:她的 Brain 里有一页"日本通用设计冲刺"项目,问题"我在京都和仙台要见哪些机构"的答案直接写在该维基页上。
设计上刻意避开了向量数据库。博客给出的理由是精确率与召回率的权衡:把静态记忆全部塞进上下文会稀释注意力,按需查询外部数据库又让 agent 负担导航。Brain 的做法是"本地工作集加后台检索":沙箱启动时预载一份记忆索引地图,缺上下文时由 Memory Agent 子 agent 做语义搜索并物化相关文件。内部测试中,走远程 FUSE 路径的简单 grep 比本地文件慢约 400 到 500 倍,所以相关文件必须落在本地。
Dream:四阶段"过夜整理"的后台 agent
Brain 由后台 agent 维护,Perplexity 称之为 Dream。Dream agent 在沙箱里离线运行,拥有与会话相同的文件系统和只读工具,唯一目标是改进未来会话的上下文;每次运行从上次产出的 Brain 出发,而不是从零重建。
一次 Dream 运行分四个阶段:定向,确认权威范围、既定指令、删除日志和停止条件;总结自上次更新以来有新内容或新回合的会话;把值得记录的观察挂到对应的维基页面,必要时查询已认证的连接器;最后更新知识维基,为新主题建页、修订已变化的综合、给事实断言补链接或引用,若当前图已经正确也可以什么都不改。
改动不会直接落盘:Dream 先把提议写进暂存输出树,全部更新完成后做两层校验。确定性校验检查页面格式与引用规范,语义校验确认综合有证据支撑、与整张图保持一致;通过后经一次受控同步与先前状态比对,再写入 Git 仓库。Perplexity 把 Dream 的范围和责任写成一个 Skill,用专门的 guardrails 约束它不乱改。
评测:640 道合成题与 30 天线上配对 A/B
Brain 的评测分三层。离线层用内部数据集:640 道问题、44 个合成人物档案,正确答案机械地绑定到档案历史中的特定证据。开启 Brain 后,答案正确率从 0.600 升到 0.661(+6.1 个百分点),证据召回从 0.573 升到 0.625(+5.2 个百分点);提升最大的是关于用户偏好的问题(+10.2 个百分点)、时间推理(+8.6)和从过往活动中提取细节(+6.9),84% 的问题上 agent 可验证地触碰了与标准证据绑定的来源。
两个公开基准的子集消融也有结果:去掉维基后,LoCoMo 上答案正确率平均下降 4.6 个百分点(三种模型各跑一轮),LongMemEval-S 上没有统计显著变化。博客的解释是,LongMemEval-S 主要考单会话内的事实提取,原始转写本身就是冗余路径;LoCoMo 的证据分散在多会话、多说话人、多日期之间,正是跨会话综合能发挥的地方。开启 Brain 后,生产 agent 在 LongMemEval-S 上达到 0.91、LoCoMo 上 0.83;博客同时注明这些是子集实验,不能算最终基准成绩。
线上层是每日配对评测:同一批固定问题分别对着开启与关闭 Brain 的配对用户状态回答,再按正确性、时效性、召回打分。6 月 18 日公布的初步结果显示正确率 +25%、召回 +16%;最近 30 天,开启 Brain 的会话在每一轮、每一个评判维度上都胜过对照组,绝对值为正确率 +9.3 分、时效性 +8.0 分、召回 +8.9 分,token 用量约少 15%、成本低 10%、生成快 10%。官方还披露一个近期改动:把 Brain 的紧凑索引直接放进 agent 的初始上下文后,随机实验中与记忆相关的不满下降了 6.9%。
离线评测 harness 本身也兼作自动优化流水线:Brain 记忆子 agent、检索技能和 prompt 的每次改动都先跑一轮配对消融,只保留能提升数字的改动。用 Perplexity 的话说,Brain 的"评估者同时也是它的优化者"。
从 2 月的 Computer 到 6 月的 research preview,再到今天的完整蓝图
Brain 不是全新功能。2 月 25 日,Perplexity 发布 ,把它定位为能"端到端研究、设计、编码、部署和管理任何项目"的通用数字员工;6 月 18 日,官方在 :一个持续学习的记忆系统,每项任务都接入由 Brain 构建的上下文图,以 research preview 形式向所有 Perplexity Max 订阅用户开放。
8 月 26 日的这篇博客补齐了架构细节和新一轮数据:Brain 是"链接式 Markdown 知识维基",Dream agents 是它的后台维护者;官方 X 账号当天的推文把两者串成一句话:Brain 把会话、文件和来源编译成结构化知识维基,新评测在原有结果之上,正确率再提 9.3 分、时效 8.0、召回 8.9,token 少 15%。
CEO 下场转发,评论区追问评测口径
发文约 10 分钟后,Perplexity 联合创始人兼 CEO :"面向 Max 用户的 Perplexity Computer 自带一个后台 Dream agent,不断从文件和已连接应用中摄取上下文,在持续的复利循环里构建多跳上下文图。结果显示正确率、召回和 token 效率都有显著提升。"
财经资讯账号 评价:"这看起来是 agent 记忆的重要进展……后台 Dream agent 在你离开时离线运行,阅读你的会话和已连接应用,把它们编成每条断言都带证据引用的链接式 Markdown 维基。新评测显示正确率 +9.3、召回 +8.9、token 少 15%,记忆让系统同时变得更好也更便宜。"中文社区里,评论者 把博客要点译成长帖:"agent 记忆不该是黑盒向量库——他们把记忆做成文件系统里的 Markdown wiki,agent 用 cat 和 grep 就能翻。"
回复区里两种声音并存。开发者 认同"把会话编成维基胜过向量汤:结构能留存,embedding 会漂移"; 则追问:"+9.3 的正确率来自会自我书写的记忆。这是和上周同一套评测集,还是新的一套?"这些数字目前都以 Perplexity 内部评测口径呈现,而按博客的说法,Brain 的评估者同时是优化者,数字会随每次产品迭代继续变化;对开启 Brain 的用户,官方给出的承诺是:记忆随每一次会话变得更好。