AREX Feed Article
阶跃星辰开源 onPanda:定位首个错误 token、让模型续写,自称标注耗时较人工后编辑降 52%
北京时间 9 月 23 日凌晨 1 时 45 分(UTC 9 月 22 日 17:44),阶跃星辰(StepFun)官方账号 宣布开源 onPanda,推文原文称这是「我们在内部用于 LLM 数据标注与模型检查的工具」。推文把工作流概括成一句话:「找到一个错误、改掉那个 token、让模型继续。」工具直接开在浏览器里,对手机友好;GitHub 主仓库 的描述是「在 token 层面操控你的 LLM 和 agent:一个用于 token 可视化与控制、模型检查、数据标注等功能的 web 应用」。
随帖附上了论文:,9 月 21 日提交 arXiv。摘要给出的两个核心数字:与人工后编辑相比,中位标注时间降低 52%;产出数据相对模型重采样基线的困惑度变化 ΔPPL 小于 1%。onPanda 的全称是 on-Policy Alignment Data Annotator(on-policy 对齐数据标注器),on-policy 指数据保持贴近模型自身的采样分布。这两个数字出自作者团队自己的对照研究,摘要原文的措辞是「一项小规模对照研究显示」(a small controlled study)。
先找到第一个不合适的 token,再让模型写完剩下的话
标注员通读模型回复,定位第一个不合适的 token,然后二选一:从模型给出的候选 token 里挑一个替代,或者直接手打正确文本。系统随即截断该位置之后的所有内容,从改好的前缀继续生成;这个「定位—修正—续写」的循环反复进行,直到得到满意的回答(论文摘要)。
界面就是按这个循环设计的。每个 token 块下方以颜色标出该 token 的概率,绿色为高、红色为低;鼠标悬停在回复文本上会浮现候选 token,点一下候选就从那里续写;双击某个 token 块可以直接改写,模型随后从修改处接着生成。进阶操作包括选中一段文字整体重写(改写部分以蓝底标出)、右键或 Ctrl+点击候选替换当前 token 块、中键或 Alt+点击把候选复制到剪贴板。官网的标注要求一节写明:优先用「候选续写」,候选里没有合适的再双击手改,保存前删掉与标注无关的对话历史(官网)。
多模态输入走同一个输入框:图片、音频、视频可以直接粘贴进去,不过官网注明只有特定模型支持图像输入。官方推文称,这套界面支持在图像、音频、视频三种模态下标注 agent 轨迹。
数据为什么仍算 on-policy:绝大多数 token 是模型自己生成的
论文解释这套流程为什么能保住 on-policy:最终回答里绝大多数 token 仍由模型自己生成,数据因此「在很大程度上保留了模型的采样分布」,适合构建 on-policy 的 SFT(监督微调)数据与偏好数据。摘要称,标注过程中记录下的每一处 token 级纠错自带「精确位置」,并「天然配对正负样本」——官方推文同样把这列为核心卖点:一个工作流同时产出 SFT 和偏好两类数据。配套的 仓库负责把 onPanda 标注数据解析成 SFT 数据与 token 级偏好数据。
保真度有专门的度量。论文表 1 的说明写明:PPL(困惑度)由 rollout 模型(生成待标注回答的模型)打分,ΔPPL 是相对重采样基线(1.171)的相对变化,绝对值越小,说明标注产出的数据越贴近模型自己的分布()。
330 秒对 681 秒:21 个 prompt 上的三种标注范式
论文表 1 给出了 52% 的具体算法。这项对照研究在 21 个 prompt 上比较三种标注范式:Argilla 的四选一排序、POTATO 的人工后编辑、onPanda 的 token 级纠错。onPanda 的中位标注耗时为 330 秒(均值 516 秒),POTATO 为 681 秒(均值 711 秒),中位数较 POTATO 低约 52%。
质量指标上,LLM 评审的两两对比中 onPanda 胜率 66.7%,高于 POTATO 的 54.8% 和 Argilla 的 28.6%;每个 prompt 平均可推导 7.43 个偏好对,多于 Argilla 的 6.00 与 POTATO 的 0.95;NASA-TLX 负荷量表(作者改编的 0~10 分制,越低越好)为 3.1,同样低于两者。POTATO 的 ΔPPL 达 +36.31%,onPanda 为 +0.86%,后者就是推文所称 ΔPPL<1% 的出处。
Argilla 的 ΔPPL 是 −0.83%,绝对值比 onPanda 的 +0.86% 还小,按论文口径其 on-policy 保真度甚至略高;但 Argilla 在 21 个 prompt 里只有 11 个产出有效 SFT 回答,而 onPanda 与 POTATO 均为 21/21。
研究的边界也写在摘要里:作者自述这是一项小规模对照研究,21 个 prompt 的规模、由作者团队开展,表中所有效率与质量数字都以这一实验为限。
同一个浏览器标签页,也是模型检查台
官方推文把另一半用途概括为模型检查与调试:查看每个 token 的概率和 top-k 候选、逐 token 操控解码、直接在浏览器里尝试 SVG 生成、网页开发和 agent 任务。GitHub README 写得更细:模型输出的每一部分都可以编辑,包括推理过程和 tool_calls;可以改动 prompt、给 tool call 开分支,用树状结构记录分支历史——官方称这让 onPanda 同样适用于模型检查和 prompt 工程。
内置的 browser-agent 无需安装即可在用户浏览器里运行,把浏览器本身当作 harness(agent 的执行环境):执行 JavaScript、检索信息、操作界面、多媒体输入输出、访问本地文件、保持持久记忆。它还能外接 Claude Code、Codex、OpenCode 等主流 harness,查看并比较它们的工具集、系统提示词、skills 与记忆机制;组织下另有 harness_to_mcp 仓库,把 harness 内部工具转成标准 MCP(Model Context Protocol,模型上下文协议)服务器,兼容 Claude Code、Codex、OpenClaw 等。
部署方面,主仓库要求 Node.js 和 npm,一条 npx -y @on-panda/serve --port 8080 --web_config web_config.json5 就能起本地服务,LLM API 配置可以预设,也可以在界面里现加,存放在浏览器本地存储中。
官宣之前四天,作者先发了帖:数据集和基准一并交出
UTC 时间 9 月 18 日, 发帖介绍:「我花了两年构建这个交互工具,让你在 token 层面操控 LLM 和 agent。」该账号显示名为 Lei Yang,X 简介写明身份是 StepFun 的机器学习研究员;论文作者列表的第一位也是 Lei Yang。9 月 21 日论文提交 arXiv;9 月 22 日,上线并挂出 StepFun 组织标签;同日,官方账号发帖官宣。截至发稿(北京时间 9 月 23 日上午),官宣推文获 146 个赞、15 次转发、78 个收藏,浏览 6,602 次;HF 论文页收获 27 个赞。
论文由 12 位作者署名,研究页把第一机构标为 StepFun、第二机构标为厦门大学。随论文一并交出的还有数据:摘要称发布了用 onPanda 标注的数据集 Panda-CVL 和一个 token 级纠错基准,研究页的贡献介绍称之为「多模态 Panda-CVL 数据集」,并列出 Panda-CVL-train、Panda-CVL-test 与 Panda-MultiRef-21 三个入口,最后一个的说明是「用于研究 token 级纠错分布的小型数据集」,可以直接浏览并在线试标注。
这些数据集与基准是外部研究者眼下能直接上手的检验材料;在线工具开在浏览器里,打开网页就能试。