AREX Feed Article
OpenRouter 上线 Cost per Session 数据层:Kimi K3 单次 50 轮以上会话 4.56 美元
模型聚合平台 在 8 月 17 日宣布,其平台与 API 新增一个数据层 Cost per Session(每会话成本),用"完成一次会话实际花多少钱"评估模型的真实使用成本,并同步开放配套数据集与查询接口。官方给出的示例是编码代理 harness Hermes Agent 上的模型对比:一次 50 轮以上的会话,Kimi K3 的中位成本为 4.56 美元,同口径下 Claude Fable 5 为 27.04 美元,Claude Opus 5 为 13.73 美元,GPT-5.6 Sol 为 9.86 美元。
OpenRouter 称,这个指标比每 token 价格更有用,因为后者没有把模型的 token 效率算进去。数据覆盖各主要 harness 观察到的全市场任务,取 30 天中位数,以 CC BY 4.0 许可发布;用户可直接查询 Dataset API 自行绘图,也可在排名页查看现成榜单。
Kimi K3 在 Hermes 上:50 轮以上会话 4.56 美元,Fable 5 要 27.04 美元
配了一张排名页 Cost per session 板块的图表,当前选中 Hermes Agent 标签,另设 Claude Code、Kilo Code、Codex 三个 harness 标签。图上按"最高到最低成本"列出 13 个模型,每个模型按会话长度分四档着色:1 轮、2–9 轮、10–49 轮、50 轮以上。Kimi K3 四档中位成本为 0.054、0.17、0.83、4.56 美元;Claude Fable 5 为 0.37、0.93、4.38、27.04 美元;Claude Opus 5 为 0.18、0.44、2.27、13.73 美元;GPT-5.6 Sol 为 0.10、0.36、1.57、9.86 美元。
在 50 轮以上这一档,Kimi K3 是图中 13 个模型里最便宜的,Claude Sonnet 5(4.79 美元)紧随其后。但它并非每档都最低:2–9 轮档 Claude Sonnet 5 的 0.14 美元低于 Kimi K3 的 0.17 美元,10–49 轮档 Sonnet 5 的 0.79 美元也略低于 0.83 美元。推文所称 Sol、Fable 与 Opus 系列,对应图中的 GPT-5.6 Sol(含 Sol Pro)、Claude Fable 5 与 Claude Opus 4.6 至 5;推文里的 Hermes 指的就是这个 Hermes Agent 标签页。
OpenRouter 在推文中把新指标定义为"评估模型真实使用成本的方式,横跨任务与 harness 两个维度"("a way of assessing the real-world cost of using models, across tasks and harnesses")。其自称榜单基于基准测试和"数百万用户通过 OpenRouter 使用模型的真实数据"。
每 token 价格没算进去的账:token 效率
OpenRouter 在中解释了这个指标相对每 token 价格的优势:"它比每 token 价格更有用,因为每 token 价格没有纳入模型在 token 使用上有多高效。"("It's more useful than price per token, which doesn't incorporate how token-efficient a model is.")
机制上,一次会话的账单等于单价乘以实际消耗的 token 数。两个模型每百万 token 报价相同,完成任务时话多的那个,单次会话账单更高;反过来,token 单价贵但一次任务消耗少的模型,实际花费可能更低。Hermes 图正好展示了这层差距:Kimi K3 与 Claude Fable 5 在四个会话长度档上的成本都相差 5 倍以上。
数据的口径在同一条推文里写明:"Cost per session 涵盖各主要 harness 视角下的全市场任务,取 30 天中位数。"("Cost per session encompasses all tasks across the market, as seen by each major harness, by looking at medians across 30 days.")
30 天中位数、每周刷新:数据口径与隐私边界
对口径做了更细的规定。GET /datasets/session-cost 每周刷新,每个快照覆盖 30 天窗口(meta 中的 window_days 为 30);会话成本取"单次会话美元支出的中位数";会话从不跨应用合并("Sessions are never pooled across apps");聚合过程做隐私保护,不暴露用户 ID(clerk_user_id),也不暴露单条会话记录。
查询支持三个过滤维度:app_slug(harness,hermes-agent 即 Hermes Agent)、model、turn_range(会话轮数区间,分 1 轮、2–9 轮、10–49 轮、50 轮以上四档)。文档给出的示例单元是:Hermes Agent 上 Claude Opus 4.8 的 10–49 轮会话,中位成本 1.74 美元。文档还注明,仅按 model 过滤即可跨 harness 比较同一模型的成本。
Pareto 前沿图、Dataset API 与 CC BY 4.0
的另一张配图是"成本-智能 Pareto 前沿"散点图:横轴为单次编码代理会话的中位成本(美元,对数刻度),纵轴为 Artificial Analysis Intelligence Index,虚线标出前沿。图上可见 DeepSeek V4 Flash(0.03 美元)、Kimi K3(0.89 美元)、GPT-5.6 Sol(1.68 美元)、Claude Opus 5(2.00 美元)、Claude Fable 5(3.46 美元)等点位,左上方标出"更聪明且更便宜"区域。
"直接查询我们的 Dataset API,就能做出这样的图。"OpenRouter 在里说,并给出两个入口:排名页和接口文档。排名页的 Cost per session 板块写着"一次编码代理会话通常花多少钱(付费用量),按会话长度分档",页面底部注明排名数据以 CC BY 4.0 授权;接口文档则写明,该数据集可以复用、再发布,包括商业用途,只需注明出处为 OpenRouter。
社区的第一反应:物有所值,也有人想对比 harness
推文发布后数小时内,多条回复都提到 Kimi K3。 写道:"Cost per session 是比较 AI 模型实用得多的方式,Kimi K3 的结果看起来尤其有意思。"("Cost per session is a much more practical way to compare AI models. Kimi K3's results look especially interesting.")更短:"Kimi K3 继续保持着很高的性价比。"
另一条回复盯上了图中最大的数字。:"花 27 美元跟聊天机器人吵 50 轮,太离谱了",对应的正是 Claude Fable 5 在 50 轮以上档的 27.04 美元。 则附了一张截图评论:"最近的 GPT 模型看起来贵了不少。"
也有改进诉求。:"你需要按 harness 来做,这样我可以挑一个样本模型,对比不同 harness 的成本效率。"接口文档已支持仅按 model 过滤、跨 harness 比较同一模型的成本。截至核验时(发布约 10 小时后),主推文获得 312 次点赞与约 4.7 万次浏览。