AREX Feed Article
TypeSafe AI 决策模型 Jev 上线 OpenRouter 公测:每百万输入 token 0.042 美元、输出免费,Google Gemma 官方跟进
北京时间 2026 年 9 月 18 日上午 8 时 32 分(UTC 同日 00:32),聚合 400 多个模型的平台 OpenRouter 宣布:TypeSafe AI 的模型 Jev 上线其平台,进入 beta。OpenRouter 在官宣线程里这样定义它:Jev 是一种「System One」模型,「不生成文本,而是接收你的应用状态加一个类型化问题,返回附带概率的类型化决策。没有 JSON 提示、没有解析层、也没有需要校验的东西」。()
本报道检索时,已在 OpenRouter 在线:发布日期标注为 2026 年 9 月 18 日,定价每百万输入 token 0.042 美元、输出 0 美元,上下文窗口 32K,最佳供应商的 P50(中位数)延迟 0.27 秒。页面将 Jev 介绍为「来自 TypeSafe 的结构化决策模型,其第一个 System One 模型」,适用于路由、分类等「快速、可预测的答案比生成散文更重要」的应用内决策点。
三天前的 9 月 15 日,TypeSafe AI 结束隐身,宣布获得 DCVC 领投的 4000 万美元种子轮;公司由前 OpenAI 研究员、RLHF/ChatGPT 共同发明人 Diogo Almeida 与 Erik Gafni、Sasha Sheng 创立,Jev 当时仅以早期访问名义向部分开发者开放,需在 typesafe.ai 排等候名单。()
从等候名单到公测:三类问题、适用任务与 20 美元征集
OpenRouter 在官宣线程中给出了调用形态。三类问题:是/否题,以概率形式返回答案;多选题,从调用方定义的选项集中选一;量表题,在自定义尺度上打分——帖子举的例子分别是「这个客户是否即将流失」「这五个队列中该进哪一个」「紧急程度按 1~5 打分」。()TypeSafe 技术博客补充了一个具体参数:Jev 单次最多支持 255 个选项的基数(cardinality)。()
置信度随每个答案一起返回:问一个工单属于哪个队列,得到「billing 84%、technical 16%」而不只是「billing」;同一次调用还能对同一输入提出多个问题。()
同一条目还给出速度与倍数:端到端响应 70~500 毫秒;「在 TypeSafe 公布的工作流上,比把同一逻辑交给 LLM 运行至多快 190 倍、便宜 440 倍」。OpenRouter 称 Jev 为「软件每天数百万次的决策」而设计,定价也按此调校。()TypeSafe 博客把输出定价写作「FREE(too cheap to meter,便宜到无需计量)」,并换算为每十亿 token 42 美元。()
OpenRouter 列出的适用任务:把客服工单路由到正确的团队、判断消息是否违反内容规则、标记疑似欺诈的注册、为 agent 选定下一步、决定工作流是否暂停交给人处理。()它同时发起征集:在 OpenRouter 上用 Jev 构建项目并 @jjacky,「最有创意、最有趣的 10 个项目」各得 20 美元额度。()
OpenRouter 的示例帖:2.3 秒打完一批工单标签,八个 recipes 附代码上线
9 月 18 日 21:31(UTC,北京时间 19 日凌晨),OpenRouter 再发一帖解释「什么是决策模型」:Jev 回答是/否与多选题、附置信度分数,「软件开发很大程度是一连串决策」,做这类决策比 LLM 便宜且快 10 倍。()
四个示范场景的数字均出自 OpenRouter 自己的演示。客服打标:给消息贴「取消?退款?愤怒?Bug 报告?升级?」等标签,Jev 2.3 秒完成一批、成本约十分之一美分,聊天 LLM 处理同批用了 20 秒();agent 工具调用:Jev 能以零头级的成本和时间挑出该调的工具();X 信息流过滤:每条回复都是一道多选题——真问题、暴论(hot take)、推广、激怒式钓鱼(rage bait)还是杠精(troll)——边刷边实时过滤,成本以美分计();会议记录:逐段对话实时判断是否在跟助手说话、对方是否说完、有无具体请求、有无待办动作()。帖子的结论是:把问题拆成小的是/否与多选决策,决策模型就快到、便宜到可以跑在每条消息、每次工具调用、每一句话上。()
mini apps(小型应用)已可独立核验: 在线,八个 recipes(附代码的示例程序)均为「通过 OpenRouter 实时跑在 TypeSafe 的 Jev 上,每个都是代码加结果」。客服消息分诊让 95 条消息各过 5 个是否问题,约 1 秒完成;agent 操作审批在同一个请求里对 24 次工具调用各做 4 项检查,有风险的步骤停下交人工;字段抽取由 Jev 从文本中找到的候选里挑值,页面称其因此「无法编造一个值」;「提示转问题」把一段提示交给 Claude 改写成 Jev 问题,再对每一行执行;信息流过滤器接受自然语言写的规则,在一个请求内标出所有匹配帖子;语音助手门控由 Jev 逐句判断是否在跟它说话、该做什么;追逐游戏里「你跑、Jev 追」,追逐者每一步都是一个请求,每秒 2~3 次;结账表单在每次点击后问 8 个问题并按答案作出反应。()
Google Gemma 官方跟进:「DiffusionGemma as Jev」
9 月 18 日 22:04(UTC),Google Gemma 官方账号发帖推介「DiffusionGemma as Jev」,称其「展示了非自回归架构的力量」。按帖子的说法,Jev 展示了快速决策模型的价值,而把 DiffusionGemma 放进这一范式,则用 canvas diffusion(画布扩散)在单次并行处理中评估结构化选择:单步去噪、而非逐 token 的自回归生成,在一台 DGX Spark 上约 0.2 秒;全双向注意力让每个选项同时关注完整上下文,「产生校准良好的决策分布」;再继承 Gemma 4 的空间视觉能力,处理复杂的视觉与文本决策。()
帖子链接的原始工件之一,是开发者 mmastrac 9 月 16 日提交到开源推理框架 vLLM 的 ,标题为「structured generation mode for DiffusionGemma model (Jev-like)」。该 PR 为 DiffusionGemma 增加 diffusion_seed_canvas、diffusion_max_steps、diffusion_read_only 三个采样参数:只读请求在达到步数上限时即提交 argmax(取概率最高项)画布,单步请求由此返回画布每个位置一次前向计算的 logprobs(对数概率值)。页面显示改动涉及 17 个文件、新增 2,892 行、删除 132 行,已有 26 条评论与 3 次评审记录;9 月 17 日,作者向 vLLM 的代码维护者发出评审邀请。与只能通过 API 按量计费调用的 Jev 不同,这条路线把同类结构化决策能力放进可自托管的服务框架。
开发者的四个用法与平台 CEO 的转发评价
9 月 17 日 21:09(UTC),比 OpenRouter 官宣早约三个半小时,开发者账号 @omarsar0(简介自述为 DAIR.AI 创始人)发帖列出「现在就可以用 Jev 尝试的四件事」:LLM-as-a-Judge(以 LLM 充当评审)评估;为 agent harness(智能体编排框架)做路由;借助 SOTA 分类能力实现更聪明的 subagent(子智能体)创建、以扩展 agent 编排;增强以结构化输出为关键的动态 harness 生成。他称前三项「在成本和效率上带来极高 ROI」,说自己正把 Jev 用作其 meta harness 的更聪明路由器,还看到改进 tool calling(工具调用)与 agent 上下文工程(context engineering)方面的应用;第四项是正在测试的新方向。「总体而言,这像是改进你的 agent 的一个重要原语」,如有兴趣将在未来几天分享完整指南。()
9 月 18 日,OpenRouter 联合创始人兼 CEO Alex Atallah 两次转发评价 Jev:一条称它是「第一个真正为低与中等熵任务做优化的模型」,另一条称「Jev 是一个高效做决策的模型……这对 AI 是一次巨大的开发者体验(devex)利好」。(、)
190 倍与 440 倍仍出自厂商一方
OpenRouter 转述的 190 倍、440 倍来自 TypeSafe 自己的工作流评测(workflow evals)。TypeSafe 技术博客给出更精确的 193.6 倍、444.6 倍,同时交代了口径:评测不优化真值分类(ground truth),参考答案取 GPT-6 Astra 与 Fable 5.1 预测的平均值;工作流由公司模型能力团队成员编写,博客承认「可能存在偏差」;评测通常「从我们西海岸的笔记本上运行」;作为对照的 LLM 使用 TypeSafe 的 System One 包装器输出带概率的结构化决策,博客称这比「不给概率」的取法更慢也更贵,并预期自家数字「处于真实世界收益的高端」。()
「0% 幻觉」同样是定义性结果:博客明言,由于可能的输出与结构事先定义、模式匹配有保证,「我们的数字不是经验性的」。()在公测上线前两天,软件工程师 Mehran(@mehran_go)于 9 月 16 日发表十点质疑:Jev 实质是「一次前向传播中的分类器」,分类器做这件事已有十年,新的只是训练目标(以校准替代偏好)与包装;194 倍、445 倍的基线是「平均思考 8 秒的 GPT-6 Astra 与 Claude Fable」,公平的基线应是微调的 0.5B 小分类器或直接读开源模型的 logprobs,「那个对比没有发布」;没有 F1、没有真值基准、没有校准曲线;权重、参数规模与端侧部署均未公开。他同时承认,把校准作为训练目标的 RLCD(Reinforcement Learning for Calibrated Decisions,校准决策强化学习)是个好想法,便宜而快速的 judge(评审模型)有用。这条帖子传播有限,本报道检索时为 5 个赞、512 次浏览。()
截至发稿,本报道能核实的准确率与校准数据仍全部来自 TypeSafe 一方及其转述。Mehran 在帖子结尾留下的检验标准是:公布相对廉价基线的 accuracy(准确率)与 ECE(期望校准误差),并用生产结果重新校准。
参考链接
- OpenRouter 官宣 Jev 上线(推文):
- OpenRouter Jev 1.13 模型页:
- Business Wire:TypeSafe AI Emerges From Stealth With $40M in Funding:
- OpenRouter 三类问题形态(推文):
- TypeSafe 技术博客「Introducing System One Models and Jev」:
- OpenRouter 置信度示例(推文):
- OpenRouter 定价与速度(推文):
- OpenRouter 适用任务(推文):
- OpenRouter 20 美元征集(推文):
- OpenRouter「What is a decision model?」(推文):
- OpenRouter 客服打标示例(推文):
- OpenRouter agent 工具调用示例(推文):
- OpenRouter X 信息流过滤示例(推文):
- OpenRouter 会议记录示例(推文):
- OpenRouter 拆解决策结论(推文):
- OpenRouter mini apps 上架 Labs(推文):
- OpenRouter Jev Lab 页面:
- Google Gemma「DiffusionGemma as Jev」(推文):
- vLLM PR #57250:
- @omarsar0「Things to try with Jev right now」(推文):
- OpenRouter 转发 Alex Atallah 评价(推文):
- Alex Atallah X 账号简介:
- @mehran_go 十点质疑(推文):