AREX Feed Article
Diogo Almeida 发布 Jev 与 RLCD:自称快 20~200 倍、输出 token 免费
9 月 15 日 18:17(UTC;北京时间 9 月 16 日凌晨),Diogo Almeida(X 账号 )发帖宣布:他在隐身状态下工作两年,做出一种新的模型训练方法 RLCD 和一个新类型的前沿模型 Jev,并在当天发布。帖子给出的卖点包括快 20~200 倍、成本低 40~400 倍(输出 token 免费);他把 Jev 描述为 “frontier composable intelligence”(可组合的前沿智能)、为决策(decisions)优化,并称据他所知,这是通往基于 AI 的经济革命的最短路径。
产品细节在 TypeSafe 的里,署名是创始人 Diogo Almeida。文章把 Jev 定义为 TypeSafe 的第一个 “System One model”:输入非结构化状态,输出类型安全的结构化取值,每个答案都带概率和置信度(confidence)。他在同一串帖子里:“这些提升不是免费的:Jev 不能生成文本。”这些性能与成本数字均来自发布方,帖子没有给出对比基线,也没有给出评测方法;公司在博客里补充了评测做法,并自己标出了部分偏差。
图:TypeSafe 上“四组工作流平均:准确率与成本”的对比图,Jev(粉色)位于最左端。
Jev 的工作方式,与训练它的 RLCD
按公司的说法,Jev 接收一段“状态”(非结构化的文本或程序状态)和若干“类型化的问题”,返回结构化取值:Choice 从给定选项里选一个,附上选项、概率分布与置信度;Score 按量表打分,附上分数、各档位概率与置信度;Noul 判断一个说法是否为真,返回 0 到 1 的概率。三类问题可以在一次调用里混用,彼此独立、并行评估;文档称,增加问题几乎不改变响应时间。
RLCD 的全称是 Reinforcement Learning for Calibrated Decisions(面向校准决策的强化学习)。博客把它的目标与现有方法并列:RLHF 优化人类偏好,RLVR 优化可被程序验证的奖励,RLCD 优化的是“校准的决策”,也就是在 System One 任务上让答案带上“认识上诚实”的概率。Every 的给了一个日常解释:如果模型把 100 条客服消息标为 90% 可能“愤怒”,那么其中大约 90 条应当确实愤怒;代码据此分流,而不必把文本答案再解析回数字。
并行采样是这套设计的关键。博客称,模型在一次查询里生成全部输出,用并行替代逐 token 生成,效率极高,并且是硬件感知的设计;Almeida 在补充帖里用了一个类比:“用并行取代顺序计算,正是当年 Transformer 超越 RNN 的方式。”名字也有出处:System One 借自 Daniel Kahneman 的《思考,快与慢》,Jev 取自 William Stanley Jevons;公司预期,智能成本每下降一个数量级,就会解锁数量级更多的用例。
这些工作出自 TypeSafe,一家新的 AI 实验室。公司把 Diogo Almeida(CEO)、Erik Gafni(CTO)和 Sasha Sheng(COO)列为创始人,并称 Almeida 共同发明了 RLHF 与 InstructGPT;他帖子开篇写道,在“共同发明 ChatGPT”之后,他一直在问,为什么已经超越人类的聊天模型没有带来 AGI。Every 的文章写明,他在 OpenAI 期间共同撰写了 2022 年的 InstructGPT 论文。
数字的出处:公司自己的四组工作流评测
更细的数字在公司自己的材料里。官网首页写的是“193.6 倍更快、444.6 倍更便宜”,标注依据是 System One 任务的工作流;博客解释,这来自四组工作流评测的平均值,并称这些数字“处于真实世界收益的偏高区间”。博客的对比表里还有一行:对 System One 型查询、在同等前沿智能水平下,可以快 40~200 倍。
评测方法公布在上:他们把代码里的工作流当作正确的计算图,让所有模型跑同一套流程;参考答案取 GPT-6 Astra 与 Claude Fable 5.1 在最高思考档位下的平均;其他模型使用各家的默认推理设置。四组任务分别是安全事件、Agent 轨迹可观测性、发票处理和客服;网站称,读图时“越靠左上越好”,每个点是一个模型配置在四组任务上等权平均后的准确率、成本与时间。
图:TypeSafe 公布的四条工作流里最简单的一条(安全事件处置),展示“把判断拆成结构化问题、由代码决定分支”的用法。
公司自己列出了这套评测的偏差来源:评测通常在其西海岸的笔记本电脑上运行;四组工作流由自家模型能力团队的成员制作,“可能存在一些偏差”;参考答案偏向 OpenAI 与 Anthropic 的模型,公司称这可能同时低估自己和 DeepSeek 的模型;LLM 一侧要通过 TypeSafe 的封装层输出结构化决策,会比不输出概率时更慢、更贵。至于价格,博客写的是:“我们无法证明它没有被补贴”,长期可持续性要靠时间证明。
0% 错误率:来自结构匹配的保证
博客写道,Jev 放弃字符串生成,因此“针对结构化输出优化,不会幻觉”。博客的配图给出两类错误率:结构化输出错误率与工具调用错误率,Jev 均为 0%,被比较的模型从 0.58% 到 45.5% 不等。
图:TypeSafe 博客给出的两类错误率。按公司的说明,Jev 的 0% 来自 schema(预先定义的结构与类型)匹配的保证;公司同时把它标注为非实测数据。
公司主动标出了这组对比的边界:“我们的数字不是实测数据。schema 匹配是有保证的,因此我们可以放心地把 0% 放进图里。”LLM 一侧的数字来自 OpenRouter,公司称那里“几乎肯定存在偏差”,因为更复杂的查询可能被路由给更强的模型。公司还把另一项主张“没有类型错误”描述成:一个反例即可证伪,但它在数学上不可能发生。
Every 的试用:0.7 秒、777 次判断,和一处漏检
发布当天,Every 负责模型评测的 Mike Taylor 写了他自己做的一组测试。他把自己的 27 篇 Every 文章连同 10 篇刻意模仿“AI 风格”的对照文章一起交给 Jev,用 21 个问题扫描 AI 写作痕迹:不到 0.7 秒,Jev 返回 777 个判断,估算花费约四分之一美分。随后他又跑了 11 组实验,共 1,709 次判断,估算总成本不到 1 美分。
另一次对照测试来自 Every CEO Dan Shipper:他把同一套 4 项写作检查、12 段合成文本(6 段清晰、6 段故意植入问题)同时交给 Jev 和 Fable 5.1。Jev 每段中位耗时 0.35 秒,Fable 5.1 高强度模式为 8.83 秒,约快 25 倍;估算成本约为 Fable 的 1/580。准确率上,Jev 找出了 7 个植入缺陷中的 6 个,Fable 找出了全部 7 个;漏掉的那处是 Every 所说的“未被解释的动作”,Jev 三次运行都没抓到。
Taylor 的评价留有余地:文章说,Jev 确实标出了他写得更偏 AI 的篇目,但“它把事情做得有多好,仍然是一个开放问题”。
回复区的追问:校准、延迟与质疑
截至发稿时,原帖浏览量约 860 万,点赞约 3.3 万,转发约 3,100 次,引用帖约 2,200 条。回复区里, 说,模型返回置信度本身就能减少大量幻觉,因为系统可以据此决定把回答直接给用户、还是转给人工;他好奇的是“这些置信度是否真的准确、是否经过校准”。 则写道:让置信度反映真实准确率是有前景的方向;他想看开发者带着自己的任务和数据进来时,“这种校准能保持得如何”。
也有人关注速度。 写道,150 毫秒级别的延迟“能真正改变局面”,模型决策由此可以进入过去对 LLM 太延迟敏感的软件路径。怀疑同样存在: 回复说,这类“大得离谱的主张”人们一直在提却拿不出东西,“到目前为止有 100 个像你一样的案例,没有一个交付”。
早期访问、定价,与博客标出的边界
Jev 以早期访问方式开放;博客称会“尽快把开发者从等候名单里放出来”。配套文档与 Python、JavaScript SDK 已经上线。定价是每百万输入 token 0.042 美元、输出 token 免费,公司的说法是“便宜到不值得计量”;公司同时承认无法证明这一定价没有被补贴,并预期长期价格会下降。
博客也列出了几条边界:Jev 支持最多 255 个选项的高基数选择,这类选择分两阶段处理,偶尔会变慢;在“Wikiracing”演示里,它的提速幅度“往往比之前的演示小得多”;团队还用它做了一个每秒查询 10 次、约每小时 7 美元的 Doom 机器人。
发布材料最后向开发者征求反馈:他们想知道哪些决策值得自动化、Jev 在哪里有效、在哪里失败。发布当天,Every 的试用文章写道:在把 Jev 放进生产环境之前,Mike Taylor 想先做一次“更彻底的准确率检查”。