AREX Feed Article
Jev 发布两天内涌现六个开源复现:从 421M 参数的 Laya 到 MacBook 可跑的 Kev-0.5B
TypeSafe AI 的决策模型 Jev 发布两天内,开源社区已经交出六个复现。9 月 19 日,以「Here are 6 Clones of Jev in 2 days」为题逐一列出:Laya(421M 参数、ModernBERT-large 编码器)、DiffusionGemmaJev(vLLM PR)、Bespoke Nimble(Qwen3.5-9B 的 LoRA 微调)、SemIf/OpenJev(Qwen3.5 4B/35B 骨干)、Jevlike,以及能在 MacBook 上运行的 Kev-0.5B(Qwen2.5-0.5B)。日报同时提醒:这批社区基准数字全部由开发者自报、未经独立验证,这一模型类别至今没有标准基准。
Jev 是 TypeSafe 的商业决策模型:输入一段文本和一组候选选项,直接输出每个选项的概率,不逐字生成文本。TypeSafe 没有公布设计,模型只经闭源 API 提供——转引的第三方独立测量给出 0.042 美元/百万输入 token 的定价与 236~276 毫秒的 p50 延迟(即一半请求低于该值)。在 AINews 看来,正是「不开源」这一点引来了大量架构猜测、演示与争论,进一步推高了热度。
六个复现,六条不同的技术路线
来自 Bespoke Labs CEO Mahesh Sathiamoorthy(X 账号 ),9 月 18 日发布:在 Qwen3.5-9B 上做 LoRA(低秩适配)微调,用他称为「对比式数据整理」(contrastive data curation)的方法造训练数据——把几乎相同的两个样本改动一个关键事实、让正确答案随之翻转,以此逼出分辨力,校准隐式形成。数据全合成,覆盖 10 个类别、2,676 条样本;训练不从 Jev 蒸馏,Jev 只用来做评测。在他自建的评测集(curated eval)上,基座 Qwen3.5-9B 得 66%,Nimble 提到 90%,Jev 为 93%;他报告 H100 上延迟 100 毫秒,模型在 Apple Silicon 的 Mac 上也能本地运行,权重发布在 。仓库另有一句提醒:输出的概率只是归一化分数,「0.9 并不意味着 90% 的时候答对」。
干脆不用 LLM。AINews 概括其结构为 ModernBERT-large 编码器外加两层 transformer,用来给用户提供的选项打分;仓库口径是单次前向、T4 上单题延迟 32.8 毫秒、批量后每题 7.2 毫秒,权重按 Apache 2.0 开源。仓库附了一张与 Jev 的对照表:typed-decisions 工作流 0.766 对 0.727,AG News 0.950 对 0.910,DAIR Emotion 0.595 对 0.480;但在 Banking77(72/77 个标签)上 Jev 仍以 0.870 对 0.425 大幅领先。AINews 对 Laya 另有两句批评:作者自称用了 RLCD 训练却未给出论证,置信度基于熵而非校准。
扩散路线的代表是此前已进入报道视野的 DiffusionGemmaJev:Matt Mastracci()9 月 16 日向 vLLM 提交 ,为 DiffusionGemma 增加 Jev 式的结构化生成模式。他 9 月 17 日贴出实测结果:两者质量大致打平,Jev(API 形态)并不比跑在 DGX Spark 上的 DiffusionGemma 更快。
(曾用名 OpenJev)在 Qwen3.5 4B/35B 因果骨干的最后一个 token 上接一个自然语言推理(NLI)三分类器;其项目网站把「直读选项概率」与「逐 token 写出概率 JSON」两种做法放进同一个浏览器 demo,页面显示 Qwen3.5 4B 骨干在 102 行公开子集上与 Jev 公布值的同案一致率为 84.5%(Jev 公布值 88.3%),并写明「无人声称能匹敌 Jev」。
自称「研究起点」而非复制品:从零训练的字节级编码器加选项注意力(option-attention)头,每个候选转成一个查询向量(query)去读共享的上下文表示,然后被打分。作者的自测数字:合成菜单上 top-1 准确率(首选即正确)约 98%;在按目标划分、互不重叠的 Wikispeedia 下一步点击预测上得 26%(对照约 8%);八个选项时一次前向比让小解码器写 400 个 token 快约 100 倍。README 同时声明:没有证明与 Jev 同等质量,也没有复现 TypeSafe 的私有训练方法。
Kev-0.5B 出自 v0 与 Vercel AI SDK 的创建者 Jared Palmer(),9 月 18 日发布:在 Qwen2.5-0.5B 上加 LoRA 适配器和一个小读出头,API 与 TypeSafe 兼容,可在 MacBook Pro 上训练和运行,权重与模型卡放在 GitHub 仓库 。
自报的 90% 对自报的 93%:数字之间没有共同标尺
@madiator 在发布推文里写明了这组数字的边界:「没有衡量性能的标准基准,Nimble 在其他基准上完全可能比 Jev 差得多。但它应该比 Qwen 好。」同一期 AINews 日报里,@abacaj 被引述提出的正是这个问题:大量演示强调速度多过质量,而这个类别至今没有标准基准——AINews 称这个问题「问对了」。
各项目量 Jev 的尺子也不一样。Laya 的 README 注明,表中 Jev 数字全部来自第三方公布结果,「没有 TypeSafe API 访问权限,样本量与提示词均不一致,从未在本项目中实测 Jev」;openjev 网站用的是公开子集上的同案一致率;Nimble 用的是自己策展的评测集。三组成绩各自成立,放在一起并不可比。
被略过的数据面:TypeSafe 承认训练数据 100% 合成
AINews 把一条提醒放在盘点末尾:讨论大多围着架构转,「没有足够多的人谈论数据这一面——而数据已被承认是 100% 合成」。9 月 17 日,TypeSafe CEO Diogo Almeida(X 账号 )回复 @badlogicgames 时写道,公司「自视为一个数据研究实验室」,绝大部分研究花在造「真正通用的数据」上,「我们 100% 的数据都是合成的——但显然不是那种直接从 LLM 里吐出来的垃圾」,并称对方「可能是第一个在谈数据而不是架构的人」。
复现者面对同一个数据问题:训练数据要自己造。Nimble 的训练集同为全合成,作者把对比式负例当作关键一环;Jevlike 也从合成数据起家。
两天 3600 万观看之后:第一波落地在工作流
这波热度有参照系:AINews 记录 Jev 发布视频两天内获 3600 万次观看,OpenAI 的 Navier-Stokes 结果为 7400 万,Anthropic 的 Fable 5 为 5700 万;日报配图(见文首)显示 Jev 上线首日 24 小时在各模型的团队采用份额中居首。
按 AINews 的汇总,第一批有说服力的应用集中在浏览器与计算机操作工作流:@levie 演示 Jev 把 Box 的事件报告分类进升级路径;@ndrezn 用 LangChain 接 Jev 做浏览器操作,在 Wikipedia 游戏和「叠衣服」一类结构化任务上表现强劲;Cline 上线了一个给 Jev 配浏览器的插件;@hwchase17 称浏览器操作是他迄今见过最好的 Jev 应用。@ankrgyl 称 Jev 已作为评测模型接入 Braintrust,打分成本约为此前方案的 1/400。AINews 自己的综合判断是:这与其说是一个聊天机器人的故事,不如说是一个「工作流控制面」的故事。
反响同时沿着使用经验分裂。AINews 引述 @MParakhin 的观察:ChatGPT 之后入行的用户把它当作一种启示,前 GPT 时代的机器学习从业者则更困惑于这波热度。