AREX Feed Article
Jared Palmer 开源 Kev 决策模型家族:自报域外 79.6%,低于 Jev 的 85.7%
北京时间 9 月 21 日凌晨(UTC 9 月 20 日 16:49),Cognition 工程副总裁、v0 与 AI SDK 的作者 在自己的 X 账号上,Kev-0.6B、Kev-4B、Kev-8B 三档开源决策模型上线,代码、权重与评测发布在 GitHub 仓库 ,采用 Apache-2.0 许可。据他称,这批模型基于 Qwen3,沿用此前那套 LoRA 适配器加指针头的做法,只是规模更大;在 Kev 从未训练过的数据上,Kev-8B 为 79.6%,TypeSafe 的托管参考模型 Jev 为 85.7%。
Kev 是受 Jev 启发的小型决策模型:输入一段文本和几个带类型的问题,一次前向传播直接给出各选项的概率分布,不生成文字;接口对齐 TypeSafe 的 System One,后者的 Python SDK 改一处 base_url 就能连上本地服务。这个项目此前发布过基于 Qwen2.5-0.5B 的 0.5B 原型,这次是把同一套做法推到更大的底座上。
单张 H100 训练 Kev-4B 约 40 分钟,权重与评测公开
按发布帖给出的规格:Kev-4B 在单张 H100 上训练约 40 分钟,Kev-8B 约 83 分钟;Kev-4B 可在 32 GB Mac 上以 bf16 精度(一种 16 位浮点格式)服务,在 H100 上跑五个问题约 40 毫秒;重复文档命中 KV 缓存(键值缓存)后可快 2~2.5 倍。
做法延续此前的路线:底座权重冻结,只训练一个 rank-16 的低秩适配器(LoRA)和一个小型指针头(pointer head);问题分是非(noul)、多选(choice)、评分(score)三类,答案以概率而非文字给出。训练数据包含 1 万条来自十个公开数据集的示例、896 条生成的策略示例和 1,680 条规则结构示例,训练两轮。
权重同时发布在 Hugging Face 的 与 GitHub 的 里(压缩包附 SHA-256 校验);仓库中另有训练代码、冻结的评测套件(数据版本与校验和固定)和各档模型的模型卡。仓库 9 月 17 日创建,GitHub 星标已超过 1,000 个。
对比跑在 764 条冻结的域外题上
这两组数字的对比基准,是仓库冻结的域外套件 transfer-v4:764 条记录,取自 QNLI、SciQ、PAWS、MMLU、Emotion、TweetEval 六个训练时未用过的数据集,外加专门留出的策略规则题,所有模型跑的是同一批题。发布帖给出的 79.6% 是 Kev-8B 的域外开发集读数;同一张表格里,它的锁定测试读数是 78.0%。Jev 在表里只有两个读数(域外开发集 85.7%、同分布开发集 84.5%),锁定测试一栏为空。
表下的说明写着:不清楚 Jev 是用哪些数据训练的,因此这不是两种架构的受控比较。这些读数都出自项目自己冻结的评测套件,仓库称每个数字都可以用带校验和的套件复现。
底座已迁到 Qwen3.5:锁定测试分更高,Apple 芯片上更慢
发布帖里写的是 Qwen3 底座;而截至发稿,仓库描述已经改成“基于 Qwen3.5、可自行训练与运行的小型 Jev-like 决策模型家族”。release 说明里标注了一条 2026-09-20 的更新:家族已迁移到 Qwen3.5 底座,训练数据与配方不变;家族型号随之改为 Kev-0.8B、Kev-4B、Kev-9B,此前宣布的 Qwen3 检查点仍留在 Hugging Face Hub 上、也附在这次 release 里,但不再继续开发。
更新说明给出的域外锁定测试成绩:Kev-9B 83.7%(前代 Kev-8B 为 78.0%)、Kev-4B 83.2%(此前 80.6%)、Kev-0.8B 66.8%(此前 64.2%),Brier 分数(越低越好)同步下降。由于这一轮只换了底座,仓库称之为受控比较:三档新模型在域外锁定测试上都高于各自的 Qwen3 前代。即便如此,Kev-9B 在域外开发集上仍是 81.2%,落后 Jev 的 85.7% 约 4.5 个百分点。
代价出现在 Apple 芯片上:Qwen3.5 混入了 Gated DeltaNet 层(一种循环结构),没有对应的快速内核,PyTorch 只能跑参考实现。仓库自己的实测(M5、bf16、五问、约 230 token 输入):Kev-4B 要 779 毫秒,Qwen3 版只要 174 毫秒;Kev-9B 约 2 秒,前代 Kev-8B 约 300 毫秒。仓库的建议是:要在 Mac 上服务且在意延迟,暂时用 Qwen3 版本;Qwen3.5 的 MLX 后端是下一个计划改动。另外,Qwen3.5 版本需要 transformers 5.17 及以上;在 CUDA 上装好 flash-linear-attention 后,H100 上五问仍是数十毫秒。
仓库自列的限制:校准、知识题与顺序敏感
在这些分数之外,仓库的 Limitations 一节给出了更细的边界:新数据源上的概率校准并不好,Kev-4B 有 8.2% 的题把至少 0.9 的概率给了错误答案,Kev-9B 为 7.5%。知识类基准 MMLU 上差距同样明显,74% 对 Jev 的 90%。微调还会让底座在某些题目上变差,例如策略题里的期限日期算术:未训练的 Qwen3.5-9B 底座得 0.82,Kev-9B 反而只有 0.72。选项顺序仍可能改变答案,问题之间的隔离解决不了这一点。仓库给使用者的建议是:在选定概率阈值之前,先用自己的数据测一遍。