AREX Feed Article
模型实验室在卷参数,Not Diamond 在卷路由:让 Claude Code 自动省 39%,质量不降
"最强模型"是个每周过期的称号
过去六个月,AI 编码工具的推理账单在以肉眼可见的速度膨胀。个人开发者月花数百美元,千人工程团队的 API 支出动辄六位数。所有人面对同一个默认配置:买最强的模型,用它处理一切。重命名变量、修一行 typo、生成 README、排查复杂并发 bug,统统交给同一个大脑。
细想荒谬,但这就是现状。工厂不会让总工程师去拧每一颗螺丝。然而在 AI 编程的世界里,选择"所有事情都用 Opus 4.8 或者 Fable 5 Max"不仅被默许,甚至被视为"舍得花钱""质量优先"的标志。
Not Diamond 的创始人 Tomas Hernando Kofman 从 2023 年底就看到了这道裂缝。彼时模型生态远没有今天拥挤,GPT-3.5 和 GPT-4 二分天下,路由选择看上去像锦上添花的小优化,远非必需品。三年后的今天,Claude、DeepSeek、GLM、GPT、Gemini 轮番登顶,"最强模型"这个头衔的保质期以周为单位计算。
Tomas 和团队用了三年时间回答一个问题:当模型足够多、推理成本足够高、决策质量足够重要时,路由层不是省钱工具,而是基础设施。今天发布的 Not Diamond Code,是这份赌注的兑现。
39% 成本直降,质量持平 Opus 4.8 Xhigh
Not Diamond Code 是一个专为长链路编码 Agent 设计的智能模型路由器。它集成在任何 gateway 或 agent harness 中,包括 Claude Code,在编码会话的每一步自动选择最合适的模型和推理强度,在不影响任务完成质量的前提下,将推理成本降低 20% 至 65%。
评估跑在 Claude Code 上,路由池覆盖 Haiku 4.5、Sonnet 4.6 和 Opus 4.8 在不同推理强度下的配置。在 SWE-PolyBench-Verified 基准上,Not Diamond Code 以接近 Opus 4.8 Xhigh 的任务完成率,实现 39% 的成本降低。在 LongCodeQA(一个评估真实仓库中长程代码理解能力的基准,最高 100 万 token 上下文)上,成本降幅达到 61%。
更有信息量的数据来自多模型混合路由实验。当 Not Diamond 的路由池从 Anthropic 全家桶扩展到加入 GLM 5.2 和 DeepSeek V4 Flash 后,SWE-PolyBench 的任务完成率提升了 3.6%,成本节省从 39% 扩大到 66%。多加模型源,不是多了选择困难,是多了优化空间。
路由的不是模型,是整个 Session
Not Diamond Code 与上一代模型路由器最根本的差异,在于把优化目标从"下一个请求"升级到了"整个会话"。
传统的 request 级路由器按每次独立调用决策:当前这个 prompt 最便宜能交给谁就交给谁。这种策略在编码 Agent 的长链路场景下制造了两个隐性成本。第一,切换到更便宜的模型会打断 KV cache,导致后续请求需重新读取整个上下文。调用方以为省下了模型差价,实际为 cache miss 支付了更高账单。第二,一个便宜但不够聪明的模型在中间步骤犯的错,会迫使后续步骤反复修补甚至回滚,而修复的成本远高于一开始就用对模型的成本。
Not Diamond Code 在每一步决策时同时考虑当前和历史会话状态、消息和 token 数量、任务复杂度、隐式开发者反馈信号以及 KV cache 状态。系统预测每个候选模型和推理强度在整个剩余轨迹上的未来成本和收益,然后选择能最大化全局会话质量与成本平衡的选项。
Tomas 解释了 cache-aware 路由的关键决策逻辑:"如果 cache 是热的,我们可能继续用一个更贵的模型来保住 cache,即使当前这一步有更便宜的模型可以处理。反过来,如果上下文窗口利用率低或 cache 是冷的,我们就会优先路由经济性而非 cache 经济性。"
这意味着 Not Diamond Code 不是在"每步都选最便宜模型"和"全程用最强模型"之间取一个简单折衷。它在精确建模每一步切换的全局代价(包括 cache 损失、下游影响和任务成功率)之后,做出一个全局最优的选择。
在隐私方面,Not Diamond Code 通过一个本地代理(local proxy)运行在开发者的编码 harness 旁边。代理只提取匿名化的衍生元数据(不读取 agent 的输入、输出或代码负载),发送到 Not Diamond 的云端优化服务。后者返回模型和推理强度建议,实际的 API 请求仍然通过团队现有的 gateway 或 provider 直连执行。
Tomas 在回复一位关心隐私的开发者时直截了当地说:"隐私是一件好事。"这个架构使 Not Diamond 成为目前唯一既不受 harness 绑定也不受 gateway 绑定的智能路由器。代码和 prompt 永远不会离开开发者的本地机器,但路由决策可以调用云端算力持续优化。
系统还会根据每个开发者的隐式反馈信号持续调整路由策略,逐渐个性化地适配每个开发者的工作流和偏好。换句话说,用得越久,它越懂你的代码习惯。
从 2023 年就在等这一刻的团队
Not Diamond 的故事始于 2023 年 12 月,他们发布了全球第一个开源智能模型路由器。彼时的任务空间简单得多:在 GPT-3.5 和 GPT-4 之间做选择,优化维度只有成本和正确率。
Tomas Hernando Kofman,Not Diamond 的创始人兼 CEO,从第一天起就押注一个判断:一个拥有多样化模型的市场比所有人共用同一个巨型模型更高效、更便宜、也更健康。智能路由层推动模型供应商的多样性竞争,把议价权从实验室转移到消费者手中,同时降低 AI 的生态成本。
联合创始人 Jeffrey Akiki 在今日的推文中回顾:"我们在 2023 年发布全球首个开源智能模型路由器时,它只在 GPT-3.5 和 GPT-4 之间做选择,优化维度很少。编码 Agent 让路由问题变得严重得多。每个模型决策的影响在长链路会话中不断累积,影响下游工作、cache 状态、总成本和跨推理强度及供应商的输出质量。"
目前 Not Diamond Code 处于早期访问阶段,客户包括顶尖创业公司和财富 500 强工程团队。公司已通过 SOC 2 合规和 ISO 27001 认证。Tomas 透露,最大的痛点出现在拥有 1000 名以上工程师的组织中:当一个团队有数百名开发者大量使用编码 Agent 时,模型选择的效率问题和成本问题同时被放大到不可忽视的量级。
在早期访问数据中,Not Diamond 观测到超过 20% 的推理成本节省,同时开发者满意度指标相比纯 Opus 4.8 配置提升了 33%。用户省钱的同时,用起来反而更顺手。
Router Wars 正式开打
Not Diamond Code 的发布让模型路由这个细分赛道瞬间升温。
这个赛道上各有各的打法。Factory 偏 IDE 内嵌体验,把路由做进编辑器。OpenRouter 偏 API 网关层的统一接入和计量计费。Cursor 在自有编码 Agent 内部做了隐式路由。Not Diamond 的牌是 "harness-agnostic":不绑定你的工具链,也不绑定你的模型供应商,以独立中间件的形式插进现有工作流。
AI 工程师 Ofek Shaked(@VibeCoderOfek)评论道:"按步骤难度在 harness 内部做路由才是早就该来的东西。大多数人还在为循环中间那些无聊的步骤付 Opus 的价格。"
另一位开发者 Andrew(@andr3w,17.9 万粉丝)提供了更深入的分析框架:"如果你只路由到最便宜的模型,它可能陷入循环、产出劣质代码,然后一个更强的模型要花更多步骤来修复,总成本反而更高。优化目标应该是被 merge 的代码,而不只是 token 消耗。"
Santiago(@svpino,45.3 万粉丝,AI/ML 工程教育者)将 Not Diamond Code 与一种常见但低效的路由策略做了对比:"调用最便宜的模型是错误的策略。你应该优化的是完成任务的总成本。在优化 Agent 时,你需要考虑推理强度、重试、cache 状态、每个路由决策的下游影响。为此,你需要在完整会话上做路由决策,而不是一次一个请求。"
McKay Wrigley(22.8 万粉丝的 AI 创业者和教育者)给出了更大的判断:"看好模型路由器。同等性能更低成本是明牌。但真正的巨大收益来自通过融合多个锯齿状模型来创造更'平滑'的智能。模型融合的时代开始了。"
X 上的 @iAmHenryMascot 用四个词总结了当下的战局:"Router wars... continue. Factory. Cursor. Not Diamond Code."
路由层吃掉一切,历史已经演过一次
Shirish(@shiri_shh,4.3 万粉丝)在评述中做了一个精确的历史类比:"2010 年,广告不再由人工购买。每一次展示在毫秒内自动路由到最优出价方。推理正在经历完全相同的时刻。路由层永远是最后的赢家。"
这个类比一击即中。路由层在几乎所有技术体系成熟的过程中最终都成为了基础设施:网络层有 BGP,CDN 有智能调度,广告有实时竞价程序化购买。AI 推理不会例外。当模型数量足够多、推理成本足够高、决策质量足够重要时,手动选择模型就和手动配置路由表一样不可持续。
Not Diamond Code 今天的发布,意义可能比它自己宣称的"省 20-65% 成本"更大。它不是在模型战争中站队,而是在模型战争的地图上画出了一条新边界:模型归实验室,路由归基础设施。如果这条路走通了,Not Diamond 定义的就不是一个产品,而是一个从零开始的新品类。
参考链接:
- Not Diamond Code 官方博客:
- Tomas Hernando Kofman 宣布推文:
- Not Diamond Code 早期访问申请:
- Jeffrey Akiki 推文:
- McKay Wrigley 评论:
- Santiago 评论: