AREX Feed Article
Harvey Tenet 以 Kimi K3 为基座,法律任务完成量接近两倍
新华社旧金山 8 月 27 日发表综述《中国开放权重模型加速融入全球 AI 产业链》,美国法律 AI 公司 Harvey 日前发布其首个后训练开放权重模型 Tenet,基座是中国月之暗面的开放权重模型 Kimi K3。
据综述转引的哈维公司技术细节,Tenet 依托约 1750 个专业化法律工作智能体环境完成迭代优化,整套专项训练历时约 2 个月。训练后,Tenet 完整完成的综合法律实务任务数量接近原始 Kimi K3 模型的两倍;在合同起草、审查和谈判等专项任务中,完整完成的任务数量增加约 20%,同时基本保留原模型的通用法律知识能力。
1750 个法律智能体环境,150 块 B300,训练 2 个月
Harvey 研究团队 8 月 20 日发布的研究预览披露了训练体系构造。 Tenet 从 Kimi K3 基座出发,与 Fireworks 合作做异步强化学习,训练环境模拟真实法律工作:每个任务包含一段以合伙人交办口吻写成的指令(平均约 50 词)、一套客户卷宗材料,以及一份专家评分细则。
细则把合伙人层面的审阅拆成平均约 50 条"通过/不通过"的原子标准。智能体在沙箱工作区里检索卷宗、阅读文档、起草成果文件,单个 rollout(一次完整试跑)可超过 1000 轮交互、消耗数十万 token。
训练数据集由约 1750 个这样的法律任务环境组成,每个训练轮次执行 150 步优化、跑 1 万余次 rollout。优化采用 GSPO(组序列策略优化)配合 rank-64 LoRA,在完整 Kimi K3 网络上微调注意力、MLP 和路由专家权重;每次 rollout 由大模型裁判按细则打分,团队对比后选定 Kimi 2.6 作为裁判模型。整套训练在约 150 块 NVIDIA B300 GPU 上持续约 2 个月。Harvey 说明,全部后训练没有使用任何客户数据。
完成量接近两倍,通用法律知识基本保留
综述转引哈维公司 5 月公布的早期测试:以"全部标准通过"为评判标准,市场上多数通用模型完整完成法律实务任务的比例不足 10%,在专业场景中实用性存在明显短板。这正是后训练要解决的问题。
研究预览给出专项训练后的结果:LAB 留出集完成量接近翻倍,all-pass 率提高 9 个百分点;LAB Contracts 完成量增加约 20%,all-pass 率提高 2 个百分点。LAB 是 Harvey 开源的长程法律智能体基准,含 24 个执业领域的 1200 余项任务;Tenet 在 LAB Contracts 上取得当前最优成绩,在 LAB 总榜位列第二。
泛化测试显示,模型在训练时没见过的 Mercor APEX Agents(公司法子集)和 Crosby's Redline Bench 上显著超过 Kimi K3 基座;而在考察法律知识而非智能体能力的 LegalBench、CUAD、MAUD 等基准上,Tenet 保持强表现。按 Harvey 的说法,智能体能力提升没有损害基座对教科书级法律概念的理解。
成本效率是研究预览的第二个主要发现。开放权重模型本身每 token 价格更低,训练中又通过奖励塑造鼓励更省 token 的工具使用和推理路径,在同等性能下压低推理消耗。综述补充,开放权重模型可由企业自主部署、持续优化和继续训练,在大规模调用场景下降低单位推理成本、提高部署灵活性、减少对外部 API 的依赖。
Cursor、Cognition、Cosine 同走 Kimi 后训练路线
综述指出,Tenet 并非孤例。AI 编程平台 Cursor 所属公司今年 3 月公布的编程模型 Composer 2 技术报告称,该模型以 Kimi K2.5 为基础,先依托以代码数据为主的持续预训练夯实专业底层能力,再通过大规模强化学习完成任务优化;5 月推出的 Composer 2.5 仍以 Kimi K2.5 为基础,进一步扩大预训练规模和强化学习任务数量。
美国 AI 初创企业"认知"公司()和英国 AI 初创企业 Cosine 则分别以 Kimi 模型为基础,通过进一步的大规模强化学习提升软件工程能力,各自打造核心 AI 软件工程产品。这些技术路线均出自新华社综述转引的各公司技术报告口径。
Inkling 沿用 DeepSeek V3 的 MoE 路线
中国开放权重模型的影响还延伸到训练数据和模型架构。据综述,OpenAI 前首席技术官米拉·穆拉蒂创办的思维机器实验室(Thinking Machines Lab)在研发其首款开放权重模型 Inkling 时,并未直接采用中国模型作为基础模型;但其官方技术说明称,Inkling 的混合专家(MoE)架构主要沿用 DeepSeek V3 的技术路线。在后训练启动阶段,公司使用包括 Kimi K2.5 在内的开放权重模型生成合成数据,用于首轮监督微调。
综述由此归纳,中国开放权重模型参与海外 AI 研发的形式,已从直接作为基础模型接受进一步训练,延伸到生成合成数据、提供模型架构和训练方法参考。
衡量标准从"答对"走向"做完"
综述把这一轮变化放进行业演进里解释:过去 AI 企业追求前沿模型能力时高度依赖闭源模型,Kimi、DeepSeek 等中国开放权重模型能力提升并进入前沿后,提供了闭源之外的技术选择。与此同时,AI 正由问答工具向智能体演进,衡量模型能力的标准从知识回答延伸到完整执行复杂任务;而完成复杂任务所需的操作流程、判断标准和纠错机制,往往存在于真实业务场景、评测体系和工作流程里。垂直 AI 的后训练因此更重视任务执行能力,Cursor、Harvey、"认知"等公司就在接近真实业务的任务环境中开展大规模强化学习,让模型学习信息搜索、工具调用、上下文管理和错误修正。
综述据此判断,随着权重、数据、架构等技术成果更深融入全球 AI 研发和产业体系,中国开放权重模型在全球 AI 供应链中的作用不断增强,其国际影响正由产品出海向技术输出延伸,正在成为海外 AI 企业开发新模型、新产品的重要技术来源。
参考链接
- 新华社《综述|中国开放权重模型加速融入全球AI产业链》:
- Harvey《Technical: Harvey: Tenet Research Preview》:
- Cognition 官网: