AREX Feed Article
Liquid AI 放出 LFM2.5-2.6B,220 tok/s 跑在 M5 Max,2.6B 硬刚 4 倍大模型
一个 2.6B 模型,把 Agent 训练当成了主菜
8 月 4 日,Liquid AI 在 Hugging Face 上放出 LFM2.5-2.6B,一个专为端侧 Agent 部署设计的 2.6B 参数模型。它在 Apple M5 Max 上以 220 tok/s 解码,AMD Ryzen AI Max+ 395 上跑到 113 tok/s,内存占用不到 2.5GB,手机上也能维持 30 tok/s。
LFM2.5-2.6B 的整个后训练流程围绕 Agent 构建:最终阶段直接接入 OpenClaw 和 Hermes Agent 等真实 agent harness 运行多轮强化学习。Liquid AI 宣称,其工具使用和指令遵循能力可与 4 倍参数量的模型竞争。
模型以 LFM2 开放权重许可发布,首日即支持 llama.cpp、MLX、vLLM、SGLang 和 ONNX。
65 万次观看,社区开发者踩到了第一颗雷
Liquid AI 官方账号 在 X 上的发布帖获得超过 65 万次观看、4000 余次点赞和 500 余次转发,一天内被收藏超过 2600 次。AI 工程师 Awais Khawar 博士在分析线程中写道,关键突破在于 "the whole agent loop can now sit on the device, keeping data local and cutting the cloud inference bill to zero"——整个 agent 循环可以留在设备上,数据不离开本地,云端推理账单归零。
但首批实测也暴露了问题。一位开发者在 Hugging Face 博客评论区报告:在一次 agentic 运行中,模型通过 MCP 工具以错误格式拉取数据后,没有标记异常,反而"自信地将错误数据当作事实呈现"。同一场景下,参数量更大的 Gemma 4 E4B 没有出现同类幻觉。该开发者追问:"当 MCP 工具返回错误或格式错误的数据时,是模型、提示词还是工具层的责任来捕捉它?"
一周两款模型,Liquid AI 的端侧攻势在加速
就在一周前的 7 月 28 日,Liquid AI 刚刚发布了 LFM2.5-Encoders,主打 CPU 上的长上下文快速推理。
时隔七天再推 LFM2.5-2.6B,节奏明显加快。Liquid AI 在博客中将其定位为"AI 随处运行"愿景的一部分:从基础模型到定制化部署,一套架构覆盖多个用例。加上上周的 Encoder 和此前 LFM2.5-8B-A1B 的发布,LFM2.5 家族正在快速成形。
Agentic RL 不是噱头——它真的在 Harness 里练出来的
LFM2.5-2.6B 基于约 34T token 预训练,词汇表扩展到 128K,上下文窗口 128K。后训练分四个阶段:
SFT → 教师特化 → 多域在线策略蒸馏(MOPD)→ Agentic RL。 前两轮 SFT 的数据量约为此前 LFM2.5-8B-A1B 的七倍,大幅向工具使用、网页搜索和 agent 轨迹倾斜。之后为数学、代码、工具使用等领域分别训练专家教师,再通过 MOPD 将多域能力蒸馏回单一学生模型。
最后阶段是整套流程的核心:模型在 OpenClaw 和 Hermes Agent 等真实 harness 内执行多轮 RL,每个 rollout 在独立沙箱中运行,奖励信号由 LLM-as-a-judge 评分、程序化检查和硬安全门控组合而成。训练引擎(FSDP)、推理引擎(SGLang)和 RL 框架(verl)解耦,Harness Proxy 将 agent 环境当作黑盒接入,同时捕获 token 级轨迹用于训练样本验证。
在基准测试上,LFM2.5-2.6B 是参数量最小的选手,却在所有指令遵循基准上领先:IFBench 59.17、Multi-IF 80.07、IFStruct 85.49。工具使用方面,ToolSandbox 77.83 超过 Qwen3.5-9B 的 76.44,BFCLv4 56.88 仅次于 Qwen3.5-9B。Agent 任务上全面领先两款 Gemma 模型(gemma-4-E2B-it 5.1B 和 gemma-4-E4B-it 8B),与 Qwen 系列互有胜负。唯一短板是编程,LiveCodeBenchv6 59.41 落后于 Qwen3.5-9B 的 69.86。
推理效率方面,单张 H100 上高并发时可达到近 15K output tokens/s,约合每天 13 亿 token。
当推理边际成本归零,Agent 的游戏规则就变了
此前,部署 agent 的默认路径是调用云端 API——每次工具调用、每轮推理都在烧 token 费。对需要全天候运行的后台 agent 而言,这意味着要么接受持续账单,要么限制 agent 的使用频率。
LFM2.5-2.6B 尝试改写这个账本。2.6B 参数、2.5GB 以下的体积,意味着整个 agent 循环可以在笔记本甚至手机上闭环运行。Liquid AI 在博客中写道:"When token spend is no longer a constraint, agents can be run everywhere around the clock"——当 token 花费不再是约束,agent 就可以全天候到处运行;本地硬件上的 agent 可以大规模并行运行后台任务,"burn through millions of tokens at no marginal cost"——消耗数百万 token 而边际成本为零。
不过,社区实测中的幻觉案例也提醒了一个现实问题:小模型跑得快和跑得稳是两件事。Agent 场景中,一次工具调用的错误输出会级联到后续步骤,容错空间比单轮对话小得多。
小模型的野心不在跑分,在改写 Agent 的成本方程
LFM2.5-2.6B 的意义不是又一个小模型在榜单上刷出了高分。它代表了一种不同的假设:Agent 能力不应该通过堆参数来获得,而应该在真实的 agent 环境里被锻造出来。这条路能否走通,取决于开发者愿不愿意把"零成本 agent"的承诺放到自己的硬件上去验证。