AREX Feed Article
Liquid AI 发布端侧视觉模型 LFM2.5-VL-3B:约 3GB 内存,M5 Max 解码 228 token/s
2026 年 8 月 12 日,Liquid AI 发布视觉语言模型 LFM2.5-VL-3B,总参数 3.1B,同步上线 与官方 Playground。官方给它的定位是「你能在自己硬件上运行的最强视觉语言模型」。最直接的事实是一组速度数字:Apple M5 Max 上解码 228 token/s,AMD Ryzen AI Max+ 395 上 116 token/s,内存占用约 3GB;在 Galaxy S26 Ultra 手机上也能跑到 20 token/s,完全离线运行。
官方自测基准表给出第二层信息:这个 3.1B 模型把前代 LFM2-VL-3B 的视觉定位分数 RefCOCO 从 57.1 拉到 87.9,屏幕理解 ScreenSpot-v2 平均 80.7 分,压过参数约 2.6 倍的 Gemma-4-E4B(51.2 分)。这些数字均出自厂商自己的评测。
视觉数据是前代 4 倍,RefCOCO 涨了 30 分
架构上,模型把 SigLIP2 400M NaFlex 视觉编码器接到 LFM2.5-2.6B 语言骨干上,是非推理模型:直接作答、不先思考,换取实时应用的响应速度。官方列出四项主要改进:跨设备屏幕/UI 理解、自然语言视觉定位、多图推理、函数调用。
训练规模上,约 34T token 预训练,视觉数据是前代的 4 倍,来自策展与合成的图像描述、OCR、定位和指令数据。词表翻倍到 128K 以支持非拉丁文字,做法是原地扩展 tokenizer 而非从头重训。
后训练分两段:先用更大教师模型做知识蒸馏的 SFT 和 Antidoom 训练,再做多奖励强化学习。
基准表上,RefCOCO 平均定位精度从 57.1 涨到 87.9;多图 BLINK 从 50.2 到 61.5、MuirBench 从 34.9 到 58.3。函数调用 ToolSandbox 从 26.4 到 59.5、BFCL v4 从 20.5 到 32.5,其中 ToolSandbox 翻倍有余。Liquid AI 的把口径概括为「与最高达其 2.6 倍大小的模型成绩相当或更好」。
屏幕理解是跳变最大的地方:前代 LFM2-VL-3B 在 ScreenSpot-v2 桌面上只有 6.0 分、移动端 7.6、网页 2.5,基本读不了屏幕。这一代桌面 78.7、移动端 81.2、网页 82.2,平均 80.7;对照的 Gemma-4-E4B 三项平均 51.2,4.7B 的 Qwen3.5-4B 为 78.5。
28 项基准平均下来,Liquid AI 的给出的成绩是 69.4 分,与 4.7B 的 InternVL 3.5 4B 持平,只比 Qwen3.5-4B 低 0.7。文档侧 DocVQA 91.1、ChartQA 81.3、OCRBench v1 84.2。
评测口径需要交代:全部由 Liquid AI 用 vLLM 0.26.0 自测,统一使用非推理模式、要求模型直接作答;带推理能力的 Qwen 系模型是在关掉推理的状态下被比对的,分数归一化到 0–100。
三档硬件实测:228、116、20 token/s
端侧测试条件写在图注里:Q4_K_M 量化加 FP16 视觉投影,输入一张 512×512 图像加 1024 token 文本、输出 64 token。这一条件下 M5 Max 解码 228 token/s、Ryzen AI Max+ 395 为 116 token/s,内存约 3GB,写的是 3.3GB 以内。
官方称更轻的视觉编码器让首 token 更快,同尺寸输入下 InternVL 这类编码器更重的模型会明显卡住。
GPU 侧,单张 NVIDIA H100 在高并发下输出吞吐约 11K token/s,官方称是所测模型中最高的、约为 4B 级模型的 2 倍,单卡一天接近 10 亿输出 token。5 帧视频输入的首 token 约 34 毫秒,Gemma 系列约 200 毫秒。
发布当天即支持包括 llama.cpp、MLX、vLLM、SGLang、ONNX 在内的推理栈,模型卡同时提供原始权重和 GGUF、ONNX、MLX 三种量化导出,上下文长度 32,768 token。浏览器里有完全本地的 WebGPU 演示,无需安装。
语言版 8 月 4 日刚发布,视觉版接上同一底座
这不是一次孤立发布。8 月 4 日,Liquid AI 刚发布文本模型 LFM2.5-2.6B(日期见 HF 博客侧栏),LFM2.5-VL-3B 用的正是同一个预训练底座;7 月 28 日还发过主打 CPU 长上下文的 LFM2.5-Encoders。
官网博客称视觉版延续此前 LFM2.5-VL-1.6B 与 LFM2.5-VL-450M 的架构,上一代同尺寸的 LFM2-VL-3B 则承担基准表里的对照基线。
词表扩到 128K 后,模型卡列出 16 种语言,含中文、日文、阿拉伯文。日本科技媒体 GIGAZINE 8 月 13 日正是抓住这一点:「能在手机上跑的视觉语言模型 LFM2.5-VL-3B 登场,支持日语,可用于 UI 识别和 OCR」。
发布两天内:iPhone 实机、Agent 之眼与一次按钮翻车
发布几小时后,社区开始把它装进真实设备。X 用户 Noctus(简介自称 MistralAI 大使)了把 LFM2.5-VL-3B 当作 Hermes Agent「眼睛」、配合 DeepSeek V4 Flash 的组合:只靠本地视觉模型浏览,读 Hacker News、打开日食地图、找到冰岛网络摄像头并打开直播。
他写道:「每一步都由一个本地运行的 3B 模型看到,没有云端视觉 API。」
本地聊天应用 atomic.chat 8 月 13 日已把模型跑在 iPhone 上,Q4 量化约占 2.3GB,并放出一段它认出 Minecraft Steve 玩偶的视频。
反例也被记录下来。AI 资讯账号 thehype. 用 Q5_K_M 量化把 LFM2.5-VL-3B 和 Qwen3.5-4B 放到截图定位任务里:读收据总额命中 46.42,找照片主体打平,但在亚马逊页面找「Add to Cart」按钮三次全没框对,1.8 秒、13 token 给出错误答案。
该账号的结论是「两个模型都没一次框对按钮」,而 Gemma-4-E4B 每次都拒绝输出边界框。开发者 Ivan Fioravanti 在 MLX 与 GGUF 版本间做了,称 GGUF 略好,并抱怨 4-bit 量化在 MLX 侧损耗过大。
官方不推荐用它做视觉网页设计和图纸问答
模型卡给这款模型划了边界:推荐单轮、高吞吐、低延迟的任务——汽车场景近实时目标检测、带版面标注的扫描文档 OCR、菜单与路牌的端侧翻译。不推荐长上下文、推理密集的任务,比如视觉网页设计、回答图纸上的高难度技术问题。
这个边界来自同一设计:模型直接作答、不做推理,低延迟和推理能力上限是同一件事的两面。官方自测的 ScreenSpot-v2 80.7 是厂商口径,thehype. 实测三次点不中按钮则来自另一种量化、另一套任务,两组数字测试条件不同,不能互相替代。
能确认的是,8 月 12 日之后,一个带视觉定位和函数调用能力的 3.1B 模型,可以在约 3GB 内存里、在手机上完全离线运行。