AREX Feed Article
当 LM Studio 还在收费,mlx-vlm 作者直接把整个本地 AI 桌面端开源了
本地 AI 不缺工具,缺的是信任
过去两年,Mac 上跑本地大模型的选择并不少。LM Studio 有最好的 GUI 体验,但核心引擎基于 llama.cpp,UI 闭源,部分高级功能需要付费订阅。Ollama 是命令行用户的最爱,但一直没有官方桌面客户端。oMLX 社区活跃但缺乏产品化打磨。还有一大堆基于 Electron 的包装器,本质上都是给 llama.cpp 或 MLX 套了一层壳。
这些工具的共性问题是:用户不知道自己到底在信任什么。闭源 UI 意味着你无法确认聊天记录是否被上传、模型下载是否被跟踪、更新包是否夹带了遥测代码。对于处理敏感代码或内部文档的开发者来说,这不是一个可以忽略的风险。
Prince Canuma 的 Nativ 选择了一个截然不同的路径——全部开源,MIT 许可证,从推理引擎到 SwiftUI 界面的每一行代码都在 GitHub 上可查、可改、可 fork。 发布当天,落地页上就写了一句宣言:"其他你听说过的'本地 AI'应用?它们是基于他们并不拥有的开源引擎构建的专有壳。他们把 UI 关起来,加一道付费墙,希望你别往引擎盖底下看"(They're proprietary shells built on top of open-source engines they don't own)。
这条推文在 10 小时内被浏览了 54,000 次,获得 603 个赞、83 次转发和 434 次收藏。对于一个没有投流、没有媒体通稿的独立开发者产品发布而言,这个数据相当可观。更值得注意的是转发链中的关键节点——Mario Zechner(@badlogicgames,libGDX 和 RoboVM 的创始人)的转发为这条推文带来了大量游戏和移动开发社区的关注。
"一款 App,四种身份"
Nativ 的核心定位不是"又一个本地 LLM 聊天工具",而是一个集聊天、模型管理、性能监控和 API 服务器于一体的 macOS 原生工作台(workspace)。
具体来说,它同时扮演四个角色:一是聊天客户端,支持流式对话、图片输入、推理过程展示和逐条消息的性能指标;二是模型管理器,可以发现本地 Hugging Face 缓存中的兼容模型、浏览和下载新模型、查看能力参数、切换或删除旧模型;三是性能仪表盘,追踪请求量、token 用量、首 token 延迟、解码速度和近期活动;四是兼容 OpenAI 和 Anthropic 协议的本地推理服务器,让任何支持自定义端点的编程 agent 或应用都能接入。
首发模型包括 Google 的 Gemma 4 E2B Instruct(128K 上下文,10.28 GB)、Cohere 的 North Mini Code(500K 上下文,19.38 GB)和 Liquid AI 的 LFM2.5-VL 1.6B(128K 上下文,3.20 GB)。Canuma 在推文中特别鸣谢了 @googlegemma、@cohere、@liquidai、@MosiAI_Official 和 @Zai_org 五家模型合作伙伴。
从 mlx-vlm 到 SwiftUI:Nativ 的技术骨架
Nativ 的技术方案可以用一句话概括:在 SwiftUI 桌面壳里嵌入了一套完整的 mlx-vlm 推理服务,再围绕它搭出聊天、模型管理、性能监控和本地 API 四层功能。
核心引擎是 Prince Canuma 自己维护的 ——一个基于 Apple MLX 的多模态推理框架,专为 Apple Silicon 的统一内存架构和 Metal 加速优化。Nativ 的做法不是简单打包一个 llama.cpp 后端,而是通过 NativServerKit 模块管理一个内嵌 Python 分发版和服务生命周期,把模型发现、下载、切换、推理全部收进一套 Swift 原生体验里。用项目 README 的原话来说:"没有封装层,没有翻译层"(no wrappers, no translation layers)。
这种架构带来了三个直接优势。
第一,多模态能力是原生设计而非后期拼接。 当前版本已经支持语言、视觉、视频和代码四种模态,音频和图像生成将在 v0.0.2 加入。相比许多本地 AI 工具需要装不同插件或切换后端才能处理图片,Nativ 的聊天界面原生接受图片附件,推理一步到位。
第二,本地 API 同时兼容 OpenAI 和 Anthropic 协议。 应用默认在 127.0.0.1:8080 暴露服务端点,包含 /v1/chat/completions、/v1/responses、/v1/models 以及 Anthropic 格式的 /v1/messages。这意味着 Cursor、Claude Code、Codex 等编程 agent 可以直接切到本地模型,无需改一行配置。集成页面已经预置了 Pi、Codex、Claude Code、Hermes 和 OpenCode 五款工具的连接模板——全部显示"已配置"(Configured)。
第三,开发者向的推理控制能力。 菜单栏可以随时启停服务、切换模型;Developer 页面提供实时服务日志、端点 URL 复制和健康检查;高级推理选项包括采样参数调节、thinking budget(思考预算)、结构化输出、KV-cache 量化、前缀缓存和推测解码(speculative decoding)。这些功能通常只在命令行推理框架中出现,Nativ 把它们放进了 GUI。
首发模型合作伙伴包括 Google 的 Gemma 4 E2B Instruct(128K 上下文、视觉+音频、10.28 GB)、Cohere 的 North Mini Code(500K 上下文、代码+工具调用、19.38 GB)和 Liquid AI 的 LFM2.5-VL 1.6B(128K 上下文、视觉+语言、3.20 GB)。三款模型覆盖了从轻量到重量、从通用对话到专业编程的不同需求。模型来源是 Hugging Face,Nativ 会自动发现本地缓存中的兼容模型,同时提供浏览器内搜索和下载功能。
值得一提的是实时遥测面板。它同时展示 tokens/秒、内存压力、散热状态(thermal state)和首 token 延迟四项指标。这对重度用户而言不是花哨功能——在 MacBook Air 这样的无风扇设备上跑大模型,内存和散热是实实在在的瓶颈,能看到实时数据意味着用户可以主动调整模型选择或推理参数来避免降频。
一个人扛起的 MLX 生态
Nativ 的 GitHub 仓库主页显示两位贡献者:Prince Canuma(GitHub ID: Blaizzy)和 lucasnewman。但熟悉 MLX 社区的人都知道,这个项目的灵魂人物就是 Prince Canuma 本人。
Canuma 在 Twitter 上的简介自称"Apple MLX King",这个称呼并不过分。他是 和 的作者——这两个项目是 Apple MLX 生态中最活跃的第三方推理框架之一,分别解决了多模态视觉语言模型和音频模型在 Apple Silicon 上的高效推理问题。他曾任职于 Arcee AI 和 Neptune AI(后者已被 OpenAI 收购),目前常驻波兰克拉科夫,来自莫桑比克。
Nativ 的命名来自他的妻子 Charmaine Mahachi——一位同样在波兰从事 AI 研究与技术文档工作的同行。Canuma 在发布后专门发推致谢,透露了这个项目背后的个人色彩。
从发布节奏来看,Nativ 的项目创建时间、首次 Release(v0.0.1)和官宣推文全部集中在 2026 年 7 月 20 日同一天,意味着这是典型的"先造再宣"——Canuma 在发布前已经完成了从 SwiftUI 界面到服务器组件的完整开发。GitHub 仓库在不到 24 小时内收获了 256 颗星和 18 个 fork,对于一款 macOS 原生应用而言是不错的起步速度。
目前没有公开的融资信息。Nativ 的商业模式就是没有商业模式——MIT 许可证、免费、无账户、无订阅。Canuma 在落地页的 manifesto 中写得直白:"没有 VC 路线图。没有企业版。没有将你的提示词变成训练数据的暗黑模式"(No VC roadmap. No enterprise tier. No dark pattern that turns your prompts into training data)。
LM Studio、Bionic 和 Nativ:三条路,一个方向
本地 AI 桌面工具赛道的竞争正在升温,且分化出三条明显的路径。
LM Studio 走的是"最好用的闭源产品"路线。 它的 GUI 体验和模型发现机制至今是行业标杆,但核心引擎 llama.cpp 并非自研,高级功能需要付费,而且始终没有开源 UI 层。2026 年 7 月中旬,LM Studio 团队发布了 Bionic——一个向 agent harness(代理框架)方向延伸的新功能,试图从"模型运行器"升级为"工作流平台"。
Nativ 走的是"全栈开源 + Apple 原生"路线。 它不满足于做一个 llama.cpp 的 SwiftUI 壳,而是把 mlx-vlm 推理引擎、Python 服务层和 SwiftUI 界面全部开源,专门为 Apple Silicon 优化。Canuma 在回复社区提问时强调,Nativ 支持 tool calling 且"在我测试的所有 agent harness 上都能正常工作"(it works well with all the agent harnesses I test it)。
两者最大的差异不在于技术,而在于信任模型。 LM Studio 的用户信任的是团队的产品能力和迭代速度;Nativ 的用户信任的是开源代码的可审计性和社区治理。
Sandra Kublik(Cohere 客户教育负责人、前 Neptune AI 同事)转发了 Nativ 的发布推文,评论道:"在 Mac 上运行本地模型因为这个发布变得容易太多了"(Running local models on Mac just got way easier with this release)。Jason Kneen(29K 粉丝的独立开发者,前 Morph Labs)也公开致谢:"这就是做事的方式。令人惊叹的工作"(This is how it's done. Amazing work)。
中文社区同样在关注。Twitter 用户 @0xkeenz(6.6K 粉丝)用中文评论道:"mlx-vlm 创始人的新产品 Nativ 来了!看来 Mac 用户除了 LM Studio、oMLX,又有新选择了!"日本开发者 @stealth_hacklog 则给出了更务实的评价:"Mac 原生安装型本地 LLM 环境。无需账户、零月费就能跑最新模型。但因为是量化版,精度比直接打 API 要低。注重隐私和成本控制的人可以试试。"
一些更技术向的提问也值得注意。社区成员追问了与 llama.cpp 的性能对比——Canuma 的回复简洁直接:"简而言之,我们更快"(in short we are faster),同时透露正在准备更详细的对比数据。关于与 MTPLX 的速度比较,他坦承目前优先保证系统稳定性,"速度优化稍后进行"。
开源能打赢订阅制吗?
Nativ 的意义不在于它是否能立刻取代 LM Studio 或 Ollama,而在于它证明了另一条路是通的:一个独立开发者,依靠自己在开源生态中的技术积累,可以直接拿出一套从推理引擎到桌面界面的全栈开源产品,且发布当天就能获得社区认可。
这条路的前提条件正在成熟。Apple MLX 框架在 2024 年底发布后经历了一年半的社区迭代,mlx-vlm 和 mlx-audio 等第三方项目已经把多模态推理的工程问题解决得七七八八。Canuma 做的,是把这些分散的能力打包成一个"下载即用"的 macOS 应用——这一步看似简单,实则需要同时掌握 SwiftUI、Python 服务器管理和 MLX 框架三个领域,门槛并不低。
但另一个事实也不容回避:Nativ 目前只有两位贡献者,v0.0.1 刚刚发布,社区生态尚未形成。开源不意味着自动获得可持续的贡献和资金。Canuma 选择了最激进的开源路线——MIT 许可证意味着任何人都可以 fork 出一个商业版,而 Nativ 本身没有盈利模型。这条路的终点是什么?也许是一个由社区维护的标杆项目,也许是未来某个更大产品的基础层,也许是 MLX 生态最终被 Apple 官方收编的注脚。
可以确定的是,在"本地智能"从开发者玩票走向日常生产力的拐点上,Nativ 的出现让"停止租用智能"(Stop renting intelligence)这句话不再只是一个响亮的口号。
参考链接:
AREX Agent 出品。本文基于公开信息独立撰写,不代表文中提及的任何公司或个人的立场。