AREX Feed Article
Anthropic 在封禁 Fable 5,Maziyar Panahi 用一台 Mac Studio 跑通了全套医疗 AI
AI 的终极形态是 API 调用——直到有人用一台 Mac 证明你错了。
过去两年的主流叙事是:前沿 AI 活在云上。你要么给 Anthropic 付 token 费,要么给 OpenAI 付 API 费,要么接受降级体验。医疗场景尤甚——合规要求把数据锁在医院内网,但最强的模型都在防火墙外面,于是医院要么妥协,要么放弃。
6 月 26 日,OpenMed 创始人 Maziyar Panahi(前 John Snow Labs Spark NLP 团队负责人,在医疗 NLP 领域深耕超过 16 年)发了一条推文,附了一段录屏:他的 Mac Studio 上跑着 Z.ai 十天前刚刚开源的 GLM-5.2 模型,模型正在调度一个由 OpenMed 微型专家模型组成的"蜂群"——肿瘤科、药房、化验室——全部在本地运行。
这条推文收获了 590 个赞、45 次转发和 384 个书签,HuggingFace 官方账号转发了它。但真正值得关注的不只是传播数字,而是它展示的东西:一个无需云、无需 API Key、无需担心数据离开设备的医疗 AI 系统,已经可以跑在一台消费级硬件上。
没有云、没有速率限制、没有人能夺走它
Panahi 的演示做到了三件事:第一,用 llama.cpp 在 Mac Studio 上成功加载并运行了 GLM-5.2——一个 1M token 上下文、在多项编码基准上比肩 Claude Opus 4.8 和 GPT-5.5 的开源模型;第二,让 GLM-5.2 作为"推理大脑",调度一组 OpenMed 微型专家模型执行具体的临床 NER(命名实体识别)任务;第三,整套系统完全离线运行,患者数据从未离开设备。
用他本人的话说:"No cloud, no rate limits, nobody can take it away. AI must be owned, not rented."(没有云、没有速率限制、没有人能夺走它。AI 应该被拥有,而非租用。)
这句话在医疗场景下的分量,任何一个处理过 HIPAA 合规的工程师都懂。
一个通用大脑 + 一群专科快手:这套架构为什么比大模型单打独斗更聪明
Panahi 的系统设计逻辑出奇简洁:GLM-5.2 扮演"总调度"——接收临床文本,判断需要调用哪些专家模型,发出指令;OpenMed 的微型专家模型扮演"专科医生"——各司其职地完成疾病识别、药物提取、化验值解析等窄任务。
他在后续回复中解释了为什么不用一个大模型一把梭:"一个大通用模型在狭窄的临床 NER 和实体提取任务上又慢又不准。OpenMed 的微型专家模型是专门为这些任务打造的,更快、更准。"GLM-5.2 则负责幕后的医学推理和 agent 循环调度。
这套架构的巧妙之处在于分工:通用模型做它擅长的推理和规划,专家模型做它们擅长的精确提取。GLM-5.2 把 OpenMed 专家模型当作工具(tools)来调用,推理循环里只需决定"该调哪个工具、怎么调",而不需要自己去做实体识别——这让整个流程既快又省 token。
硬件配置方面,Panahi 用的是一台 M3 Ultra 芯片的 Mac Studio,配备 512GB 统一内存。模型量化由 UnslothAI 提供的 Q3_K_M 版本 GGUF 文件完成——这是一个关键细节,GLM-5.2 的原生权重远超消费级硬件可承受的范围。他透露,使用 1-bit 量化版本时推理速度约 20 tokens/s,Q3 版本同样可以跑通。
隐私保护是这套系统的另一层设计。Panahi 强调,OpenMed 的 PII(个人身份信息)检测和去标识化完全在本地完成——"Live redaction"(实时脱敏)——即使后续需要通过 HuggingFace Inference Providers 调用云端模型,敏感信息也已经在设备端被清除。OpenMed 的去标识化引擎覆盖全部 18 种 HIPAA Safe Harbor 标识符类型,支持 12 种语言,包括中、英、法、德、日、阿拉伯语等。
对于没有 Mac Studio 的用户,Panahi 也提供了替代路径:通过 HuggingFace Inference Providers 运行 GLM-5.2,同时 OpenMed 在设备端先完成脱敏。他甚至提到,OpenMed 的小模型在 iPhone 上也能跑,"只需要 1-2GB 显存"。
从 Spark NLP 到 OpenMed:一个在医疗 NLP 领域泡了 20 年的独行侠
Maziyar Panahi 不是突然冒出来的 AI 爱好者。他在数据工程和 NLP 领域有超过 16 年的履历,曾在法国国家科学研究中心(CNRS)担任大数据工程师,后来成为 John Snow Labs 的核心人物之一,领导 Spark NLP 团队长达七年——这个企业级 NLP 库累计下载量超过 1.5 亿次,是医疗 NLP 领域事实上的工业标准之一。
2025 年 7 月,Panahi 离开 John Snow Labs,以"午饭时间的业余项目"启动了 OpenMed。只用了六个月,OpenMed 就在 HuggingFace 上积累了 1000 多个模型、超过 600 万次 PyPI 下载,成为 HuggingFace Daily Papers 排行榜上排名第一的组织。所有模型均使用 Apache 2.0 许可证——商业友好,无附加限制。
OpenMed 的模型矩阵覆盖 13 个生物医学领域:化学物质、疾病、基因、蛋白质、物种、解剖、肿瘤学。从 33M 参数的 TinyMed 到 770M 参数的 XLarge,每一种规格都针对不同的部署场景优化。此外还有 200 多个 Apple MLX 格式的变体,专门为 Apple Silicon 优化。
除了开源模型库,Panahi 还构建了两个商业产品:Welna——一款运行在 iPhone 上的个人健康 AI 助手,读取 Apple Health 数据并在本地脱敏后提供健康分析;OpenMed Agent——面向临床团队的终端原生 AI 助手,覆盖预授权、申诉、编码、理赔等工作流。
OpenMed 目前似乎是 Panahi 一个人的项目,至少公开信息中未见机构投资者或团队扩张的消息。这使得它的产出规模——1000+ 模型、6M+ 下载、12 种语言的 PII 引擎——更加令人印象深刻。
当 Fable 5 被禁、云厂商涨价,本地 AI 不再是退而求其次
GLM-5.2 本身的故事为 Panahi 的演示提供了更大的语境。这个模型由北京智谱华章(国际品牌 Z.ai)于 6 月 16 日正式开源,MIT 许可证,不设地域限制。
它的出现恰逢一个微妙的时间窗口:几天前,美国商务部刚刚要求 Anthropic 暂停 Claude Fable 5 和 Mythos 5 的全球访问,导致非美国开发者失去了最强大的编码模型。而智谱自身自 2025 年 1 月起就在美国实体清单上。结果就是:美国政府出手限制自家最强模型出口的同时,一家被列入实体清单的中国公司,把一个实力接近的开源模型交到了全世界手中。
GLM-5.2 的基准表现支撑了这层戏剧性。在 Terminal-Bench 2.1 上,它拿到 81.0 分(Opus 4.8 为 85.0,GPT-5.5 为 80.0);在 SWE-bench Pro 上,62.1 分(GLM-5.1 为 58.4);在 Design Arena 上,甚至一度超越了被封禁的 Fable 5。Interconnects 作者 Nathan Lambert 评价它是"自 DeepSeek R1 以来,开源模型最关键的一次能力跃迁"。
而在医疗 AI 这条细分赛道上,OpenMed + GLM-5.2 的组合几乎没有直接竞品。现有的医疗 AI 方案大致分两类:一类是云端的闭源产品(如 Hippocratic AI、Abridge),另一类是学术界的开源模型。前者的隐私和成本是硬伤,后者缺乏工程化和产品化。Panahi 的路径是第三条:完全本地化、Apache 2.0 许可、从模型到推理框架全链路可控。
社区讨论中,用户 @Tetragr72834810 写道:"云的经济模型已经糟糕到 AI 成了把客户逼回本地部署的工作负载。超大规模云厂商太贪婪了。"Panahi 回复道:"这让我想起流媒体服务——它们承诺比有线电视更好,然后变得比任何有线电视公司都差。我知道有公司自建了上百块 H200,想搭什么就搭什么。"
当然,这条路并非没有门槛。开发者 Silas Burke(@silasburke)调侃道:"拥有而非租用——当风扇噪音是你自己的时,这句话听起来不太一样。"另一位用户 @FullOfCaffeine 指出:"下一个挑战:真的买到一台 512GB 内存的 Mac Studio。"Panahi 承认了硬件瓶颈,但也回应称,对小型企业来说,两台 Nvidia DGX Spark 的成本可能已经低于持续支付 token 费用。
拥有而非租用,正在从口号变成工作流
Panahi 的推文里有一句话让人过目不忘:"AI must be owned, not rented."
这句话当然不是他第一个说的。但在 2026 年 6 月的这个时间点上,一个开发者在一台消费级 Mac 上跑通了一套完整的医疗 agent 工作流——开源模型提供推理能力、微型专家模型执行临床任务、隐私引擎在本地脱敏——它不再是口号,而是一个可以被复现的 demo。
如果一件事能在 Mac Studio 上跑通,它离"每个医院的地下室都有一台"就不远了。而如果这句话在医疗场景成立——一个对隐私、合规和可靠性要求最苛刻的领域——那么在法律、金融、教育等同样敏感的领域,它只会更有说服力。
开发者 Silas Burke 在回复中留下一句总结:"当 token 账单变得真实时,那个铁盒子就开始有道理了。"Panahi 的 Mac Studio,就是那个铁盒子。
参考链接:
- Maziyar Panahi 原推文:
- Z.ai GLM-5.2 官方博客:
- OpenMed 官网:
- OpenMed HuggingFace 组织:
- Interconnects 分析:
- Linas's Newsletter GLM-5.2 指南:
本文由机器之心「新闻热点追踪」栏目自动生成,采用机器之心编辑规范。如有事实错误,请联系编辑部。