AREX Feed Article
Google 更新 Mac 版 AI Edge Gallery:Gemma 4 12B 支持视觉、音频与 MTP,并称已为 16GB Mac 优化
北京时间 9 月 17 日凌晨,Google 的 Gemma 官方 X 账号 宣布,Mac 版 Google AI Edge Gallery 应用的最新更新带来对 Gemma 4 12B 的「完整支持」。帖文列出四点能力:视觉与音频多模态输入、可配置的 vision token(视觉 token)预算、用于加速推理的 MTP(Multi-Token Prediction,多 token 预测),以及针对 16GB 内存 Mac 的优化。
同一时间发出的给出三处入口:更新后的 Gemma 4 12B 模型文件、的试用入口,以及用 LiteRT-LM 构建应用的文档。帖文所说的「完整支持」,对应到官方上的描述是:当前的 gemma-4-12B-it.litertlm 文件同时支持文本、视觉和音频三种模态以及 MTP 加速,运行它需要 LiteRT-LM v0.17 或更高版本。
Google 发布 Gemma 4 12B 时的官方宣传图(2026 年 6 月)。
视觉与音频输入进入 Mac 版应用
「多模态:视觉与音频输入」是帖文列出的第一项。在 LiteRT-LM 这一侧,已经写明多模态的处理方式:图像用 --vision-backend、音频用 --audio-backend 指定处理后端,附件通过 --attachment 传入,还可以一次带多个附件。
在应用一侧,Gallery 的把 Ask Image(就图像提问、识别物体)和 Audio Scribe(实时转写、翻译音频)列为核心用例。
Gallery 官方仓库展示的应用界面;Ask Image 对应图像问答,Audio Scribe 对应音频转写与翻译。
16GB 的 MacBook Air 被写进基准表
模型卡给出两组 macOS 实测数据,条件是 GPU 后端、1,024 个 prefill(预填充)token、256 个 decode(解码)token、4,096 的上下文长度,计时不含模型加载:48GB 内存的 M4 Pro 机型上,prefill 297 tokens/s、decode 29 tokens/s、首 token 时间(TTFT)3.48 秒;16GB 内存的 MacBook Air M4 上,三项分别是 114 tokens/s、15 tokens/s 和 9.13 秒。同一份文件在磁盘上是 6,883 MB,GPU 内存占用约 7.9 GB。
16GB 机器能装下 12B,靠的是量化。给出的 12B 内存需求随精度变化很大:BF16(16 位)约 26.7 GB、8-bit 约 13.4 GB、4-bit(Q4_0)约 6.7 GB;要在 16GB 统一内存里运行,得选量化版本。
LiteRT-LM (9 月 9 日)里,有两项与 Mac 直接相关:「Apple Silicon 加速:加入 Metal residency(驻留)支持,提升 Apple 设备上的推理性能」;「优化本地注意力:降低内存开销,并支持更长的上下文」。
MTP:draft 模型先猜,主模型再验证
MTP(Multi-Token Prediction,多 token 预测)的机制是投机解码(speculative decoding):轻量的 draft(草稿)模型一次预测多个后续 token,主模型并行验证,被接受的整段猜测一次性输出。Google 在 5 月的一篇里称,这套 drafter 可以在不损失输出质量的前提下带来最高约 3 倍加速。
在 里,开关是 --enable-speculative-decoding=true,文档建议在 GPU 后端上开启 MTP。v0.17.0 的发布说明把「扩展 Gemma 4(12B):引入多模态能力、多 token 预测(MTP)加速与更长的上下文窗口支持」列为本版更新之一;12B 的 MTP 支持比这次应用更新早约一周出现在运行时里。
Google 5 月公布的 MTP 提速数据;Gemma 4 31B 在 Apple M4 上标注为最高 2.5 倍,图中数值均为「最高」口径,随任务变化。
vision token 预算:8 月下旬新增的引擎参数
帖文的第二项是「可配置的 vision token 预算」。在 LiteRT-LM 的实现里,这对应每张图像的最大 vision token 数。8 月 26 日的把它加进 C++ 引擎的创建参数,随后扩展到 C、Kotlin、Swift 等绑定;8 月 29 日的把这一上限暴露进能力查询 API。
帖文没有说明这个预算在 Mac 应用里的默认值和调节方式;从代码看,每张图用多少 vision token,现在可以在创建推理引擎时指定。
拿到它的三种方式:应用、模型文件、命令行
对应帖文的第一条链接,Gallery 的官方仓库也挂着 macOS 版下载入口。仓库同时写明,所有模型推理都在本机完成,不需要联网。
模型文件在 Hugging Face:。版本门槛仍为 v0.17 或更高。
命令行入口可以快速试跑:
pip install -U litert-lmlitert-lm run \ --from-huggingface-repo=litert-community/gemma-4-12B-it-litert-lm \ --prompt="Write me a poem"要 GPU 加速加 --backend=gpu,要开 MTP 加 --enable-speculative-decoding=true。确认,macOS 上的 CPU 与 GPU 后端都在支持之列。
从 6 月登陆 macOS 到这次更新
6 月 3 日,:Google 称它是首个原生支持音频输入的中等尺寸模型,用直接线性投影取代了视觉与音频编码器,16GB 内存就足以本地运行。同一天,AI Edge Gallery 登陆 macOS,的描述是「在 Apple Silicon GPU 上原生离线运行 Gemma 4 12B」,演示用例是让模型在对话里写 Python、执行代码、绘制图表。
Google 发布 Gemma 4 12B 时给出的基准对比;官方称其表现接近 26B MoE(混合专家)模型。
9 月 9 日,LiteRT-LM v0.17.0 发布,把 12B 的多模态、MTP 与长上下文支持写进发布说明;9 月 17 日凌晨,帖文宣布这条线的最新进展:Mac 应用与模型文件更新。
本文引用的能力描述与性能数字,全部来自 Google 官方渠道(帖文、模型卡、博客、文档与代码仓库)。模型卡把 12B 的上下文上限标为 128k,前提是设备内存充足;内存吃紧时,模型卡给出的操作建议是把 max_num_tokens 调小。对 16GB 机型,可用的上下文长度就取决于这个值的设置。