AREX Feed Article
Google Gemma 官宣:Gemma 4 E2B 全程离线驱动 Reachy Mini,树莓派 5 上仅占 1.5GB 内存
「一块 175 美元的板子,能驱动一个离线机器人语音助手吗?」8 月 12 日美东时间中午,在 X 上用这个问题开场,并给出自己的答案:官方称,Gemma 4 E2B 模型正在树莓派 5(Raspberry Pi 5)上完全本地驱动 Reachy Mini 机器人,低延迟语音、视觉(YOLO)和机器人动作全部由 LiteRT 推理处理,全程离线。
官方给出的性能数字是:文本生成约 300 词/分钟,约为常人语速的两倍,峰值内存仅占 1.5GB。推文链到 8 月 11 日 的文章《Mastering Edge AI on Raspberry Pi with LiteRT and Gemma》,由 Lu Wang、Terry Heo 与 Raspberry Pi Ltd 的 Naushir Patuck、Igalia 的 José María Casanova 共同署名;博客把常人语速算作约 150 词/分钟,并公布了更完整的基准数据。
Google 公布的基准:99 prefill、9 decode、1432 MB 峰值内存
Gemma 是 Google 的轻量开源模型家族,Gemma 4 E2B 是其中面向移动端和紧凑边缘环境的型号。博客公布的基准来自 LiteRT-LM,即 LiteRT 之上专门编排 LLM 的一层:在树莓派 5 上,Gemma 4 E2B 跑出 99 tokens/sec 的 prefill 和 9 tokens/sec 的 decode,峰值内存 1432 MB。
测试条件标注为树莓派 5(8GB 内存版)、1024 个 prefill tokens、256 个 decode tokens、4 线程。推文里的 1.5GB 对应这 1432 MB 峰值内存。
博客解释,Gemma 4 E2B 的 tokenizer 平均每个 token 装下约 4.2 个字符,端到端生成速度约 27.3 字符/秒,在 Reachy Mini 语音演示中约合 300 词/分钟。
这个型号采用 memory-mapped per-layer embeddings,博客称其适合连续监测、快速文本/图像/音频推理,以及"节省 RAM 绝对关键"的边缘语音处理。
四段流水线:YOLO 看、Moonshine 听、Gemma 想、TTS 说
博客配的演示视频说明:Reachy Mini 在树莓派 5 上由 Gemma 和 LiteRT 驱动,用回应和动作做出反应。其流水线分四段:摄像头画面持续送入 GPU 上的 Ultralytics YOLO 目标检测。
用户说话时,Moonshine 语音识别在 CPU 上把语音转成文本;Gemma 4 E2B 把转写文本连同最新视觉信息一起推理,流式生成语音回复和机器人姿态动作;TTS 再把句子合成为声音传回机器人。
让 YOLO 常驻 GPU,是为了视觉检测连续运行而不与 CPU 争抢资源。树莓派 5 的四核 ARM Cortex-A76 CPU 有约 153.6 GFLOPS(FP32)、最高约 2.0 TOPS(INT8)。
集成 GPU VideoCore VII 主频 800 MHz,约 76.8 GFLOPS(FP32)、约 0.24 TOPS(INT8)。GPU 推理经 LiteRT 的 WebGPU(Vulkan)后端、通过 ML Drift 启用,可直接运行 MediaPipe、Ultralytics YOLO、Moonshine 等模型。
Reachy Mini 本体:499 美元的 DIY 开源机器人
Reachy Mini 是 的开源陪伴机器人,定位为用于人机交互、创意编程和 AI 实验的"表情丰富的陪伴机器人"。Wireless 版售价 499 美元,板载 Raspberry Pi CM 4,带 Wi-Fi、摄像头、4 个麦克风和扬声器。
Lite 版售价 399 美元,经 USB 连接外部主机作为大脑。两个版本都按 DIY 套件发货,官方称组装约需 2 小时。
在 Google 的演示里,推理硬件是树莓派 5:博客的流水线图和基准表均标注 Raspberry Pi 5(8GB 版),而 Reachy Mini Wireless 自带的计算模块是 CM 4。官方推文把这块推理板子的成本表述为 175 美元,博客正文没有给出板卡价格。
同一模型换框架,内存差三倍、prefill 快四倍
博客的对比表显示:同一个 Gemma 4 E2B 在树莓派 5(8GB)上,用 LiteRT-LM(QAT)跑出 prefill 99 tokens/sec、decode 9 tokens/sec、峰值内存 1432 MB。
换用 llama.cpp(Q4_0),prefill 跌到 24 tokens/sec、decode 4 tokens/sec,峰值内存反而涨到 4406 MB。
按同一测试条件折算,LiteRT-LM 的内存占用约为 llama.cpp 的三分之一,prefill 约快 4 倍,decode 约快 2 倍多。文中把 LiteRT 介绍为 Google AI Edge 的端侧推理运行时,CPU 加速经 XNNPACK 完成,命令行工具可一行安装:pip install litert-cli。
零延迟与隐私之外,还有人追问吞吐
截至发稿,这条官宣在 X 上约 1.5 万次浏览、274 次点赞、26 次转推。聚焦 agent、自动化和机器人的账号 (约 4.4 万关注者)回复:
"Local inference on a Pi 5 ensures zero voice lag and absolute privacy for sensitive, real-world robotic deployments."(树莓派 5 上的本地推理,为敏感的机器人实地部署保证了零语音延迟和绝对隐私。)
用户 则追问:官方是否测过语音管线本身的 tokens/sec 吞吐?他同时指出,实际性能取决于语音指令复杂度和 YOLO 视觉任务的并发负载。
博客公布过模型级 decode 9 tokens/sec 和语音演示端到端约 27.3 字符/秒,但没有按"语音管线"口径单列 token 级吞吐。
下一站是 Hailo 加速卡,示例代码已在 GitHub
博客收尾章节预告:LiteRT 集成和 Gemma 模型即将支持 Hailo AI 加速器,开发者可把推理卸载到 Raspberry Pi AI HAT+ 和 AI HAT+ 2,沿用同一套 LiteRT 工作流。
Reachy Mini 演示的完整源码已放在 LiteRT Samples GitHub 仓库,博客还给出最小复现命令,直接运行 gemma-4-E2B-it-litert-lm。示例 prompt 写着:"You are Reachy Mini. Identify the main object in front of you, state its location (Left/Right/Center), and suggest head action in 10 words or less."
模型以 open-weights 形式放在 LiteRT Hugging Face Community,CLI 与示例代码公开。官方账号在里把这条路线称为"零云端依赖的物理智能体"(physical agents with zero cloud dependencies),并问:"What's your first project?"