AREX Feed Article
Gemma 4 塞进树莓派,Google 掏出离线翻译机
2026 年 8 月 5 日, 在推上发了一条 thread,展示了一台名为 Gemma Translator 的原型机——完全离线运行的语音翻译设备。次日, 官方账号跟进官宣。不需要 Wi-Fi,不需要 API,不需要把任何语音数据送出设备。一台 Raspberry Pi 5,一个麦克风,一个扬声器,一个 3D 打印外壳,全组装起来就能用。
整机所有代码、3D 打印 STL 文件、部署脚本全部开源在 ,Apache 2.0 协议。Google Creative Lab 的三位开发者——Alan Yam、Shashwath Santosh 和 Dan Motzenbecker——在 README 里放了一行 deploy-pi.sh,一条命令就能把树莓派刷成一台专用翻译机。
「手机上不是也能翻译吗?」
设备一亮相,评论区最先冒出来的问题极其一致:手机不就能翻译吗,为什么要一台专用硬件?
官方账号在 thread 里没有直接回应这个问题,但把答案写进了产品设计里:这是一台双通道面对面设备。屏幕分成两条 lane,两个人各自一侧,按住自己那侧的按键说话,松手后对方的语言就从扬声器里出来。手机翻译是两个人凑在一台屏幕前轮流戳,这台设备的设计逻辑是两个人对坐,各自操作各自的一侧。
华强北背景的出海创业者 在推上拉了一张完整的硬件 BOM 表:树莓派 5 8GB 或国产 RK3588 替代板 80–150 元,2.8–3.5 寸小屏 25–40 元,USB 麦克风加小喇叭 15–25 元,外壳注塑 10–20 元,电池加电源管理 30–50 元。整机出厂成本压在 250–350 元,零售可以做到 499–699 元。他的判断很直接:「端侧 AI 真正落地的形态不是手机里再塞一个 chatbot,而是专用硬件、只干一件事、断网即用、几百块出厂。」
也有人不买账。一位用户在 Antigravity 推文下回复:「基于我的经验,这种设备至少需要 Whisper V3 Turbo 才能在自动模式下处理好语音识别。恕我直言,这看起来像个可爱的玩具。」另一位问得更干脆:「谁需要在树莓派上跑本地翻译?手机不就够了?」
,Google Creative Lab 的创意总监,在转发时点明了团队的来源:「我的 Creative Lab 队友用 @googlegemma + @Raspberry_Pi + @antigravity 做的新开源硬件实验。」项目由 Shashwath Santosh、Alan Yam 和 Dan Motzenbecker 三人完成。
从 Gemma 4 发布到翻译机原型,五个月
Gemma 4 在今年 4 月发布,一共四个尺寸。其中最小的 E2B 变体是专门为边缘设备设计的——有效参数约 23 亿,总参数 51 亿(含 embedding),支持文本、图像和音频输入,128K 上下文窗口,目标硬件就是树莓派和 Jetson Nano 这个级别。
4 月模型发布时,「能在树莓派上跑」更多是一个技术指标。8 月的 Gemma Translator 把它变成了一台可以真正拿在手里的设备。这条五个月的路径很清晰:模型 → LiteRT-LM 部署框架 → Python 推理服务器 → React 前端 → 一键部署脚本 → 3D 打印外壳。
Antigravity 今年在 Google I/O 上作为 agent 开发平台亮相,Gemma Translator 是它发布后最早一批面向非开发者的落地项目之一。整机硬件成本不到 100 美元,模型 Apache 2.0 免费,外壳和代码全部开源。
Google 在 README 里明确写了标准免责声明:「This is not an officially supported Google product。」这不是一款 Google 要量产的产品,而是一份任何人都可以照着做的参考设计。
Moonshine 听,Gemma 译,Kokoro 说
翻译链路跑了三个模型,全部在本机推理,没有一个字节离开设备。
翻译引擎:Gemma 4 E2B 通过 LiteRT-LM 在 Raspberry Pi 5 上本地运行,由一个 Python http.server 处理请求。得很直接:「所有翻译知识都内建在模型里,不需要 API 也不需要 Wi-Fi。」日本 Qiita 上有开发者实测,Gemma 4 E2B 在 Raspberry Pi 5 上通过 LiteRT-LM 的推理速度约为每秒 5 个 token——不快,但对于对话翻译场景,够用()。
语音识别:,一个开源的多语言 ASR 模型,负责把语音转成文字。语音合成:Kokoro,一个小型 TTS 模型,把 Gemma 输出的译文念出来。三者串成一条完整链路:按住说话 → 松手转写 → Gemma 翻译 → Kokoro 用对方语言朗读。
前端是一个 React + Vite 应用,界面做成了复古终端风格,专门适配 480×320 的小屏。设备有两种键盘模式:Landscape 模式下一个人操作两条 lane,按空格切换说话人,按住 Z 录音;Vertical 模式下两人各用各的按键——Z 管 Lane 1,X 管 Lane 2。每一条 lane 配一个语言「转轮」,用方向键或加减键切换目标语言。
在报道中指出一个诚实的问题:README 没有给出具体的支持语言对列表,也没有发布翻译质量或延迟的 benchmark 数据。对于需要评估实际效果的团队来说,这份源代码更像一张施工蓝图,而不是一份产品规格书。
端侧 AI 的下一个战场不在手机上
过去两年,「端侧 AI」这个词主要出现在三处:手机芯片厂商的发布会 PPT 里,开源模型的 benchmark 排行榜上,还有学术论文的消融实验中。真正能拿在手里、断网也能干活、成本低到可以随便造的东西,极少。
Gemma Translator 把这个叙事往前推了一步。它不跟手机 app 抢用户,而是回答了另一个问题:如果端侧推理已经成熟到可以撑起一个专用设备,那为什么所有交互都要挤在一台手机上?
的报道点出了一个关键变化:Antigravity 作为开发平台,Gemma Translator 是它首次瞄准非开发者的产出——一个物理设备,只做一件事,不联网,成本不到 100 美元。「作为开放模型持续缩小体积、同时变得越来越能干,这类设备最终可能出现在旅行配件、无障碍工具、教室或灾难应急包里。」
对于隐私敏感的场景——医疗问诊、法律咨询、现场拍摄、野外研究——一份能在 Pi 级硬件上跑通的工作蓝图,比又一张 leaderboard 表格更有价值。华强北的快速反应则说明,从「开源蓝图」到「档口现货」的距离,正在以天为单位缩短。