Gemma Translator 是一个面向树莓派等小型设备的离线语音翻译项目。它使用 Gemma 4 / gemma4-e2b 通过 LiteRT-LM 在本地运行大语言模型,结合 Moonshine 做语音识别与语音合成,提供一个针对 480x320 等小屏优化的 React Web 前端,以及 Python 本地 API 服务。项目目标是构建一台无需联网即可工作的双向语音翻译终端,适合做成树莓派 5 + 麦克风 + 扬声器 + 小屏幕的实体设备。
适用领域
本地大模型推理 / 语音翻译 / 离线 AI 应用 / 边缘计算 / 树莓派硬件项目 / 人机交互 / 语音识别 STT / 语音合成 TTS / React 前端 / Python API 服务 / LiteRT-LM / Google AI Edge
配置难度
中高。对于熟悉 Python、Node.js、React 和 Linux 的开发者,按脚本部署难度中等;但如果要在树莓派上稳定运行、处理音频设备、模型下载、LiteRT-LM、systemd、kiosk、自启动和硬件外壳,则需要一定嵌入式 Linux 与 AI Edge 部署经验。
商业价值
该项目的商业价值主要在于快速验证离线 AI 翻译硬件的可行性。它适合作为 PoC、展陈设备、教育原型、特定场景的离线翻译终端或企业内部 AI Edge 应用参考。由于 Apache-2.0 许可证较宽松,二次开发和商业化障碍较低。但若要做成正式产品,还需要补足稳定性、语言覆盖、错误恢复、用户体验、隐私合规、安全加固、设备管理和长期维护能力。
01
技术亮点
- 完全本地推理:安装完成并下载模型后,翻译流程无需互联网连接。
- 端到端完整示例:包含前端、后端、模型下载、本地 LLM 服务、STT、TTS 和部署脚本。
- 适合树莓派部署:提供 deploy-pi.sh 和 systemd 服务模板,可做成长期运行的 kiosk 设备。
- 小屏优化 UI:界面采用复古终端风格,适配 480x320 等低分辨率显示器。
- 统一启动脚本:./start.sh 可以同时启动 LiteRT-LM、Python API 和 React 前端,降低运行复杂度。
- 支持开发和生产两种模式:开发模式使用 Vite,生产模式由后端直接服务构建后的前端资源。
- 提供 3D 打印外壳 STL 文件,方便制作实体硬件原型。
- 键盘模式设计清晰:支持 landscape 单人操作模式和 vertical 双人独立操作模式。
- Apache-2.0 许可证,商业和二次开发友好。
02
目标用户
- 希望在本地设备上运行 AI 翻译应用的开发者
- 树莓派和嵌入式硬件爱好者
- 需要离线翻译设备原型的产品团队
- AI Edge / on-device AI 方向的研究者
- 想学习 Gemma、LiteRT-LM、Moonshine 集成方式的开发者
- 教育、展览、创客空间中的交互装置开发者
03
配置要求
- Python 版本需要 3.10 或以上。
- Node.js 需要 18 或以上,推荐 20 LTS。
- 操作系统主要面向 Linux 或 macOS;树莓派部署面向 Raspberry Pi OS / Debian。
- 推荐硬件是 Raspberry Pi 5 8GB RAM,低配设备可能无法流畅运行本地模型。
- 需要可用的音频输入设备,例如 USB 麦克风、声卡采集器或系统默认麦克风。
- 需要可用的音频输出设备,例如扬声器、耳机或 HDMI/USB 音频输出。
- 需要显示设备,项目 UI 特别针对 480x320 小屏或 kiosk 屏幕优化。
- 首次安装和下载模型时需要联网;模型下载完成后可以离线运行。
- 需要能够从 Hugging Face 下载 gemma4-e2b 相关模型文件,可能涉及 Hugging Face 访问权限、地区网络或代理配置。
- 本地服务默认使用端口 5173、3000、9379,需要确保端口未被占用。
- 浏览器端会使用 localStorage 保存键盘模式等设置。
- 当前交互主要依赖键盘快捷键,触摸屏上的完整触控操作并非核心支持方式。
04
适用场景
- 制作一台离线双向语音翻译机
- 在没有互联网或网络不稳定的环境中进行基础语音翻译
- 为展览、博物馆、创客活动构建小屏 AI 交互终端
- 验证 Gemma 4 在边缘设备上的推理能力
- 学习 React 前端、Python 后端、本地 LLM 服务和语音模块的端到端集成
- 作为树莓派 5 AI appliance 的参考项目
- 为自定义翻译硬件、手持翻译器、桌面翻译终端开发原型
05
部署与配置
- 准备环境:Python 3.10+、Node.js 18+ 或 20 LTS、npm、Linux 或 macOS。若部署到树莓派,推荐 Raspberry Pi 5 8GB RAM。
- 准备硬件:麦克风或 USB 音频输入设备、扬声器或耳机输出设备、显示器或触摸屏,例如 480x320 小屏。
- 克隆仓库:git clone https://github.com/google-gemma/gemma-translator.git 并进入项目目录。
- 赋予脚本执行权限:chmod +x setup.sh download_model.sh start.sh deploy-pi.sh。
- 安装依赖:运行 ./setup.sh,脚本会创建 Python 虚拟环境并安装后端依赖,同时处理前端相关依赖。
- 下载模型:运行 ./download_model.sh,从 Hugging Face 获取 gemma4-e2b 模型并导入 LiteRT-LM。
- 开发模式启动:运行 ./start.sh,启动 LiteRT-LM、本地 Python API 服务和 Vite 前端。
- 访问开发界面:http://localhost:5173;API 服务默认在 http://localhost:3000;LiteRT-LM 默认在 http://localhost:9379。
- 生产模式运行:运行 ./start.sh --prod,使用编译后的 frontend/dist 静态资源并由 backend/server.py 在 3000 端口提供服务。
- 树莓派长期部署:在 Raspberry Pi 5 上运行 ./deploy-pi.sh,脚本会安装系统依赖、构建前端、下载模型、注册 systemd 服务,并配置 Chromium kiosk 自启动。
06
风险与注意事项
- README 明确声明这不是 Google 官方支持产品,不能依赖官方 SLA 或长期维护承诺。
- 项目较偏实验性质,生产环境使用前需要自行评估稳定性、异常处理和安全性。
- 依赖 Gemma 4、LiteRT-LM、Moonshine 等多个 AI 组件,版本兼容和部署排障成本可能较高。
- 树莓派 5 8GB 是推荐硬件,其他低性能设备可能出现延迟高、内存不足或推理失败。
- 语音识别、翻译和语音合成质量受模型能力、语言种类、口音、噪声环境影响较大。
- 模型文件可能较大,首次下载耗时且对网络环境有要求。
- 默认本地服务如果暴露到局域网或公网,需要额外考虑鉴权、跨域、端口访问和输入安全。
- 当前构建主要依赖键盘快捷键,若目标是纯触摸屏产品,需要额外开发触控交互。
- 使用 http.server / Python 本地 API 的方式更适合原型和设备内运行,不一定适合高并发服务端场景。
- LiteRT-LM 与相关模型生态仍可能快速变化,后续 API 或模型格式变更可能带来维护成本。
2026-08-10
第9名
新收录 · github_search
2026-08-09
第13名
新收录 · github_search