djev-run 是一个用于在 Google Cloud Run GPU 上部署 DiffusionGemma-Jev(djev / DiffusionGemma 26B)推理服务的项目。它基于 vLLM 和 mmastrac/djev,提供预构建容器、Cloud Run 部署命令、GCS 模型权重加载方案,以及 OpenAI 兼容的 `/v1/chat/completions` 接口和自定义 `/v1/systemone` 分类/决策接口。项目重点是低冷启动、低延迟、高吞吐地运行扩散式语言模型,并附带 snake、dino、tetris 等演示应用。
适用领域
大语言模型推理部署 / Diffusion LLM / 扩散式语言模型 / Google Cloud Run / GPU Serverless / vLLM / OpenAI API 兼容服务 / 云原生 AI 应用 / 低延迟分类与决策系统
配置难度
中高。该项目不是普通 Web 应用,而是面向 GPU Serverless 推理部署,需要理解 Google Cloud Run GPU、GCS volume、gcloud CLI、Hugging Face 权重下载、vLLM 参数、GPU 配额和模型推理接口。对熟悉 GCP 和 LLM serving 的工程师较容易复现;对只熟悉前端或普通后端的开发者门槛较高。
商业价值
适合用于构建低延迟、按需计费的 AI 推理服务,尤其是文本分类、客服工单路由、意图识别、候选答案打分、结构化决策等场景。它的主要商业价值在于通过 Cloud Run GPU 的 scale-to-zero 降低闲置成本,同时用 DiffusionGemma-Jev 实现较快响应和较高吞吐。对于需要自托管模型、避免完全依赖第三方闭源 API、并希望保留 OpenAI 兼容调用方式的团队有较高参考价值。但生产落地时需要重点评估云成本、模型授权、稳定性、安全鉴权和区域合规问题。
01
技术亮点
- 提供 Cloud Run GPU 部署 DiffusionGemma-Jev 的完整命令,降低部署门槛。
- 支持预构建容器 `ghcr.io/taeold/djev-run:latest`,无需自己编写 Dockerfile。
- 兼容 OpenAI 风格 `/v1/chat/completions` API,便于接入现有应用。
- 额外提供 `/v1/systemone` 接口,可输出分类概率和置信度,适合决策和分类场景。
- 针对 Cloud Run 冷启动做了优化,README 宣称从 0 实例冷启动约 47.5 秒,明显优于 4 分钟级基线。
- 性能数据较完整:服务端中位响应约 61ms,端到端约 117ms,批量吞吐约 100-123 requests/sec。
- 支持 `min-instances=0`,闲置时成本可降为 0,适合间歇性负载。
- 文档解释了各个 Cloud Run、GCS、vLLM 参数的作用,对调优有参考价值。
- 附带多个 demo 应用入口,便于快速展示模型能力。
02
目标用户
- 希望在 Google Cloud 上部署 DiffusionGemma-Jev 的 AI 工程师
- 熟悉 Cloud Run、GCS、gcloud CLI 的云原生开发者
- 需要低延迟文本分类、决策或结构化判断服务的后端开发者
- 研究 Diffusion LLM 推理形态和性能的机器学习工程师
- 希望用 serverless GPU 降低闲置成本的创业团队或原型开发团队
- 需要 OpenAI 兼容接口但想自托管模型的开发者
03
配置要求
- Google Cloud Run 支持 GPU 的区域,README 中示例为 `us-central1`。
- 需要 NVIDIA RTX PRO 6000 GPU,部署参数为 `--gpu=1 --gpu-type=nvidia-rtx-pro-6000`。
- 建议配置 20 vCPU 和 80Gi 内存:`--cpu=20 --memory=80Gi`。
- 建议关闭 CPU throttling:`--no-cpu-throttling`,以加速权重加载和调度。
- 需要 GCS Bucket 存储模型权重,并以 Cloud Run volume 方式挂载到 `/mnt/gcs`。
- 模型权重来自 Hugging Face:`nvidia/diffusiongemma-26B-A4B-it-NVFP4`。
- 推荐将 GCS 中的权重复制到 `/dev/shm/dgemma` 后再启动 vLLM,以降低启动和读取延迟。
- Raw vLLM 方案需要设置环境变量:`VLLM_FLASHINFER_MOE_BACKEND=masked_gemm` 和 `VLLM_ENABLE_V1_MULTIPROCESSING=0`。
- vLLM 关键参数包括:`--trust-remote-code`、`--enforce-eager`、`--language-model-only`、`--attention-backend TRITON_ATTN`、`--kv-cache-memory 2G`、`--max-model-len 4096`、`--diffusion-config {"canvas_length":128}`。
- 如需公网访问,需要配置 Cloud Run 服务的访问权限、认证策略和网络安全策略。
04
适用场景
- 在 Cloud Run 上一键部署 DiffusionGemma-Jev 推理服务
- 构建低延迟文本分类接口,例如客服工单分类、意图识别、标签预测
- 通过 `/v1/chat/completions` 提供 OpenAI 风格调用接口
- 通过 `/v1/systemone` 对候选选项输出概率和置信度
- 基于 serverless GPU 实现按需扩缩容,闲置时缩容到 0
- 搭建扩散式语言模型的性能测试环境
- 为交互式 demo 或游戏类 AI 示例提供后端推理能力
05
部署与配置
- 准备 Google Cloud 项目,并确保已安装和登录 gcloud CLI。
- 开通 Cloud Run、Cloud Storage、Artifact/Container Registry 相关权限,并申请 NVIDIA RTX PRO 6000 GPU 配额。
- 设置环境变量:`BUCKET=your-gcs-bucket`,`REGION=us-central1`。可用区域包括 us-central1、europe-west4、asia-southeast1、asia-south2。
- 创建 GCS Bucket:`gcloud storage buckets create gs://${BUCKET} --location=${REGION}`。
- 从 Hugging Face 下载模型权重:`hf download nvidia/diffusiongemma-26B-A4B-it-NVFP4 --local-dir /tmp/dgemma`。
- 上传权重到 GCS:`gcloud storage cp -r /tmp/dgemma/* gs://${BUCKET}/dgemma/`。
- 推荐使用预构建镜像部署:`ghcr.io/taeold/djev-run:latest`,并配置 Cloud Run GPU、CPU、内存、GCS volume、启动探针等参数。
- 也可以使用原始 `docker.io/vllm/vllm-openai:nightly` 镜像,通过 Cloud Run `--command` 和 `--args` 直接运行 vLLM。
- 部署完成后,通过 Cloud Run URL 调用 `/tokenize`、`/v1/chat/completions` 或 `/v1/systemone` 接口进行测试。
06
风险与注意事项
- 依赖 Google Cloud Run GPU 和 RTX PRO 6000 配额,中国开发者可能面临区域、账号、网络和配额申请门槛。
- 模型权重较大,下载 Hugging Face 模型和上传 GCS 可能耗时较长,并可能受网络限制影响。
- Cloud Run GPU 单价较高,README 标注 1 张 RTX PRO 6000、20 vCPU、80Gi RAM 活跃时约 $3.19/小时。
- 项目语言标记为 HTML,但实际核心依赖云部署脚本、容器和 vLLM,仓库结构可能不是传统应用项目。
- README 未声明 license,商用或二次分发前需要谨慎确认授权。
- 使用 vLLM nightly 镜像可能存在 API 或行为变更风险,生产环境需要固定版本并充分测试。
- DiffusionGemma、djev、vLLM 扩散推理相关参数较专业,调参错误可能导致启动失败、性能下降或输出异常。
- `--allowed-origins '["*"]'` 和公网 Cloud Run 如果未配置鉴权,可能造成未授权调用和高额费用风险。
- 最大实例数示例为 1,适合控制成本和单 GPU 部署,但高可用和横向扩展需要额外设计。
- 冷启动虽然已优化,但约 47.5 秒仍不适合对首次请求极度敏感的在线场景。
2026-09-26
第26名
新收录 · github_search