这是一个面向 2 台 NVIDIA DGX Spark/GB10 设备部署 GLM-5.3-Flash EXL3 4bpw 量化模型的 vLLM OpenAI 兼容推理服务方案。仓库提供 Docker 镜像、启动脚本、vLLM/ExLlamaV3/CUDA kernel 覆盖补丁、DFlash2 推测解码配置、长上下文 KV 缓存配置和基准测试脚本,用于在双节点 GB10 环境中以 tensor parallel 2 的方式运行约 164GiB、120 分片的 GLM-5.3-Flash-EXL3 模型。服务默认暴露 OpenAI 风格的 /v1/chat/completions API,端口为 8888,模型 ID 为 GLM-5.3-Flash-EXL3。
适用领域
大语言模型推理部署 / LLM 量化推理 / vLLM OpenAI API 服务 / 多 GPU/多节点推理 / 长上下文推理 / CUDA Kernel 优化 / MoE 模型推理 / 推测解码 Speculative Decoding / ARM64 + CUDA 13.0 AI 基础设施
配置难度
高。该仓库面向熟悉 vLLM、多节点 GPU 推理、NCCL/RoCE 网络、CUDA kernel、量化模型和容器部署的高级工程师。对于只会常规 Python 或单卡部署的开发者,上手难度较大;对于已有 DGX Spark/GB10 集群和 LLM Serving 经验的团队,可作为较完整的生产级参考配置。
商业价值
对需要在本地或私有环境中部署高性能 GLM-5.3-Flash 的企业具有较高价值,尤其适合金融、政企、代码智能、长文档分析、私有知识库和对外提供类 OpenAI API 的场景。EXL3 4bpw 可显著降低模型存储和显存压力,DFlash2 与专用 CUDA kernel 可提升吞吐,1M 上下文能力可扩展高价值长文本任务。但其商业落地依赖昂贵且特定的硬件环境、工程团队调优能力,以及对模型权重许可证和安全行为修改功能的合规审查。
01
技术亮点
- 提供 GLM-5.3-Flash EXL3 4bpw 在 2x GB10/DGX Spark 上可运行的完整 vLLM 部署方案。
- OpenAI 兼容 API,便于直接接入现有 OpenAI SDK、LangChain、LlamaIndex 或企业内部网关。
- EXL3 4bpw 权重体积约为官方 FP8 的 54%,README 中给出的 KLD 质量接近官方 FP8。
- 支持 1M 级上下文配置,适合长文档、代码库和复杂上下文任务。
- 集成 DFlash2 k=7 推测解码,在结构化高接受率场景下单流可达到约 60+ tok/s 级别。
- PR77 引入 fat-expert prefill CUDA kernel,README 报告 fully uncached long-context prefill 提升约 20% 到 21%。
- 针对 GLM-5.3-Flash NoPE MLA、fp8_ds_mla、SM120/SM121a、ExLlamaV3 MoE 做了专门适配。
- 支持 prefix caching、CUDA graphs、fused EXL3 MoE、DFlash2 draft TP=2 等性能优化。
- 包含可复现实验脚本 tests/bench_decode.py,便于验证 structured/prose 场景吞吐。
- MIT License,便于二次开发,但模型权重和 donor ablit 权重仍需分别关注其许可证。
02
目标用户
- 拥有 2x NVIDIA DGX Spark/GB10 硬件的 AI 工程团队
- 需要本地或私有化部署 GLM-5.3-Flash 的开发者
- 研究 EXL3/TR3 量化、MoE 推理和长上下文推理优化的工程师
- 希望使用 OpenAI 兼容接口接入国产/开源大模型的后端开发者
- 做模型服务性能调优、CUDA kernel 优化、vLLM 定制的基础设施团队
03
配置要求
- 硬件:2x NVIDIA GB10/DGX Spark,目标架构 sm_121a。
- 节点:head + worker 双节点部署,vLLM 使用 --nnodes 2 和 --tensor-parallel-size 2。
- 网络:CX7 QSFP/RoCE 互联,README 中示例为 head 10.0.0.1、worker 10.0.0.2。
- 容器:ARM64 CUDA 13.0 镜像,基础镜像来自 vllm/vllm-openai:glm53-flash-arm64-cu130。
- 模型权重:Mia-AiLab/GLM-5.3-Flash-EXL3-TR3-4bpw,约 164GiB/176GB 级别,120 shards。
- 推测解码模型:incoai/GLM-5.3-Flash-DFlash2,默认 DFlash2 k=7。
- 服务端口:默认 8888,OpenAI-compatible API。
- 模型 ID:GLM-5.3-Flash-EXL3,即 --served-model-name。
- KV cache:--kv-cache-dtype fp8,目标路径为 packed fp8_ds_mla。
- 上下文长度:默认 MAX_MODEL_LEN=1000000。
- 安全认证:默认 API 开放,可设置 VLLM_API_KEY 启用 Bearer token。
- 注意力后端:目标为 FLASHINFER_MLA_SPARSE_SM120,draft attention 应使用 FLASH_ATTN,不建议固定 TRITON_ATTN。
- 不要传入 --moe-backend marlin;该配置不适用于此 EXL3 + fp8 KV overlay。
- 可选视觉能力:默认 LANGUAGE_MODEL_ONLY=0,支持 image/video,并限制每个 prompt 的多模态输入数量。
- 可选工具调用/推理解析:启用 --tool-call-parser glm47、--enable-auto-tool-choice、--reasoning-parser glm45。
04
适用场景
- 在双 DGX Spark/GB10 上部署 GLM-5.3-Flash 作为私有 OpenAI 兼容 API
- 运行 1M 上下文窗口的长文本分析、代码理解、文档问答或复杂推理任务
- 通过 EXL3 4bpw 权重量化降低显存/存储占用,同时保持接近 FP8 的质量
- 使用 DFlash2 k=7 推测解码提升结构化输出或高接受率场景下的解码速度
- 测试长上下文 prefill、KV cache、prefix caching 和 CUDA graph 对推理性能的影响
- 作为 GLM-5.3-Flash 在 ARM64 CUDA 13.0 GB10 平台上的生产部署参考
- 对比 MTP 与 DFlash2 的 speculative decoding 效果
- 实验可选的 ablit/refusal-direction ablation 行为改写
05
部署与配置
- 准备两台 NVIDIA GB10/DGX Spark 节点,并确保它们通过 CX7/RoCE 网络互联。
- 在两台机器上安装支持 ARM64、CUDA 13.0、Docker/容器运行环境的系统依赖。
- 克隆仓库:git clone https://github.com/MiaAI-Lab/GLM-5.3-Flash-EXL3-2x-DGX-Sparks.git
- 根据实际网络环境修改 head/worker IP、网卡名、WORKER_USER、WORKER_IP 等变量。
- 拉取或构建镜像:ghcr.io/miaai-lab/glm-5.3-flash-2x-dgx-sparks:exl3。
- 确保 Hugging Face 可访问,并能下载 Mia-AiLab/GLM-5.3-Flash-EXL3-TR3-4bpw 和 incoai/GLM-5.3-Flash-DFlash2 权重。
- 在 head 节点运行启动脚本,例如 ./start.sh restart,脚本会启动 head 容器并通过 SSH/远程命令启动 worker 容器。
- 确认服务监听 8888 端口,并使用 OpenAI SDK 或 curl 访问 /v1/chat/completions。
- 如需复测性能,可运行 tests/bench_decode.py,例如 structured 或 prose benchmark。
- 如需启用 ablit,先运行 python3 ablit/fetch_transplant.py 下载 donor o_proj 张量,然后设置 ABLIT=1 并重启服务。
06
风险与注意事项
- 硬件门槛非常高,基本只适用于 2x DGX Spark/GB10 特定环境,普通 GPU 服务器难以直接复用。
- 配置复杂,涉及多节点、RoCE/CX7、NCCL、CUDA 13.0、ARM64、vLLM、ExLlamaV3 和自定义 kernel。
- README 明确指出部分配置容易导致性能或正确性问题,例如不要使用 --moe-backend marlin,不要将 draft attention 固定为 TRITON_ATTN。
- 模型权重体积很大,下载、缓存和启动时间成本高,对网络和磁盘有较高要求。
- 仓库高度依赖特定镜像、特定权重快照和特定硬件架构,未来上游 vLLM、CUDA、权重或 Hugging Face ID 变动可能导致不可复现。
- 默认 API 开放在 8888 端口,如果暴露到不可信网络且未设置 VLLM_API_KEY,会有未授权访问风险。
- ablit 功能会改变模型行为,README 也提示 KLD 质量评测未覆盖 ablit,启用后可能造成质量漂移、安全策略变化或合规风险。
- 长上下文和高并发场景下 KV cache、CUDA graph、MNBT 等参数需要实测调优,否则可能出现容量不足或吞吐下降。
- 该项目更像硬件/模型部署 recipe 和 overlay,而不是通用 Python 库,缺少面向新手的完整抽象。
- 模型本身及外部 donor 权重可能有独立使用条款,商业使用前需要逐项审查许可证和模型协议。
2026-09-03
第28名
新收录 · github_search