该仓库提供一个面向 NVIDIA DGX Spark 单机部署的 DeepSeek V4 Flash 0731 EXL3/ExLlamaV3 推理启动方案。它通过 Docker、sparkinfer/b12x 内核栈、DSpark speculative decoding、NVFP4 压缩 KV cache 等配置,在单台 DGX Spark 上运行约 107GB 权重的 DeepSeek v4 Flash,并暴露 OpenAI 兼容 API。项目重点是单机长上下文推理,默认配置支持 384k 上下文、单并发、约 44–47 tok/s 解码速度,并宣称通过 320k/370k needle recall 压测。
适用领域
大语言模型推理部署 / DeepSeek 模型部署 / 本地私有化 LLM 服务 / 高性能 GPU 推理 / 长上下文推理 / Docker 化 AI 服务 / OpenAI 兼容 API 服务
配置难度
高。该仓库不是通用 Python 包,而是针对 DGX Spark 的高性能推理部署方案。开发者需要熟悉 Docker、NVIDIA GPU 容器运行时、Linux 内存管理、HuggingFace 权重缓存、LLM 推理参数、KV cache、长上下文调优和故障排查。对于具备 DGX Spark 和推理基础设施经验的团队,按 README 启动相对直接;对于普通开发者,硬件和环境门槛很高。
商业价值
业务价值主要体现在私有化、长上下文、高性能 DeepSeek 推理服务。对于拥有 DGX Spark 的企业或实验室,该项目可以将单机硬件转化为可通过 OpenAI 兼容 API 调用的 DeepSeek V4 Flash 服务,适合内部知识库问答、超长文档分析、代码审查、研发助手、合规内网部署等场景。其最大卖点是单机运行 300k+ 级别上下文,减少多节点部署复杂度。不过商业落地需要评估硬件成本、并发能力、模型许可、运维稳定性和服务级别保障。
01
技术亮点
- 单台 DGX Spark 即可运行 DeepSeek V4 Flash EXL3,不需要官方 FP4 方案要求的双 Spark TP2。
- 提供自包含 Docker 启动方案,降低部署复杂度。
- 默认启用 DSpark K5 speculative decoding,并使用 K64 draft model 提升解码性能。
- 使用 nvfp4_ds_mla 压缩 KV cache,强调超长上下文 KV 容量。
- 默认 384k 上下文配置,README 中报告 KV pool 可达约 439,622 tokens。
- README 提供 320k 和 370k 上下文 needle-in-a-haystack 压测结果,显示可精确召回且无 preemption。
- 暴露 OpenAI 兼容接口,便于接入现有应用、Agent 框架和 SDK。
- 权重默认完整下载到本地 ./hf-hub,不依赖远程机器。
- 提供可选 LAN 共享模式,适合多台 DGX Spark 复用同一份权重缓存。
- MIT 许可证,便于开发者参考和二次集成。
02
目标用户
- 拥有 NVIDIA DGX Spark 硬件的 AI 开发者
- 需要本地部署 DeepSeek V4 Flash 的团队
- 研究长上下文推理、KV cache 优化、speculative decoding 的工程师
- 希望在单机上运行大模型而非多节点部署的开发者
- 企业内部 AI 平台、私有化模型服务、推理基础设施团队
03
配置要求
- 硬件必须是 NVIDIA DGX Spark 或高度匹配的 aarch64 + NVIDIA GB10/SM121 环境;该项目不是普通 x86_64 CUDA 服务器通用部署方案。
- 需要约 128GiB 统一内存,启动时要求空闲主机内存至少约 114.3GiB。
- 运行镜像为 aarch64-only,不适用于常规 x86 GPU 服务器。
- 需要 Docker Engine、Docker Compose v2、NVIDIA Container Toolkit。
- 需要访问 HuggingFace 下载模型权重,首次下载约 107GB。
- 默认无需 HuggingFace 登录;遇到限流或私有模型时可设置 HF_TOKEN。
- 默认服务端口为 8888,API 路径为 http://127.0.0.1:8888/v1。
- 默认模型名为 deepseek-v4-flash-0731。
- 主要参数位于 start.sh 中,而不是 compose.yml;compose.yml 每次由 start.sh 自动生成,不应手动修改。
- 关键默认参数包括 MAX_MODEL_LEN=384000、MAX_NUM_SEQS=1、GPU_MEMORY_UTILIZATION=0.94、KV_RECORD=stock432。
04
适用场景
- 在单台 DGX Spark 上部署 DeepSeek v4 Flash 服务
- 构建 OpenAI API 兼容的本地大模型推理接口
- 进行超长上下文问答、文档分析、代码库分析、检索增强生成测试
- 验证 300k+ token 长上下文下的模型召回能力
- 作为企业内网 LLM 服务或研发测试服务
- 研究 NVFP4 KV cache、ExLlamaV3、DSpark 推测解码等推理优化方案
05
部署与配置
- 准备一台 NVIDIA DGX Spark,要求 GB10、SM121、约 128GiB 统一内存,并确保 Docker 可访问 GPU。
- 在 DGX OS / Linux aarch64 环境安装 Docker Engine、Docker Compose v2、NVIDIA Container Toolkit、curl。
- 确保本地磁盘至少有 110GB 以上可用空间,用于下载 HuggingFace 权重和缓存。
- 如果系统启用了 earlyoom,执行 sudo systemctl disable --now earlyoom,避免服务占用大量统一内存时被误杀。
- 克隆仓库:git clone https://github.com/MiaAI-Lab/DeepSeek-v4-Flash-One-DGX-Spark.git
- 进入项目目录:cd DeepSeek-v4-Flash-One-DGX-Spark
- 执行 ./start.sh 启动服务。首次启动会拉取 Docker 镜像、下载约 107GB 权重、合并 TP4 到 TP1、构建 K64 draft、捕获 CUDA graphs。
- 等待服务健康检查完成后,通过 http://127.0.0.1:8888/v1 使用 OpenAI 兼容接口调用模型。
- 可选:使用 ./download.sh 预先下载、合并并校验权重,以便后续离线启动。
- 可选:设置 REMOTE_HOST、REMOTE_USER、REMOTE_SHARE_DIR 等变量,通过 SSHFS 在局域网内复用权重副本。
06
风险与注意事项
- 硬件要求极高且非常特定,普通开发者或常规 GPU 服务器基本无法直接使用。
- 项目强绑定 aarch64 DGX Spark 运行环境,可移植性较弱。
- 首次启动下载约 107GB 权重,耗时长且对网络、磁盘空间要求高。
- 默认占用约 94% 统一内存,宿主机上其他进程可能导致启动失败或不稳定。
- README 中的性能和稳定性数据来自特定硬件、特定启动状态和特定配置,实际结果可能因冷/热启动、JIT 缓存、内存碎片而波动。
- 默认 MAX_NUM_SEQS=1,适合深上下文单请求,不适合高并发服务;提高并发会显著牺牲上下文长度。
- 依赖 sparkinfer/b12x、ExLlamaV3、内核 backport、CUDA graph 等复杂底层组件,排障门槛较高。
- README 提到部分修复和 postmortem 保留在本地而不在仓库中,可能影响可审计性。
- 如果 earlyoom 或其他 OOM killer 未关闭,服务可能在正常高内存占用时被杀死。
- compose.yml 自动生成,不熟悉 start.sh 的用户可能误改配置导致无效或被覆盖。
2026-08-26
第27名
新收录 · github_search