Python · 项目报告

MiaAI-Lab/DeepSeek-v4-Flash-One-DGX-Spark

DeepSeek v4 Flash EXL3 on one DGX Spark

已完成 打开 GitHub
M
255星标
27Fork
4Issue
MIT许可证

分析结果

项目分析

该仓库提供一个面向 NVIDIA DGX Spark 单机部署的 DeepSeek V4 Flash 0731 EXL3/ExLlamaV3 推理启动方案。它通过 Docker、sparkinfer/b12x 内核栈、DSpark speculative decoding、NVFP4 压缩 KV cache 等配置,在单台 DGX Spark 上运行约 107GB 权重的 DeepSeek v4 Flash,并暴露 OpenAI 兼容 API。项目重点是单机长上下文推理,默认配置支持 384k 上下文、单并发、约 44–47 tok/s 解码速度,并宣称通过 320k/370k needle recall 压测。

适用领域 大语言模型推理部署 / DeepSeek 模型部署 / 本地私有化 LLM 服务 / 高性能 GPU 推理 / 长上下文推理 / Docker 化 AI 服务 / OpenAI 兼容 API 服务
配置难度 高。该仓库不是通用 Python 包,而是针对 DGX Spark 的高性能推理部署方案。开发者需要熟悉 Docker、NVIDIA GPU 容器运行时、Linux 内存管理、HuggingFace 权重缓存、LLM 推理参数、KV cache、长上下文调优和故障排查。对于具备 DGX Spark 和推理基础设施经验的团队,按 README 启动相对直接;对于普通开发者,硬件和环境门槛很高。
商业价值 业务价值主要体现在私有化、长上下文、高性能 DeepSeek 推理服务。对于拥有 DGX Spark 的企业或实验室,该项目可以将单机硬件转化为可通过 OpenAI 兼容 API 调用的 DeepSeek V4 Flash 服务,适合内部知识库问答、超长文档分析、代码审查、研发助手、合规内网部署等场景。其最大卖点是单机运行 300k+ 级别上下文,减少多节点部署复杂度。不过商业落地需要评估硬件成本、并发能力、模型许可、运维稳定性和服务级别保障。
01

技术亮点

  • 单台 DGX Spark 即可运行 DeepSeek V4 Flash EXL3,不需要官方 FP4 方案要求的双 Spark TP2。
  • 提供自包含 Docker 启动方案,降低部署复杂度。
  • 默认启用 DSpark K5 speculative decoding,并使用 K64 draft model 提升解码性能。
  • 使用 nvfp4_ds_mla 压缩 KV cache,强调超长上下文 KV 容量。
  • 默认 384k 上下文配置,README 中报告 KV pool 可达约 439,622 tokens。
  • README 提供 320k 和 370k 上下文 needle-in-a-haystack 压测结果,显示可精确召回且无 preemption。
  • 暴露 OpenAI 兼容接口,便于接入现有应用、Agent 框架和 SDK。
  • 权重默认完整下载到本地 ./hf-hub,不依赖远程机器。
  • 提供可选 LAN 共享模式,适合多台 DGX Spark 复用同一份权重缓存。
  • MIT 许可证,便于开发者参考和二次集成。
02

目标用户

  • 拥有 NVIDIA DGX Spark 硬件的 AI 开发者
  • 需要本地部署 DeepSeek V4 Flash 的团队
  • 研究长上下文推理、KV cache 优化、speculative decoding 的工程师
  • 希望在单机上运行大模型而非多节点部署的开发者
  • 企业内部 AI 平台、私有化模型服务、推理基础设施团队
03

配置要求

  • 硬件必须是 NVIDIA DGX Spark 或高度匹配的 aarch64 + NVIDIA GB10/SM121 环境;该项目不是普通 x86_64 CUDA 服务器通用部署方案。
  • 需要约 128GiB 统一内存,启动时要求空闲主机内存至少约 114.3GiB。
  • 运行镜像为 aarch64-only,不适用于常规 x86 GPU 服务器。
  • 需要 Docker Engine、Docker Compose v2、NVIDIA Container Toolkit。
  • 需要访问 HuggingFace 下载模型权重,首次下载约 107GB。
  • 默认无需 HuggingFace 登录;遇到限流或私有模型时可设置 HF_TOKEN。
  • 默认服务端口为 8888,API 路径为 http://127.0.0.1:8888/v1。
  • 默认模型名为 deepseek-v4-flash-0731。
  • 主要参数位于 start.sh 中,而不是 compose.yml;compose.yml 每次由 start.sh 自动生成,不应手动修改。
  • 关键默认参数包括 MAX_MODEL_LEN=384000、MAX_NUM_SEQS=1、GPU_MEMORY_UTILIZATION=0.94、KV_RECORD=stock432。
04

适用场景

  • 在单台 DGX Spark 上部署 DeepSeek v4 Flash 服务
  • 构建 OpenAI API 兼容的本地大模型推理接口
  • 进行超长上下文问答、文档分析、代码库分析、检索增强生成测试
  • 验证 300k+ token 长上下文下的模型召回能力
  • 作为企业内网 LLM 服务或研发测试服务
  • 研究 NVFP4 KV cache、ExLlamaV3、DSpark 推测解码等推理优化方案
05

部署与配置

  • 准备一台 NVIDIA DGX Spark,要求 GB10、SM121、约 128GiB 统一内存,并确保 Docker 可访问 GPU。
  • 在 DGX OS / Linux aarch64 环境安装 Docker Engine、Docker Compose v2、NVIDIA Container Toolkit、curl。
  • 确保本地磁盘至少有 110GB 以上可用空间,用于下载 HuggingFace 权重和缓存。
  • 如果系统启用了 earlyoom,执行 sudo systemctl disable --now earlyoom,避免服务占用大量统一内存时被误杀。
  • 克隆仓库:git clone https://github.com/MiaAI-Lab/DeepSeek-v4-Flash-One-DGX-Spark.git
  • 进入项目目录:cd DeepSeek-v4-Flash-One-DGX-Spark
  • 执行 ./start.sh 启动服务。首次启动会拉取 Docker 镜像、下载约 107GB 权重、合并 TP4 到 TP1、构建 K64 draft、捕获 CUDA graphs。
  • 等待服务健康检查完成后,通过 http://127.0.0.1:8888/v1 使用 OpenAI 兼容接口调用模型。
  • 可选:使用 ./download.sh 预先下载、合并并校验权重,以便后续离线启动。
  • 可选:设置 REMOTE_HOST、REMOTE_USER、REMOTE_SHARE_DIR 等变量,通过 SSHFS 在局域网内复用权重副本。
06

风险与注意事项

  • 硬件要求极高且非常特定,普通开发者或常规 GPU 服务器基本无法直接使用。
  • 项目强绑定 aarch64 DGX Spark 运行环境,可移植性较弱。
  • 首次启动下载约 107GB 权重,耗时长且对网络、磁盘空间要求高。
  • 默认占用约 94% 统一内存,宿主机上其他进程可能导致启动失败或不稳定。
  • README 中的性能和稳定性数据来自特定硬件、特定启动状态和特定配置,实际结果可能因冷/热启动、JIT 缓存、内存碎片而波动。
  • 默认 MAX_NUM_SEQS=1,适合深上下文单请求,不适合高并发服务;提高并发会显著牺牲上下文长度。
  • 依赖 sparkinfer/b12x、ExLlamaV3、内核 backport、CUDA graph 等复杂底层组件,排障门槛较高。
  • README 提到部分修复和 postmortem 保留在本地而不在仓库中,可能影响可审计性。
  • 如果 earlyoom 或其他 OOM killer 未关闭,服务可能在正常高内存占用时被杀死。
  • compose.yml 自动生成,不熟悉 start.sh 的用户可能误改配置导致无效或被覆盖。

历史记录

热榜历史快照

2026-08-26 第27名 新收录 · github_search