这是一个面向本地运行大模型(Local LLM)的实践型指南仓库,作者记录了从约 2000 美元级别的双 RTX 3090 方案,到约 4 万美元级别的 4 张 RTX PRO 6000 工作站显卡方案,如何在本地部署较先进的开源大语言模型和语音识别模型。仓库内容包括硬件 BOM、PCIe Switch 组网经验、BIOS / GRUB / 内核参数、GPU P2P / NCCL 调优、Docker Compose 推理服务配置、Whisper 本地 STT 配置以及 GPU 互联性能测试脚本。它更像是一份高端本地 AI 工作站搭建手册,而不是传统意义上的软件库。
适用领域
本地大语言模型部署 / AI 工作站 / GPU 服务器搭建 / 大模型推理服务 / 多 GPU 并行推理 / 语音识别 STT / NVIDIA GPU 调优 / PCIe P2P / NCCL 性能优化 / Docker 化模型服务 / 私有化 AI 基础设施
配置难度
高。该仓库对普通开发者而言门槛较高,需要理解 Linux、Docker、NVIDIA 驱动、CUDA、vLLM、多 GPU 拓扑、PCIe、BIOS 配置和大模型推理。若只使用单卡或 STT runner,难度为中等;若复现 4 卡 RTX PRO 6000 + PCIe Switch 方案,难度很高。
商业价值
对需要私有化 AI 能力的团队有较高参考价值。它可以帮助企业或高级开发团队评估是否自建本地 LLM 推理基础设施,从而降低长期 API 成本、增强数据隐私、支持离线或内网环境,并为代码助手、语音转写、自动化研发代理等场景提供基础设施参考。不过,该仓库本身不是商业化产品,价值主要体现在硬件选型、部署经验和性能调优方法论。
01
技术亮点
- 内容非常实战,包含作者真实硬件采购、组装和踩坑经验。
- 覆盖从 2000 美元级别到 4 万美元级别的本地 LLM 硬件方案。
- 提供多 GPU 高性能推理中非常关键但资料较少的 PCIe Switch、ACS、IOMMU、NCCL 调优经验。
- 包含可直接参考的 Docker Compose runner 配置,适合快速启动模型服务。
- 关注本地化和隐私,适合不希望依赖 OpenAI、Anthropic 等云 API 的开发者。
- 不仅覆盖 LLM,也包含本地语音识别 whisper-large-v3 的部署思路。
- 对硬件成本、VRAM 容量、PCIe 拓扑和实际性能之间的取舍解释较清楚。
- 提供 GPU P2P 性能测试脚本,方便验证多 GPU 通信是否正常。
02
目标用户
- 希望在本地运行大模型的开发者
- AI Infra / MLOps 工程师
- 有多 GPU 服务器搭建经验的高级用户
- 需要私有化部署 LLM 的团队
- 关注数据隐私、不希望依赖云端模型 API 的开发者
- 想了解 RTX 3090、RTX 6000、PCIe Switch 等硬件方案的技术人员
- 有预算搭建本地 AI 推理工作站的个人或小团队
03
配置要求
- 硬件:至少需要一张 NVIDIA GPU;运行 whisper-large-v3 约需 11GB VRAM。
- 中低预算方案:作者建议 2 张 RTX 3090,总计 48GB VRAM,可运行较强的中等规模模型。
- 高预算方案:作者使用 4 张 RTX PRO 6000 Blackwell Workstation,总计 384GB VRAM,用于运行更大规模模型。
- 系统:Linux 环境,需支持 NVIDIA 驱动、Docker、Docker Compose。
- 模型下载:需要 Hugging Face CLI,并具备访问相应模型权重的权限。
- 存储:大模型权重通常需要数百 GB 到数 TB 存储空间,作者使用多块 NVMe 和 ZFS。
- 多 GPU 通信:若追求高性能 tensor parallel,需要正确配置 PCIe 拓扑、P2P、NCCL、ACS、IOMMU。
- BIOS 设置:可能需要设置 PCIe Link Width 为 x16、强制 Gen4、关闭 ASPM、启用 Re-Size BAR、关闭 SR-IOV。
- GRUB 参数:作者示例中使用 iommu=off amd_iommu=off nomodeset,以避免 NCCL 多 GPU P2P 挂起。
- NVIDIA UVM:作者建议配置 options nvidia_uvm uvm_disable_hmm=1。
- ACS:为保证 GPU P2P 流量留在 PCIe Switch 内部,作者通过 setpci 在启动时禁用 ACS。
- 网络:模型服务可通过内网 HTTP 地址访问,可配合本地 DNS 或直接使用机器 IP。
04
适用场景
- 搭建本地 LLM 推理服务器
- 在本地运行 Qwen、GLM 等大模型
- 使用 vLLM / Docker Compose 部署模型服务
- 本地运行 whisper-large-v3 做语音转文字
- 构建私有 AI 编程助手或代码代理环境
- 为内部 Gitea、代码仓库、自动化开发流程接入本地大模型
- 评估不同预算下的本地 AI 硬件方案
- 优化多 GPU 之间的 P2P 通信性能
- 验证 PCIe Switch、ACS、IOMMU、NCCL 对推理性能的影响
05
部署与配置
- 准备具备 NVIDIA GPU 的 Linux 主机,建议 Ubuntu / Debian 类系统。
- 安装 NVIDIA 驱动、CUDA 相关运行环境、Docker 和 Docker Compose。
- 准备本地模型存储目录,例如作者使用 ~/storage 或 ~/storage/models。
- 使用 Hugging Face CLI 下载模型权重,例如:hf download <model-name> --local-dir ~/storage/<model-name>。
- 进入仓库中的 runners 目录,选择对应模型的运行配置,例如 runners/GLM-5.2-594B 或 runners/stt。
- 根据本机模型路径、GPU 数量、服务端口修改 docker-compose.yml。
- 启动服务:docker compose up -d。
- 通过 HTTP API 访问模型服务,例如 http://<llm-machine-ip>:5000。
- 如使用多 GPU PCIe Switch 方案,需要额外配置 BIOS、GRUB、IOMMU、ACS、NVIDIA UVM 参数。
- 使用 tools/measure-gpu-speed.sh 或 NVIDIA 官方 p2pBandwidthLatencyTest 验证 GPU P2P 带宽和延迟。
06
风险与注意事项
- 仓库不是成熟软件产品,更像个人经验文档和配置集合,无法保证适用于所有硬件环境。
- 高端方案成本极高,4 张 RTX PRO 6000 级别机器总成本可达数万美元,不适合普通个人开发者。
- 涉及 BIOS、GRUB、IOMMU、ACS、setpci 等底层配置,操作不当可能导致系统无法启动、设备异常或稳定性问题。
- 关闭 IOMMU、禁用 ACS 等设置可能带来安全隔离风险,不一定适合生产多租户环境。
- 多 GPU P2P、PCIe Switch、NCCL 调试复杂,对 Linux、硬件和 NVIDIA 生态经验要求较高。
- README 中部分模型名称、硬件价格和性能指标具有时间敏感性,未来可能过时。
- 依赖 Hugging Face 模型,部分模型可能需要授权、登录或受地区网络影响。
- Docker 配置可能需要根据本地 GPU 数量、驱动版本、CUDA 版本、模型路径手工调整。
- 使用高功率 GPU 工作站存在供电、散热、噪音和安全风险,尤其是作者提到在 110V 电路上运行高功耗设备。
2026-07-10
第6名
新收录 · github_search
2026-07-09
第6名
新收录 · github_search
2026-07-08
第4名
新收录 · github_search
2026-07-07
第5名
新收录 · github_search
2026-07-06
第4名
新收录 · github_search
2026-07-05
第6名
新收录 · github_search