Splash 是一个面向 Apple Silicon Mac 的本地大模型推理引擎,专为少量特定模型包做深度优化,重点服务代码智能体和兼容 OpenAI / Anthropic API 的客户端。它通过模型专属的 Metal kernel、DFlash 2 draft model、投机解码和启动时内存规划,在本地 Mac 上实现较高的解码速度、长上下文缓存和低首 token 延迟。当前主要支持 incoai 发布的 Qwen3.8-27B-Splash 与 Qwen3.6-35B-A3B-Splash 模型包,不支持直接加载普通 MLX 或 Transformers checkpoint。
适用领域
本地大模型推理 / Apple Silicon / macOS AI / 代码智能体基础设施 / LLM API Server / OpenAI / Anthropic API 兼容服务 / Metal GPU 加速 / 投机解码 / 长上下文推理 / 离线 AI 开发环境
配置难度
中等。作为普通用户通过 Homebrew 安装和启动官方模型较简单,但对硬件、系统和内存要求较高;如果要自定义模型包、调试服务配置、做 LAN 部署或从源码构建,则需要较强的 macOS、Hugging Face、LLM 推理和 API 集成经验。
商业价值
对拥有高配 Apple Silicon Mac 的个人开发者和小团队价值较高,可以在本地低延迟运行 coding agent,减少云端 API 成本并提升代码隐私保护。对企业内网研发场景也有吸引力,尤其是需要 OpenAI / Anthropic API 兼容、本地部署和长上下文代码分析的团队。但其商业价值受限于硬件门槛、模型选择较少和 Apple 生态绑定,更适合作为 Mac 本地 AI 开发基础设施,而不是通用跨平台推理服务。
01
技术亮点
- 针对 Apple Silicon 深度优化,使用 Metal 与模型专属 fused kernel。
- 模型包内置专属 DFlash 2 draft model,投机解码是默认路径而不是可选功能。
- 兼容 OpenAI Chat Completions、OpenAI Responses 和 Anthropic Messages API,便于接入现有工具链。
- 支持 streaming、tool calls、JSON Schema output、图片输入和 inline PDF。
- 面向 coding agents 有直接启动器支持,包括 opencode、claude、codex、hermes。
- 默认几乎零配置:安装后指定模型即可启动,自动下载模型并规划内存。
- 支持长上下文,理论上可到模型原生 256K,上限由本机内存决定。
- 性能数据亮眼:README 中 M5 Pro 48GB 上 Qwen3.6-35B-A3B 短 prompt decode 约 210 tok/s,Qwen3.8-27B 约 74 tok/s。
- 缓存 32K 上下文时首 token 延迟很低,README 数据中 Qwen3.8-27B 为 282ms,Qwen3.6-35B-A3B 为 123ms。
- Apache-2.0 许可证对商业使用友好,但模型权重需单独查看各自许可证。
02
目标用户
- 使用 M3/M4/M5 系列 Mac 的 AI 开发者
- 希望在本地运行代码模型和 coding agent 的程序员
- 需要 OpenAI 或 Anthropic 兼容本地 API 的团队
- 关注隐私、离线运行和数据不出本机的企业或个人开发者
- LLM 推理性能优化研究者
- 使用 Claude Code、Codex、OpenCode、Hermes 等 coding agent 的用户
- 希望避免云端 API 成本或网络依赖的开发团队
03
配置要求
- 硬性平台要求:仅面向 Apple Silicon,README 要求 Apple M3 或更新芯片,不适合 Intel Mac、Linux 服务器或 Windows。
- 系统要求:macOS 26.4 或更高版本。
- 内存要求:至少 36GB 统一内存,48GB 或以上更推荐;如果模型无法装入可用内存,启动会失败并打印内存预算。
- 模型格式要求:只能加载 Splash package 格式的模型,如 incoai/Qwen3.8-27B-Splash;普通 MLX 或 Transformers checkpoint 不可直接使用。
- 私有 Hugging Face 仓库需要设置 HF_TOKEN。
- 默认服务地址为 127.0.0.1:8000,可通过 --host 和 --port 修改,端口也可使用 SPLASH_PORT。
- 如需 API 鉴权,可设置 SPLASH_API_KEY 或启动时传入 --api-key;默认无鉴权,仅适合本机访问。
- 可通过 --max-memory 限制 Metal 内存分配,例如 28G。
- 可通过 --max-context 设置上下文上限,最高 256K,例如 100K 或 256K。
- KV cache 默认使用 int8,可通过 --kv-format bf16 切换为 BF16,但会消耗约两倍 target KV 内存,长上下文下可能更慢。
- 可通过 --max-image-pixels 限制图片输入像素。
- 可通过 --allowed-host 增加允许的 HTTP Host 名称。
- 可通过 --no-webui 关闭内置 Web 聊天页面。
04
适用场景
- 在 Mac 本地运行代码问答、代码生成、代码审查和重构助手
- 为 OpenAI Chat Completions、OpenAI Responses 或 Anthropic Messages 兼容客户端提供本地推理服务
- 作为 Claude、Codex、OpenCode、Hermes 等 coding agent 的本地后端
- 处理长上下文代码库分析,最高可配置到模型原生 256K 上下文窗口
- 本地聊天 Web UI 使用
- 通过 streaming、tool calls、JSON Schema 输出、图片和 PDF 输入构建本地 AI 应用
- 在无需生成文本的情况下使用 /v1/judgments 或 /v1/systemone 做评分类任务
- 对本地 Mac 上不同推理引擎进行性能 benchmark
05
部署与配置
- 确认硬件和系统要求:Apple M3 或更新芯片、macOS 26.4 或更高版本、至少 36GB 统一内存,推荐 48GB 或更高。
- 安装 Homebrew,如果尚未安装可从 https://brew.sh 获取。
- 通过 Homebrew 安装 Splash:brew install incoai/tap/splash
- 启动服务并指定模型,例如:splash serve --model incoai/Qwen3.8-27B-Splash
- 首次运行会自动下载并校验模型包,模型大小约 17.4GB 或 20.9GB,下载到 Hugging Face cache。
- 等待终端输出 Ready,服务默认监听 http://127.0.0.1:8000。
- 在浏览器打开 http://127.0.0.1:8000 使用内置聊天界面,或在另一个终端运行 coding agent 启动器,例如 splash opencode、splash claude、splash codex 或 splash hermes。
- 也可以通过 curl 或任意 OpenAI / Anthropic 兼容 SDK 调用 /v1/chat/completions、/v1/responses 或 /v1/messages。
- 停止服务时,在 server 终端按 Ctrl+C。
06
风险与注意事项
- 平台限制非常强,只适合 Apple Silicon Mac,且要求 M3 或更新与较新的 macOS。
- 内存门槛高,36GB 是最低要求,实际建议 48GB 或更高,普通 16GB/24GB Mac 基本不适合。
- 支持模型数量很少,当前 README 主要列出两个 incoai 官方 Splash package。
- 不能直接使用普通 Hugging Face Transformers 或 MLX 模型,需要专门打包成 Splash package。
- 项目依赖模型专属 kernel、draft model 和内存规划,扩展新模型的成本可能较高。
- README 中性能数据来自作者环境和特定 benchmark,实际效果会受芯片、内存、上下文长度、并发和客户端影响。
- 默认无 API 鉴权,如果将 --host 绑定到局域网或公网地址但未设置 API key,会有安全风险。
- macOS 26.4 这一系统要求较新,部分开发者环境可能暂时无法满足。
- 仓库 stars 约 610,仍属于相对新兴项目,生态、文档和第三方经验可能不如 Ollama、LM Studio 等成熟方案丰富。
- 模型权重有独立许可证,商业落地前需要逐一确认模型许可。
2026-09-23
第24名
新收录 · github_search