Python · 项目报告

incoai/splash

A local inference engine for Apple silicon, built around the model.

已完成 打开 GitHub
I
610星标
51Fork
35Issue
Apache-2.0许可证

分析结果

项目分析

Splash 是一个面向 Apple Silicon Mac 的本地大模型推理引擎,专为少量特定模型包做深度优化,重点服务代码智能体和兼容 OpenAI / Anthropic API 的客户端。它通过模型专属的 Metal kernel、DFlash 2 draft model、投机解码和启动时内存规划,在本地 Mac 上实现较高的解码速度、长上下文缓存和低首 token 延迟。当前主要支持 incoai 发布的 Qwen3.8-27B-Splash 与 Qwen3.6-35B-A3B-Splash 模型包,不支持直接加载普通 MLX 或 Transformers checkpoint。

适用领域 本地大模型推理 / Apple Silicon / macOS AI / 代码智能体基础设施 / LLM API Server / OpenAI / Anthropic API 兼容服务 / Metal GPU 加速 / 投机解码 / 长上下文推理 / 离线 AI 开发环境
配置难度 中等。作为普通用户通过 Homebrew 安装和启动官方模型较简单,但对硬件、系统和内存要求较高;如果要自定义模型包、调试服务配置、做 LAN 部署或从源码构建,则需要较强的 macOS、Hugging Face、LLM 推理和 API 集成经验。
商业价值 对拥有高配 Apple Silicon Mac 的个人开发者和小团队价值较高,可以在本地低延迟运行 coding agent,减少云端 API 成本并提升代码隐私保护。对企业内网研发场景也有吸引力,尤其是需要 OpenAI / Anthropic API 兼容、本地部署和长上下文代码分析的团队。但其商业价值受限于硬件门槛、模型选择较少和 Apple 生态绑定,更适合作为 Mac 本地 AI 开发基础设施,而不是通用跨平台推理服务。
01

技术亮点

  • 针对 Apple Silicon 深度优化,使用 Metal 与模型专属 fused kernel。
  • 模型包内置专属 DFlash 2 draft model,投机解码是默认路径而不是可选功能。
  • 兼容 OpenAI Chat Completions、OpenAI Responses 和 Anthropic Messages API,便于接入现有工具链。
  • 支持 streaming、tool calls、JSON Schema output、图片输入和 inline PDF。
  • 面向 coding agents 有直接启动器支持,包括 opencode、claude、codex、hermes。
  • 默认几乎零配置:安装后指定模型即可启动,自动下载模型并规划内存。
  • 支持长上下文,理论上可到模型原生 256K,上限由本机内存决定。
  • 性能数据亮眼:README 中 M5 Pro 48GB 上 Qwen3.6-35B-A3B 短 prompt decode 约 210 tok/s,Qwen3.8-27B 约 74 tok/s。
  • 缓存 32K 上下文时首 token 延迟很低,README 数据中 Qwen3.8-27B 为 282ms,Qwen3.6-35B-A3B 为 123ms。
  • Apache-2.0 许可证对商业使用友好,但模型权重需单独查看各自许可证。
02

目标用户

  • 使用 M3/M4/M5 系列 Mac 的 AI 开发者
  • 希望在本地运行代码模型和 coding agent 的程序员
  • 需要 OpenAI 或 Anthropic 兼容本地 API 的团队
  • 关注隐私、离线运行和数据不出本机的企业或个人开发者
  • LLM 推理性能优化研究者
  • 使用 Claude Code、Codex、OpenCode、Hermes 等 coding agent 的用户
  • 希望避免云端 API 成本或网络依赖的开发团队
03

配置要求

  • 硬性平台要求:仅面向 Apple Silicon,README 要求 Apple M3 或更新芯片,不适合 Intel Mac、Linux 服务器或 Windows。
  • 系统要求:macOS 26.4 或更高版本。
  • 内存要求:至少 36GB 统一内存,48GB 或以上更推荐;如果模型无法装入可用内存,启动会失败并打印内存预算。
  • 模型格式要求:只能加载 Splash package 格式的模型,如 incoai/Qwen3.8-27B-Splash;普通 MLX 或 Transformers checkpoint 不可直接使用。
  • 私有 Hugging Face 仓库需要设置 HF_TOKEN。
  • 默认服务地址为 127.0.0.1:8000,可通过 --host 和 --port 修改,端口也可使用 SPLASH_PORT。
  • 如需 API 鉴权,可设置 SPLASH_API_KEY 或启动时传入 --api-key;默认无鉴权,仅适合本机访问。
  • 可通过 --max-memory 限制 Metal 内存分配,例如 28G。
  • 可通过 --max-context 设置上下文上限,最高 256K,例如 100K 或 256K。
  • KV cache 默认使用 int8,可通过 --kv-format bf16 切换为 BF16,但会消耗约两倍 target KV 内存,长上下文下可能更慢。
  • 可通过 --max-image-pixels 限制图片输入像素。
  • 可通过 --allowed-host 增加允许的 HTTP Host 名称。
  • 可通过 --no-webui 关闭内置 Web 聊天页面。
04

适用场景

  • 在 Mac 本地运行代码问答、代码生成、代码审查和重构助手
  • 为 OpenAI Chat Completions、OpenAI Responses 或 Anthropic Messages 兼容客户端提供本地推理服务
  • 作为 Claude、Codex、OpenCode、Hermes 等 coding agent 的本地后端
  • 处理长上下文代码库分析,最高可配置到模型原生 256K 上下文窗口
  • 本地聊天 Web UI 使用
  • 通过 streaming、tool calls、JSON Schema 输出、图片和 PDF 输入构建本地 AI 应用
  • 在无需生成文本的情况下使用 /v1/judgments 或 /v1/systemone 做评分类任务
  • 对本地 Mac 上不同推理引擎进行性能 benchmark
05

部署与配置

  • 确认硬件和系统要求:Apple M3 或更新芯片、macOS 26.4 或更高版本、至少 36GB 统一内存,推荐 48GB 或更高。
  • 安装 Homebrew,如果尚未安装可从 https://brew.sh 获取。
  • 通过 Homebrew 安装 Splash:brew install incoai/tap/splash
  • 启动服务并指定模型,例如:splash serve --model incoai/Qwen3.8-27B-Splash
  • 首次运行会自动下载并校验模型包,模型大小约 17.4GB 或 20.9GB,下载到 Hugging Face cache。
  • 等待终端输出 Ready,服务默认监听 http://127.0.0.1:8000。
  • 在浏览器打开 http://127.0.0.1:8000 使用内置聊天界面,或在另一个终端运行 coding agent 启动器,例如 splash opencode、splash claude、splash codex 或 splash hermes。
  • 也可以通过 curl 或任意 OpenAI / Anthropic 兼容 SDK 调用 /v1/chat/completions、/v1/responses 或 /v1/messages。
  • 停止服务时,在 server 终端按 Ctrl+C。
06

风险与注意事项

  • 平台限制非常强,只适合 Apple Silicon Mac,且要求 M3 或更新与较新的 macOS。
  • 内存门槛高,36GB 是最低要求,实际建议 48GB 或更高,普通 16GB/24GB Mac 基本不适合。
  • 支持模型数量很少,当前 README 主要列出两个 incoai 官方 Splash package。
  • 不能直接使用普通 Hugging Face Transformers 或 MLX 模型,需要专门打包成 Splash package。
  • 项目依赖模型专属 kernel、draft model 和内存规划,扩展新模型的成本可能较高。
  • README 中性能数据来自作者环境和特定 benchmark,实际效果会受芯片、内存、上下文长度、并发和客户端影响。
  • 默认无 API 鉴权,如果将 --host 绑定到局域网或公网地址但未设置 API key,会有安全风险。
  • macOS 26.4 这一系统要求较新,部分开发者环境可能暂时无法满足。
  • 仓库 stars 约 610,仍属于相对新兴项目,生态、文档和第三方经验可能不如 Ollama、LM Studio 等成熟方案丰富。
  • 模型权重有独立许可证,商业落地前需要逐一确认模型许可。

历史记录

热榜历史快照

2026-09-23 第24名 新收录 · github_search