Backburner 是一个面向 Apple Silicon Mac + iPhone/iPad 的本地大模型推理加速项目。它基于 llama.cpp fork,通过 USB-C 让 iPhone GPU/Neural Engine 分担 Qwen3.8-27B 的部分计算,实现更快的长提示词 prefill、更大的上下文窗口,以及 OpenAI 兼容的本地服务接口。项目重点优化 Mac 本地 LLM Agent 场景,例如读取大文件、工具返回结果、多轮长上下文会话。
适用领域
本地大语言模型推理 / Apple Silicon / macOS / iOS 计算加速 / llama.cpp 生态 / 端侧 AI / 边缘 AI / 长上下文推理 / LLM Agent 工具链 / Metal / SME2 / Neural Engine 优化 / 推测解码 speculative decoding
配置难度
高。该项目面向熟悉本地 LLM、llama.cpp、Apple 开发工具链、模型量化与推理参数的开发者。虽然提供一键安装脚本,但真实使用仍涉及大模型下载、iPhone App 安装、模型切分、USB 连接、ANE/CoreML 依赖和长上下文调试。普通用户上手难度较大。
商业价值
中高。对于需要本地运行大模型、保护私有代码和文档、并希望提升长上下文 Agent 响应速度的团队,该项目具有明显价值,尤其适合 Apple 设备存量较多的研发团队。它可以降低对云端推理服务的依赖,提升隐私和离线能力,也展示了手机作为协处理器的产品化可能。但其商业化受限于硬件要求高、生态封闭、部署复杂、并发能力弱和设备兼容性不确定,短期更适合作为高端开发者工具、研究原型或本地 AI 工作站增强方案。
01
技术亮点
- 创新地将 iPhone 作为 Mac 本地 LLM 推理协处理器,通过 USB-C 分担模型后半层或旧 KV attention 计算。
- 在 16k-48k 上下文读取 2000-token 文件时,prefill 提升约 29%-44%。
- 24GB Mac 单机 8-bit 上下文实测约 64k;结合 iPhone 后,按手机空闲内存可扩展到约 196k-229k,端到端测试到 128k 8-bit 和 140k 4-bit。
- 使用 OpenAI-compatible server,便于接入现有 Agent、IDE 或本地推理工具。
- 项目包含 llama.cpp fork,并实现 SME2、Metal fusion、DFlash2 speculative decoding、SSD prompt cache 等多项优化。
- 在低于 64k 上下文时,iPhone 可参与 split prefill;超过 64k 后,iPhone 主要用于持有旧 KV 并计算 attention。
- 强调 greedy 输出在测试中与无手机模式 token-identical,目标是保持推理结果一致性。
- 支持通过 AltStore 安装 iPhone App,无需付费 Apple Developer 账号。
- MIT 许可证,适合研究、二次开发和商业评估。
02
目标用户
- 使用 Apple Silicon Mac 运行本地大模型的开发者
- 希望在本地运行 Qwen 27B 级模型的 AI 工程师
- 构建代码 Agent、文档 Agent、自动化工具 Agent 的开发者
- 拥有较新 iPhone 或 M 系列 iPad,并希望利用其算力的极客用户
- 关注隐私、本地推理、不希望把代码或数据上传云端的团队
- 研究 Apple 端侧异构计算、Metal、ANE、llama.cpp 优化的开发者
03
配置要求
- 硬件:Apple Silicon Mac;实测为 M4 Pro 24GB。
- 手机:iPhone 15 Pro 或更新,实测 iPhone 17 Pro Max / 16 Pro Max;M 系列 iPad 支持但未充分验证。
- 连接:建议 10Gb/s USB-C 线缆,USB 2 线缆会成为瓶颈。
- 系统:macOS + iOS,需能运行 AltStore 或 Xcode 安装 App。
- 模型:Qwen3.8-27B IQ4_XS GGUF 主模型,以及 DFlash2 draft model。模型和引擎下载约 24GB。
- Python:需要 Python 3,部分脚本依赖 huggingface-cli、coremltools。
- 构建工具:手动构建需要 cmake、Xcode/Apple 开发工具链。
- 运行限制:当前一次只支持一个请求,即 -np 1。
- 手机状态:超过 64k 上下文时,Backburner App 必须保持前台运行且屏幕不能锁定,否则 Mac 端会停止。
- 内存:项目围绕 24GB Mac 进行了优化,但长上下文和 27B 模型仍对内存、显存和系统稳定性有较高要求。
04
适用场景
- 在 Mac 本地运行 Qwen3.8-27B,并通过 iPhone 加速长 prompt 读取
- 为代码 Agent 提供更快的大文件读取和工具结果处理能力
- 在 24GB 内存 Mac 上扩展 8-bit 上下文容量,从约 64k 提升到接近 196k-229k 的理论范围
- 搭建 OpenAI-compatible 本地 API 服务,供 IDE、Agent 框架或脚本调用
- 研究 Mac GPU、CPU SME2、iPhone GPU、iPhone Neural Engine 的混合推理架构
- 离线处理私有代码库、文档、日志等长上下文数据
- 测试 speculative decoding、KV cache 外移、phone-held context 等推理优化技术
05
部署与配置
- 准备 Apple Silicon Mac,推荐 M4 Pro 或更新,README 测试环境为 24GB MacBook Pro M4 Pro。
- 准备 iPhone 15 Pro 或更新机型,README 测试为 iPhone 17 Pro Max、iPhone 16 Pro Max;M 系列 iPad 理论支持但未充分测试。
- 准备 10Gb/s USB-C 数据线;iPhone 包装内线缆通常是 USB 2,速度不够。
- 可使用一键安装:curl -fsSL https://raw.githubusercontent.com/StayLameBro/backburner/main/install.sh | bash
- 插入手机并打开 Backburner App,然后运行:backburner phone,用于复制手机侧模型分片。
- 启动服务:backburner,默认提供 OpenAI 兼容接口:http://127.0.0.1:8080/v1
- 手动安装方式包括:git clone --recursive 仓库、使用 cmake 构建 llama.cpp fork、下载 Qwen3.8-27B-DFlash2 相关模型、安装 iPhone App、运行 split-gguf.py 生成手机侧模型分片。
- iPhone App 可通过 AltStore 使用免费 Apple ID 安装,或使用 Xcode 自行构建。
- 需要安装 coremltools:pip3 install coremltools,用于生成手机 Neural Engine 页面模型。
06
风险与注意事项
- 硬件门槛很高,需要较新的 Apple Silicon Mac、新款 iPhone/iPad 和高速 USB-C 线缆。
- 项目高度依赖 Apple 私有生态、Metal、ANE、SME2 等特性,跨平台价值有限。
- README 中测试设备较少,主要集中在 M4 Pro + iPhone 17/16 Pro Max,其他设备表现和稳定性未知。
- M 系列 iPad 虽支持安装但 README 表示尚未充分测试。
- 超过 64k 上下文时,手机必须保持 App 前台,iOS 后台限制会影响稳定性和体验。
- 当前只支持单请求并发,服务端吞吐能力有限。
- 需要下载和处理大型模型文件,安装和排错成本较高。
- 使用 llama.cpp fork,可能与上游 llama.cpp 更新存在兼容和维护风险。
- 项目涉及模型切分、手机端 App、USB/Wi-Fi 通信、ANE 页面编译等多个复杂环节,部署失败点较多。
- 安全方面虽然说明了 USB 和加密 Wi-Fi 配对机制,但早期版本存在 Wi-Fi 连接行为差异,用户需确保 App 更新到较新版本。
- README 中部分日期、设备如 iPhone 17 Pro Max、2026 测试数据带有前瞻性或非常新,实际复现时需谨慎验证。
2026-10-06
第18名
新收录 · github_search