Python · 项目报告

StayLameBro/backburner

Your iPhone helps your Mac run a 27B model: faster prompt reading and more context over a USB-C cable

已完成 打开 GitHub
S
638星标
63Fork
8Issue
MIT许可证

分析结果

项目分析

Backburner 是一个面向 Apple Silicon Mac + iPhone/iPad 的本地大模型推理加速项目。它基于 llama.cpp fork,通过 USB-C 让 iPhone GPU/Neural Engine 分担 Qwen3.8-27B 的部分计算,实现更快的长提示词 prefill、更大的上下文窗口,以及 OpenAI 兼容的本地服务接口。项目重点优化 Mac 本地 LLM Agent 场景,例如读取大文件、工具返回结果、多轮长上下文会话。

适用领域 本地大语言模型推理 / Apple Silicon / macOS / iOS 计算加速 / llama.cpp 生态 / 端侧 AI / 边缘 AI / 长上下文推理 / LLM Agent 工具链 / Metal / SME2 / Neural Engine 优化 / 推测解码 speculative decoding
配置难度 高。该项目面向熟悉本地 LLM、llama.cpp、Apple 开发工具链、模型量化与推理参数的开发者。虽然提供一键安装脚本,但真实使用仍涉及大模型下载、iPhone App 安装、模型切分、USB 连接、ANE/CoreML 依赖和长上下文调试。普通用户上手难度较大。
商业价值 中高。对于需要本地运行大模型、保护私有代码和文档、并希望提升长上下文 Agent 响应速度的团队,该项目具有明显价值,尤其适合 Apple 设备存量较多的研发团队。它可以降低对云端推理服务的依赖,提升隐私和离线能力,也展示了手机作为协处理器的产品化可能。但其商业化受限于硬件要求高、生态封闭、部署复杂、并发能力弱和设备兼容性不确定,短期更适合作为高端开发者工具、研究原型或本地 AI 工作站增强方案。
01

技术亮点

  • 创新地将 iPhone 作为 Mac 本地 LLM 推理协处理器,通过 USB-C 分担模型后半层或旧 KV attention 计算。
  • 在 16k-48k 上下文读取 2000-token 文件时,prefill 提升约 29%-44%。
  • 24GB Mac 单机 8-bit 上下文实测约 64k;结合 iPhone 后,按手机空闲内存可扩展到约 196k-229k,端到端测试到 128k 8-bit 和 140k 4-bit。
  • 使用 OpenAI-compatible server,便于接入现有 Agent、IDE 或本地推理工具。
  • 项目包含 llama.cpp fork,并实现 SME2、Metal fusion、DFlash2 speculative decoding、SSD prompt cache 等多项优化。
  • 在低于 64k 上下文时,iPhone 可参与 split prefill;超过 64k 后,iPhone 主要用于持有旧 KV 并计算 attention。
  • 强调 greedy 输出在测试中与无手机模式 token-identical,目标是保持推理结果一致性。
  • 支持通过 AltStore 安装 iPhone App,无需付费 Apple Developer 账号。
  • MIT 许可证,适合研究、二次开发和商业评估。
02

目标用户

  • 使用 Apple Silicon Mac 运行本地大模型的开发者
  • 希望在本地运行 Qwen 27B 级模型的 AI 工程师
  • 构建代码 Agent、文档 Agent、自动化工具 Agent 的开发者
  • 拥有较新 iPhone 或 M 系列 iPad,并希望利用其算力的极客用户
  • 关注隐私、本地推理、不希望把代码或数据上传云端的团队
  • 研究 Apple 端侧异构计算、Metal、ANE、llama.cpp 优化的开发者
03

配置要求

  • 硬件:Apple Silicon Mac;实测为 M4 Pro 24GB。
  • 手机:iPhone 15 Pro 或更新,实测 iPhone 17 Pro Max / 16 Pro Max;M 系列 iPad 支持但未充分验证。
  • 连接:建议 10Gb/s USB-C 线缆,USB 2 线缆会成为瓶颈。
  • 系统:macOS + iOS,需能运行 AltStore 或 Xcode 安装 App。
  • 模型:Qwen3.8-27B IQ4_XS GGUF 主模型,以及 DFlash2 draft model。模型和引擎下载约 24GB。
  • Python:需要 Python 3,部分脚本依赖 huggingface-cli、coremltools。
  • 构建工具:手动构建需要 cmake、Xcode/Apple 开发工具链。
  • 运行限制:当前一次只支持一个请求,即 -np 1。
  • 手机状态:超过 64k 上下文时,Backburner App 必须保持前台运行且屏幕不能锁定,否则 Mac 端会停止。
  • 内存:项目围绕 24GB Mac 进行了优化,但长上下文和 27B 模型仍对内存、显存和系统稳定性有较高要求。
04

适用场景

  • 在 Mac 本地运行 Qwen3.8-27B,并通过 iPhone 加速长 prompt 读取
  • 为代码 Agent 提供更快的大文件读取和工具结果处理能力
  • 在 24GB 内存 Mac 上扩展 8-bit 上下文容量,从约 64k 提升到接近 196k-229k 的理论范围
  • 搭建 OpenAI-compatible 本地 API 服务,供 IDE、Agent 框架或脚本调用
  • 研究 Mac GPU、CPU SME2、iPhone GPU、iPhone Neural Engine 的混合推理架构
  • 离线处理私有代码库、文档、日志等长上下文数据
  • 测试 speculative decoding、KV cache 外移、phone-held context 等推理优化技术
05

部署与配置

  • 准备 Apple Silicon Mac,推荐 M4 Pro 或更新,README 测试环境为 24GB MacBook Pro M4 Pro。
  • 准备 iPhone 15 Pro 或更新机型,README 测试为 iPhone 17 Pro Max、iPhone 16 Pro Max;M 系列 iPad 理论支持但未充分测试。
  • 准备 10Gb/s USB-C 数据线;iPhone 包装内线缆通常是 USB 2,速度不够。
  • 可使用一键安装:curl -fsSL https://raw.githubusercontent.com/StayLameBro/backburner/main/install.sh | bash
  • 插入手机并打开 Backburner App,然后运行:backburner phone,用于复制手机侧模型分片。
  • 启动服务:backburner,默认提供 OpenAI 兼容接口:http://127.0.0.1:8080/v1
  • 手动安装方式包括:git clone --recursive 仓库、使用 cmake 构建 llama.cpp fork、下载 Qwen3.8-27B-DFlash2 相关模型、安装 iPhone App、运行 split-gguf.py 生成手机侧模型分片。
  • iPhone App 可通过 AltStore 使用免费 Apple ID 安装,或使用 Xcode 自行构建。
  • 需要安装 coremltools:pip3 install coremltools,用于生成手机 Neural Engine 页面模型。
06

风险与注意事项

  • 硬件门槛很高,需要较新的 Apple Silicon Mac、新款 iPhone/iPad 和高速 USB-C 线缆。
  • 项目高度依赖 Apple 私有生态、Metal、ANE、SME2 等特性,跨平台价值有限。
  • README 中测试设备较少,主要集中在 M4 Pro + iPhone 17/16 Pro Max,其他设备表现和稳定性未知。
  • M 系列 iPad 虽支持安装但 README 表示尚未充分测试。
  • 超过 64k 上下文时,手机必须保持 App 前台,iOS 后台限制会影响稳定性和体验。
  • 当前只支持单请求并发,服务端吞吐能力有限。
  • 需要下载和处理大型模型文件,安装和排错成本较高。
  • 使用 llama.cpp fork,可能与上游 llama.cpp 更新存在兼容和维护风险。
  • 项目涉及模型切分、手机端 App、USB/Wi-Fi 通信、ANE 页面编译等多个复杂环节,部署失败点较多。
  • 安全方面虽然说明了 USB 和加密 Wi-Fi 配对机制,但早期版本存在 Wi-Fi 连接行为差异,用户需确保 App 更新到较新版本。
  • README 中部分日期、设备如 iPhone 17 Pro Max、2026 测试数据带有前瞻性或非常新,实际复现时需谨慎验证。

历史记录

热榜历史快照

2026-10-06 第18名 新收录 · github_search