大模型部署

Splash

Apple Silicon 本地推理引擎:DFlash 2 推测解码 + Metal 内核,一条 brew 跑 Qwen3.8-27B

免费开源

Splash

一句话:给 Apple 芯片(M 系列)Mac 做的本地推理引擎——brew 一条命令装好,Mac 上跑 27B 模型,还能把编程智能体接上去。

它能帮你干什么

  • Mac 上本地跑大模型:内置推测解码(自动加速)、专用 Metal 内核、自动管内存
  • 一条 brew 命令安装,splash serve 起服务,浏览器直接聊
  • OpenAI 和 Anthropic 两套 API 全兼容、全支持流式——你现有的代码基本不用改
  • 一条命令把 OpenCode / Claude / Codex / Hermes 等编程智能体接到本地模型上
  • 支持视觉、工具调用、JSON 输出、图片、内联 PDF

适合谁

  • Mac 用户(M3 及以上,macOS 26.4+)想本地跑 27B 级编程智能体
  • 想要推测解码提速、又要双兼容 API 的开发者
  • 不想把代码和对话发到云端的人

硬件要求

你的 Mac 能跑什么
24GB 统一内存 更小的 GGUF 变体
36GB 统一内存 27B 模型 4 位量化(最低要求)
48GB 统一内存 27B 模型(推荐,更宽裕)

上手(两句话)

brew install incoai/tap/splash 装好,splash serve 起服务,默认就加载 Qwen3.8-27B 的 Q4_K_M 量化版。