本地部署最现实的问题:想要的模型比显存大。这篇讲清楚"显存不够"时各手段的真实效果,避免走弯路。

一、量化:性价比最高的第一步

量化就是把模型权重从 16 位压到 4~8 位。Q4 量化后,模型体积约为原参数的 0.5 倍左右——27B 模型 Q4 量化后约 16GB 出头,32GB 显存轻松装下。

精度取舍的经验:

二、CPU offload:能用,但要懂它的代价

offload 是把部分层放到内存/CPU 上,显存放不下时的兜底方案。但代价是速度:CPU 参与的层,速度可能是 GPU 的几分之一到几十分之一。

三、层切分:一个常见的误区

很多人以为把模型层切到多张 GPU 上能"翻倍"速度。实际效果取决于卡间互连带宽——普通 PCIe 互连带宽远小于单卡显存带宽,切分带来的通信开销往往吃掉大部分收益。单卡装得下就单卡跑,跨卡切分只在"一张卡装不下、且对速度不敏感"时考虑。

另外注意:跨厂商组多卡(比如 Intel Arc + AMD 混插)没有可用的互连方案,等于两张卡各跑各的,不要投入。

四、32GB 显存的实用组合(R9700 实测思路)

需求 建议配置
对话/Agent 27B Q4 全量 GPU
长上下文(128K+) 量化模型 + KV cache 优化,必要时少量 offload
跑不动更大的模型 换 7B~14B 的 Q8 也比 27B 大量 offload 快

核心原则:速度优先选"装得下的最大量化模型",而不是"勉强 offload 的更大模型"。显存是本地部署的第一约束,围绕它做决策。