strata-old-gpu-8gb-11gb/hero.jpg" alt="8GB 和 11GB 老显卡跑 125B 大模型">

2019 年的 RX 5500 XT(8GB)和 RTX 2080 Ti(11GB),到 2026 年还能跑 125B 的 MoE 大模型吗?Strata 的长尾支持给出了肯定的答案:8GB 的卡能到 15-22 tok/s,11GB 的卡甚至能跑满 262K 的完整上下文窗口。这篇文章把小显存、老架构卡的实测数据、配置和"能跑但别期待太高"的真实边界讲清楚。

为什么老卡也能跑:Strata 的长尾支持逻辑

Strata 把模型权重按量化分片,专家池放内存和 SSD,GPU 只负责最热门的专家缓存。这个设计意味着:显卡的显存决定命中率,但不决定能不能跑——8GB 显存装不下全部专家,但装得下"够用的那一小部分",剩下走内存。

更关键的是它对老架构的源码构建路径支持:Turing(sm_75)、Ampere(sm_86)、甚至 Volta/Pascal 时代的计算卡,都有对应的实验性 CUDA/HIP 构建路径。

实测数据:小显存端的三组锚点

RTX 2080 Ti 11GB(Turing sm_75,Threadripper 3960X)——最亮眼的

这是 Strata 社区最极端的案例:11GB 的卡跑满 262,144 token 的完整上下文窗口。

场景 prefill decode
128K 冷 prompt 566 tok/s(226.6 秒填完) 34.1 tok/s
250K 深度 follow-up 只读 470 个新 token(3.56 秒) 34.6 tok/s

关键细节:

证明:11GB 显存 + 大内存 + KV 流式,能跑满 125B 的完整窗口,代价是 prefill 慢(128K 要 4 分钟)。

RX 5500 XT 8GB(RDNA1 gfx1012,2019 年)——长尾支持的代表

走手动 Linux HIP 源码构建路径,Ryzen 5 3600 + 56GB DDR4:

任务 输出 MTP off MTP on
counting 512 11.35 tok/s 16.81 tok/s
coding 125 10.45 tok/s 15.30 tok/s
writing 232 10.17 tok/s 10.91 tok/s

坑:MTP 加速了 decode,但增加了 prefill 时间——对 8K 的新请求,总完成时长反而变长了。8GB 卡上开不开 MTP 要按场景判断:长对话 follow-up 开,大量新请求关。

Tesla P4 8GB(Pascal sm_61,计算卡)——最低门槛

CUDA 12.x 实验性支持,bounded FP32 prefill 路径,IQ3_S + Q8 KV:

老卡/小卡跑 125B 的真实边界

显卡 显存 decode 能跑满 262K 窗口 备注
RX 5500 XT 8GB 10-17 tok/s 否(8K 上下文) 手动 HIP 构建,MTP 按需开
Tesla P4 8GB 15-22 tok/s 否(8K 上下文) 计算卡,FP32 prefill
RTX 2080 Ti 11GB 34 tok/s 是(满窗口) KV streaming,显存压满
RTX 3500 Ada 12GB 9-10 tok/s 否 消费级内存带宽限制

规律:显存越大、内存越多、KV 流式打开,老卡越接近"实用"。 8GB 卡是"能跑起来看看",11GB + 大内存 + KV streaming 是能跑满窗口的真·可用。

三个实用建议

  1. 别只看显存,内存带宽是隐藏瓶颈。 2080 Ti 能跑满窗口,一半功劳在 Threadripper 的大内存带宽。8GB 卡配 56GB 内存和配 32GB 内存,速度差一大截。
  2. 老架构要走源码构建,别用预编译包。 5500 XT 是手动 Linux HIP 路径,Turing/Ampere 老卡也常有专门的实验性构建,README 里的预编译包不一定覆盖。
  3. MTP 按场景开关。 老卡/小卡上 MTP 的 prefill 开销占比更高,长对话 follow-up 值得开,大量独立新请求反而拖累总时长。

数据出处

本文数据来自 Strata 官方仓库(github.com/Niko1221/Strata)社区 benchmark issue:2080 Ti 11GB 满窗口实测 #469、5500 XT 8GB HIP 构建 #323、Tesla P4 8GB 实验支持 #336、3500 Ada 12GB #6。