
一台 i5-5600 + 32GB 内存 + 二手 RTX 3080 20G 魔改卡的普通主机,跑 Qwen3.8-27B,decode 稳定 30+ t/s、prefill 1200 t/s,再挂上 DeepSeek Harness 当 coding agent——这就是本文的"作业"。
先说结论
二手 3080 20G 魔改卡 + 普通主机,跑 27B 模型已经完全够用。 关键不是堆硬件,而是三件事:
- llama.cpp 按显卡架构编译(3080 是 A 系列,
CMAKE_CUDA_ARCHITECTURES=86) - KV cache 量化(
-ctk q8_0 -ctv q4_0,把 KV 缓存的显存占着砍掉一半) - DeepSeek Harness 加持(工具调用稳定,极少死循环)
配置与编译
| 部件 | 规格 |
|---|---|
| CPU | AMD Ryzen 5 5600 |
| 内存 | 32GB DDR4 3200 |
| 显卡 | RTX 3080 20G 魔改卡(A100 架构,86 架构号) |
| 系统 | Ubuntu 26.04 |
| llama.cpp | v9737,Vulkan 后端 |
git clone https://github.com/ggerganov/llama.cpp
cmake -B build -D GGML_CUDA=ON -D CMAKE_CUDA_ARCHITECTURES=86 \
-D LLAMA_BUILD_SERVER=ON -D LLAMA_BUILD_ALL_EXAMPLES=OFF
cmake --build build --config Release --parallel 2启动参数(Qwen3.8-27B IQ4_XS,160K 上下文):
llama-server -m Qwen3.8-27B-thinkingcap-abliterated.IQ4_XS.gguf \
-c 160768 -np 1 -ngl 99 -fa on \
-b 4096 -ub 256 -t 18 -tb 18 \
--temp 0.5 --top-p 0.9 \
--cache-type-k q8_0 --cache-type-v q4_0实测数据
| 场景 | 速度 |
|---|---|
| 初始状态 | 40+ t/s decode / 1200 t/s prefill |
| 接上 DeepSeek Harness | 35 t/s / 600 t/s(压缩上下文前) |
| 长会话后期 | 30 t/s 稳定 |
几个值得知道的小细节
- KV 量化精度损失见仁见智:Q8_0 的 K + Q4_0 的 V 组合,实际使用中工具调用失败率极低,DSH 对模型自身能力还有加成,能一定程度缓和 Qwen3.8 思考过长的问题
- 思考模式是双刃剑:首字会变慢,但工具调用的精准度和回答质量明显更高,跑 agent 值得开
- 魔改卡就是省:20G 显存的 3080 二手价格比 24G 3090 便宜一大截,跑 27B IQ4 量化绰绰有余
适合谁抄作业
手里有一张 20G+ 显存的 NVIDIA 卡、不想花大钱买 5090 的朋友。这套配置的核心价值是:用一千块级别的卡,跑 160K 上下文的 27B 模型,挂 agent 写代码,完全流畅。