显卡与机箱全景

一台 i5-5600 + 32GB 内存 + 二手 RTX 3080 20G 魔改卡的普通主机,跑 Qwen3.8-27B,decode 稳定 30+ t/s、prefill 1200 t/s,再挂上 DeepSeek Harness 当 coding agent——这就是本文的"作业"。

先说结论

二手 3080 20G 魔改卡 + 普通主机,跑 27B 模型已经完全够用。 关键不是堆硬件,而是三件事:

  1. llama.cpp 按显卡架构编译(3080 是 A 系列,CMAKE_CUDA_ARCHITECTURES=86)
  2. KV cache 量化(-ctk q8_0 -ctv q4_0,把 KV 缓存的显存占着砍掉一半)
  3. DeepSeek Harness 加持(工具调用稳定,极少死循环)

配置与编译

部件 规格
CPU AMD Ryzen 5 5600
内存 32GB DDR4 3200
显卡 RTX 3080 20G 魔改卡(A100 架构,86 架构号)
系统 Ubuntu 26.04
llama.cpp v9737,Vulkan 后端
git clone https://github.com/ggerganov/llama.cpp
cmake -B build -D GGML_CUDA=ON -D CMAKE_CUDA_ARCHITECTURES=86 \
      -D LLAMA_BUILD_SERVER=ON -D LLAMA_BUILD_ALL_EXAMPLES=OFF
cmake --build build --config Release --parallel 2

启动参数(Qwen3.8-27B IQ4_XS,160K 上下文):

llama-server -m Qwen3.8-27B-thinkingcap-abliterated.IQ4_XS.gguf \
  -c 160768 -np 1 -ngl 99 -fa on \
  -b 4096 -ub 256 -t 18 -tb 18 \
  --temp 0.5 --top-p 0.9 \
  --cache-type-k q8_0 --cache-type-v q4_0

实测数据

场景 速度
初始状态 40+ t/s decode / 1200 t/s prefill
接上 DeepSeek Harness 35 t/s / 600 t/s(压缩上下文前)
长会话后期 30 t/s 稳定

几个值得知道的小细节

适合谁抄作业

手里有一张 20G+ 显存的 NVIDIA 卡、不想花大钱买 5090 的朋友。这套配置的核心价值是:用一千块级别的卡,跑 160K 上下文的 27B 模型,挂 agent 写代码,完全流畅。