同样 24GB 显存,RTX 3090 和 AMD RX 7900 XTX 是本地大模型部署里最常被讨论的两张消费级卡。这篇把它们和 RTX 4090 放在一起,用公开实测数据说清楚:24GB 这个容量到底能装下多大的模型,N 卡和 A 卡在推理速度上的真实差距有多大,以及各自踩过的坑。
一、先记住一个结论:显存容量 > 算力,24GB 是消费级的甜点
本地跑大模型,第一约束不是 TFLOPS,是模型权重装不装得下。一个 7B 模型 FP16 加载光权重就要约 14GB,加上 KV Cache 和运行时开销,16GB 的卡上下文稍微拉长就 OOM。
量化是绕不开的一步。GGUF Q4_K_M 量化后的大致占用:7B 约 4.2GB,14B 约 8.5GB,32B 约 20GB,70B 约 37GB。对照下来:
| 模型规模 | Q4_K_M 量化后 | 16GB 卡 | 24GB 卡 | 32GB 卡 |
|---|---|---|---|---|
| 7B/8B | ~4.5GB | 舒适,可拉大上下文 | 轻松 | 轻松 |
| 14B | ~8.5GB | 可用 | 舒适 | 舒适 |
| 32B | ~20GB | 装不下 | 紧但能跑 | 舒适,还有余量 |
| 70B | ~37GB | 不可能 | 仅 INT4 极限 + offload | offload 勉强跑通 |
32GB 能轻松装下 32B Q4 还留长上下文空间;24GB 卡在"32B 能跑但没余量"的位置——这就是 24GB 卡的核心定位:中小模型的全能选手,大模型的极限选手。
二、N 卡侧:3090 和 4090 的实测差距没有纸面参数那么大
公开实测(Ollama,Qwen3,8 组复杂度相近的 prompt,MAX_TOKENS=256):
| 指标 | 3090 | 4090 | 4090/3090 |
|---|---|---|---|
| 显存 | 24GB GDDR6X | 24GB GDDR6X | 相同 |
| 显存带宽 | 936 GB/s | 1008 GB/s | 1.08x |
| TDP | 350W | 450W | 1.29x |
| qwen3:8b FP16 生成速度 | 47.46 tok/s | 52.45 tok/s | 1.10x |
| qwen3:14b Q4_K_M 生成速度 | 67.62 tok/s | 77.31 tok/s | 1.14x |
| 8b 平均响应时长 | 5.39s | 4.88s | 快 9% |
两张卡的显存容量相同、带宽差距只有 8%,所以推理速度差距只有 10%~14%,远小于纸面算力 2.3 倍的差距——LLM 生成阶段(decode)是显存带宽瓶颈,不是算力瓶颈。3090 二手价格通常只有 4090 的一半左右,单卡跑 24GB 档模型,3090 的性价比普遍更高;4090 的优势在训练/微调(算力优势开始体现)和更长的驱动支持周期。
另一份单卡 vLLM 实测参考:3090 跑 Qwen 9B 可稳定到 75 tok/s 级别;跑 7B 模型 8192 tokens 长文本生成没有压力。
三、A 卡侧:7900 XTX 的量化阶梯与两个反直觉点
RX 7900 XTX(24GB GDDR6,RDNA3,显存带宽 960 GB/s)的公开极限测试数据:
| 量化精度 | 24GB 可承载参数 | 生成速度 | 精度损失 |
|---|---|---|---|
| FP16 | ~10B-12B | 15-20 tok/s | 无 |
| INT8 | ~20B-24B | 25-35 tok/s | 极小 |
| INT4 (Q4_K_M) | ~60B-70B | 40-55 tok/s | 轻微 |
两个反直觉点,都是社区实测反复验证过的:
- 24GB 显存不等于长上下文自由。有实测案例:7900 XTX 跑 7B 模型反而比 16GB 的 4080 更早爆显存——ROCm 栈的默认配置下 KV Cache 和中间激活的显存占用比 CUDA 栈明显更大。同样"装得下",A 卡留给上下文的余量更少,长上下文场景要主动砍 ctx 或降量化精度。
- ROCm 不是唯一快路径。有用户在 Windows 环境实测发现 Vulkan 后端跑 LLM 反而比 ROCm 快——AMD 的软件栈还在快速迭代期,换后端可能是免费的速度提升,值得在自己卡上各试一遍。
ROCm 环境两个必查项
# 1. RDNA3/RDNA4 识别异常时,强制指定 GFX 版本(R9700 等 RDNA4 尤其注意)
export HSA_OVERRIDE_GFX_VERSION=11.0.0
ollama serve
# 2. 用 rocm-smi 盯温度/功耗,显存过热会降频,直接吃掉 tokens/s
watch -n 1 rocm-smiOllama 调参侧:num_ctx 决定能记住多长的对话历史,num_batch 影响并行处理能力,24GB 卡上 num_batch=512~1024 通常是吞吐比甜点,过大会显存溢出,过小吃不满 GPU。
四、稳定性:超频的代价与降压超频的正确姿势
7900 XTX 默认频率下长时间推理温度 75-80°C。实测小幅超频(核心 +100MHz、显存 +200MHz)速度提升约 8%,但温度逼近 85°C 阈值,且跑 70B 大模型超过 30 分钟后出现概率性推理错误(输出乱码/中断)。可复现的教训:对推理卡,降压超频(undervolt)比单纯提频更值——压低电压曲线能降约 5°C 且不损失性能,长时间稳定性显著提升。
3090 侧的常见坑是PCIe 插槽带宽:3090 是 PCIe 4.0 卡,插在只支持 3.0 x4 的老槽上会带宽受限,表现为 GPU 利用率周期性波动。装卡前查主板插槽的实际协商速率。
五、选卡结论(按预算档)
- 预算最省、单卡跑 14B~32B:二手 3090(约 4090 半价),N 卡生态最省心
- 预算最省、A 卡阵营:二手 7900 XTX,INT4 下能摸到 70B,但接受 ROCm 栈的成熟度
- 要最新架构 + 长驱动支持:4090,推理只比 3090 快 10-14%,但训练/微调优势明显
- 要 32GB 容量:这三张都到不了,看 V100 32G 或 AMD R9700(本站另有专文)