同样 24GB 显存,RTX 3090 和 AMD RX 7900 XTX 是本地大模型部署里最常被讨论的两张消费级卡。这篇把它们和 RTX 4090 放在一起,用公开实测数据说清楚:24GB 这个容量到底能装下多大的模型,N 卡和 A 卡在推理速度上的真实差距有多大,以及各自踩过的坑。

一、先记住一个结论:显存容量 > 算力,24GB 是消费级的甜点

本地跑大模型,第一约束不是 TFLOPS,是模型权重装不装得下。一个 7B 模型 FP16 加载光权重就要约 14GB,加上 KV Cache 和运行时开销,16GB 的卡上下文稍微拉长就 OOM。

量化是绕不开的一步。GGUF Q4_K_M 量化后的大致占用:7B 约 4.2GB,14B 约 8.5GB,32B 约 20GB,70B 约 37GB。对照下来:

模型规模 Q4_K_M 量化后 16GB 卡 24GB 卡 32GB 卡
7B/8B ~4.5GB 舒适,可拉大上下文 轻松 轻松
14B ~8.5GB 可用 舒适 舒适
32B ~20GB 装不下 紧但能跑 舒适,还有余量
70B ~37GB 不可能 仅 INT4 极限 + offload offload 勉强跑通

32GB 能轻松装下 32B Q4 还留长上下文空间;24GB 卡在"32B 能跑但没余量"的位置——这就是 24GB 卡的核心定位:中小模型的全能选手,大模型的极限选手。

二、N 卡侧:3090 和 4090 的实测差距没有纸面参数那么大

公开实测(Ollama,Qwen3,8 组复杂度相近的 prompt,MAX_TOKENS=256):

指标 3090 4090 4090/3090
显存 24GB GDDR6X 24GB GDDR6X 相同
显存带宽 936 GB/s 1008 GB/s 1.08x
TDP 350W 450W 1.29x
qwen3:8b FP16 生成速度 47.46 tok/s 52.45 tok/s 1.10x
qwen3:14b Q4_K_M 生成速度 67.62 tok/s 77.31 tok/s 1.14x
8b 平均响应时长 5.39s 4.88s 快 9%

两张卡的显存容量相同、带宽差距只有 8%,所以推理速度差距只有 10%~14%,远小于纸面算力 2.3 倍的差距——LLM 生成阶段(decode)是显存带宽瓶颈,不是算力瓶颈。3090 二手价格通常只有 4090 的一半左右,单卡跑 24GB 档模型,3090 的性价比普遍更高;4090 的优势在训练/微调(算力优势开始体现)和更长的驱动支持周期。

另一份单卡 vLLM 实测参考:3090 跑 Qwen 9B 可稳定到 75 tok/s 级别;跑 7B 模型 8192 tokens 长文本生成没有压力。

三、A 卡侧:7900 XTX 的量化阶梯与两个反直觉点

RX 7900 XTX(24GB GDDR6,RDNA3,显存带宽 960 GB/s)的公开极限测试数据:

量化精度 24GB 可承载参数 生成速度 精度损失
FP16 ~10B-12B 15-20 tok/s 无
INT8 ~20B-24B 25-35 tok/s 极小
INT4 (Q4_K_M) ~60B-70B 40-55 tok/s 轻微

两个反直觉点,都是社区实测反复验证过的:

  1. 24GB 显存不等于长上下文自由。有实测案例:7900 XTX 跑 7B 模型反而比 16GB 的 4080 更早爆显存——ROCm 栈的默认配置下 KV Cache 和中间激活的显存占用比 CUDA 栈明显更大。同样"装得下",A 卡留给上下文的余量更少,长上下文场景要主动砍 ctx 或降量化精度。
  2. ROCm 不是唯一快路径。有用户在 Windows 环境实测发现 Vulkan 后端跑 LLM 反而比 ROCm 快——AMD 的软件栈还在快速迭代期,换后端可能是免费的速度提升,值得在自己卡上各试一遍。

ROCm 环境两个必查项

# 1. RDNA3/RDNA4 识别异常时,强制指定 GFX 版本(R9700 等 RDNA4 尤其注意)
export HSA_OVERRIDE_GFX_VERSION=11.0.0
ollama serve

# 2. 用 rocm-smi 盯温度/功耗,显存过热会降频,直接吃掉 tokens/s
watch -n 1 rocm-smi

Ollama 调参侧:num_ctx 决定能记住多长的对话历史,num_batch 影响并行处理能力,24GB 卡上 num_batch=512~1024 通常是吞吐比甜点,过大会显存溢出,过小吃不满 GPU。

四、稳定性:超频的代价与降压超频的正确姿势

7900 XTX 默认频率下长时间推理温度 75-80°C。实测小幅超频(核心 +100MHz、显存 +200MHz)速度提升约 8%,但温度逼近 85°C 阈值,且跑 70B 大模型超过 30 分钟后出现概率性推理错误(输出乱码/中断)。可复现的教训:对推理卡,降压超频(undervolt)比单纯提频更值——压低电压曲线能降约 5°C 且不损失性能,长时间稳定性显著提升。

3090 侧的常见坑是PCIe 插槽带宽:3090 是 PCIe 4.0 卡,插在只支持 3.0 x4 的老槽上会带宽受限,表现为 GPU 利用率周期性波动。装卡前查主板插槽的实际协商速率。

五、选卡结论(按预算档)