L40S 是 2023 年上市的 Ada 架构数据中心卡,24GB GDDR6、864GB/s 带宽、250W TDP,到 2026 年二手价约 ¥7000-9000。它和 4090 同代架构、同显存容量,但没有游戏限制、ECC 可选、PCIe 满速——数据中心卡下放家用是"4090 买不到时的第二选择",这篇把它的性能底细、跑大模型的实测、和 4090 的取舍整理清楚。
一、规格对比:L40S vs RTX 4090(24GB 同代)
| 项目 | L40S | RTX 4090 |
|---|---|---|
| 架构 | Ada(2023) | Ada(2023) |
| 显存 | 24GB GDDR6 ECC 可选 | 24GB GDDR6X |
| 显存带宽 | 864GB/s | 1008GB/s |
| FP16 算力 | 91 TFLOPS | 82.6 TFLOPS |
| INT8 算力 | 182 TOPS | 165 TOPS |
| TDP | 250W | 450W |
| 供电 | 单 8pin | 16pin |
| 显示输出 | 4× DisplayPort(有) | 3× DP + 1× HDMI |
| 价格 | ¥7000-9000(二手) | ¥9000-11000(二手) |
| 驱动 | 数据中心驱动,无游戏限制 | 游戏驱动,有游戏限制 |
关键差异:
- L40S 无游戏限制:4090 的 16pin 供电和 450W TDP 让它功耗高、噪音大;L40S 单 8pin、250W,更适合 24/7 推理。
- ECC 显存:可选,跑长时间推理时能纠正位翻转(4090 没有)。
- 有显示输出:不像 P40 需要亮机卡,L40S 直接能当显卡用。
- 带宽略低:864 vs 1008 GB/s,推理速度约慢 15-20%,但算力略高。
二、跑大模型实测(社区公开数据)
| 模型 | 量化 | L40S 速度 | 对比 4090 |
|---|---|---|---|
| Qwen3.8-27B | Q4_K_M | 约 28-32 tok/s | 4090 约 35-40 tok/s |
| Llama 8B | FP16 | 约 55-65 tok/s | 4090 约 60-70 tok/s |
| DeepSeek-R1-Distill-70B | INT4(双卡) | 约 8-10 tok/s | 4090 双卡约 10-12 tok/s |
| Qwen2.5-14B | Q4_K_M | 约 45-55 tok/s | 4090 约 50-60 tok/s |
一句话:L40S 速度比 4090 慢 15-20%,但功耗低 44%、噪音小、有 ECC、无游戏限制——对"24/7 推理服务器"场景,L40S 是更理性的选择。
三、买 L40S 的决策框架
| 场景 | 推荐 |
|---|---|
| 24/7 推理服务器,预算 ¥8000-9000 | L40S(功耗低、稳定、有 ECC) |
| 要打游戏 + 跑模型 | RTX 4090(带宽高、游戏驱动全功能) |
| 预算 ¥7000 以下,要 24GB | 看 4090 二手或 L40S 二手,谁便宜买谁 |
| 要 32GB+ 显存 | 5090 / R9700(见本站专文) |
买前必知:
- ECC 要选对:L40S 有 ECC 和非 ECC 两个版本,买前确认——ECC 版贵 10-15%,但长时间推理更稳。
- 驱动:用 NVIDIA 数据中心驱动分支(不是游戏驱动),CUDA 12.x 全支持。
- 散热:服务器卡设计,单槽/双槽被动散热,家用机箱需要直吹风道或暴力扇(和 P40 类似,但 L40S 功耗低 200W,好压得多)。
- 显存带宽:864GB/s 比 4090 低 14%,KV Cache 大时(长上下文)差距更明显。
四、总结
L40S 是"数据中心卡下放家用"的典型:比 4090 慢 15-20%,但功耗低 44%、有 ECC、无游戏限制、单 8pin 供电——对24/7 推理服务器场景,它是更理性的选择。对打游戏 + 跑模型的混合场景,4090 仍是首选。
一句话:预算 ¥8000 左右、要 24GB、跑推理服务器——L40S 是 4090 的理性替代。