大模型部署

NInfer

专为单张 5090 而生的 C++/CUDA 推理引擎,榨干 Qwen 系列单卡性能

免费开源

NInfer 是一个从头用 C++/CUDA 编写的单 GPU 推理引擎(GitHub 约 2,150 star),定位非常明确:榨干单张 RTX 5090(及同代高端单卡)上 Qwen 系列推理的性能,支持 Qwen3.6 / Qwen3.8 多个 Checkpoint,可处理文本、图片和视频输入。它和 vLLM、SGLang 这类通用多硬件引擎是两条路——通用引擎拼覆盖面,NInfer 拼"在特定 GPU + 特定模型上把性能榨到极限":C++/CUDA 手写 kernel 没有通用抽象层的开销,直接吃 Blackwell 的 GDDR7 高带宽与 FP8/NVFP4 原生格式,再按 Qwen 模型结构特化专家路由、KV 布局与量化 kernel。适合手里就是一张 5090、要跑 Qwen 系列、追求"这台机器上最快"的单用户/低并发本地推理;不适合要对外高并发 API 服务、跑非 Qwen 系模型或多卡集群(那些正是 vLLM/SGLang 的主场)。

F

FlagAttention (FlagOpen)

大模型部署

国产 FlashAttention 加速库,支持 Ampere 及以上 N 卡,降低 attention 显存与延迟

免费开源中文了解更多