KTransformers 是主打"没有 GPU 也能跑大模型"的推理框架,核心靠 CPU 极致优化(尤其 AMX / AMX-tile 加速)实现,功耗可低于 10W,树莓派这类边缘设备都能运行。它的定位非常清晰:不是追求"快",而是解决"有没有"——在无 GPU 环境、边缘计算、低功耗场景下,它是目前唯一能跑大模型的主流选择,尤其适合消费级硬件硬扛超大 MoE 模型(如 DeepSeek 671B 这类需要 CPU+AMX 混合调度的场景)。代价是纯 CPU 吞吐比 GPU 框架低一个量级,社区实测约 35 tokens/s 量级,比 GPU 框架慢 5 倍以上。项目零 GPU 依赖、部署复杂度极低,但缺少主流生态集成,需要自行定制开发。
大模型部署
KTransformers
零 GPU 依赖 + CPU(AMX)极致优化,无卡 / 边缘设备跑大模型唯一解
免费开源