kubit · vram planner

显存选型台

挑一个模型和量化档,设好上下文与并发,看两种机型组合谁装得下、还剩多少。

显存需求

GiB

全清单速查

按当前的上下文、并发和 KV 精度,把每个模型的每个量化档都算一遍。点表头排序。

模型 · 量化 权重 KV 合计 机型 A 机型 B
算法与口径

权重

参数量 × bpw ÷ 8,再按 1 GiB = 230 B 折算。bpw 是等效位宽,已经把量化的 scale / zero-point 摊进去了,所以 NVFP4 记 4.5 而不是 4.0。MoE 模型按总参数算——权重要全部常驻显存,激活参数只影响算力不影响占用。

KV Cache

GQA 模型:层数 × 2 × KV 头数 × 头维度 × 精度字节 × 上下文 × 并发

MLA 模型(DeepSeek 系):层数 × 压缩维度 × 精度字节 × 上下文 × 并发,没有 ×2,所以同尺寸下 KV 只有 GQA 的零头。

没算进去的部分

激活内存、CUDA context、框架碎片、PagedAttention 的块对齐损耗都不在内。工程上按合计再留 8%–15% 余量比较稳,长上下文预填充阶段的激活峰值尤其吃显存。

多卡摊分

每卡占用按显存容量比例分摊。异构混插(比如 72GB 内置 + 84GB sidecar)在真实的张量并行里做不到这样自由的比例切分,vLLM/SGLang 的 TP 会按最小那张卡对齐,所以异构组合的实际可用容量要打折。同型号满配才拿得到这里显示的总量。

互联

DGX Spark 多台之间走 200Gb 网络,不是统一显存域;跨机张量并行的通信开销远大于单机 PCIe/NVLink。384 GiB 是三台加起来的数字,不等于一个能跑 384 GiB 模型的池子。RTX PRO 5000 Blackwell 与 PRO 6000D 均无 NVLink,多卡也只有 PCIe。

数据来源

参数量、上下文、评分、许可、显卡规格全部照抄《GPU信息 / 模型》原表。层数、KV 头数、头维度是估算值,页面上可改。