显存需求
—GiB
全清单速查
按当前的上下文、并发和 KV 精度,把每个模型的每个量化档都算一遍。点表头排序。
| 档 | 模型 · 量化 | 权重 | KV | 合计 | 机型 A | 机型 B |
|---|
算法与口径
权重
参数量 × bpw ÷ 8,再按 1 GiB = 230 B 折算。bpw 是等效位宽,已经把量化的 scale / zero-point 摊进去了,所以 NVFP4 记 4.5 而不是 4.0。MoE 模型按总参数算——权重要全部常驻显存,激活参数只影响算力不影响占用。
KV Cache
GQA 模型:层数 × 2 × KV 头数 × 头维度 × 精度字节 × 上下文 × 并发。
MLA 模型(DeepSeek 系):层数 × 压缩维度 × 精度字节 × 上下文 × 并发,没有 ×2,所以同尺寸下 KV 只有 GQA 的零头。
没算进去的部分
激活内存、CUDA context、框架碎片、PagedAttention 的块对齐损耗都不在内。工程上按合计再留 8%–15% 余量比较稳,长上下文预填充阶段的激活峰值尤其吃显存。
多卡摊分
每卡占用按显存容量比例分摊。异构混插(比如 72GB 内置 + 84GB sidecar)在真实的张量并行里做不到这样自由的比例切分,vLLM/SGLang 的 TP 会按最小那张卡对齐,所以异构组合的实际可用容量要打折。同型号满配才拿得到这里显示的总量。
互联
DGX Spark 多台之间走 200Gb 网络,不是统一显存域;跨机张量并行的通信开销远大于单机 PCIe/NVLink。384 GiB 是三台加起来的数字,不等于一个能跑 384 GiB 模型的池子。RTX PRO 5000 Blackwell 与 PRO 6000D 均无 NVLink,多卡也只有 PCIe。
数据来源
参数量、上下文、评分、许可、显卡规格全部照抄《GPU信息 / 模型》原表。层数、KV 头数、头维度是估算值,页面上可改。